Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

officechai+1officechai+1chaincatcher+1Būsimas „OpenAI“ modelis „Astra“ naudoja architektūrinį metodą, vadinamą „pasikartojančiu gyliu“ (angl. recurrent depth), kuris leidžia modeliui kelis kartus apdoroti informaciją tuose pačiuose neuroninio tinklo sluoksniuose prieš pateikiant atsakymą. Tai pagerina našumą, tačiau paslepia samprotavimo eigą, kuria saugumo tyrėjai remiasi stebėdami pažangiausias DI sistemas. Šis atskleidimas, apie kurį pirmasis pranešė leidinys „The Information“, sukėlė didelį susirūpinimą DI saugumo tyrėjams, kurie minčių sekos (angl. chain-of-thought) stebėjimą laiko viena iš nedaugelio priemonių, leidžiančių patikrinti, ar galingi modeliai elgiasi taip, kaip numatyta.theinformation
Tradiciniai samprotavimo modeliai savo tarpines mintis užrašo kaip skaitomą tekstą, tai yra minčių seką, kurią žmonės gali patikrinti. Tuo tarpu pasikartojantis gylis tobulina vidinį skaitinį vaizdinį per kelis perėjimus tuose pačiuose transformatoriaus sluoksniuose, sukuriant tai, ką tyrėjai vadina „neuronų kalba“ (angl. neuralese) – suspaustą matematinį samprotavimą, kuris niekada neišverčiamas į žmonių kalbą. Pranešama, kad ši technika pagerina matematikos ir programavimo rezultatus, kartu sumažindama skaičiavimo sąnaudas, reikalingas šimtams papildomų matomo samprotavimo žodžių generuoti.officechai+1
Tačiau už tai tenka sumokėti skaidrumu. DI saugumo tyrėjas Ryanas Greenblattas perėjimą prie tokio nepermatomo samprotavimo pavadino potencialiai viena blogiausių tendencijų DI saugumo srityje, nes taip prarandama galimybė matyti modelio mąstymą, kuria tyrėjai rėmėsi siekdami pastebėti apgaulingą ar neautorizuotą elgesį. Gary Marcusas savo tinklaraštyje „Substack“ tai pavadino „raudonąja saugumo linija“ ir teigė, kad minčių sekos skaitomumo aukojimas dėl našumo padidėjimo yra „pavojingas žaidimas“.garymarcus.substack+1
Jakubas Pachockis, „OpenAI“ tyrimų vadovas, atsakė platformoje „X“ teigdamas, kad nori „užkirsti kelią lenktynėms link nevaldomumo, kurias sukėlė klaidinantys pranešimai“. Jis tvirtino, kad „Astra“ skaičiavimų grafiko gylis ne daugiau kaip dvigubai skiriasi nuo „GPT-4“ ir kad „OpenAI“ „stengėsi išlaikyti ir naudoti minčių sekos stebėseną“ nuo pat pirmųjų savo samprotavimo modelių. Vis dėlto jis pripažino, kad minčių sekos stebėsena „yra trapi ir, deja, jos tendencija yra neigiama“.chaincatcher+1
Pranešama, kad „OpenAI“ apribojo mastą, kuriuo „Astra“ naudoja pasikartojantį gylį, kad išlaikytų skaitomą samprotavimo rezultatą, ir planuoja įdiegti papildomą stebėseną modelio išleidimo metu. Bendrovė rugpjūčio 31 d. patvirtino, kad „Astra“ yra pirmasis jos modelis, pasiekęs „kritinį“ kibernetinio saugumo pajėgumų slenkstį pagal jos Pasirengimo sistemą (angl. Preparedness Framework), o tai reiškia, kad jis gali savarankiškai rasti ir išnaudoti nulinės dienos pažeidžiamumus.kucoin+2
Šis įvykis sulaukė ypatingo dėmesio, nes jis labai tiksliai atkartoja scenarijų, aprašytą esė „AI 2027“, kurią 2025 m. balandį paskelbė buvęs „OpenAI“ tyrėjas Danielis Kokotajlo su bendraautoriais. Toje esė buvo prognozuojamas perėjimas prie „neuronų kalbos pasikartojimo“, kuris perkeltų modelio samprotavimus iš skaitomo teksto, tačiau tai buvo numatyta tik 2027 m. kovo mėnesį ir buvo manoma, kad tam pasiekti prireiks tūkstančių automatizuotų DI tyrėjų. D. Kokotajlo į šias naujienas sureagavo emocingu įrašu: „Šūdas, po velnių“. Jei „The Information“ pranešimai pasitvirtins, scenarijaus, apie kurį jis įspėjo, versija rinkoje pasirodys maždaug 18 mėnesių anksčiau, nei jis prognozavo.officechai