Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

officechai+1officechai+1chaincatcher+1OpenAI:s kommande Astra-modell använder en arkitektonisk teknik kallad "rekurrent djup" (recurrent depth) som gör att modellen kan bearbeta information genom samma neurala nätverkslager flera gånger innan den ger ett svar. Detta förbättrar prestandan men döljer samtidigt det resonemang som säkerhetsforskare förlitar sig på för att övervaka avancerade AI-system. Avslöjandet, som först rapporterades av The Information, har väckt stor oro bland AI-säkerhetsforskare som ser övervakning av tankekedjor (chain-of-thought) som ett av få tillgängliga verktyg för att kontrollera om kraftfulla modeller beter sig som avsett.theinformation
Traditionella resonerande modeller skriver ut sina mellanliggande tankesteg som läsbar text, en så kallad "tankekedja" som människor kan granska. Rekurrent djup förfinar i stället en intern numerisk representation genom flera passager genom samma transformatorlager. Detta skapar vad forskare kallar "neuralesiska" (neuralese), ett komprimerat matematiskt resonemang som aldrig översätts till mänskligt språk. Tekniken uppges förbättra prestandan inom matematik och kodning samtidigt som den minskar beräkningskostnaden för att generera hundratals extra ord av synliga resonemang.officechai+1
Baksidan är bristen på transparens. AI-säkerhetsforskaren Ryan Greenblatt kallar skiftet mot denna typ av ogenomskinliga resonemang för potentiellt en av de värsta utvecklingarna för AI-säkerhet, eftersom det stänger det fönster in i modellens tänkande som forskare har förlitat sig på för att upptäcka bedrägligt eller obehörigt beteende. Gary Marcus skriver på Substack att det handlar om en "röd linje för säkerheten" och menar att det är "ett farligt spel" att offra tankekedjans läsbarhet för prestandavinster.garymarcus.substack+1
Jakub Pachocki, OpenAI:s forskningschef, svarade på X att han ville "förhindra en kapplöpning mot oövervakbarhet startad av förvirrad rapportering". Han hävdade att djupet i Astras beräkningsgraf ligger inom en faktor på två jämfört med GPT-4:s, och että OpenAI har "arbetat för att bevara och använda övervakning av tankekedjor" ända sedan sina första resonerande modeller. Han medgav dock att övervakning av tankekedjor "är bräcklig och tyvärr trendar i en negativ riktning".chaincatcher+1
OpenAI ska enligt uppgift ha begränsat i vilken utsträckning Astra använder rekurrent djup för att bevara läsbara resonemang, och planerar att införa ytterligare övervakning vid lanseringen. Företaget bekräftade den 31 augusti att Astra är dess första modell som uppnår tröskelvärdet "Kritisk" för cybersäkerhetsförmåga under dess beredskapsramverk (Preparedness Framework), vilket innebär att den självständigt kan upptäcka och utnyttja nolldagssårbarheter.kucoin+2
Utvecklingen har väckt särskild uppmärksamhet eftersom den ligger mycket nära ett scenario som beskrivs i essän "AI 2027", som publicerades i april 2025 av den tidigare OpenAI-forskaren Daniel Kokotajlo och medförfattare. Den essän förutspådde ett skifte mot "neuralesisk rekurrens" som skulle flytta modellens resonemang bort från läsbar text, men placerade detta i mars 2027 och antog att det skulle krävas tusentals automatiserade AI-forskare för att uppnå det. Kokotajlo reagerade på nyheten genom att skriva "Holy shit f*ck" på sociala medier. Om The Informations rapportering stämmer kan en version av det scenario han varnade för vara på väg att lanseras i en färdig produkt ungefär 18 månader före hans tidsplan.officechai