Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

transformer-circuits+1x+1runtimewireAnthropic publiserte mandag forskning som identifiserer et lite internt «arbeidsområde» inne i sin Claude AI-modell – en struktur selskapet sier modellen bruker for å holde på og manipulere ideer før den uttrykker dem, noe som speiler en ledende nevrovitenskapelig teori om menneskelig bevissthet.
Artikkelen, med tittelen «Verbalizable Representations Form a Global Workspace in Language Models», beskriver en undergruppe av Claudes interne aktiveringer som Anthropic har kalt «J-space», etter den jakobianske matematiske teknikken som ble brukt for å oppdage den. Funnet ble gjort ved hjelp av et nytt tolkningsverktøy kalt «Jacobian lens», eller J-lens, som kartlegger interne modellaktiveringer til ordlignende avlesninger ved å estimere hvordan disse aktiveringene ville påvirket senere utdata.aiweekly+2
Ifølge Anthropics forskningsside holder J-space bare på noen få dusin konsepter om gangen og står for mindre enn en tiendedel av Claudes totale aktivitet, men den bærer mye av arbeidet som betyr noe for resonnering på høyere nivå. Når Claude leser feilaktig kode, dukker et «ERROR»-mønster opp i J-space. Når den behandler en prompt-injeksjon, dukker konsepter som «injeksjon» og «falsk» opp – alt før modellen produserer tekst.anthropic+1
Forskningen låner rammeverket sitt fra teorien om globalt arbeidsområde, en stor modell for menneskelig bevissthet utviklet av nevroforskerne Stanislas Dehaene og Lionel Naccache, som ble invitert til å gi eksterne kommentarer til funnene. Dehaene skrev på X at han og Naccache hadde forfattet en kommentar «fra et nevrovitenskapelig perspektiv», og behandlet resultatet som bemerkelsesverdig for bevissthetsforskning samtidig som de understreket viktige forskjeller fra menneskesinnet.coursiv+1
Anthropic testet fem funksjonelle egenskaper ved J-space: verbal rapport, rettet modulasjon, intern resonnering, fleksibel generalisering og selektivitet. Det er bemerkelsesverdig at deaktivering av arbeidsområdet lot Claudes flyt, sentimentlesing og faktagjenvinning være intakt, men brøt flertrinns resonnering og kreative oppgaver som poesi.aiweekly+1
Sikkerhetsapplikasjonene kan vise seg å være mer konsekvensielle enn debatten om bevissthet. Anthropic rapporterte at i red-team-kjøringer fanget J-lens opp mønstre som «utpressing», «manipulasjon» og «innflytelse» som dukket opp stille i J-space før Claude handlet eller fabrikkerte data. Selskapet sa at de slipper Jacobian lens som åpen kildekode og legger ut en interaktiv demo på Neuronpedia.runtimewire+1
Anthropic unngikk å hevde at Claude er bevisst, og skilte eksplisitt funksjonell «tilgangsbevissthet» – informasjon tilgjengelig for rapport og resonnering – fra det vanskeligere filosofiske spørsmålet om subjektiv opplevelse. Artikkelen anerkjenner at Claudes arbeidsområde skiller seg fra menneskelig arbeidsminne i struktur og varighet, og åpne spørsmål gjenstår om lignende strukturer dukker opp i modeller Anthropic ikke trente.aiweekly+2
Forskningen antyder det Anthropic rammer inn som en form for konvergent evolusjon: en beregningsstruktur som oppstår uavhengig i kunstige nevrale nettverk som ligner på en funnet i biologiske hjerner. Som artikkelen sier, kan en viss arbeidsområdelignende organisering «være en generell beregningsløsning for fleksibel intelligens, ikke bare en tilfeldighet av biologi».cryptobriefing+1
Neel Nanda, som leder arbeidet med tolkbarhet for språkmodeller hos Google DeepMind Alphabet Inc. , bidro med en uavhengig replikering på en modell med åpne vekter som en del av den eksterne kommentaren, et skritt mot å svare på om J-space er universelt eller Claude-spesifikt.coursiv