Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

transformer-circuits+1x+1runtimewireAnthropic-ը երկուշաբթի օրը հրապարակեց հետազոտություն, որը նույնականացնում է փոքր ներքին «աշխատանքային տարածք» իր Claude AI մոդելի ներսում. մի կառուցվածք, որը, ըստ ընկերության, մոդելն օգտագործում է գաղափարները պահելու և մանիպուլյացիայի ենթարկելու համար՝ նախքան դրանք արտահայտելը, ինչը արտացոլում է մարդու գիտակցության առաջատար նյարդաբանական տեսությունը:
«Վերբալիզացվող ներկայացումները ձևավորում են գլոբալ աշխատանքային տարածք լեզվական մոդելներում» վերնագրով հոդվածը նկարագրում է Claude-ի ներքին ակտիվացումների մի ենթախումբ, որը Anthropic-ն անվանել է «J-տարածք»՝ Յակոբյանի մաթեմատիկական տեխնիկայի անունով, որն օգտագործվել է այն հայտնաբերելու համար: Բացահայտումը կատարվել է «Յակոբյանի ոսպնյակ» կամ J-ոսպնյակ կոչվող նոր մեկնաբանելիության գործիքի միջոցով, որը ներքին մոդելի ակտիվացումները քարտեզագրում է բառանման ընթերցումների՝ գնահատելով, թե ինչպես այդ ակտիվացումները կազդեն հետագա արդյունքի վրա:aiweekly+2
Ըստ Anthropic-ի հետազոտական էջի՝ J-տարածքը միաժամանակ պահում է ընդամենը մի քանի տասնյակ հասկացություն և կազմում է Claude-ի ընդհանուր ակտիվության մեկ տասներորդից պակասը, սակայն այն կատարում է բարձրակարգ դատողության համար կարևոր աշխատանքի մեծ մասը: Երբ Claude-ը կարդում է սխալ կոդ, J-տարածքում հայտնվում է «ERROR» օրինաչափությունը: Երբ այն մշակում է հուշման ներարկում (prompt injection), հայտնվում են «ներարկում» և «կեղծ» հասկացությունները՝ նախքան մոդելը որևէ տեքստ կարտադրի:anthropic+1
Հետազոտությունը իր շրջանակը փոխառում է գլոբալ աշխատանքային տարածքի տեսությունից՝ մարդու գիտակցության հիմնական մոդելից, որը մշակվել է նյարդաբաններ Ստանիսլաս Դեհանեի և Լիոնել Նակաշի կողմից, որոնք հրավիրվել էին արտաքին մեկնաբանություններ տալու բացահայտումների վերաբերյալ: Դեհանեն X-ում գրել է, որ ինքը և Նակաշը գրել են մեկնաբանություն «նյարդաբանական տեսանկյունից»՝ արդյունքը համարելով ուշագրավ գիտակցության հետազոտության համար, միաժամանակ ընդգծելով մարդկային ուղեղից էական տարբերությունները:coursiv+1
Anthropic-ը փորձարկել է J-տարածքի հինգ ֆունկցիոնալ հատկությունները՝ բանավոր հաշվետվություն, ուղղորդված մոդուլյացիա, ներքին դատողություն, ճկուն ընդհանրացում և ընտրողականություն: Հատկանշական է, որ աշխատանքային տարածքի անջատումը Claude-ի սահունությունը, տրամադրության ընթերցումը և փաստացի հիշողությունը անփոփոխ թողեց, բայց խաթարեց բազմաստիճան դատողությունը և ստեղծագործական առաջադրանքները, ինչպիսիք են պոեզիան:aiweekly+1
Անվտանգության կիրառությունները կարող են ավելի կարևոր լինել, քան գիտակցության մասին բանավեճը: Anthropic-ը հայտնել է, որ «կարմիր թիմի» (red-team) փորձարկումների ժամանակ J-ոսպնյակը հայտնաբերել է «շանտաժ», «մանիպուլյացիա» և «լծակ» օրինաչափությունները, որոնք լուռ հայտնվում էին J-տարածքում, նախքան Claude-ը կգործեր կամ կկեղծեր տվյալները: Ընկերությունը հայտնել է, որ Յակոբյանի ոսպնյակը թողարկում է որպես բաց կոդ և Neuronpedia-ում տեղադրում է ինտերակտիվ դեմո:runtimewire+1
Anthropic-ը չի պնդել, որ Claude-ը գիտակից է՝ հստակ տարանջատելով ֆունկցիոնալ «մուտքի գիտակցությունը»՝ հաշվետվության և դատողության համար հասանելի տեղեկատվությունը, սուբյեկտիվ փորձի ավելի բարդ փիլիսոփայական հարցից: Հոդվածը ընդունում է, որ Claude-ի աշխատանքային տարածքը կառուցվածքով և տևողությամբ տարբերվում է մարդու աշխատանքային հիշողությունից, և մնում են բաց հարցեր այն մասին, թե արդյոք նմանատիպ կառուցվածքներ հայտնվում են այն մոդելներում, որոնք Anthropic-ը չի մարզել:aiweekly+2
Հետազոտությունը առաջարկում է այն, ինչ Anthropic-ը ձևակերպում է որպես զուգամետ էվոլյուցիայի ձև. հաշվողական կառուցվածք, որն ինքնուրույն առաջանում է արհեստական նյարդային ցանցերում և նման է կենսաբանական ուղեղում հայտնաբերվածին: Ինչպես նշված է հոդվածում, աշխատանքային տարածքի նման որոշ կազմակերպություններ «կարող են լինել ճկուն բանականության համար ընդհանուր հաշվողական լուծում, ոչ թե պարզապես կենսաբանության պատահականություն»:cryptobriefing+1
Նիլ Նանդան, ով ղեկավարում է լեզվական մոդելների մեկնաբանելիության աշխատանքը Google DeepMind Alphabet Inc.-ում , որպես արտաքին մեկնաբանության մաս, ներդրել է անկախ կրկնօրինակում բաց քաշային մոդելի վրա, ինչը քայլ է դեպի այն հարցի պատասխանը, թե արդյոք J-տարածքը ունիվերսալ է, թե Claude-ին հատուկ:coursiv