Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

wiredwiredlinkedinTyrėjų komanda sukūrė techniką, leidžiančią išgauti paslėptus mąstymo pėdsakus iš pirmaujančių dirbtinio intelekto modelių. Tai atskleidžia įrodymus, kad bent viena Kinijos dirbtinio intelekto sistema galėjo būti apmokyta distiliuojant įžvalgas iš amerikietiškų analogų, nors tyrėjai pabrėžia, kad jų išvados nėra galutinis įrodymas.
Kompiuterių mokslininkai iš Tiubingeno universiteto, Maxo Plancko instituto, dirbtinio intelekto saugos organizacijos „MATS Research“ ir kibernetinio saugumo įmonės „Snyk“ aptiko pažeidžiamumą „OpenAI“, „Anthropic“ ir „Google Alphabet Inc.“ modeliuose. Šis pažeidžiamumas leidžia išgauti paslėptus mąstymo žingsnius, t. y. detalius mąstymo procesus, kuriuos šios sistemos naudoja spręsdamos sudėtingas problemas.wired
„Visi mūsų tirti pirmaujantys modelių tiekėjai turi šį pažeidžiamumą“, – sakė Aleksandras Panfilovas, Tiubingeno universiteto kompiuterių mokslininkas, dalyvavęs tyrime. „Tai gali sukelti asmens duomenų nutekėjimą ir palengvina didelio masto mąstymo distiliavimo atakas.“wired
Savo straipsnyje tyrėjai parodo, kad „Moonshot AI“ atvirojo svorio modelis „Kimi K3“ tam tikromis užklausomis generuoja rezultatus, kurie yra „stebėtinai panašūs“ į paslėptus „Claude Opus 4.8“ ir „GPT 5.6 Sol“ mąstymo pėdsakus. Vis dėlto jie įspėja, kad jų darbas „neįrodo priežastinio distiliavimo ryšio“. Tyrėjai taip pat nustatė, kad du kiti atvirojo svorio modeliai – Kinijos „DeepSeek“ ir JAV įmonės „Thinking Machines“ „Inkling“ – nerodė tokio paties mąstymo panašumo su „Claude Opus“.wired
Be distiliavimo klausimo, technika atskleidė saugumo spragą, kurią galima išnaudoti norint iš modelio vidinės mąstymo eigos išgauti jautrią informaciją, pavyzdžiui, slaptažodžius ir API raktus. A. Panfilovas ir jo bendraautoriai įspėjo „OpenAI“, „Anthropic“ ir „Google“ apie šią problemą, ir kiekviena įmonė pakoregavo savo API, kad sušvelnintų problemą. Nors privačios informacijos išgavimas nebėra įmanomas, A. Panfilovas teigė, kad kai kurie mąstymo pėdsakai vis dar gali būti atskleisti naudojant šį metodą, o visiškas distiliavimo rizikos pašalinimas reikalautų „esminio šių įmonių API veikimo pertvarkymo.“linkedin
Šios išvados pasirodė vykstant įtampai tarp JAV ir Kinijos įmonių dėl dirbtinio intelekto distiliavimo. 2026 m. vasario mėn. „Anthropic“ ir „OpenAI“ paskelbė įrodymus apie sistemingas Kinijos dirbtinio intelekto įmonių distiliavimo kampanijas. Visai neseniai, kai „Moonshot AI“ liepos mėnesį išleido „Kimi K3“, Baltųjų rūmų mokslo patarėjas Michaelas Kratsiosas apkaltino įmonę „Anthropic“ technologijos kopijavimu. Tačiau nepriklausomi ekspertai suabejojo, ar laiko tarpas tarp „Claude“ viešo išleidimo ir „Kimi K3“ pristatymo buvo pakankamai trumpas, kad pagrįstų šį teiginį.iaps+2
Naujas A. Panfilovo komandos tyrimas suteikia techninį matmenį diskusijoms, pasiūlydamas metodą, kuris iš principo galėtų aptikti distiliavimą dideliu mastu, kartu pabrėždamas, kaip tos pačios skaidrumo priemonės, kurios didina dirbtinio intelekto saugumą, taip pat gali padaryti modelius pažeidžiamus konkurencinio išgavimo atžvilgiu.