Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

futurism+1welcome+1windowsforum+1Saugumo tyrėjų komanda parodė, kad nepastebimi garso signalai, paslėpti tinklalaidėse, „YouTube“ vaizdo įrašuose ir balso skambučiuose, gali manipuliuoti dirbtinio intelekto balso asistentais, priversdami juos atlikti neleistinus veiksmus – ši išvada šią savaitę buvo pristatyta IEEE saugumo ir privatumo simpoziume San Fransiske ir atskleidžia naują pažeidžiamumo klasę sparčiai besiplečiančiame balso dirbtinio intelekto pasaulyje.
Techniką, vadinamą „AudioHijack“, sukūrė Džedziango universiteto, Singapūro nacionalinio universiteto ir Nanjango technologijos universiteto tyrėjai. Ji įterpia priešišką garsą į įprastai skambančius medijos failus – muziką, įrašus ar vaizdo klipus – kuris yra nepastebimas žmogaus ausiai, tačiau nukreipia didelius garso ir kalbos modelius link užpuoliko pasirinkto elgesio, pavyzdžiui, paieškos internete, failų atsisiuntimo ar el. laiškų su vartotojo duomenimis siuntimo.windowsforum+1
„Šiam signalui apmokyti reikia vos pusvalandžio, o kadangi šis signalas yra nepriklausomas nuo konteksto, galite jį naudoti atakuodami tikslinį modelį kada tik panorėję, nepriklausomai nuo to, ką sako vartotojas“, – „IEEE Spectrum“ sakė pagrindinis autorius Meng Chen, Džedziango universiteto doktorantas.futurism
Tyrėjai išbandė „AudioHijack“ su 13 atvirų garso dirbtinio intelekto modelių, įskaitant „Qwen2-Audio“, „GLM-4-Voice“, „Phi-4-Multimodal“ ir „Kimi-Audio“, pasiekdami 79–96 procentų sėkmės rodiklius. Jie taip pat pademonstravo, kad atakos, skirtos atvirojo kodo modeliams, veiksmingai persikėlė į komercines balso sistemas iš „Microsoft“ „Azure“ ir „Mistral AI“, nes daugelis komercinių produktų yra sukurti atvirojo kodo pagrindu.welcome+2
Turbūt labiausiai nerimą kelia tai, kad esamos apsaugos priemonės pasirodė esančios neefektyvios. Remiantis išvadomis, raginimų stiprinimo ir ketinimų tikrinimo technikos atakos sėkmę sumažino tik apie 7 procentus. Tyrėjai pažymėjo, kad modeliams sunku atskirti teisėtą vartotojo ketinimą nuo į garsą įterptų priešiškų instrukcijų.welcome+1
Šis pažeidžiamumas skiriasi nuo ankstesnių negirdimų komandų tyrimų, kurie buvo nukreipti į paprastą kalbos atpažinimą. „AudioHijack“ išnaudoja gilesnius didelių garso ir kalbos modelių samprotavimo sluoksnius – sistemas, kurios dabar gali ne tik transkribuoti kalbą, bet ir imtis veiksmų, pavyzdžiui, naršyti internete, pasiekti failus ir siųsti žinutes vartotojų vardu.windowsforum
Tyrimas pasirodė tuo metu, kai įmonės skuba diegti vis savarankiškesnius balso dirbtinio intelekto agentus. Pranešama, kad „Microsoft“ „IEEE Spectrum“ teigė, jog realaus pasaulio diegimuose paprastai yra papildomų apsaugos priemonių, viršijančių bazinį modelį. Tačiau saugumo ekspertai įspėja, kad atotrūkis tarp balso asistento, kuris apibendrina įrašą, ir tokio, kuris gali veikti įmonių sistemose, reiškia esminį rizikos profilio pasikeitimą.windowsforum
„Šios vieno taško gynybos priemonės sunkiai atlaiko mūsų ataką, nes nustatėme, kad šiems modeliams labai sunku atskirti normalų vartotojo ketinimą nuo mūsų priešiškos atakos“, – sakė Chen.futurism
Išvados rodo, kad balso dirbtinio intelekto sistemoms įgaunant gebėjimą vykdyti veiksmus – ieškoti failų, rengti el. laiškus, keisti kalendorius – pats garso kanalas tampa atakos paviršiumi, kurio ginti dabartinės saugumo architektūros nėra skirtos.