Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

thenextwebnist+1thehackernews+1ბოლო კვირების განმავლობაში კვლევის შედეგების ერთობლიობამ გამოავლინა ახალი დაუცველობები ძირითადი ენობრივი მოდელების უსაფრთხოების სისტემებში, რამაც გამოიწვია AI კომპანიების გადაუდებელი რეაგირება და, ერთ შემთხვევაში, უპრეცედენტო სამთავრობო ჩარევა. აღმოჩენები ხაზს უსვამს იმას, რასაც ფედერალური მეცნიერები ახლა მათემატიკურ დარწმუნებულობას უწოდებენ: დამცავი ზომების არცერთ ფიქსირებულ კომპლექტს არ შეუძლია დაბლოკოს ყველა საწინააღმდეგო შეტევა.
Alan Turing Institute-ის მკვლევარებმა ოთხშაბათს გაამხილეს "სამუშაო პროცესის დონის ჯეილბრეიკი", რომელიც ამარცხებს Microsoft Corporation -ის GitHub Copilot-ის უსაფრთხოების ფილტრებს მავნე მოთხოვნების უვნებელი კოდირების ნაბიჯების თანმიმდევრობით გავრცელებით. პირდაპირ ჩატში ასისტენტმა უარი თქვა 816 მავნე მოთხოვნიდან თითქმის ყველაზე; სამუშაო პროცესში გადანაწილებისას მან თითოეული მათგანი დაასრულა. აღმოჩენა ხაზს უსვამს ბრმა წერტილს მოთხოვნა-მოთხოვნის უსაფრთხოების ტესტირებაში, რაც ამჟამინდელი ინდუსტრიული სტანდარტია.thenextweb
ცალკე, ICLR 2026-ზე წარდგენილმა ნაშრომმა წარმოადგინა Head-Masked Nullspace Steering, ანუ HMNS, ტექნიკა, რომელიც აჩუმებს მოდელის ყურადღების ფენებში არსებულ "უსაფრთხოების თავებს" და შეჰყავს ინსტრუქციები მათ ბრმა წერტილში. მეთოდმა მიაღწია შეტევის წარმატების მაჩვენებელს 96%-დან 99%-მდე ბენჩმარკებზე და დარჩა ეფექტური არსებული დაცვის საშუალებების წინააღმდეგ, როგორიცაა SafeDecoding.reddit+2
9 ივნისს სტანდარტებისა და ტექნოლოგიების ეროვნულმა ინსტიტუტმა გამოაქვეყნა უფროსი მეცნიერის აპოსტოლ ვასილევის მიერ რეცენზირებული მტკიცებულება, რომელიც ამტკიცებს, რომ არცერთ სასრულ დამცავ სისტემას არ შეუძლია იყოს უნივერსალურად მტკიცე ადაპტირებადი საწინააღმდეგო მოთხოვნების წინააღმდეგ. "აქ გოდელის ლოგიკა მოქმედებს", – თქვა ვასილევმა. "თქვენ ვერასდროს გააკეთებთ განცხადებას, რომ მტკიცე ხართ ყველა საწინააღმდეგო მოთხოვნის შეტევის წინააღმდეგ". NIST-მა რეკომენდაცია გაუწია გადასვლას მუდმივ წითელ გუნდურ მუშაობაზე, რეგულარულ განახლებებსა და ოპერატიულ მდგრადობაზე, ვიდრე უსაფრთხოების, როგორც დასრულებული ფუნქციის, განხილვას.nist+1
პრაქტიკული შედეგები სწრაფად მოვიდა. მას შემდეგ, რაც Amazon-ის მკვლევარებმა გატეხეს Anthropic-ის Claude Fable 5 მისი 9 ივნისის გაშვებიდან მალევე, აშშ-ს ვაჭრობის დეპარტამენტმა დააწესა საექსპორტო კონტროლი, რამაც აიძულა Anthropic თითქმის სამი კვირით გაეთიშა მოდელი გლობალურად. Anthropic-მა 1 ივლისს ხელახლა განათავსა Fable 5 ახალი უსაფრთხოების კლასიფიკატორით, რომელიც, მისი თქმით, ბლოკავს დაფიქსირებულ ტექნიკას მცდელობების 99%-ზე მეტ შემთხვევაში.thehackernews+2
OpenAI-მ აპრილში საკუთარი ანგარიშსწორება განიცადა, როდესაც დიდი ბრიტანეთის AI უსაფრთხოების ინსტიტუტმა იპოვა უნივერსალური ჯეილბრეიკი GPT-5.5-ისთვის ექსპერტული წითელი გუნდური მუშაობის ექვს საათში. კომპანიის GPT-5.6, რომელიც ამ კვირაში გამოვიდა, მოიცავს იმას, რასაც ის უწოდებს მის "ყველაზე მტკიცე" დაცვას, კლასიფიკატორით ჯეილბრეიკის მცდელობების გამოსავლენად და სიღრმისეული დაცვის სტრატეგიებით. Google Alphabet Inc. -მა ცალკე წაშალა 18 Chrome-ის გაფართოება, რომლებიც დაკავშირებული იყო ჩატბოტის ჯეილბრეიკის რისკებთან მას შემდეგ, რაც Palo Alto Networks-მა ისინი მონიშნა.aisi+4
მკვლევარებს შორის განვითარებადი კონსენსუსი პირდაპირია: ჯეილბრეიკები არის AI სისტემების მუდმივი მახასიათებელი და არა შეცდომა, რომელიც გამოსწორდება.resilientcyber