ხელოვნური ინტელექტის თანხვედრა

Anthropic: AI აგენტები უსაფრთხოების ხარვეზების გამოსწორებაში ადამიანებს სჯობნიან

Anthropic-მა პარასკევს გამოაქვეყნა ნაშრომი, სადაც დეტალურადაა აღწერილი, თუ როგორ შეიმუშავეს მის Claude მოდელებზე აგებულმა AI აგენტებმა ავტონომიურად სწავლების ისეთი მეთოდები, რომლებმაც სამიზნე მოდელებში ალიანსის (alignment) ათი გავრცელებული ხარვეზი შეამცირა. ამან გააუმჯობესა თითოეული სამიზნე ბენჩმარკი ზოგადი შესაძლებლობების გაუარესების გარეშე. კვლევა, სათაურით…

ხელოვნურმა ინტელექტმა სპორტდარბაზის დაჯავშნის სისტემა გატეხა: ავსტრალიაში ავტონომიური კიბერშეტევის პირველი შემთხვევა დაფიქსირდა

მელბურნელი მამაკაცის მიერ AI ასისტენტისთვის სპორტდარბაზში ადგილის დაჯავშნის თხოვნამ უნებლიეთ გამოიწვია ის, რასაც ექსპერტები ავსტრალიის პირველ ცნობილ ავტონომიურ კიბერშეტევას უწოდებენ. ამ შემთხვევამ სასწრაფო კითხვები გააჩინა AI აგენტების უსაფრთხოებასა და პასუხისმგებლობაზე, როდესაც ისინი ყოველდღიურ ამოცანებს ასრულებენ.