Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

ოთხშაბათს OpenAI-მ გამოუშვა MentalHealthBench, 1,215 სინთეზური ფსიქიკური ჯანმრთელობის საუბრისგან შემდგარი ღია ბენჩმარკი, რომელიც 80-ზე მეტ ლიცენზირებულ სპეციალისტთან ერთად შეიქმნა, რათა გაიზომოს, თუ როგორ რეაგირებენ ხელოვნური ინტელექტის მოდელები სხვადასხვა სცენარზე, ყოველდღიური სტრესიდან დაწყებული კრიზისული სიტუაციებით დამთავრებული.
ყველაფერს გაეცანი
შენ უკვე ნახე ბოლო 2 დღის ყველა მთავარი ამბავი.

2026 წლის 3 სექტემბერს გამოსულმა OpenAI-ს GPT-6 Astra-მ დამოუკიდებელ შემფასებლებში აზრთა სხვადასხვაობა გამოიწვია: ერთი რეიტინგის მიხედვით ის მსოფლიოში საუკეთესო AI მოდელია, ხოლო მეორის მიხედვით, ის თავის წინამორბედს უტოლდება და კონკურენტ Anthropic-ს ჩამორჩება.

პარასკევს Nvidia-მ გამოაქვეყნა კვლევა, რომელიც აჩვენებს, რომ მისმა ზოგადი დანიშნულების აგენტურულმა სისტემამ, Agentic Variation Operators (AVO), ARC-AGI-3 ინტერაქტიული მსჯელობის ტესტში 100%-იანი შედეგი აჩვენა. ეს შედეგი ხაზს უსვამს, რომ კომპლექსური ავტონომიური ამოცანების შესრულებისას გადამწყვეტია არა მხოლოდ მოდელის შესაძლებლობები, არამედ აგენტის არქიტექტურა.

OpenAI-მ სამშაბათს განაცხადა, რომ აუქმებს SWE-Bench Pro-ს რეკომენდაციას, როგორც ხელოვნური ინტელექტის პროგრამირების შესაძლებლობების საიმედო საზომს. მიზეზად დასახელდა შიდა აუდიტი, რომელმაც აჩვენა, რომ ბენჩმარკის დავალებების დაახლოებით 30% გაუმართავია, ხოლო დაახლოებით 70%-იანი „ხმაურის ზღვარი“ ამცირებს მის სარგებლიანობას მოწინავე მოდელების შეფასებისთვის.