benchmarking

OpenAI-მ ხელოვნური ინტელექტის ფსიქიკური ჯანმრთელობის პასუხების შესაფასებელი ბენჩმარკი გამოუშვა

ოთხშაბათს OpenAI-მ გამოუშვა MentalHealthBench, 1,215 სინთეზური ფსიქიკური ჯანმრთელობის საუბრისგან შემდგარი ღია ბენჩმარკი, რომელიც 80-ზე მეტ ლიცენზირებულ სპეციალისტთან ერთად შეიქმნა, რათა გაიზომოს, თუ როგორ რეაგირებენ ხელოვნური ინტელექტის მოდელები სხვადასხვა სცენარზე, ყოველდღიური სტრესიდან დაწყებული კრიზისული სიტუაციებით დამთავრებული.

ყველაფერს გაეცანი

შენ უკვე ნახე ბოლო 2 დღის ყველა მთავარი ამბავი.

GPT-6 Astra-ს შეფასებები დამოუკიდებელ ლაბორატორიებში გაიყო

2026 წლის 3 სექტემბერს გამოსულმა OpenAI-ს GPT-6 Astra-მ დამოუკიდებელ შემფასებლებში აზრთა სხვადასხვაობა გამოიწვია: ერთი რეიტინგის მიხედვით ის მსოფლიოში საუკეთესო AI მოდელია, ხოლო მეორის მიხედვით, ის თავის წინამორბედს უტოლდება და კონკურენტ Anthropic-ს ჩამორჩება.

Nvidia-ს აგენტმა ARC-AGI-3 მსჯელობის ტესტში 100%-იანი შედეგი აჩვენა

პარასკევს Nvidia-მ გამოაქვეყნა კვლევა, რომელიც აჩვენებს, რომ მისმა ზოგადი დანიშნულების აგენტურულმა სისტემამ, Agentic Variation Operators (AVO), ARC-AGI-3 ინტერაქტიული მსჯელობის ტესტში 100%-იანი შედეგი აჩვენა. ეს შედეგი ხაზს უსვამს, რომ კომპლექსური ავტონომიური ამოცანების შესრულებისას გადამწყვეტია არა მხოლოდ მოდელის შესაძლებლობები, არამედ აგენტის არქიტექტურა.

OpenAI-მა SWE-Bench Pro-ს რეკომენდაცია გააუქმა მას შემდეგ, რაც აუდიტმა დაადგინა, რომ დავალებების 30% გაუმართავია

OpenAI-მ სამშაბათს განაცხადა, რომ აუქმებს SWE-Bench Pro-ს რეკომენდაციას, როგორც ხელოვნური ინტელექტის პროგრამირების შესაძლებლობების საიმედო საზომს. მიზეზად დასახელდა შიდა აუდიტი, რომელმაც აჩვენა, რომ ბენჩმარკის დავალებების დაახლოებით 30% გაუმართავია, ხოლო დაახლოებით 70%-იანი „ხმაურის ზღვარი“ ამცირებს მის სარგებლიანობას მოწინავე მოდელების შეფასებისთვის.