benchmarking

„OpenAI“ pristatė vertinimo sistemą dirbtinio intelekto atsakymams apie psichinę sveikatą

Trečiadienį „OpenAI“ pristatė „MentalHealthBench“ – atvirą 1 215 sintetinių psichinės sveikatos pokalbių vertinimo sistemą, sukurtą bendradarbiaujant su daugiau nei 80 licencijuotų psichikos sveikatos specialistų. Sistema skirta įvertinti, kaip dirbtinio intelekto modeliai reaguoja į įvairias situacijas – nuo kasdienio streso iki…

Viską peržiūrėjote

Peržiūrėjote visas svarbiausias pastarųjų 2 dienų naujienas.

GPT-6 Astra sulaukė prieštaringų nepriklausomų laboratorijų vertinimų

Rugsėjo 3 d. išleistas „OpenAI“ modelis „GPT-6 Astra“ sukėlė retą nesutarimą tarp nepriklausomų vertintojų: vieni jį įvardija kaip geriausią pasaulyje dirbtinio intelekto modelį, kiti jį vertina lygiai su pirmtaku ir atsiliekantį nuo konkurentės „Anthropic“.

Nvidia agentas pasiekė 100 proc. rezultatą ARC-AGI-3 samprotavimo teste

Penktadienį Nvidia paskelbė tyrimą, rodantį, kad jos bendrosios paskirties agentų sistema, Agentic Variation Operators (AVO), pasiekė tobulą 100 proc. rezultatą ARC-AGI-3 interaktyvaus samprotavimo teste. Tai pabrėžia, kad agento architektūra, o ne tik modelio galimybės, lemia našumą atliekant sudėtingas autonomines užduotis.

„OpenAI“ atšaukia „SWE-Bench Pro“ rekomendaciją, auditui nustačius, kad 30 % užduočių yra neveikiančios

„OpenAI“ antradienį paskelbė, kad atšaukia „SWE-Bench Pro“ kaip patikimo dirbtinio intelekto programavimo gebėjimų matavimo įrankio rekomendaciją. Bendrovė nurodė, kad vidinis auditas parodė, jog maždaug 30 % šios sistemos užduočių yra neveikiančios, o maždaug 70 % siekianti „triukšmo riba“ mažina jos…