Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

Trečiadienį „OpenAI“ pristatė „MentalHealthBench“ – atvirą 1 215 sintetinių psichinės sveikatos pokalbių vertinimo sistemą, sukurtą bendradarbiaujant su daugiau nei 80 licencijuotų psichikos sveikatos specialistų. Sistema skirta įvertinti, kaip dirbtinio intelekto modeliai reaguoja į įvairias situacijas – nuo kasdienio streso iki…
Viską peržiūrėjote
Peržiūrėjote visas svarbiausias pastarųjų 2 dienų naujienas.

Rugsėjo 3 d. išleistas „OpenAI“ modelis „GPT-6 Astra“ sukėlė retą nesutarimą tarp nepriklausomų vertintojų: vieni jį įvardija kaip geriausią pasaulyje dirbtinio intelekto modelį, kiti jį vertina lygiai su pirmtaku ir atsiliekantį nuo konkurentės „Anthropic“.

Penktadienį Nvidia paskelbė tyrimą, rodantį, kad jos bendrosios paskirties agentų sistema, Agentic Variation Operators (AVO), pasiekė tobulą 100 proc. rezultatą ARC-AGI-3 interaktyvaus samprotavimo teste. Tai pabrėžia, kad agento architektūra, o ne tik modelio galimybės, lemia našumą atliekant sudėtingas autonomines užduotis.

„OpenAI“ antradienį paskelbė, kad atšaukia „SWE-Bench Pro“ kaip patikimo dirbtinio intelekto programavimo gebėjimų matavimo įrankio rekomendaciją. Bendrovė nurodė, kad vidinis auditas parodė, jog maždaug 30 % šios sistemos užduočių yra neveikiančios, o maždaug 70 % siekianti „triukšmo riba“ mažina jos…