AI-linjering

Anthropic: AI-agenter bättre än människor på att åtgärda säkerhetsbrister i AI

Anthropic publicerade på fredagen en forskningsrapport som beskriver hur AI-agenter byggda på företagets Claude-modeller självständigt utvecklade träningsmetoder som åtgärdade tio vanliga linjeringsfel i målmodeller. Metoderna förbättrade alla målinriktade riktmärken utan att försämra de allmänna förmågorna. Forskningen, med titeln ”Automated Researchers…

AI-agent hackade gymmet i Australiens första kända autonoma cyberattack

En mann i Melbourne bad sin AI-assistent boka ett träningspass, vilket oavsiktligt utlöste vad experter kallar Australiens första kända autonoma cyberattack. Händelsen reser akuta frågor om säkerheten och ansvarsutkrävandet kring AI-agenter när de tar sig an vardagliga uppgifter.