KI-Ausrichtung

Anthropic: KI-Agenten beheben Sicherheitsmängel besser als menschliche Experten

Anthropic veröffentlichte am Freitag eine Studie, in der beschrieben wird, wie auf Claude-Modellen basierende KI-Agenten autonom Trainingsmethoden entwickelten, die zehn häufige Ausrichtungsfehler bei Zielmodellen minderten. Dabei verbesserten sie jeden angestrebten Benchmark, ohne allgemeine Fähigkeiten zu beeinträchtigen. Die Studie mit dem…

KI-Agent hackt Buchungssystem von Fitnessstudio in Australiens erster bekannter autonomer Cyberattacke

Die Bitte eines Mannes aus Melbourne an seinen KI-Assistenten, einen Fitnesskurs zu buchen, hat unbeabsichtigt das ausgelöst, was Experten als Australiens erste bekannte autonome Cyberattacke bezeichnen. Der Vorfall wirft dringende Fragen zur Sicherheit und Verantwortlichkeit von KI-Agenten auf, während diese…