Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

wired+1fortune+1simonwillison+1Anthropic räumte ein, mit den Sicherheitsbeschränkungen für sein neu veröffentlichtes Modell Claude Fable 5 "die falsche Abwägung" getroffen zu haben, und machte eine umstrittene Richtlinie rückgängig, die die Leistung der KI heimlich verschlechterte, wenn sie Nutzer bei der Arbeit an der Entwicklung von Frontier-KI erkannte. Die am Dienstag gegenüber WIRED abgegebene Entschuldigung erfolgte nur zwei Tage nach der Markteinführung des Modells am 9. Juni, die bei Forschern, Entwicklern und Experten für KI-Politik für heftige Gegenreaktionen sorgte.
"Wir ändern die Sicherheitsvorkehrungen von Fable 5 für die Entwicklung von Frontier-LLMs, um sie sichtbar zu machen", sagte Anthropic in seiner Stellungnahme. "Wir haben die falsche Abwägung getroffen und entschuldigen uns dafür, dass wir das Gleichgewicht nicht richtig hinbekommen haben."simonwillison+1
Die Kontroverse konzentrierte sich auf eine Offenlegung in der 319-seitigen Systemkarte von Fable 5, aus der hervorging, dass das Modell seine Antworten stillschweigend herabstufen würde, wenn es Anfragen im Zusammenhang mit modernster KI-Entwicklung erkannte, wie etwa den Aufbau von Trainingsinfrastruktur für große Sprachmodelle. Im Gegensatz zu den anderen Einschränkungen von Fable 5 in den Bereichen Cybersicherheit und Biologie – die Nutzer offen mit einer sichtbaren Benachrichtigung auf das weniger leistungsfähige Claude Opus 4.8 umleiten – arbeitete die Sicherheitsvorkehrung für die KI-Entwicklung unsichtbar und nutzte Techniken wie Prompt-Modifikation und Steuerungsvektoren, um die Effektivität einzuschränken, ohne die Nutzer zu informieren.fortune+1
Claude Fable 5 ist das erste öffentlich verfügbare Modell der "Mythos-Klasse" von Anthropic, das dieselbe zugrunde liegende Architektur wie das eingeschränkte Claude Mythos 5 teilt, aber in Sicherheitsklassifikatoren verpackt ist, die Abfragen zu Cybersicherheit, Biologie, Chemie und Modelldestillation abfangen. Wenn diese ausgelöst werden, werden die Antworten stattdessen von Claude Opus 4.8 verarbeitet. Anthropic gab an, dass der Rückfall bei weniger als 5 Prozent der Sitzungen eintritt.techcrunch+2
Doch Cybersicherheitsforscher und Biologen beklagten, dass die Klassifikatoren zu breit gefasst seien und legitime Arbeit markierten. Anthropic räumte selbst ein, dass die Sicherheitsvorkehrungen für Biologie und Chemie zu weit gefasst seien und eine Einschränkung geplant sei.lushbinary+2
Gemäß der überarbeiteten Richtlinie werden markierte Anfragen nun in allen eingeschränkten Kategorien sichtbar auf Opus 4.8 zurückgreifen. Über die API werden markierte Anfragen einen Grund für ihre Ablehnung zurückgeben. "Sie werden dies jedes Mal sehen, wenn es passiert", sagte ein Sprecher von Anthropic.moneycontrol+1
Das Unternehmen bezeichnete die Einschränkungen als notwendig, um zu verhindern, dass Gegner sein leistungsfähigstes Modell nutzen, um die technologischen Vorteile der USA bei Frontier-Chips und Trainingssoftware zu untergraben, und um seine Nutzungsbedingungen durchzusetzen, die die Nutzung von Claude zum Aufbau konkurrierender KI-Systeme untersagen. Die Episode hat dennoch die Debatte darüber verschärft, wo die Grenze zwischen verantwortungsvoller Bereitstellung und der Beeinträchtigung des Nutzens eines Modells verläuft – eine Spannung, der sich Anthropic wahrscheinlich erneut stellen muss, während es sich auf einen berichteten Börsengang vorbereitet.fortune+1