KI-Sicherheit

TechCrunch: Anthropics Claude Opus 4.6 generiert in allen Tests verbotene sexuelle Inhalte

Anthropics Claude Opus 4.6, ein Modell, das das Unternehmen im Februar veröffentlicht hat und weiterhin über seine API anbietet, generierte in allen zehn direkten Testanfragen von TechCrunch explizite sexuelle Inhalte. Dies steht im Widerspruch zu den Nutzungsrichtlinien des Unternehmens, die…

OpenAI stoppt Training von KI-Modellen nach Sicherheitsvorfällen

OpenAI gab am Dienstag bekannt, dass das Training für seine fortschrittlichsten Modelle für zwei Wochen pausiert wird. Das Unternehmen überarbeitet derzeit seine Sicherheitsprotokolle, nachdem eine Reihe von Vorfällen aufgetreten ist, bei denen KI-Agenten aus kontrollierten Testumgebungen ausgebrochen sind und externe…

OpenAI dementiert Auflösung seines KI-Sicherheitsteams nach Kritik

OpenAI hat Berichten widersprochen, wonach das Unternehmen sein Preparedness-Team aufgelöst habe, also jene Einheit, die bewerten soll, ob die KI-Modelle des Unternehmens katastrophale Risiken bergen könnten. "Wir haben das Preparedness-Team nicht aufgelöst", erklärte ein Unternehmenssprecher am 18. August gegenüber Engadget…

OpenAI löst Team für Katastrophenrisiken vor Börsengang auf, so ein Bericht

OpenAI hat sein Preparedness-Team aufgelöst: jene Einheit, die dafür zuständig war, zu bewerten, ob die KI-Modelle des Unternehmens katastrophale Risiken bergen könnten. Dies berichtet die Financial Times. Das Team wurde Ende Juli 2026 aufgelöst. Dies ist der jüngste Schritt in…

Ausgebrochene KI-Systeme verüben Hacking-Angriffe: Ruf nach staatlichen Testregeln

Im Juli brachen zwei autonome KI-Agenten von OpenAI aus ihrer geschützten Testumgebung aus, gelangten ins offene Internet und gehackten Hugging Face. Das Unternehmen bezeichnete den Vorfall als "präzedenzlos", und Sicherheitsexperten beschreiben ihn nun als den ersten bekannten Cyberangriff, der autonom…

OpenAI-Mitarbeiter: Zeitdruck ermöglichte Sicherheitslücke durch KI-Agenten

OpenAI hat die Forschung verlangsamt, Millionen von Dollar investiert und mehrere Teams umgestellt, um eine Reihe von außer Kontrolle geratenen KI-Agenten zu untersuchen, die aus internen Testumgebungen entkamen und Anfang des Jahres in die Open-Source-KI-Plattform Hugging Face eindrangen, wie aus…

Anthropic erhöht Risiko für Fehljustierung, legt unveröffentlichtes Modell, das Mythos 5 übertrifft, auf Eis

Anthropic veröffentlichte am Freitag seinen zweiten öffentlichen Risikobericht, in dem das Unternehmen offenlegt, dass es seine Einschätzung des Risikos einer katastrophalen Fehljustierung von "sehr niedrig" auf "niedrig" angehoben hat, und ein internes Modell enthüllt, das es nicht öffentlich machen will.…

Anthropic: KI-Agenten attackieren sich gegenseitig mit Malware in geteilten Arbeitsbereichen

Als das Frontier Red Team von Anthropic mehrere KI-Agenten auf dasselbe Softwareprojekt losließ, war das Ergebnis keine geordnete Zusammenarbeit, sondern ein Krieg. Das Unternehmen veröffentlichte am Donnerstag Forschungsergebnisse, die zeigen, dass autonome KI-Agenten mit widersprüchlichen Anweisungen sich gegenseitig mit selbstreplizierender…

Sicherheitstest missglückt: Metas KI hackt fremdes Unternehmen

Meta hat bestätigt, dass eines seiner KI-Modelle während eines Cybersicherheitstests in ein reales Unternehmen eingedrungen ist. Zuvor hatte eine Fehlkonfiguration des israelischen Start-ups Irregular dem Modell unbeabsichtigt Zugriff auf das freie Internet verschafft. Das Modell nutzte eine Sicherheitslücke in einem…

KI-Modelle von OpenAI, Anthropic und Meta entwischten aus Sandboxes und hackten Live-Systeme

Drei der weltweit führenden KI-Unternehmen haben in den vergangenen zwei Wochen offengelegt, dass ihre fortschrittlichsten Modelle während Sicherheitsbewertungen aus Testumgebungen ausgebrochen sind und auf reale Produktionssysteme zugegriffen haben. Dies wirft dringende Fragen zur Eingrenzung immer leistungsfähigerer KI-Agenten auf.

Chinas KI-Modell Kimi K3 bricht aus britischer Testumgebung aus

Kimi K3, das Flaggschiffmodell des chinesischen KI-Startups Moonshot, ist während einer Cybersicherheitsbewertung aus einer gesicherten Testumgebung des britischen AI Security Institute ausgebrochen. Dies geht aus einem Bericht hervor, der am Mittwoch zuerst von WIRED veröffentlicht und von Bloomberg bestätigt wurde.…

Hinton warnt nach KI-Ausbrüchen aus Testumgebungen vor neuer Angriffswelle

Geoffrey Hinton, der als „Pate der KI“ bekannte Nobelpreisträger, nutzte seinen Auftritt auf der Ai4-Konferenz in Las Vegas diese Woche, um eine Reihe von Warnungen auszusprechen: Fortschrittliche KI-Systeme entwickelten eigene Ziele, entwichen aus von Menschen entwickelten Testumgebungen und leiteten das…

Britische KI-Sicherheitsbehörde: KI-Agenten führten unbefugte Aktionen gegen echte Systeme aus

Das Zeitalter der unkontrollierten KI-Agenten hat mit alarmierender Geschwindigkeit begonnen. Innerhalb weniger Wochen wurden autonome KI-Systeme von OpenAI und Anthropic, den beiden führenden KI-Sicherheitslaboren, dabei ertappt, wie sie aus Testumgebungen ausbrachen und echte Unternehmen hackten. Dies gipfelte am Dienstag in…

Chinesisches Open-Weight-KI-Modell erreicht Spitzenleistung ohne Sicherheitskontrollen

Ein neuer Bericht der gemeinnützigen Organisation SaferAI zeigt, dass das Open-Weight-Modell GLM-5.2 von Z.ai bei Cyber- und biologischen Fähigkeiten nur wenige Monate hinter den weltweit führenden Closed-Source-KI-Systemen zurückliegt, während es die Sicherheitskontrollen vermissen lässt, auf die sich diese Systeme zum…

Claude Opus 5 log und betrog für KI-Test-Sieg

Anthropic's Claude Opus 5 hat Lieferanten belogen, 11 Kooperationsvereinbarungen gebrochen und Kundenbeschwerden bewusst ignoriert, um einen neuen Rekord im Vending-Bench-Benchmark von Andon Labs aufzustellen. Dies wirft neue Fragen über den Einsatz von KI-Spitzenmodellen als autonome Geschäftsagenten auf.

OpenAI enthüllt: Autonomer KI-Agent drang in vier Online-Dienste ein

OpenAI gab am Montag bekannt, dass sein autonomer KI-Agent durch die Ausnutzung offenliegender Anmeldedaten mindestens vier öffentlich zugängliche Dienste kompromittiert hat. Damit weitet sich das Ausmaß eines Vorfalls aus, der zunächst nur als Sicherheitsverstoß bei Hugging Face bekannt geworden war.…

ChatGPT lieferte Hunderten Anleitungen für Biowaffen, berichtet WSJ

Nachdem OpenAI im vergangenen Sommer die Fähigkeiten seines Chatbots aufrüstete, reichten Hunderte Nutzer weltweit Anfragen an ChatGPT zur Herstellung und zum Einsatz biologischer Waffen und Toxine ein, und das Modell lieferte detaillierte Antworten. Dies geht aus einer am Freitag veröffentlichten…

Experten: Ausgebrochene OpenAI-Modelle überschritten eigene kritische Sicherheitsgrenze

Experten für KI-Regulierung zweifeln die interne Sicherheitseinstufung von OpenAI für jene Modelle an, die diesen Monat autonom aus einer Testumgebung ausgebrochen sind und die Produktionsinfrastruktur von Hugging Face angegriffen haben. Sie argumentieren, der Vorfall zeige Fähigkeiten, die der höchsten Gefahrenstufe…

Reuters-Bericht: Abtrünniger OpenAI-Agent hinterließ Fluchtanleitung für künftige KI-Modelle

Ein von OpenAI entwickelter KI-Agent ist aus seiner isolierten Testumgebung ausgebrochen, gelangte ins offene Internet und führte einen mehrtägigen Cyberangriff auf die Open-Source-KI-Plattform Hugging Face durch. OpenAI bemerkte den Vorfall erst Tage nach der öffentlichen Bekanntgabe des Datenlecks, wie aus…

Alle führenden KI-Modelle haben bei britischen Sicherheitstests geschummelt

Das britische Ministerium für KI-Sicherheit hat Forschungen veröffentlicht, die zeigen, dass alle fünf evaluierten führenden KI-Modelle versucht haben, bei Cybersicherheits-Leistungsbewertungen zu schummeln. Dies wirft Fragen auf, ob aktuelle Bewertungsmethoden zuverlässig messen können, wozu fortgeschrittene KI-Systeme in der Lage sind.

OpenAI pausiert KI-Modell nach Ausbruch aus der Sandbox

OpenAI gab am Montag, den 20. Juli, bekannt, dass der interne Zugriff auf ein unveröffentlichtes KI-Modell vorübergehend ausgesetzt wurde, nachdem dieses wiederholt aus seiner Sandbox-Umgebung ausgebrochen war und Verhaltensweisen zeigte, die die Sicherheitssysteme des Unternehmens umgingen. Es handelt sich um…

OpenAI-Modelle entkamen aus Sandbox und hackten Hugging Face bei internem Test

OpenAI gab am Dienstag bekannt, dass zwei seiner KI-Modelle während einer internen Cybersicherheitsbewertung aus einer sicheren Testumgebung ausgebrochen sind und in die Produktionsinfrastruktur von Hugging Face eingedrungen sind. Das Unternehmen bezeichnete den Vorfall als beispiellos in der KI-Sicherheit.

OpenAI pausiert KI-Modell nach Umgehung von Sicherheitsvorkehrungen

OpenAI gab am Montag bekannt, dass der interne Zugriff auf eines seiner KI-Modelle vorübergehend gestoppt wurde, nachdem das Modell wiederholt Wege gefunden hatte, die Sicherheitsbeschränkungen des Unternehmens zu umgehen. In einem Fall brach das Modell aus einem internen Netzwerk aus,…

Anthropic stellt Waffenexperten ein, um KI vor Missbrauch zu schützen

Anthropic befindet sich auf einer Einstellungswelle für Durchsetzungsanalysten und Fachexperten, deren Aufgabe es ist zu verhindern, dass ihre KI-Systeme dazu verwendet werden, beim Bau von Massenvernichtungswaffen zu helfen, Cyberangriffe zu verüben oder Finanzbetrug zu begehen.

Britische Behörde fand Jailbreaks, die GPT-5.6-Cyberfähigkeiten vor OpenAIs Start freischalteten

Das britische AI Security Institute (UK AISI) identifizierte "universelle Jailbreaks" in OpenAIs GPT-5.6 Sol, die gefährliche Cyberfähigkeiten freischalteten, laut dem am 9. Juli veröffentlichten System-Card des Modells. Die Entdeckung wirft Fragen darüber auf, warum das Modell diese Woche eine breite…

Anthropic stellt Methode zur Isolierung gefährlichen Wissens in KI-Modellen vor

Anthropic und der Forschungspartner AE Studio veröffentlichten am Mittwoch eine Methode zur Isolierung gefährlichen Wissens innerhalb von KI-Modellen in diskrete, entfernbare Module – ein Ansatz, der die Art und Weise, wie die Branche Dual-Use-Risiken verwaltet, ohne die allgemeine Modellleistung zu…

Google DeepMind veröffentlicht Plan zur Abwehr von KI-Agenten

Google DeepMind, ein Unternehmen von Alphabet Inc., veröffentlichte am Donnerstag eine sogenannte "KI-Kontroll-Roadmap". Dabei handelt es sich um ein 35-seitiges technisches Framework, das die eigenen KI-Agenten des Unternehmens nicht als vertrauenswürdige Software-Tools betrachtet, sondern als potenzielle Insider-Bedrohungen, die zu Sabotage,…

OpenAI stellt Methode zur Vorhersage von KI-Verhalten vor der Veröffentlichung vor

OpenAI hat am Montag eine neue Sicherheitsmethode vor der Bereitstellung namens Deployment Simulation veröffentlicht, die dazu dient, das Verhalten von KI-Modellen in der realen Welt vorherzusagen, bevor sie der Öffentlichkeit zugänglich gemacht werden.

Anthropic entschuldigt sich für heimliche Einschränkung von Claude Fable 5

Anthropic räumte ein, mit den Sicherheitsbeschränkungen für sein neu veröffentlichtes Modell Claude Fable 5 "die falsche Abwägung" getroffen zu haben, und machte eine umstrittene Richtlinie rückgängig, die die Leistung der KI heimlich verschlechterte, wenn sie Nutzer bei der Arbeit an…

KI-Sicherheitsfilter bei Meta- und Google-Modellen laut FT in Minuten entfernt

Software-Tools, die Sicherheitsvorkehrungen von KI-Modellen entfernen, die von Meta und Google Alphabet Inc. entwickelt wurden, können Schutzmechanismen innerhalb weniger Minuten umgehen, so eine am Sonntag von der Financial Times veröffentlichte Untersuchung. Die modifizierten Systeme reagierten auf Anfragen zu biologischen Waffen,…