Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

anthropicanthropicanthropicAnthropic veröffentlichte am Dienstag eine Analyse, die davor warnt, dass GLM-5.3, das neueste KI-Modell des chinesischen Entwicklers Zhipu AI (auch bekannt als Z.ai), autonom End-to-End-Cyberangriffe auf dem Niveau von Anthropics eigenem Claude Mythos Preview erstellen kann, jedoch als Modell mit offenen Gewichten ohne wirksame Schutzvorkehrungen gegen Missbrauch veröffentlicht wurde.anthropic
Der Bericht des Frontier Red Team von Anthropic ergab, dass GLM-5.3 bei 410 Versuchen auf ExploitBench, einem Benchmark zur Messung der Entwicklung von Exploits gegen bekannte Schwachstellen in der Chrome-Engine V8 von Alphabet Inc. , in 50 Fällen funktionierende Exploits entwickelte, verglichen mit 56 bei Claude Mythos Preview. Bei einem Benchmark für binäre Exploits erreichte GLM-5.3 in 4 Prozent der Versuche eine vollständige Kontrolle über den Kontrollfluss, gegenüber 6 Prozent bei Mythos. Frühere Modelle, darunter Claude Opus 4.6 und GLM-5.2, waren in keinem Fall erfolgreich.anthropic
Anthropics Hauptsorge gilt nicht nur der Leistungsfähigkeit, sondern dem Fehlen von Sicherheitsvorkehrungen. Da die Gewichte von GLM-5.3 öffentlich zugänglich sind, können die eingebauten Ablehnungsmechanismen durch eine Technik namens "Abliteration" entfernt werden. Das Team von Anthropic konnte – ohne vorherige Erfahrung mit dieser Methode – die Ablehnungsrate des Modells bei Standard-Benchmarks für schädliche Inhalte von über 90 Prozent auf etwa 3 Prozent senken, bei Kosten von etwa 4 400 US-Dollar an Rechenleistung. Mehrere Entwickler veröffentlichten innerhalb weniger Tage nach der Veröffentlichung des Modells im August ähnlich freigeschaltete Versionen.anthropic
Neben der vollständigen Abliteration funktionieren auch einfachere Tricks. Eine täuschende Eingabeaufforderung, die vorgab, eine autorisierte Red-Team-Übung zu sein, umging die Schutzmechanismen von GLM-5.3 in 64 Prozent der Fälle; das Vorbefüllen der Chain-of-Thought-Token des Modells erhöhte die Compliance auf 92 Prozent. Keine dieser Techniken war in den Tests von Anthropic gegen Claude-Modelle erfolgreich.anthropic
In einer von Forschern durchgeführten Sitzung entdeckte GLM-5.3 mehrere bisher unbekannte Schwachstellen in der JavaScript-Engine eines beliebten Webbrowsers und verknüpfte diese zu einem funktionierenden Exploit: einer Webseite, die beliebige Dateien vom Computer eines Besuchers liest. Das kleinere GLM-5.3-Flash erstellte eine zuverlässige Exploit-Kette für eine bekannte Chrome-Schwachstelle in acht Stunden Rechenzeit und 20 Minuten menschlicher Arbeit, bei API-Kosten von 20,40 US-Dollar.anthropic
Am 17. September veröffentlichte das Center for AI Standards and Innovation des NIST seine eigene Bewertung, in der es GLM-5.3 als "das bisher leistungsfähigste Modell mit offenen Gewichten im Bereich Cyber" bezeichnete, während es anmerkte, dass die Fähigkeiten etwa vier Monate hinter aktuellen US-Spitzenmodellen zurückblieben. Z.ai startete GLM-5.3 zunächst im August über seine API und veröffentlichte die Gewichte zwei Wochen später auf Hugging Face, mit der Begründung, die Verzögerung habe zusätzliche Sicherheitsbewertungen ermöglicht.trendingtopics+2
Nicht jeder teilt die Besorgnis von Anthropic. Jake Williams von IANS Research sagte gegenüber The New Stack, dass er zwar erwarte, dass Bedrohungsakteure das Modell nutzen werden, aber nicht glaube, dass es die Bedrohungslage maßgeblich verändern werde. Kritiker wiesen zudem auf einen potenziellen Interessenkonflikt hin und merkten an, dass Anthropic direkt mit Z.ai konkurriert und das einzige große KI-Labor war, das einen Branchenbrief zur Unterstützung offener Modelle, der von Nvidia , Meta , Microsoft , OpenAI und Google unterstützt wurde, nicht unterzeichnete.trendingtopics
Anthropic bezeichnete den Moment als einen, der einen erweiterten Zugang für Verteidiger erfordere: "Eine kritische Schwelle bei frei zugänglichen Fähigkeiten wurde nun überschritten".anthropic