Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

wiredwiredlinkedinEin Forschungsteam hat eine Technik entwickelt, um verborgene Denkprozesse aus führenden KI-Modellen zu extrahieren. Dies liefert Hinweise darauf, dass mindestens ein chinesisches KI-System durch die Destillation von Erkenntnissen amerikanischer Pendants trainiert worden sein könnte, wobei die Forscher betonen, dass ihre Ergebnisse keinen endgültigen Beweis darstellen.
Informatiker der Universität Tübingen, des Max-Planck-Instituts, der KI-Sicherheitsorganisation MATS Research und des Cybersicherheitsunternehmens Snyk entdeckten eine Schwachstelle in Modellen von OpenAI, Anthropic und Google Alphabet Inc. , die es ermöglicht, verborgene Schlussfolgerungsschritte zu extrahieren – die detaillierten Denkprozesse, die diese Systeme zur Lösung komplexer Probleme nutzen.wired
"Alle führenden Anbieter von Grenzmodellen, die wir untersucht haben, weisen diese Schwachstelle auf", sagte Alexander Panfilov, Informatiker an der Universität Tübingen, der an der Forschung beteiligt war. "Dies könnte zum Abfluss persönlicher Daten führen und erleichtert groß angelegte Angriffe durch Destillation von Denkprozessen."wired
In ihrer Arbeit zeigen die Forscher, dass das Open-Weight-Modell Kimi K3 von Moonshot AI bei bestimmten Eingaben Ergebnisse liefert, die "bemerkenswert ähnlich" zu den verborgenen Denkspuren von Claude Opus 4.8 und GPT 5.6 Sol sind. Sie warnen jedoch davor, dass ihre Arbeit "keinen kausalen Nachweis für Destillation erbringen kann". Die Forscher stellten zudem fest, dass zwei andere Open-Weight-Modelle – das chinesische DeepSeek und Inkling der US-Firma Thinking Machines – nicht dieselbe Ähnlichkeit in den Denkprozessen mit Claude Opus aufwiesen.wired
Über die Frage der Destillation hinaus deckte die Technik eine Sicherheitslücke auf, die ausgenutzt werden könnte, um sensible Informationen wie Passwörter und API-Schlüssel aus dem internen Denkprozess eines Modells abzurufen. Panfilov und seine Koautoren alarmierten OpenAI, Anthropic und Google, woraufhin jedes Unternehmen seine API anpasste, um das Problem zu entschärfen. Obwohl das Extrahieren privater Informationen nicht mehr möglich ist, sagte Panfilov, dass einige Denkspuren mit der Methode weiterhin aufgedeckt werden können und eine vollständige Behebung des Destillationsrisikos "eine grundlegende Überarbeitung der Funktionsweise der APIs dieser Unternehmen" erfordern würde.linkedin
Die Ergebnisse fallen in eine Zeit anhaltender Spannungen zwischen US-amerikanischen und chinesischen Firmen bezüglich KI-Destillation. Im Februar 2026 veröffentlichten Anthropic und OpenAI Beweise für systematische Destillationskampagnen chinesischer KI-Unternehmen. Als Moonshot AI im Juli Kimi K3 veröffentlichte, beschuldigte der Wissenschaftsberater des Weißen Hauses, Michael Kratsios, das Unternehmen, die Technologie von Anthropic kopiert zu haben. Unabhängige Experten haben jedoch in Frage gestellt, ob der Zeitraum zwischen der öffentlichen Veröffentlichung von Claude und dem Start von Kimi K3 kurz genug war, um diese Behauptung zu stützen.iaps+2
Die neue Forschung des Teams um Panfilov verleiht der Debatte eine technische Dimension – sie bietet eine Methode, die prinzipiell Destillation in großem Maßstab erkennen könnte – und unterstreicht gleichzeitig, wie dieselben Transparenzwerkzeuge, die die KI-Sicherheit fördern, Modelle auch für wettbewerbsorientierte Extraktionen anfällig machen können.