Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

wiredwiredlinkedinUne équipe de chercheurs a mis au point une technique permettant d'extraire les traces de raisonnement cachées des principaux modèles d'IA, révélant des preuves qu'au moins un système d'IA chinois pourrait avoir été entraîné en distillant les connaissances de ses homologues américains, bien que les chercheurs soulignent que leurs conclusions ne constituent pas une preuve définitive.
Des informaticiens de l'Université de Tübingen, de l'Institut Max Planck, de l'organisation de sécurité de l'IA MATS Research et de la société de cybersécurité Snyk ont découvert une vulnérabilité dans les modèles d'OpenAI, d'Anthropic et de Google Alphabet Inc. qui permet d'extraire des étapes de raisonnement dissimulées : les processus détaillés de chaîne de pensée que ces systèmes utilisent pour résoudre des problèmes complexes.wired
"Tous les principaux fournisseurs de modèles de pointe que nous avons examinés présentent cette vulnérabilité", a déclaré Alexander Panfilov, informaticien à l'Université de Tübingen ayant participé à la recherche. "Cela pourrait entraîner la fuite de données personnelles et faciliter des attaques de distillation de raisonnement à grande échelle".wired
Dans leur article, les chercheurs montrent que le modèle à poids ouverts Kimi K3 de Moonshot AI produit des résultats "remarquablement similaires" aux traces de raisonnement cachées de Claude Opus 4.8 et GPT 5.6 Sol pour certaines requêtes. Cependant, ils préviennent que leurs travaux "ne peuvent pas établir causalement une distillation". Les chercheurs ont également constaté que deux autres modèles à poids ouverts, DeepSeek (Chine) et Inkling (société américaine Thinking Machines), ne présentaient pas la même similitude de raisonnement avec Claude Opus.wired
Au-delà de la question de la distillation, la technique a révélé une vulnérabilité de sécurité qui pourrait être exploitée pour récupérer des informations sensibles, telles que des mots de passe et des clés API, à partir du raisonnement interne d'un modèle. Panfilov et ses coauteurs ont alerté OpenAI, Anthropic et Google, et chaque entreprise a ajusté son API pour atténuer le problème. Bien qu'il ne soit plus possible d'extraire des informations privées, Panfilov a précisé que certaines traces de raisonnement peuvent encore être découvertes via cette méthode, et qu'une résolution complète du risque de distillation nécessiterait "une refonte fondamentale du fonctionnement des API de ces entreprises".linkedin
Ces conclusions interviennent dans un contexte de tensions persistantes concernant la distillation de l'IA entre les entreprises américaines et chinoises. En février 2026, Anthropic et OpenAI ont publié des preuves de campagnes systématiques de distillation menées par des entreprises d'IA chinoises. Plus récemment, lors du lancement de Kimi K3 par Moonshot AI en juillet, le conseiller scientifique de la Maison Blanche, Michael Kratsios, a accusé l'entreprise de copier la technologie d'Anthropic. Des experts indépendants ont toutefois mis en doute le fait que le délai entre la sortie publique de Claude et le lancement de Kimi K3 soit suffisamment court pour étayer cette affirmation.iaps+2
La nouvelle recherche de l'équipe de Panfilov ajoute une dimension technique au débat, en offrant une méthode qui pourrait, en principe, détecter la distillation à grande échelle, tout en soulignant comment les outils de transparence qui améliorent la sécurité de l'IA peuvent également exposer les modèles à une extraction concurrentielle.