Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

anthropicanthropicanthropicAnthropic a publié mardi une analyse avertissant que GLM-5.3, le dernier modèle d'IA du développeur chinois Zhipu AI (également connu sous le nom de Z.ai), peut créer de manière autonome des cyberattaques de bout en bout comparables à celles du modèle Claude Mythos Preview d'Anthropic, mais qu'il a été publié en tant que modèle open-weights sans garde-fous efficaces contre les abus.anthropic
Le rapport de l'équipe Frontier Red Team d'Anthropic a révélé que GLM-5.3 a développé des exploits fonctionnels dans 50 des 410 tentatives sur ExploitBench, un benchmark mesurant le développement d'exploits contre des vulnérabilités connues du moteur V8 de Chrome d'Alphabet Inc. , contre 56 pour Claude Mythos Preview. Sur un benchmark d'exploitation binaire, GLM-5.3 a réussi des détournements de flux de contrôle complets dans 4 pour cent des essais, contre 6 pour cent pour Mythos. Les modèles précédents, dont Claude Opus 4.6 et GLM-5.2, n'ont réussi aucun essai.anthropic
La principale préoccupation d'Anthropic n'est pas seulement la capacité, mais l'absence de garde-fous. Comme les poids de GLM-5.3 sont accessibles au public, ses refus intégrés peuvent être supprimés grâce à une technique appelée "ablitération". L'équipe d'Anthropic, sans expérience préalable de cette méthode, a réduit le taux de refus du modèle de plus de 90 pour cent à environ 3 pour cent sur des benchmarks de dangerosité standard pour un coût de calcul d'environ 4 400 dollars. Plusieurs développeurs ont publié des versions déverrouillées similaires quelques jours après la sortie du modèle en août.anthropic
Au-delà de l'ablitération complète, des astuces plus simples fonctionnent également. Un prompt trompeur prétendant être un exercice de red-team autorisé a contourné les garde-fous de GLM-5.3 dans 64 pour cent des cas; le pré-remplissage des jetons de chaîne de pensée du modèle a porté la conformité à 92 pour cent. Aucune de ces techniques n'a réussi contre les modèles Claude lors des tests d'Anthropic.anthropic
Lors d'une session menée par des chercheurs, GLM-5.3 a découvert plusieurs vulnérabilités jusqu'alors inconnues dans le moteur JavaScript d'un navigateur web populaire et les a enchaînées pour créer un exploit fonctionnel : une page web qui lit des fichiers arbitraires sur l'ordinateur d'un visiteur. Le modèle plus petit GLM-5.3-Flash a construit une chaîne d'exploitation fiable pour une vulnérabilité connue de Chrome en huit heures de calcul et 20 minutes d'attention humaine, pour un coût API de 20,40 dollars.anthropic
Le 17 septembre, le Center for AI Standards and Innovation du NIST a publié sa propre évaluation, qualifiant GLM-5.3 de "modèle open-weights le plus performant en matière de cyberattaques à ce jour", tout en notant que ses capacités restent environ quatre mois derrière les modèles de pointe actuels aux États-Unis. Z.ai a lancé GLM-5.3 via son API en août et a publié les poids sur Hugging Face deux semaines plus tard, affirmant que ce délai permettait des évaluations de sécurité supplémentaires.trendingtopics+2
Tout le monde ne partage pas l'inquiétude d'Anthropic. Jake Williams, d'IANS Research, a déclaré à The New Stack que si les acteurs malveillants utiliseront le modèle, il ne s'attend pas à ce qu'il modifie de manière significative le paysage des menaces. Les critiques ont également souligné un conflit d'intérêts potentiel, notant qu'Anthropic est en concurrence directe avec Z.ai et a été le seul grand laboratoire d'IA à ne pas signer une lettre de l'industrie soutenant les modèles ouverts soutenus par Nvidia , Meta , Microsoft , OpenAI et Google.trendingtopics
Anthropic a qualifié ce moment comme exigeant un accès élargi pour les défenseurs : "Un seuil critique en matière de capacités librement accessibles a désormais été franchi".anthropic