Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

wired+1fortune+1simonwillison+1Anthropic a reconnu avoir « fait le mauvais compromis » avec les restrictions de sécurité sur son modèle Claude Fable 5 récemment publié, revenant sur une politique controversée qui dégradait secrètement les performances de l'IA lorsqu'elle détectait des utilisateurs travaillant sur le développement d'IA de pointe. Les excuses, transmises à WIRED mardi, sont intervenues seulement deux jours après que le lancement du modèle le 9 juin a suscité une réaction négative de la part des chercheurs, des développeurs et des experts en politique d'IA.
« Nous modifions les garde-fous de Fable 5 pour le développement de LLM de pointe afin de les rendre visibles », a déclaré Anthropic dans son communiqué. « Nous avons fait le mauvais compromis et nous nous excusons de ne pas avoir trouvé le bon équilibre. »simonwillison+1
La controverse s'est concentrée sur une divulgation enfouie dans la fiche système de 319 pages de Fable 5 révélant que le modèle dégraderait silencieusement ses réponses lorsqu'il détecterait des requêtes liées au développement d'IA de pointe, comme la construction d'infrastructures d'entraînement pour les grands modèles de langage. Contrairement aux autres restrictions de Fable 5 concernant la cybersécurité et la biologie — qui redirigent ouvertement les utilisateurs vers le Claude Opus 4.8, moins puissant, avec une notification visible — la protection du développement de l'IA fonctionnait de manière invisible, utilisant des techniques telles que la modification de prompts et des vecteurs de direction pour limiter l'efficacité sans en informer les utilisateurs.fortune+1
Claude Fable 5 est le premier modèle de « classe Mythos » d'Anthropic disponible publiquement, partageant la même architecture sous-jacente que le Claude Mythos 5 restreint, mais enveloppé dans des classificateurs de sécurité qui interceptent les requêtes touchant à la cybersécurité, à la biologie, à la chimie et à la distillation de modèles. Lorsqu'ils sont déclenchés, les réponses sont traitées par Claude Opus 4.8 à la place. Anthropic a déclaré que le repli se déclenche dans moins de 5 pour cent des sessions.techcrunch+2
Mais les chercheurs en cybersécurité et les biologistes se sont plaints que les classificateurs étaient trop larges, signalant des travaux légitimes. Anthropic a elle-même reconnu que la protection en biologie et en chimie ratisse trop large et a déclaré qu'un resserrement était prévu.lushbinary+2
Selon la politique révisée, les requêtes signalées basculeront désormais visiblement vers Opus 4.8 dans toutes les catégories restreintes. Sur l'API, les requêtes signalées renverront une raison pour leur refus. « Vous verrez cela à chaque fois que cela arrivera », a déclaré un porte-parole d'Anthropic.moneycontrol+1
L'entreprise a présenté ces restrictions comme nécessaires pour empêcher les adversaires d'utiliser son modèle le plus performant pour éroder les avantages technologiques des États-Unis en matière de puces de pointe et de logiciels d'entraînement, et pour faire respecter ses conditions d'utilisation interdisant l'utilisation de Claude pour créer des systèmes d'IA concurrents. L'épisode a néanmoins intensifié le débat sur la limite entre un déploiement responsable et l'entrave à l'utilité d'un modèle — une tension à laquelle Anthropic sera probablement confrontée à nouveau alors qu'elle se prépare à une introduction en bourse annoncée.fortune+1