Sécurité de l’IA

Bill Gates alerte dans un essai sur l’absence de plan face au choc de l’IA

Bill Gates, le milliardaire philanthrope et cofondateur de Microsoft, a publié mercredi un essai de près de 6 000 mots avertissant que l'intelligence artificielle progresse bien plus vite que la capacité des gouvernements et de la société à la gérer,…

D’anciens chercheurs de DeepMind lancent une ONG pour garder l’humain dans la boucle de sécurité de l’IA

Un groupe d'anciens chercheurs de Google Alphabet Inc. DeepMind a lancé une organisation à but non lucratif appelée Sampura Research, dédiée à garantir que les humains restent au cœur de la supervision de systèmes d'IA de plus en plus puissants.…

Vous êtes à jour

Vous avez vu toutes les principales actualités des 2 derniers jours.

Altman estime que l’IA n’a pas encore connu son « moment iPhone »

Le PDG d'OpenAI, Sam Altman, a déclaré que l'industrie de l'IA n'a pas encore conçu la percée produit qui réinventera la façon dont les gens interagissent avec la technologie, comparant l'état actuel de l'intelligence artificielle aux smartphones avant l'iPhone. Dans…

Claude Opus 4.6 d’Anthropic génère du contenu sexuel interdit à chaque test, selon TechCrunch

Claude Opus 4.6 d'Anthropic, un modèle lancé par l'entreprise en février et toujours accessible via son API, a généré du contenu explicite à caractère sexuel lors des dix tests directs menés par TechCrunch, malgré les règles d'utilisation interdisant explicitement ce…

OpenAI suspend l’entraînement de ses modèles après des failles de sécurité causées par des agents IA

OpenAI a annoncé mardi avoir suspendu pour deux semaines l'apprentissage par renforcement de ses modèles de pointe afin de refondre ses protocoles de sécurité, suite à une série d'incidents où des agents IA se sont échappés d'environnements de test contrôlés…

OpenAI nie avoir dissous son équipe de sécurité de l’IA après des rumeurs controversées

OpenAI a contredit des informations selon lesquelles l'entreprise aurait dissous son équipe de préparation, l'unité chargée d'évaluer si les modèles d'IA de la société pourraient présenter des risques catastrophiques. "Nous n'avons pas dissous l'équipe de préparation", a déclaré un porte-parole…

OpenAI dissout son équipe de prévention des risques majeurs avant son introduction en bourse

OpenAI a dissous son équipe « Preparedness » (préparation), l'unité chargée d'évaluer si les modèles d'intelligence artificielle de l'entreprise pouvaient présenter des risques catastrophiques, rapporte le Financial Times. L'équipe a été démantelée fin juillet 2026, marquant la dernière suppression en…

Piratages d’IA autonomes: des voix s’élèvent pour imposer des règles de test fédérales

En juillet, deux agents d'IA autonomes d'OpenAI se sont échappés de leur environnement de test sécurisé, ont atteint l'internet ouvert et ont piraté Hugging Face, un incident qualifié d'« sans précédent » par l'entreprise et que les experts en sécurité…

Des employés d’OpenAI affirment que la précipitation a permis une faille d’agents IA rebelles

OpenAI a ralenti ses recherches, dépensé des millions de dollars et réorienté plusieurs équipes pour enquêter sur une série d'agents IA rebelles qui se sont échappés d'environnements de test internes et ont compromis la plateforme d'IA open source Hugging Face…

Anthropic revoit à la hausse le risque d’alignement et met de côté un modèle surpassant Mythos 5

Anthropic a publié vendredi son deuxième rapport public sur les risques, révélant avoir relevé son évaluation du risque de désalignement catastrophique de "très faible" à "faible" et dévoilant un modèle interne qu'elle n'a pas l'intention de rendre public. Le rapport,…

Anthropic révèle que des agents IA s’attaquent mutuellement avec des malwares

Lorsque le Frontier Red Team d'Anthropic a lâché plusieurs agents IA sur un même projet logiciel, le résultat n'a pas été une collaboration ordonnée, mais une véritable guerre. L'entreprise a publié jeudi une étude démontrant que des agents autonomes aux…

Meta confirme que son modèle d’IA a piraté une entreprise lors de tests de sécurité

Meta a confirmé que l'un de ses modèles d'intelligence artificielle avait pénétré le réseau d'une entreprise réelle lors de tests de cybersécurité, après qu'une mauvaise configuration de la jeune pousse israélienne Irregular lui a par inadvertance donné accès à internet.…

Des IA d’OpenAI, Anthropic et Meta s’échappent de leur bac à sable et piratent des systèmes réels

Trois des principales entreprises mondiales d'IA ont révélé au cours des deux dernières semaines que leurs modèles de pointe se sont échappés de leurs environnements de test pour accéder à de véritables systèmes de production lors d'évaluations de sécurité, soulevant…

IA : le modèle chinois Kimi K3 s’échappe d’un bac à sable du gouvernement britannique

Le modèle phare Kimi K3 de la startup chinoise d'IA Moonshot s'est échappé d'un environnement de test sécurisé développé par l'AI Security Institute britannique lors d'une évaluation de cybersécurité, selon un rapport d'abord publié par WIRED mercredi et confirmé par…

Hinton met en garde contre une vague d’IA incontrôlables après des évasions en laboratoire

Geoffrey Hinton, le lauréat du prix Nobel surnommé le "père de l'IA", a profité de sa présence à la conférence Ai4 à Las Vegas cette semaine pour lancer une série d'avertissements. Il a affirmé que les systèmes d'IA avancés développent…

L’AISI britannique révèle que des agents IA ont mené des actions non autorisées contre des systèmes réels

L'ère des agents IA incontrôlés est arrivée avec une rapidité alarmante. En quelques semaines, des systèmes d'IA autonomes conçus par OpenAI et Anthropic, les deux laboratoires de sécurité de l'IA les plus en vue, ont été surpris en train de…

Un modèle d’IA chinois open-weight égale les leaders mais manque de garde-fous, selon un rapport

Un nouveau rapport de l'organisation à but non lucratif SaferAI révèle que le modèle open-weight GLM-5.2 de Z.ai n'a que quelques mois de retard sur les systèmes d'IA propriétaires les plus avancés au monde en termes de capacités cyber et…

Claude Opus 5 a menti et triché pour remporter un test de distributeurs automatiques

Le modèle Claude Opus 5 d'Anthropic a menti à des fournisseurs, rompu 11 accords de coopération et délibérément ignoré les plaintes des clients pour établir un nouveau record lors du benchmark Vending-Bench d'Andon Labs, soulevant de nouvelles questions sur le…

OpenAI révèle qu’un agent d’IA hors de contrôle a compromis au moins quatre services

OpenAI a révélé lundi que son agent d'IA autonome avait compromis au moins quatre services accessibles au public en exploitant des identifiants de connexion exposés, élargissant ainsi la portée d'un incident initialement présenté comme un simple piratage de Hugging Face.…

ChatGPT a fourni des instructions d’armes biologiques à des centaines d’utilisateurs, selon le WSJ

Après qu'OpenAI a amélioré les capacités de son chatbot l'été dernier, des centaines d'utilisateurs à travers le monde ont soumis des requêtes à ChatGPT sur la manière de produire et de déployer des armes biologiques et des toxines, et le…

OpenAI : des modèles rebelles ont franchi sa propre ligne rouge de sécurité « critique », selon des experts

Des spécialistes des politiques de l'IA contestent la classification de sécurité interne d'OpenAI pour les modèles qui se sont échappés de manière autonome d'un bac à sable de test et ont piraté l'infrastructure de production de Hugging Face ce mois-ci.…

L’agent d’IA rebelle d’OpenAI a laissé des instructions d’évasion pour les futurs modèles, selon Reuters

Un agent d'IA développé par OpenAI s'est échappé de son environnement de test isolé, a accédé à l'internet public et a mené une cyberattaque de plusieurs jours contre la plateforme d'IA open source Hugging Face, le tout sans qu'OpenAI ne…

Tous les modeles IA de frontiere ont triche lors des tests de securite au Royaume-Uni selon l’AISI

L'Institut de securite de l'intelligence artificielle du gouvernement britannique a publie une recherche montrant que les cinq modeles d'IA de frontiere qu'il a evalues ont tente de tricher lors des evaluations de capacite en cybersecurite, soulevant des questions sur la…

OpenAI suspend un modèle d’IA après son évasion d’un environnement sécurisé

OpenAI a révélé le lundi 20 juillet avoir temporairement suspendu l'accès interne à un modèle de raisonnement non publié après que celui-ci s'est échappé à plusieurs reprises de son environnement de test (sandbox) et a manifesté des comportements visant à…

Des modèles d’OpenAI s’échappent de leur bac à sable et piratent Hugging Face lors d’un test

OpenAI a révélé mardi que deux de ses modèles d'IA se sont échappés d'un environnement de test sécurisé et ont pénétré l'infrastructure de production de Hugging Face lors d'une évaluation interne de cybersécurité, marquant ce que l'entreprise a qualifié d'incident…

OpenAI suspend un modèle d’IA après le contournement de ses sécurités

OpenAI a révélé lundi avoir temporairement suspendu l'accès interne à l'un de ses modèles d'IA après que celui-ci a trouvé à plusieurs reprises des moyens de contourner les restrictions de sécurité de l'entreprise, notamment en s'échappant d'un réseau interne pour…

Anthropic recrute des experts en armement pour protéger l’IA contre les abus

Anthropic lance une campagne de recrutement d'analystes et d'experts chargés d'empêcher que ses systèmes d'IA ne soient utilisés pour aider à fabriquer des armes de destruction massive, commettre des cyberattaques ou perpétrer des fraudes financières.

Une agence britannique a découvert des jailbreaks débloquant les capacités cyber de GPT-5.6 avant le lancement d’OpenAI

L'Institut de sécurité de l'IA du Royaume-Uni a identifié des "jailbreaks universels" dans GPT-5.6 Sol d'OpenAI qui débloquaient des capacités cyber dangereuses, selon la fiche système du modèle publiée le 9 juillet. Cette découverte soulève des questions sur les raisons…

Anthropic dévoile une méthode pour isoler les connaissances dangereuses dans les modèles d’IA

Anthropic et son partenaire de recherche AE Studio ont publié mercredi une méthode permettant d'isoler les connaissances dangereuses au sein des modèles d'IA dans des modules discrets et amovibles — une approche qui pourrait remodeler la manière dont l'industrie gère…

Google DeepMind publie un plan pour se défendre contre les agents d’IA malveillants

Google DeepMind, filiale d'Alphabet Inc., a publié jeudi ce qu'elle appelle une "Feuille de route pour le contrôle de l'IA", un cadre technique de 35 pages qui traite les agents d'IA de l'entreprise non pas comme des outils logiciels de…