Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

openai+1dailytechnologyreview+1Společnost OpenAI v úterý představila GPT-Red, interní automatizovaný systém typu „red-teaming“, který využívá metodu „self-play“ (sebe-hraní) k objevování „prompt injection“ zranitelností v modelech umělé inteligence společnosti ve velkém měřítku. Oznámení, publikované na výzkumném blogu OpenAI pod názvem „GPT-Red: Unlocking Self-Improvement for Robustness“, popisuje systém jako účelově vytvořeného protivníka navrženého k zátěžovému testování produktů společnosti dříve, než je mohou zneužít lidští útočníci.openai+1
Podle MIT Technology Review, který o tomto úsilí zveřejnil exkluzivní zprávu, je GPT-Red navržen tak, aby fungoval jako „vysoce schopný protivník“, který systematicky zkoumá, jak se modely OpenAI chovají pod útokem. Systém byl použit k adversariálnímu tréninku GPT-5.6, nejnovější rodiny vlajkových modelů OpenAI vydané 9. července, což vedlo k tomu, co společnost popsala jako zlepšenou odolnost vůči „prompt injection“ útokům.technologyreview+2
Karta systému GPT-5.6 od OpenAI uvádí, že společnost věnovala přibližně 700 000 hodin na GPU A100e „automatizovanému red-teamingu typu black-box“ před obecnou dostupností modelu, což jí umožnilo „systematicky zkoumat pravděpodobná slabá místa, odhalovat jailbreaky a pomoci nám posílit systém před spuštěním.“ GPT-Red se zdá být vyvrcholením této automatizované testovací infrastruktury, nyní formalizované jako pojmenovaný systém se schopnostmi „self-play“.openai
Vydání přichází v době, kdy OpenAI čelí rostoucí kontrole kvůli dvojímu využití svých stále schopnějších modelů. GPT-5.6 byl v rámci rámce připravenosti společnosti hodnocen jako model s „vysokou“ schopností v oblasti kybernetické bezpečnosti i biologického rizika, ačkoliv v žádné z kategorií nepřekročil „kritickou“ hranici. Britský institut pro bezpečnost AI (UK's AI Safety Institute) samostatně potvrdil, že GPT-5.5 již začátkem tohoto roku prokázal kybernetické schopnosti na úrovni nejmodernějších technologií.aisi+1
OpenAI se automatizovaným „red-teamingem“ zabývá již delší dobu. Pracovní inzerát z května 2026 hledal výzkumníka, který by vedl „úsilí o automatizovaný red-teaming (ART)“ společnosti, zaměřené na „budování škálovatelných systémů založených na výzkumu, které neustále odhalují režimy selhání.“ Společnost také loni na platformě Kaggle uspořádala veřejnou „red-teaming“ výzvu s odměnou 500 000 dolarů pro svůj model s otevřenými vahami.jobs.ashbyhq+1
OpenAI prezentovala GPT-Red jako součást svého úsilí o „zajištění bezpečnosti do budoucna“ proti adversariálním hrozbám, které se vyvíjejí spolu se schopnostmi modelů, a ve svém oznámení popsala tento přístup jako využití „self-play“ ke zlepšení „bezpečnosti AI, zarovnání (alignment) a odolnosti vůči prompt injection.“openai