Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

openai+1dailytechnologyreview+1OpenAI julkisti tiistaina GPT-Redin, sisäisen automatisoidun red-teaming-järjestelmän, joka käyttää itsepeluuta (self-play) löytääkseen kehotteiden injektiohaavoittuvuuksia yhtiön tekoälymalleista laajassa mittakaavassa. OpenAI:n tutkimusblogissa otsikolla "GPT-Red: Unlocking Self-Improvement for Robustness" julkaistu tiedote kuvailee järjestelmää tarkoitukseen rakennetuksi vastustajaksi, joka on suunniteltu stressitestaamaan yhtiön tuotteita ennen kuin ihmishyökkääjät ehtivät hyödyntää niitä.openai+1
MIT Technology Review'n julkaiseman yksinoikeusraportin mukaan GPT-Red on suunniteltu toimimaan "korkean suorituskyvyn vastustajana", joka tutkii järjestelmällisesti, miten OpenAI:n mallit käyttäytyvät hyökkäyksen alaisena. Järjestelmää käytettiin vastustajapohjaiseen koulutukseen GPT-5.6:lle, OpenAI:n uusimmalle 9. heinäkuuta julkaistulle lippulaivamalliperheelle, mikä johti yhtiön mukaan parantuneeseen kestävyyteen kehotteiden injektiohyökkäyksiä vastaan.technologyreview+2
OpenAI:n GPT-5.6-järjestelmäkortissa todetaan, että yhtiö käytti noin 700 000 A100e GPU-tuntia "mustan laatikon automatisoituun red teamingiin" ennen mallin yleistä saatavuutta, mikä mahdollisti "todennäköisten heikkouksien järjestelmällisen tutkimisen, jailbreak-aukkojen löytämisen ja järjestelmän vahvistamisen ennen julkaisua". GPT-Red näyttää olevan tämän automatisoidun testausinfrastruktuurin huipentuma, joka on nyt virallistettu nimettynä järjestelmänä, jolla on itsepeluukykyjä.openai
Julkistus tapahtuu samalla, kun OpenAI kohtaa kasvavaa tarkastelua yhä kyvykkäämpien malliensa kaksoiskäyttöluonteen vuoksi. GPT-5.6 luokiteltiin yhtiön valmiuskehyksen (Preparedness Framework) mukaisesti "korkean" suorituskyvyn luokkaan sekä kyberturvallisuuden että biologisten riskien osalta, vaikka se ei ylittänyt "kriittistä" kynnysarvoa kummassakaan kategoriassa. Yhdistyneen kuningaskunnan tekoälyturvallisuusinstituutti vahvisti erikseen, että GPT-5.5 oli jo aiemmin tänä vuonna osoittanut rajatason kyberkyvykkyyksiä.aisi+1
OpenAI on työskennellyt automatisoidun red teamingin parissa jo jonkin aikaa. Toukokuussa 2026 julkaistussa työpaikkailmoituksessa haettiin tutkijaa johtamaan yhtiön "Automated Red Teaming (ART) -pyrkimystä", joka keskittyy "skaalautuvien, tutkimuslähtöisten järjestelmien rakentamiseen, jotka paljastavat jatkuvasti virhetiloja". Yhtiö järjesti myös viime vuonna 500 000 dollarin julkisen red teaming -haasteen Kagglessa avoimen painoarvon mallilleen.jobs.ashbyhq+1
OpenAI kehysti GPT-Redin osaksi pyrkimystään "tulevaisuudenkestävöidä" turvatoimia vastustajien uhkia vastaan, jotka kehittyvät mallien kykyjen rinnalla, kuvaillen tiedotteessaan lähestymistapaa itsepeluun käytöksi "tekoälyn turvallisuuden, linjauksen ja kehotteiden injektiokestävyyden" parantamiseksi.openai