red teaming

OpenAI julkisti GPT-Redin, tekoälyn, joka on rakennettu hakkeroimaan omia mallejaan

OpenAI julkisti tiistaina GPT-Redin, sisäisen automatisoidun red-teaming-järjestelmän, joka käyttää itsepeluuta (self-play) löytääkseen kehotteiden injektiohaavoittuvuuksia yhtiön tekoälymalleista laajassa mittakaavassa. OpenAI:n tutkimusblogissa otsikolla "GPT-Red: Unlocking Self-Improvement for Robustness" julkaistu tiedote kuvailee järjestelmää tarkoitukseen rakennetuksi vastustajaksi, joka on suunniteltu stressitestaamaan yhtiön tuotteita ennen…