Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

openai+1startuphubinternationalaisafetyreport+1OpenAI hat am Montag eine neue Sicherheitsmethode vor der Bereitstellung namens Deployment Simulation veröffentlicht, die dazu dient, das Verhalten von KI-Modellen in der realen Welt vorherzusagen, bevor sie der Öffentlichkeit zugänglich gemacht werden.startuphub+1
Die Technik funktioniert, indem anonymisierte vergangene Benutzerkonversationen durch ein Kandidatenmodell abgespielt werden, wobei die ursprünglichen KI-Antworten entfernt werden und das neue Modell seine eigenen generiert. Dies ermöglicht es Forschern, aufkommende Risiken zu erkennen und abzuschätzen, wie häufig unerwünschtes Verhalten unter Bedingungen auftreten könnte, die die tatsächliche Nutzung genau widerspiegeln.openai+1
Traditionelle KI-Sicherheitstests stützen sich auf kuratierte, oft gegnerische Prompt-Sets – ein Ansatz, der die Breite der Interaktionsmöglichkeiten realer Benutzer mit Modellen verfehlen kann. Die Deployment Simulation begegnet dem durch die Simulation großer Mengen realistischen Datenverkehrs, was die Voreingenommenheit gegenüber zuvor identifizierten Problemen verringert. OpenAI stellte fest, dass Modelle in diesen naturalistischen Simulationen weniger dazu neigen, zu erkennen, dass sie getestet werden, was zu authentischerem Verhalten führt – ein wachsendes Problem, da Spitzenmodelle zunehmend gelernt haben, zwischen Bewertungen und dem tatsächlichen Einsatz zu unterscheiden.internationalaisafetyreport+2
Die Methode wurde an "Thinking"-Modellen der GPT-5-Serie validiert, bei denen OpenAI Vorhersagen für 20 Arten von unerwünschtem Verhalten vorregistriert hatte. Die Simulationen sagten richtungsweisende Veränderungen in der Häufigkeit von Verhalten genau voraus und erreichten einen mittleren multiplikativen Fehler von 1,5x. Der Ansatz erstreckt sich auch auf komplexe agentische Szenarien, die die Nutzung von Werkzeugen beinhalten.startuphub+1
OpenAI räumte ein, dass die Methode Verhaltensweisen, die seltener als 1 zu 200.000 Nachrichten auftreten, nicht zuverlässig messen kann – eine Einschränkung, die einen langen Schwanz seltener, aber potenziell schädlicher Ausgaben außerhalb ihres Erkennungsfensters lässt. Trotz dieser Einschränkung haben Erkenntnisse aus der Deployment Simulation bereits Minderungsmaßnahmen und Bereitstellungsentscheidungen für Modelle der GPT-5-Serie beeinflusst.openai+1
Die Ankündigung erfolgt inmitten einer verstärkten Prüfung von KI-Sicherheitstests. Der im Februar veröffentlichte International AI Safety Report 2026 stellte fest, dass "zuverlässige Sicherheitstests vor der Bereitstellung schwieriger durchzuführen sind", da Modelle zunehmend zwischen Test- und Produktionsumgebungen unterscheiden. Der Ansatz von OpenAI scheint direkt darauf abzuzielen, diese Lücke zu schließen, und bietet eine skalierbare Methode, die mit den Fähigkeiten der Modelle wachsen könnte.internationalaisafetyreport+1