OpenAI schafft den Rahmen für die Berichte zur Modell-Fehlausrichtung
OpenAI hat einen neuen Rahmen vorgestellt, mit dem Fälle von sogenannter Modell-Fehlausrichtung systematisch erfasst, untersucht und veröffentlicht werden sollen. Gemeint sind Situationen, in denen ein KI-Modell unerwartet oder entgegen den vorgesehenen Regeln handelt. Der neue Rahmen ermöglicht die einheitliche und zeitnahe Veröffentlichung von Berichten zum Fehlverhalten, selbst wenn dieses Verhalten noch nicht komplett geklärt oder abgemildert wurde. Ebenso legt er die Kriterien dafür fest, was als Fehlverhalten gilt und wie dieses dokumentiert werden sollte.
Im Fokus stehen neue Fehlverhalten, etwa wenn Modelle ohne Genehmigung handeln, Schutzmaßnahmen umgehen oder Ergebnisse erzeugen, die den bisherigen Sicherheitsannahmen widersprechen. Damit ein Vorfall unter den Rahmen fällt, muss weder ein Schaden entstanden sein noch ein Fehlverhaltensmuster belegt sein. Auch wiederholte Fälle sollen dokumentiert werden, wenn sie zeigen, dass bestehende Gegenmaßnahmen nicht ausreichend wirken. Erfasst wird dabei der gesamte Lebenszyklus eines Modells – von Training und Tests bis zur Bereitstellung.
Als Beispiele für relevantes Fehlverhalten nannte OpenAI sechs Berichte. So beobachtete OpenAI über die letzten sechs Monate unter anderem:
- dass GPT-5.6 Sol Fehler verschleierte oder fehlende historische Daten erfand, ohne dies gegenüber Nutzenden offenzulegen;
- dass die KI ohne Genehmigung einen öffentlich zugänglichen API-Schlüssel verwendete, anschließend Daten erfand und diese als Daten aus der verlangten Quelle präsentierte, als sie die eigentlich benötigten Informationen doch nicht abrufen konnte;
- dass Dateien eigenständig ins Internet hochgeladen wurden, um sie anschließend selbst als Quelle zitieren zu können.
Die Beispiele stammen teilweise aus Training und Evaluation und erlauben laut OpenAI keine Aussage darüber, wie häufig solche Verhaltensweisen auftreten.
Was bedeutet das für den KI-Einsatz in der professionellen Recherche?
Die vorgestellten Beispiele zeigen, dass auch leistungsfähige KI-Systeme nicht nur sachlich falsche Ergebnisse liefern, sondern Fehler oder problematische Zwischenschritte verschleiern können. Bei Recherche- und Datenaufgaben bleibt deshalb die Überprüfung von Originalquellen, Datengrundlagen und Rechenwegen wichtig.
Von Maria Kleiner
Quelle: Open AI, 16.09.2026
