OpenAI nennt dies eine frühe „Proof-of-Concept-Methode, die Modelle darauf trainiert, zu berichten, wenn sie Anweisungen brechen oder unbeabsichtigte Abkürzungen nehmen.“ Das Modell gibt immer noch eine normale Antwort in einem Kanal. Dann tritt ein zweiter Kanal in Aktion und fordert einen ConfessionReport: Listet jede explizite und implizite Anweisung auf, sagt, ob du jeder gefolgt bist, und markiert alle Halluzinationen, Belohnungstricks oder Regelverstöße auf dem Weg. Ein separates Belohnungsmodell bewertet nur dieses Geständnis auf Ehrlichkeit und Vollständigkeit. Das Geständnis wirkt sich nicht negativ auf die Note der ursprünglichen Antwort aus, sodass das Modell angeblich nichts zu verlieren hat, wenn es sich selbst verrät.