Wie man verhindert, dass ChatGPT bei regulierter Compliance-Arbeit halluziniert

AI Compliance Prompt Engineering AI Agents Responsible Gambling

Ein britisches Responsible-Gambling-Team (RG) kam mit einem Problem zu uns, das jeder wiedererkennt, der regulierte Arbeit automatisiert. Sie nutzen ChatGPT, um automatisierte Compliance-Trigger in formale Analystennotizen umzuwandeln. Wenn ein Kunde einen Schwellenwert überschreitet — Umsatz um mehr als 100 % in 30 Tagen gestiegen, eine Session, die über ihr Limit hinausläuft —, kopiert ein Analyst die relevanten Daten in ChatGPT, und das Modell verfasst gemäß einem vorab hochgeladenen Prompt eine Notiz für die Compliance-Akte des Kunden.

Diese Notiz ist kein Entwurf für eine E-Mail. Sie ist ein rechtliches Dokument, das von der UK Gambling Commission geprüft werden kann. Und nach einiger Zeit begann ChatGPT, Zahlen zu halluzinieren, wichtige Informationen auszulassen, Gedankenstriche einzufügen, die den Hausstil verletzten, und sich am Nachmittag still von den Regeln zu entfernen. Bei einer regulierten Akte ist jedes davon ein Compliance-Problem.

Die Frage, die sie stellten, war einfach: Können wir von einem Sprachmodell überhaupt die Konsistenz erreichen, die regulierte Arbeit erfordert? Die Antwort ist ja — aber nicht, indem man den Wortlaut eines Prompts in einem Chat-Fenster anpasst. Es braucht eine Änderung der Architektur plus eine disziplinierte Neufassung. Dieser Artikel führt durch die genaue Methode, anhand des RG-Workflows als Anwendungsbeispiel, damit Sie sie auf jeden regulierten Prozess anwenden können, bei dem dieselbe Eingabe jedes Mal dieselbe vertrauenswürdige Ausgabe erzeugen muss.

Warum ChatGPT bei regulierter Arbeit driftet

Bevor etwas repariert wird, hilft es, die Fehlermuster genau zu benennen. Beim RG-Workflow haben wir fünf unterschiedliche Arten reproduziert, wie die Ausgabe fehlerhaft wurde, von kritisch bis lediglich ärgerlich.

Fünf Fehlermuster: halluzinierte Zahlen und Umkehrung der Gewinn-/Verlust-Konvention (kritisch), Einfügen von Gedankenstrichen und Session-Drift (hoch) sowie inkonsistente Benennung von Interventionen (mittel)

Die beiden kritischen sind das gefährliche Paar. Halluzinierte Zahlen bringen eine falsche Einzahlungs- oder Gewinn-/Verlust-Zahl auf eine regulierte Akte — das Modell füllt eine Lücke aus dem Trainingsgedächtnis, statt zuzugeben, dass die Daten fehlen. Konventionsumkehrung ist subtiler: Dieser Betreiber verwendet eine invertierte Gewinn-/Verlust-Konvention, bei der eine positive Zahl bedeutet, dass der Kunde verliert. Das ist kontraintuitiv, sodass das Modell auf die Standardkonvention zurückfällt, die es im Training gelernt hat, und schreibt, ein Kunde verliere, obwohl er tatsächlich gewinnt.

Die Probleme mit hoher Schwere — Gedankenstriche, die den Hausstil verletzen, und Session-Drift, bei dem Regeln später am Tag ignoriert werden — bringen keine falsche Zahl in die Akte, untergraben aber das Vertrauen in die Ausgabe und erzeugen Nacharbeit. Das mittlere Problem, informelle Interventionsnamen statt der exakten regulatorischen Begriffe, verfälscht still den Compliance-Datensatz.

Die Grundursache ist Zustandslosigkeit — oder deren Fehlen

Vier dieser fünf Fehler haben eine gemeinsame Grundursache. In einer einzelnen ChatGPT-Session wird jeder geprüfte Fall dem Kontextfenster hinzugefügt. Prüft man Fall eins, sieht das Modell den Prompt und einen Fall. Bei Fall fünfzehn sieht es den Prompt plus den statistischen Rückstand von vierzehn vorherigen Austauschen. Die Regeln des Prompts sind noch da, aber sie konkurrieren mit einem wachsenden Kontextberg, und die Aufmerksamkeit für sie lässt nach.

Links: eine ChatGPT-Session, in der sich der Kontext Fall für Fall ansammelt und die Regeltreue vom Morgen bis zum Nachmittag nachlässt. Rechts: ein zustandsloser Agent, bei dem jeder Fall ein isolierter, frischer Aufruf ist und die Regeltreue konstant bleibt.

Deshalb liefert derselbe Prompt um 9 Uhr eine perfekte Notiz und um 16 Uhr eine fehlerhafte. Die architektonische Lösung ist Zustandslosigkeit: Jeder Fall muss ein völlig frischer, isolierter Aufruf sein, der nur den gesperrten Prompt und den aktuellen Fall sieht. Nichts wird übertragen. Ein so konfigurierter KI-Agent schenkt dem Prompt bei Fall fünfzig dieselbe Aufmerksamkeit wie bei Fall eins.

Zustandslosigkeit ist notwendig, aber nicht ausreichend. Sie stoppt die Drift, reproduziert aber bei jedem Aufruf treu einen schlechten Prompt. Der Prompt selbst muss also gehärtet werden.

FlowHunt Logo

Bereit, Ihr Geschäft zu erweitern?

Starten Sie heute Ihre kostenlose Testversion und sehen Sie innerhalb weniger Tage Ergebnisse.

Schritt 1: Den Prompt für Primacy und Recency härten

Sprachmodelle gewichten nicht jede Zeile eines Prompts gleich. Die Aufmerksamkeit ist grob U-förmig — am stärksten am Anfang und am Ende, am schwächsten in der Mitte. Der ursprüngliche RG-Prompt widersprach dem. Seine wichtigste Regel, die invertierte Gewinn-/Verlust-Konvention, stand in der Mitte des Prompts, nur einmal genannt. Das Verbot von Gedankenstrichen war die allerletzte Zeile, ebenfalls nur einmal genannt.

Der ursprüngliche Prompt vergrub die G/V-Regel in der Mitte, wo die Aufmerksamkeit am niedrigsten ist; der gehärtete v2.0-Prompt platziert die kritischen Regeln am Anfang und wiederholt sie am Ende, um sowohl Primacy- als auch Recency-Gewichtung zu erfassen

Die Neufassung verschob die kritischen Regeln dorthin, wo das Modell tatsächlich hinschaut, und überarbeitete die schwachen Teile des System-Prompts . Hier ist, was sich geändert hat und warum.

OriginalGehärtete v2.0Warum es wichtig ist
G/V-Regel in der Mitte des Prompts vergraben, einmal genanntRegel 1 ganz oben mit einem Selbstprüfungsschritt, im Abschnitt zum Schreibstil wiederholtPrimacy-Gewichtung — die wichtigste Regel muss zuerst kommen
Verbot von Gedankenstrichen ganz am Ende, einmalRegel 2 oben, als letzte Regel am Ende wiederholtErfasst sowohl Primacy- als auch Recency-Gewichtung
Keine Anweisung für unvollständige EingabenRegel 4 — Protokoll für fehlende Daten mit exaktem AntwortformatBeseitigt Halluzination und schafft eine Prüfspur
Keine Anweisung für das EingabeformatRegel 3 — jedes Format akzeptieren, immer von Grund auf neu schreibenVerhindert, dass das Modell eine eingefügte Notiz nur leicht umformatiert
19 Pflichtfelder, alle gleich gewichtet15 Pflicht- + 4 optionale Felder, klar getrenntOptionale Felder werden still ausgelassen; fehlende Pflichtfelder blockieren die Erstellung
„Professionell. Natürlich. Nicht robotisch."Konkrete Regeln: verbindende Sprache, variierte Satzlänge, verbotene KonstruktionenVage Adjektive werden nicht befolgt; konkrete Regeln schon
Beispielnotiz enthaltenBeispiel vollständig entferntDas Modell behandelte das Beispiel als Eingabe, auf die es reagieren sollte

Die wichtigste Lektion hierbei: vage Adjektive sind keine Anweisungen. Einem Modell zu sagen, es solle „natürlich" sein, förderte aktiv die Gedankenstriche und rhetorischen Verzierungen, die den Hausstil brachen. Dies durch konkrete, überprüfbare Regeln zu ersetzen, machte den Stil konsistent.

Schritt 2: Fehlende Daten behandeln, statt sie zu erfinden

Halluzination wird oft als Modellfehler dargestellt. Bei strukturierter Arbeit ist es meist ein Prompt-Fehler: Der Prompt hat dem Modell nie mitgeteilt, was zu tun ist, wenn ein Feld fehlt, also tat es das statistisch Wahrscheinliche und erzeugte einen plausiblen Wert.

Die Lösung ist ein Protokoll für fehlende Daten. Teilen Sie Ihre Felder in Pflicht- und optionale Felder auf. Optionale Felder werden bei Fehlen still ausgelassen. Bei Pflichtfeldern gilt das Gegenteil — fehlt eines, muss das Modell anhalten und es in einem exakten Format anfordern, statt eine Notiz zu erzeugen. Diese eine Regel verwandelt eine stille Halluzination in eine sichtbare, überprüfbare Aufforderung nach mehr Daten. Es ist der Unterschied zwischen einer falschen Zahl in einer regulierten Akte und einer Notiz, die nie erstellt wurde, weil die Eingabe unvollständig war.

Schritt 3: Die Agentenkonfiguration sperren

Mit einem gehärteten Prompt muss auch der Agent selbst gesperrt werden, damit nichts wieder Variabilität einführt. Der gesamte Ablauf ist bewusst minimal — drei Knoten und sonst nichts.

Chat-Eingabe fließt in einen KI-Agent-Knoten mit dem gesperrten System-Prompt bei Temperatur 0,2, ohne Tools und mit einer neuen Konversation pro Fall, dann zur Chat-Ausgabe

Die Konfigurationsentscheidungen, die wichtig waren:

  • System-Prompt im Feld für Systemnachrichten, niemals im Eingabefeld, damit er als Anweisung und nicht als Daten gelesen wird.
  • Temperatur 0,2. Niedrig genug für maximale Konsistenz, hoch genug, um robotische Prosa zu vermeiden. Null war zu starr, eins zu kreativ.
  • Keine Tools angeschlossen. Datei- und URL-Retriever führen Unvorhersehbarkeit ein und können das Denken des Agenten umgehen. Für diese Aufgabe braucht das Modell nichts außer dem Prompt und dem eingefügten Fall.
  • Maximale Tokenzahl auf Standard belassen. Eine Begrenzung der Tokens führte dazu, dass Notizen mitten im Satz abgeschnitten wurden, und eine abgeschnittene Notiz in einer Kundenakte ist selbst ein regulatorisches Risiko.
  • Eine Anweisung für stillen Start ganz oben im Prompt, damit der Agent die Regeln beim ersten Laden des Ablaufs nicht gegenüber dem Analysten bestätigt.

Die eine Betriebsregel, die am wichtigsten ist

Jede der obigen Lösungen wird durch eine schlechte Angewohnheit zunichtegemacht: den gleichen Chat wiederzuverwenden. Die wichtigste Betriebsregel für das Analystenteam lautet, für jeden einzelnen Fall eine neue Konversation zu starten. Niemals Fälle im selben Fenster weiter prüfen. Das ist die Regel, die Session-Drift beseitigt — die Grundursache der meisten ursprünglichen Fehler — und sie kostet nichts, sie zu befolgen.

Konsistenz ist ein Architekturproblem, kein Formulierungsproblem

Wenn Ihr Team mit einem driftenden Prompt in einem Chat-Fenster kämpft, besteht die Lösung aus einem gehärteten Prompt, der auf einem zustandslosen Agenten läuft. FlowHunt lässt Sie den Prompt sperren, Modell und Temperatur festlegen und pro Fall einen sauberen Aufruf ausführen. Lassen Sie uns Ihnen dabei helfen.

Funktioniert es tatsächlich? 9 Modelle, 27 Durchläufe

Eine Methode ist nur so gut wie ihre Belege. Wir haben neun Modelle gegen den gehärteten Prompt getestet, unter Verwendung eines identischen realen Falls (ein Gambling-Intensity-Trigger mit vorheriger Session-Duration-Historie) über jeweils drei Durchläufe — insgesamt 27 Durchläufe — und jeden Durchlauf gegen 16 Compliance-Kriterien bewertet.

Durchschnittlicher Compliance-Score über neun Modelle. Produktionsreif: GPT-5.6 Luna 10, Claude Fable 5 10, Claude Sonnet 5 9,8, Claude Opus 4.8 9,8, GPT-5.4 Default 9,5. Disqualifiziert: Claude Sonnet 4.6 8,7, Claude Haiku 4.5 8,5, günstigste Stufe 8,0, DeepSeek V4 Pro 7,8.

Über alle 27 Durchläufe hinweg halluzinierte kein produktionsreifes Modell eine Zahl, kehrte die G/V-Konvention um, verwendete einen Gedankenstrich oder schnitt die Ausgabe ab. Der gehärtete Prompt beseitigte jedes der ursprünglichen Fehlermuster bei den qualifizierten Modellen. Die verbleibenden Unterschiede betrafen analytische Tiefe und Konsistenz, nicht Korrektheit.

ModellAnbieterDurchschn. ScoreProduktionsreifAnmerkungen
GPT-5.6 LunaOpenAI10 / 10JaPerfekt in allen drei Durchläufen; höchste Konsistenz
Claude Fable 5Anthropic10 / 10JaAm besten begründete Ergebnisabsätze; beste einzelne Notiz
Claude Sonnet 5Anthropic9,8 / 10JaKeine Halluzination in keinem Durchlauf; bester Claude insgesamt
Claude Opus 4.8Anthropic9,8 / 10JaTiefste Analyse; Premium-Kosten
GPT-5.4 DefaultOpenAI9,5 / 10JaEin Benennungsfehler; beste Budgetoption
Claude Sonnet 4.6Anthropic8,7 / 10NeinVerwechselte in 2/3 Durchläufen den Trigger-Schwellenwert mit dem Einzahlungslimit
Claude Haiku 4.5Anthropic8,5 / 10NeinKonsistent, aber schwache Begründung des Ergebnisses
Günstigste StufeBudget8,0 / 10NeinExakter Interventionsname nur in 1/3 Durchläufen
DeepSeek V4 ProDeepSeek7,8 / 10NeinAusgabe in Durchlauf 1 abgeschnitten; inkonsistent

Die Disqualifikationen sind aufschlussreich. Claude Sonnet 4.6 lieferte wunderschöne Prosa, verwechselte aber den Trigger-Schwellenwert mit dem Einzahlungslimit — eine sachlich falsche Zahl in einer regulierten Akte, was disqualifizierend ist, egal wie gut sich der Text liest. Die Schwankung von Durchlauf zu Durchlauf bei DeepSeek (6, 8,5, 9) ist das eigentliche Problem: Bei regulierter Arbeit ist Qualität, die vom Glück abhängt, keine Qualität.

Kosten sind nicht die Einschränkung

Es ist verlockend, auf Preis zu optimieren, aber die Zahlen sprechen dagegen. Selbst das teuerste produktionsreife Modell, Claude Opus 4.8, kostet etwa sechs Cent pro Notiz. Für ein Team, das 50 Fälle pro Tag prüft, sind das unter 90 $ im Monat. Die Kosten eines einzigen regulatorischen Befunds aufgrund einer falschen Notiz würden die jährlichen Kosten jedes Modells auf der Liste bei Weitem übersteigen. Für regulierte Compliance gilt: Wählen Sie das zuverlässigste Modell, das Sie sich leisten können, nicht das billigste.

Wie eine gehärtete Notiz aussieht

Die beste einzelne Notiz über alle 27 Durchläufe stammte von Claude Fable 5. Beachten Sie, was sie tut: Sie gibt die Position in der korrekten Konvention an, zitiert Zahlen wörtlich, verwendet den exakten Interventionsnamen und erklärt — entscheidend — warum eine Eskalation unverhältnismäßig wäre, statt einfach ein Ergebnis zu nennen.

The customer is currently in a winning position of £1,612.50 with an account balance of £8,962.50, which represents an improvement on the winning position of £1,275.00 recorded at the previous review… Session duration was reviewed under Session Duration Level 1 on 19/07 and again on 20/07… Given that those decisions were made within the last few days, insufficient time has elapsed to assess their effectiveness, and repeating or escalating on the same behaviour at this stage would be disproportionate… In this context, No Further Action Required is the proportionate outcome.

Das ist der Standard, den regulierte Arbeit verlangt: evidenzbasiert, verhältnismäßig und in der Qualität identisch beim ersten Fall des Tages wie beim fünfzigsten.

Dies auf den eigenen regulierten Workflow anwenden

Der RG-Notizgenerator ist ein spezifischer Fall, aber die Methode lässt sich auf jeden Prozess verallgemeinern, bei dem ein Sprachmodell vertrauenswürdige, wiederholbare Ausgaben bei regulierten oder hochriskanten Daten erzeugen muss:

  1. Weg vom Chat-Fenster. Führen Sie jeden Fall als zustandslosen Aufruf aus, damit sich Kontext nicht ansammeln und driften kann.
  2. Den Prompt für Primacy und Recency härten. Kritische Regeln zuerst platzieren und am Ende wiederholen. Selbstprüfungen hinzufügen.
  3. Dem Modell ein Protokoll für fehlende Daten geben. Pflichtfelder blockieren die Erstellung bei Fehlen; optionale Felder werden still ausgelassen. Niemals raten lassen.
  4. Die Konfiguration sperren. Niedrige, nicht null gesetzte Temperatur, keine unnötigen Tools, unbegrenzte Ausgabe, Prompt in der Systemnachricht.
  5. Testen, bevor Sie vertrauen. Denselben Fall mehrfach über Kandidatenmodelle hinweg ausführen und gegen explizite Kriterien bewerten. Konsistenz über Durchläufe hinweg ist die entscheidende Kennzahl.

Tun Sie diese fünf Dinge, und Sie verwandeln ein Modell, das am Nachmittag halluziniert, in eines, das jedes Mal audit-fähige Ausgaben erzeugt. Die Konsistenz, die regulierte Arbeit erfordert, ist erreichbar — es ist ein Architektur- und Prompt-Engineering-Problem, und beide sind lösbar.

Häufig gestellte Fragen

Arshia ist eine AI Workflow Engineerin bei FlowHunt. Mit einem Hintergrund in Informatik und einer Leidenschaft für KI spezialisiert sie sich darauf, effiziente Arbeitsabläufe zu entwickeln, die KI-Tools in alltägliche Aufgaben integrieren und so Produktivität und Kreativität steigern.

Arshia Kahani
Arshia Kahani
AI Workflow Engineerin

Bringen Sie FlowHunt-Konsistenz in Ihren regulierten Workflow

Verwandeln Sie einen driftenden ChatGPT-Prompt in einen gesperrten, zustandslosen Agenten, der jedes Mal audit-fähige Notizen erzeugt. Wir helfen Ihnen, den Prompt zu härten und das richtige Modell auszuwählen.

Mehr erfahren

Jailbreaking von KI-Chatbots: Techniken, Beispiele und Abwehrmaßnahmen
Jailbreaking von KI-Chatbots: Techniken, Beispiele und Abwehrmaßnahmen

Jailbreaking von KI-Chatbots: Techniken, Beispiele und Abwehrmaßnahmen

Jailbreaking von KI-Chatbots umgeht Sicherheitsleitplanken, um das Modell dazu zu bringen, sich außerhalb seiner vorgesehenen Grenzen zu verhalten. Lernen Sie d...

8 Min. Lesezeit
AI Security Jailbreaking +3
Verstehen und Verhindern von Halluzinationen bei KI-Chatbots
Verstehen und Verhindern von Halluzinationen bei KI-Chatbots

Verstehen und Verhindern von Halluzinationen bei KI-Chatbots

Was sind Halluzinationen bei KI, warum treten sie auf und wie kann man sie vermeiden? Erfahren Sie, wie Sie mit praxisnahen, menschzentrierten Strategien die An...

4 Min. Lesezeit
Theory Intermediate
AI-Chatbot-Sicherheitsaudit
AI-Chatbot-Sicherheitsaudit

AI-Chatbot-Sicherheitsaudit

Ein AI-Chatbot-Sicherheitsaudit ist eine umfassende strukturierte Bewertung der Sicherheitslage eines AI-Chatbots, bei der auf LLM-spezifische Schwachstellen wi...

3 Min. Lesezeit
AI Security Security Audit +3