
Jailbreaking von KI-Chatbots: Techniken, Beispiele und Abwehrmaßnahmen
Jailbreaking von KI-Chatbots umgeht Sicherheitsleitplanken, um das Modell dazu zu bringen, sich außerhalb seiner vorgesehenen Grenzen zu verhalten. Lernen Sie d...
ChatGPT driftet, halluziniert Zahlen und bricht mit dem Hausstil bei regulierten Compliance-Notizen. Hier ist die Methode aus Prompt-Hardening und zustandslosem Agenten, die einen britischen Responsible-Gambling-Workflow audit-fähig gemacht hat — mit Modelltests über 9 Modelle und 27 Durchläufe.
Ein britisches Responsible-Gambling-Team (RG) kam mit einem Problem zu uns, das jeder wiedererkennt, der regulierte Arbeit automatisiert. Sie nutzen ChatGPT, um automatisierte Compliance-Trigger in formale Analystennotizen umzuwandeln. Wenn ein Kunde einen Schwellenwert überschreitet — Umsatz um mehr als 100 % in 30 Tagen gestiegen, eine Session, die über ihr Limit hinausläuft —, kopiert ein Analyst die relevanten Daten in ChatGPT, und das Modell verfasst gemäß einem vorab hochgeladenen Prompt eine Notiz für die Compliance-Akte des Kunden.
Diese Notiz ist kein Entwurf für eine E-Mail. Sie ist ein rechtliches Dokument, das von der UK Gambling Commission geprüft werden kann. Und nach einiger Zeit begann ChatGPT, Zahlen zu halluzinieren, wichtige Informationen auszulassen, Gedankenstriche einzufügen, die den Hausstil verletzten, und sich am Nachmittag still von den Regeln zu entfernen. Bei einer regulierten Akte ist jedes davon ein Compliance-Problem.
Die Frage, die sie stellten, war einfach: Können wir von einem Sprachmodell überhaupt die Konsistenz erreichen, die regulierte Arbeit erfordert? Die Antwort ist ja — aber nicht, indem man den Wortlaut eines Prompts in einem Chat-Fenster anpasst. Es braucht eine Änderung der Architektur plus eine disziplinierte Neufassung. Dieser Artikel führt durch die genaue Methode, anhand des RG-Workflows als Anwendungsbeispiel, damit Sie sie auf jeden regulierten Prozess anwenden können, bei dem dieselbe Eingabe jedes Mal dieselbe vertrauenswürdige Ausgabe erzeugen muss.
Bevor etwas repariert wird, hilft es, die Fehlermuster genau zu benennen. Beim RG-Workflow haben wir fünf unterschiedliche Arten reproduziert, wie die Ausgabe fehlerhaft wurde, von kritisch bis lediglich ärgerlich.
Die beiden kritischen sind das gefährliche Paar. Halluzinierte Zahlen bringen eine falsche Einzahlungs- oder Gewinn-/Verlust-Zahl auf eine regulierte Akte — das Modell füllt eine Lücke aus dem Trainingsgedächtnis, statt zuzugeben, dass die Daten fehlen. Konventionsumkehrung ist subtiler: Dieser Betreiber verwendet eine invertierte Gewinn-/Verlust-Konvention, bei der eine positive Zahl bedeutet, dass der Kunde verliert. Das ist kontraintuitiv, sodass das Modell auf die Standardkonvention zurückfällt, die es im Training gelernt hat, und schreibt, ein Kunde verliere, obwohl er tatsächlich gewinnt.
Die Probleme mit hoher Schwere — Gedankenstriche, die den Hausstil verletzen, und Session-Drift, bei dem Regeln später am Tag ignoriert werden — bringen keine falsche Zahl in die Akte, untergraben aber das Vertrauen in die Ausgabe und erzeugen Nacharbeit. Das mittlere Problem, informelle Interventionsnamen statt der exakten regulatorischen Begriffe, verfälscht still den Compliance-Datensatz.
Vier dieser fünf Fehler haben eine gemeinsame Grundursache. In einer einzelnen ChatGPT-Session wird jeder geprüfte Fall dem Kontextfenster hinzugefügt. Prüft man Fall eins, sieht das Modell den Prompt und einen Fall. Bei Fall fünfzehn sieht es den Prompt plus den statistischen Rückstand von vierzehn vorherigen Austauschen. Die Regeln des Prompts sind noch da, aber sie konkurrieren mit einem wachsenden Kontextberg, und die Aufmerksamkeit für sie lässt nach.
Deshalb liefert derselbe Prompt um 9 Uhr eine perfekte Notiz und um 16 Uhr eine fehlerhafte. Die architektonische Lösung ist Zustandslosigkeit: Jeder Fall muss ein völlig frischer, isolierter Aufruf sein, der nur den gesperrten Prompt und den aktuellen Fall sieht. Nichts wird übertragen. Ein so konfigurierter KI-Agent schenkt dem Prompt bei Fall fünfzig dieselbe Aufmerksamkeit wie bei Fall eins.
Zustandslosigkeit ist notwendig, aber nicht ausreichend. Sie stoppt die Drift, reproduziert aber bei jedem Aufruf treu einen schlechten Prompt. Der Prompt selbst muss also gehärtet werden.
Sprachmodelle gewichten nicht jede Zeile eines Prompts gleich. Die Aufmerksamkeit ist grob U-förmig — am stärksten am Anfang und am Ende, am schwächsten in der Mitte. Der ursprüngliche RG-Prompt widersprach dem. Seine wichtigste Regel, die invertierte Gewinn-/Verlust-Konvention, stand in der Mitte des Prompts, nur einmal genannt. Das Verbot von Gedankenstrichen war die allerletzte Zeile, ebenfalls nur einmal genannt.
Die Neufassung verschob die kritischen Regeln dorthin, wo das Modell tatsächlich hinschaut, und überarbeitete die schwachen Teile des System-Prompts . Hier ist, was sich geändert hat und warum.
| Original | Gehärtete v2.0 | Warum es wichtig ist |
|---|---|---|
| G/V-Regel in der Mitte des Prompts vergraben, einmal genannt | Regel 1 ganz oben mit einem Selbstprüfungsschritt, im Abschnitt zum Schreibstil wiederholt | Primacy-Gewichtung — die wichtigste Regel muss zuerst kommen |
| Verbot von Gedankenstrichen ganz am Ende, einmal | Regel 2 oben, als letzte Regel am Ende wiederholt | Erfasst sowohl Primacy- als auch Recency-Gewichtung |
| Keine Anweisung für unvollständige Eingaben | Regel 4 — Protokoll für fehlende Daten mit exaktem Antwortformat | Beseitigt Halluzination und schafft eine Prüfspur |
| Keine Anweisung für das Eingabeformat | Regel 3 — jedes Format akzeptieren, immer von Grund auf neu schreiben | Verhindert, dass das Modell eine eingefügte Notiz nur leicht umformatiert |
| 19 Pflichtfelder, alle gleich gewichtet | 15 Pflicht- + 4 optionale Felder, klar getrennt | Optionale Felder werden still ausgelassen; fehlende Pflichtfelder blockieren die Erstellung |
| „Professionell. Natürlich. Nicht robotisch." | Konkrete Regeln: verbindende Sprache, variierte Satzlänge, verbotene Konstruktionen | Vage Adjektive werden nicht befolgt; konkrete Regeln schon |
| Beispielnotiz enthalten | Beispiel vollständig entfernt | Das Modell behandelte das Beispiel als Eingabe, auf die es reagieren sollte |
Die wichtigste Lektion hierbei: vage Adjektive sind keine Anweisungen. Einem Modell zu sagen, es solle „natürlich" sein, förderte aktiv die Gedankenstriche und rhetorischen Verzierungen, die den Hausstil brachen. Dies durch konkrete, überprüfbare Regeln zu ersetzen, machte den Stil konsistent.
Halluzination wird oft als Modellfehler dargestellt. Bei strukturierter Arbeit ist es meist ein Prompt-Fehler: Der Prompt hat dem Modell nie mitgeteilt, was zu tun ist, wenn ein Feld fehlt, also tat es das statistisch Wahrscheinliche und erzeugte einen plausiblen Wert.
Die Lösung ist ein Protokoll für fehlende Daten. Teilen Sie Ihre Felder in Pflicht- und optionale Felder auf. Optionale Felder werden bei Fehlen still ausgelassen. Bei Pflichtfeldern gilt das Gegenteil — fehlt eines, muss das Modell anhalten und es in einem exakten Format anfordern, statt eine Notiz zu erzeugen. Diese eine Regel verwandelt eine stille Halluzination in eine sichtbare, überprüfbare Aufforderung nach mehr Daten. Es ist der Unterschied zwischen einer falschen Zahl in einer regulierten Akte und einer Notiz, die nie erstellt wurde, weil die Eingabe unvollständig war.
Mit einem gehärteten Prompt muss auch der Agent selbst gesperrt werden, damit nichts wieder Variabilität einführt. Der gesamte Ablauf ist bewusst minimal — drei Knoten und sonst nichts.
Die Konfigurationsentscheidungen, die wichtig waren:
Jede der obigen Lösungen wird durch eine schlechte Angewohnheit zunichtegemacht: den gleichen Chat wiederzuverwenden. Die wichtigste Betriebsregel für das Analystenteam lautet, für jeden einzelnen Fall eine neue Konversation zu starten. Niemals Fälle im selben Fenster weiter prüfen. Das ist die Regel, die Session-Drift beseitigt — die Grundursache der meisten ursprünglichen Fehler — und sie kostet nichts, sie zu befolgen.
Wenn Ihr Team mit einem driftenden Prompt in einem Chat-Fenster kämpft, besteht die Lösung aus einem gehärteten Prompt, der auf einem zustandslosen Agenten läuft. FlowHunt lässt Sie den Prompt sperren, Modell und Temperatur festlegen und pro Fall einen sauberen Aufruf ausführen. Lassen Sie uns Ihnen dabei helfen.
Eine Methode ist nur so gut wie ihre Belege. Wir haben neun Modelle gegen den gehärteten Prompt getestet, unter Verwendung eines identischen realen Falls (ein Gambling-Intensity-Trigger mit vorheriger Session-Duration-Historie) über jeweils drei Durchläufe — insgesamt 27 Durchläufe — und jeden Durchlauf gegen 16 Compliance-Kriterien bewertet.
Über alle 27 Durchläufe hinweg halluzinierte kein produktionsreifes Modell eine Zahl, kehrte die G/V-Konvention um, verwendete einen Gedankenstrich oder schnitt die Ausgabe ab. Der gehärtete Prompt beseitigte jedes der ursprünglichen Fehlermuster bei den qualifizierten Modellen. Die verbleibenden Unterschiede betrafen analytische Tiefe und Konsistenz, nicht Korrektheit.
| Modell | Anbieter | Durchschn. Score | Produktionsreif | Anmerkungen |
|---|---|---|---|---|
| GPT-5.6 Luna | OpenAI | 10 / 10 | Ja | Perfekt in allen drei Durchläufen; höchste Konsistenz |
| Claude Fable 5 | Anthropic | 10 / 10 | Ja | Am besten begründete Ergebnisabsätze; beste einzelne Notiz |
| Claude Sonnet 5 | Anthropic | 9,8 / 10 | Ja | Keine Halluzination in keinem Durchlauf; bester Claude insgesamt |
| Claude Opus 4.8 | Anthropic | 9,8 / 10 | Ja | Tiefste Analyse; Premium-Kosten |
| GPT-5.4 Default | OpenAI | 9,5 / 10 | Ja | Ein Benennungsfehler; beste Budgetoption |
| Claude Sonnet 4.6 | Anthropic | 8,7 / 10 | Nein | Verwechselte in 2/3 Durchläufen den Trigger-Schwellenwert mit dem Einzahlungslimit |
| Claude Haiku 4.5 | Anthropic | 8,5 / 10 | Nein | Konsistent, aber schwache Begründung des Ergebnisses |
| Günstigste Stufe | Budget | 8,0 / 10 | Nein | Exakter Interventionsname nur in 1/3 Durchläufen |
| DeepSeek V4 Pro | DeepSeek | 7,8 / 10 | Nein | Ausgabe in Durchlauf 1 abgeschnitten; inkonsistent |
Die Disqualifikationen sind aufschlussreich. Claude Sonnet 4.6 lieferte wunderschöne Prosa, verwechselte aber den Trigger-Schwellenwert mit dem Einzahlungslimit — eine sachlich falsche Zahl in einer regulierten Akte, was disqualifizierend ist, egal wie gut sich der Text liest. Die Schwankung von Durchlauf zu Durchlauf bei DeepSeek (6, 8,5, 9) ist das eigentliche Problem: Bei regulierter Arbeit ist Qualität, die vom Glück abhängt, keine Qualität.
Es ist verlockend, auf Preis zu optimieren, aber die Zahlen sprechen dagegen. Selbst das teuerste produktionsreife Modell, Claude Opus 4.8, kostet etwa sechs Cent pro Notiz. Für ein Team, das 50 Fälle pro Tag prüft, sind das unter 90 $ im Monat. Die Kosten eines einzigen regulatorischen Befunds aufgrund einer falschen Notiz würden die jährlichen Kosten jedes Modells auf der Liste bei Weitem übersteigen. Für regulierte Compliance gilt: Wählen Sie das zuverlässigste Modell, das Sie sich leisten können, nicht das billigste.
Die beste einzelne Notiz über alle 27 Durchläufe stammte von Claude Fable 5. Beachten Sie, was sie tut: Sie gibt die Position in der korrekten Konvention an, zitiert Zahlen wörtlich, verwendet den exakten Interventionsnamen und erklärt — entscheidend — warum eine Eskalation unverhältnismäßig wäre, statt einfach ein Ergebnis zu nennen.
The customer is currently in a winning position of £1,612.50 with an account balance of £8,962.50, which represents an improvement on the winning position of £1,275.00 recorded at the previous review… Session duration was reviewed under Session Duration Level 1 on 19/07 and again on 20/07… Given that those decisions were made within the last few days, insufficient time has elapsed to assess their effectiveness, and repeating or escalating on the same behaviour at this stage would be disproportionate… In this context, No Further Action Required is the proportionate outcome.
Das ist der Standard, den regulierte Arbeit verlangt: evidenzbasiert, verhältnismäßig und in der Qualität identisch beim ersten Fall des Tages wie beim fünfzigsten.
Der RG-Notizgenerator ist ein spezifischer Fall, aber die Methode lässt sich auf jeden Prozess verallgemeinern, bei dem ein Sprachmodell vertrauenswürdige, wiederholbare Ausgaben bei regulierten oder hochriskanten Daten erzeugen muss:
Tun Sie diese fünf Dinge, und Sie verwandeln ein Modell, das am Nachmittag halluziniert, in eines, das jedes Mal audit-fähige Ausgaben erzeugt. Die Konsistenz, die regulierte Arbeit erfordert, ist erreichbar — es ist ein Architektur- und Prompt-Engineering-Problem, und beide sind lösbar.
Arshia ist eine AI Workflow Engineerin bei FlowHunt. Mit einem Hintergrund in Informatik und einer Leidenschaft für KI spezialisiert sie sich darauf, effiziente Arbeitsabläufe zu entwickeln, die KI-Tools in alltägliche Aufgaben integrieren und so Produktivität und Kreativität steigern.

Verwandeln Sie einen driftenden ChatGPT-Prompt in einen gesperrten, zustandslosen Agenten, der jedes Mal audit-fähige Notizen erzeugt. Wir helfen Ihnen, den Prompt zu härten und das richtige Modell auszuwählen.

Jailbreaking von KI-Chatbots umgeht Sicherheitsleitplanken, um das Modell dazu zu bringen, sich außerhalb seiner vorgesehenen Grenzen zu verhalten. Lernen Sie d...

Was sind Halluzinationen bei KI, warum treten sie auf und wie kann man sie vermeiden? Erfahren Sie, wie Sie mit praxisnahen, menschzentrierten Strategien die An...

Ein AI-Chatbot-Sicherheitsaudit ist eine umfassende strukturierte Bewertung der Sicherheitslage eines AI-Chatbots, bei der auf LLM-spezifische Schwachstellen wi...
Cookie-Zustimmung
Wir verwenden Cookies, um Ihr Surferlebnis zu verbessern und unseren Datenverkehr zu analysieren. See our privacy policy.