Sådan stopper du ChatGPT i at hallucinere i reguleret compliance-arbejde

AI Compliance Prompt Engineering AI Agents Responsible Gambling

Et britisk Responsible Gambling-team (RG) kom til os med et problem, som alle der automatiserer reguleret arbejde vil genkende. De bruger ChatGPT til at omdanne automatiske compliance-triggere til formelle analytikernotater. Når en kunde overskrider en tærskel — omsætning op mere end 100% på 30 dage, en session der kører forbi sin grænse — kopierer en analytiker de relevante data ind i ChatGPT, og modellen udarbejder, ud fra en forhåndsuploadet prompt, et notat til kundens compliance-sag.

Det notat er ikke et udkast til en e-mail. Det er et juridisk dokument, som UK Gambling Commission kan gennemgå. Og efter et stykke tid begyndte ChatGPT at hallucinere tal, udelade vigtig information, indsætte tankestreger der brød husstilen, og stille og roligt drifte væk fra reglerne hen på eftermiddagen. På en reguleret sag er hver af disse ting et compliance-problem.

Spørgsmålet, de stillede, var enkelt: kan vi overhovedet få den konsistens, som reguleret arbejde kræver, fra en sprogmodel? Svaret er ja — men ikke ved at pille ved formuleringen af en prompt inde i et chatvindue. Det kræver en ændring i arkitektur plus en disciplineret omskrivning. Denne artikel gennemgår den præcise metode med RG-workflowet som det gennemarbejdede eksempel, så du kan anvende den på enhver reguleret proces, hvor det samme input skal producere det samme troværdige output hver eneste gang.

Hvorfor ChatGPT drifter i reguleret arbejde

Før man retter noget, hjælper det at navngive fejltilstandene præcist. På RG-workflowet reproducerede vi fem forskellige måder, outputtet gik i stykker på, lige fra kritisk til blot irriterende.

Fem fejltilstande: hallucinerede tal og omvendt P/L-konvention (kritisk), indsættelse af tankestreger og session drift (høj), samt inkonsistent navngivning af interventioner (medium)

De to kritiske er det farlige par. Hallucinerede tal sætter et forkert indskuds- eller resultattal på en reguleret sag — modellen udfylder et hul fra træningshukommelsen i stedet for at indrømme, at dataene mangler. Omvendt konvention er mere subtil: denne operatør bruger en omvendt profit-og-tab-konvention, hvor et positivt tal betyder, at kunden taber. Det er kontraintuitivt, så modellen falder tilbage til den standardkonvention, den lærte under træning, og skriver, at en kunde taber, når vedkommende faktisk vinder.

De højtsevere problemer — tankestreger der bryder husstilen, og session drift hvor regler ignoreres senere på dagen — sætter ikke et forkert tal på sagen, men de underminerer tilliden til outputtet og skaber ekstra arbejde. Det middelsvære problem, uformelle interventionsnavne i stedet for de præcise lovmæssige termer, korrumperer stille og roligt compliance-registreringen.

Grundårsagen er statelessness — eller manglen på samme

Fire af de fem fejl har én fælles grundårsag. I en enkelt ChatGPT-session bliver hver sag, du gennemgår, føjet til context window. Gennemgår du sag ét, ser modellen prompten og én sag. Ved sag femten ser den prompten plus det statistiske restindhold fra fjorten tidligere udvekslinger. Promptens regler er der stadig, men de konkurrerer med en voksende bunke kontekst, og opmærksomheden på dem forringes.

Til venstre: en ChatGPT-session hvor konteksten akkumuleres sag for sag, og regeloverholdelsen forringes fra morgen til eftermiddag. Til højre: en stateless agent hvor hver sag er et isoleret, nyt kald, og regeloverholdelsen forbliver konstant.

Det er derfor, den samme prompt producerer et perfekt notat kl. 9 og et mangelfuldt et kl. 16. Den arkitektoniske løsning er statelessness: hver sag skal være et helt nyt, isoleret kald, der kun ser den låste prompt og den aktuelle sag. Intet bæres videre. En AI-agent konfigureret på denne måde giver prompten den samme opmærksomhed ved sag halvtreds, som den fik ved sag ét.

Statelessness er nødvendigt, men ikke tilstrækkeligt. Det stopper driftet, men vil trofast reproducere en dårlig prompt ved hvert kald. Så selve prompten skal hærdes.

FlowHunt Logo

Klar til at vokse din virksomhed?

Start din gratis prøveperiode i dag og se resultater inden for få dage.

Trin 1: Hærd prompten for primacy og recency

Sprogmodeller vægter ikke hver linje i en prompt lige. Opmærksomheden er groft set U-formet — stærkest i begyndelsen og slutningen, svagest i midten. Den oprindelige RG-prompt kæmpede imod dette. Dens vigtigste regel, den omvendte profit-og-tab-konvention, lå midt i prompten, nævnt én gang. Forbuddet mod tankestreger var den allersidste linje, også nævnt én gang.

Den oprindelige prompt begravede P/L-reglen midt i prompten, hvor opmærksomheden er lavest; den hærdede v2.0-prompt placerer de kritiske regler øverst og gentager dem nederst for at fange både primacy- og recency-vægtning

Omskrivningen flyttede de kritiske regler hen, hvor modellen rent faktisk kigger, og genarbejdede de svage dele af system-prompten . Her er, hvad der blev ændret, og hvorfor.

OriginalHærdet v2.0Hvorfor det betyder noget
P/L-reglen begravet midt i prompten, nævnt én gangRegel 1 helt øverst med et selvtjek-trin, gentaget i skrivestil-sektionenPrimacy-vægtning — den vigtigste regel skal komme først
Forbud mod tankestreger helt til sidst, én gangRegel 2 øverst, gentaget som den sidste regel nederstFanger både primacy- og recency-vægtning
Ingen instruktion for ufuldstændigt inputRegel 4 — protokol for manglende data med et præcist svarformatEliminerer hallucination og skaber et revisionsspor
Ingen instruktion for inputformatRegel 3 — accepter ethvert format, omskriv altid fra bundenForhindrer modellen i blot at omformatere et indsat notat
19 påkrævede felter, alle med samme vægt15 påkrævede + 4 valgfrie felter, klart adskiltValgfrie felter udelades tavst; påkrævede felter blokerer generering, hvis de mangler
“Professionel. Naturlig. Ikke robotagtig.”Konkrete regler: forbindende sprog, varieret sætningslængde, forbudte konstruktionerVage adjektiver følges ikke; konkrete regler gør
Eksempelnotat inkluderetEksempel fjernet heltModellen behandlede eksemplet som input, den skulle svare på

Den enkelt vigtigste lærdom her: vage adjektiver er ikke instruktioner. At bede en model om at være “naturlig” opmuntrede aktivt til de tankestreger og retoriske krusseduller, der brød husstilen. At erstatte det med konkrete, testbare regler var det, der gjorde stilen konsistent.

Trin 2: Håndter manglende data i stedet for at opdigte dem

Hallucination bliver ofte fremstillet som en modelfejl. I struktureret arbejde er det som regel en prompt-fejl: prompten fortalte aldrig modellen, hvad den skulle gøre, når et felt manglede, så den gjorde det statistisk sandsynlige og producerede en plausibel værdi.

Løsningen er en protokol for manglende data. Del dine felter op i påkrævede og valgfrie. Valgfrie felter udelades tavst, når de mangler. Påkrævede felter gør det modsatte — hvis ét mangler, skal modellen stoppe og bede om det i et præcist format i stedet for at generere et notat. Denne ene regel omdanner en tavs hallucination til en synlig, reviderbar anmodning om flere data. Det er forskellen mellem et forkert tal på en reguleret sag og et notat, der aldrig blev produceret, fordi inputtet var ufuldstændigt.

Trin 3: Lås agentkonfigurationen

Med en hærdet prompt skal selve agenten låses ned, så intet genindfører variabilitet. Hele flowet er bevidst minimalt — tre noder og ikke andet.

Chat Input går ind i en AI Agent-node med den låste system-prompt ved temperatur 0.2 uden værktøjer og en ny samtale pr. sag, derefter til Chat Output

De konfigurationsvalg, der gjorde en forskel:

  • System-prompten i System Message-feltet, aldrig i Input-feltet, så den læses som instruktioner snarere end data.
  • Temperatur 0,2. Lav nok til maksimal konsistens, høj nok til at undgå robotagtig prosa. Nul var for rigidt; én var for kreativt.
  • Ingen tilknyttede værktøjer. Fil- og URL-hentere introducerer uforudsigelighed og kan omgå agentens ræsonnering. Til denne opgave har modellen ikke brug for andet end prompten og den indsatte sag.
  • Max tokens efterladt på standard. At begrænse tokens fik notater til at blive afkortet midt i en sætning, og et afkortet notat på en kundesag er i sig selv en reguleringsrisiko.
  • En instruktion om stille start øverst i prompten, så agenten ikke bekræfter reglerne tilbage til analytikeren, når flowet indlæses første gang.

Den ene operationelle regel, der betyder mest

Alle ovenstående fikser bliver ophævet af én dårlig vane: at genbruge den samme chat. Den vigtigste operationelle regel for analytikerteamet er at starte en ny samtale for hver eneste sag. Fortsæt aldrig med at gennemgå sager i det samme vindue. Det er den regel, der eliminerer session drift — grundårsagen til de fleste af de oprindelige fejl — og det koster intet at følge den.

Konsistens er et arkitekturproblem, ikke et formuleringsproblem

Hvis dit team kæmper med en driftende prompt inde i et chatvindue, er løsningen en hærdet prompt kørende på en stateless agent. FlowHunt lader dig låse prompten, fastlåse modellen og temperaturen, og køre et rent kald pr. sag. Lad os hjælpe dig derhen.

Virker det rent faktisk? 9 modeller, 27 kørsler

En metode er kun så god som dens beviser. Vi testede ni modeller mod den hærdede prompt ved brug af en identisk, reel sag (en Gambling Intensity-trigger med tidligere session-varighedshistorik) på tværs af tre kørsler hver — 27 kørsler i alt — og scorede hver kørsel mod 16 compliance-kriterier.

Gennemsnitlig compliance-score på tværs af ni modeller. Produktionsklar: GPT-5.6 Luna 10, Claude Fable 5 10, Claude Sonnet 5 9,8, Claude Opus 4.8 9,8, GPT-5.4 Default 9,5. Diskvalificeret: Claude Sonnet 4.6 8,7, Claude Haiku 4.5 8,5, billigste tier 8,0, DeepSeek V4 Pro 7,8.

På tværs af alle 27 kørsler hallucinerede ingen produktionsklar model et tal, vendte P/L-konventionen om, brugte en tankestreg eller afkortede output. Den hærdede prompt eliminerede hver eneste af de oprindelige fejltilstande hos de modeller, der kvalificerede sig. De forskelle, der stod tilbage, handlede om analytisk dybde og konsistens, ikke korrekthed.

ModelLeverandørGns. scoreProduktionNoter
GPT-5.6 LunaOpenAI10 / 10JaPerfekt på alle tre kørsler; højeste konsistens
Claude Fable 5Anthropic10 / 10JaMest ræsonnerede resultatafsnit; bedste enkeltnotat
Claude Sonnet 5Anthropic9,8 / 10JaIngen hallucination på nogen kørsel; bedste Claude alt taget i betragtning
Claude Opus 4.8Anthropic9,8 / 10JaDybeste analyse; premium-omkostning
GPT-5.4 DefaultOpenAI9,5 / 10JaÉn navngivningsfejl; bedste budgetvalg
Claude Sonnet 4.6Anthropic8,7 / 10NejForvekslede trigger-tærsklen med indskudsgrænsen i 2/3 kørsler
Claude Haiku 4.5Anthropic8,5 / 10NejKonsistent, men svag begrundelse for resultatet
Billigste tierBudget8,0 / 10NejPræcist interventionsnavn i kun 1/3 kørsler
DeepSeek V4 ProDeepSeek7,8 / 10NejAfkortet output i kørsel 1; inkonsistent

Diskvalifikationerne er lærerige. Claude Sonnet 4.6 producerede smuk prosa, men forvekslede trigger-tærsklen med indskudsgrænsen — et faktuelt forkert tal på en reguleret sag, hvilket er diskvalificerende, uanset hvor godt det læser. DeepSeeks udsving fra kørsel til kørsel (6, 8,5, 9) er det reelle problem: i reguleret arbejde er kvalitet, der afhænger af held, ikke kvalitet overhovedet.

Omkostning er ikke begrænsningen

Det er fristende at optimere efter pris, men tallene taler imod det. Selv den dyreste produktionsklare model, Claude Opus 4.8, koster omkring seks cent pr. notat. For et team, der gennemgår 50 sager om dagen, er det under $90 om måneden. Omkostningen ved et enkelt reguleringsfund fra et forkert notat ville overgå den årlige omkostning ved enhver model på listen langt. For reguleret compliance, vælg den mest pålidelige model, du kan, ikke den billigste.

Sådan ser et hærdet notat ud

Det bedste enkeltnotat på tværs af alle 27 kørsler kom fra Claude Fable 5. Læg mærke til, hvad det gør: det angiver positionen i den korrekte konvention, citerer tal ordret, bruger det præcise interventionsnavn og — afgørende — forklarer hvorfor en eskalering ville være uforholdsmæssig i stedet for blot at fastslå et resultat.

The customer is currently in a winning position of £1,612.50 with an account balance of £8,962.50, which represents an improvement on the winning position of £1,275.00 recorded at the previous review… Session duration was reviewed under Session Duration Level 1 on 19/07 and again on 20/07… Given that those decisions were made within the last few days, insufficient time has elapsed to assess their effectiveness, and repeating or escalating on the same behaviour at this stage would be disproportionate… In this context, No Further Action Required is the proportionate outcome.

Det er den standard, reguleret arbejde kræver: evidensbaseret, proportional og af identisk kvalitet ved dagens første sag og den halvtredsindstyvende.

Sådan anvender du dette på dit eget regulerede workflow

RG-notatgeneratoren er et specifikt tilfælde, men metoden generaliserer til enhver proces, hvor en sprogmodel skal producere troværdigt, gentageligt output på reguleret eller kritisk data:

  1. Flyt væk fra chatvinduet. Kør hver sag som et stateless kald, så konteksten ikke kan akkumuleres og drifte.
  2. Hærd prompten for primacy og recency. Sæt kritiske regler først, og gentag dem sidst. Tilføj selvtjek.
  3. Giv modellen en protokol for manglende data. Påkrævede felter blokerer generering, når de mangler; valgfrie felter udelades tavst. Lad den aldrig gætte.
  4. Lås konfigurationen. Lav, ikke-nul temperatur, ingen unødvendige værktøjer, ubegrænset output, prompt i system-beskeden.
  5. Test, før du stoler på. Kør den samme sag flere gange på tværs af kandidatmodeller, og scor mod eksplicitte kriterier. Konsistens på tværs af kørsler er den metrik, der betyder noget.

Gør de fem ting, og du omdanner en model, der hallucinerer hen på eftermiddagen, til én, der producerer revisionsklart output hver gang. Den konsistens, reguleret arbejde kræver, er opnåelig — det er et arkitektur- og prompt-engineering-problem, og begge dele kan løses.

Ofte stillede spørgsmål

Arshia er AI Workflow Engineer hos FlowHunt. Med en baggrund inden for datalogi og en passion for AI, specialiserer han sig i at skabe effektive workflows, der integrerer AI-værktøjer i daglige opgaver og øger produktivitet og kreativitet.

Arshia Kahani
Arshia Kahani
AI Workflow Engineer

Bring FlowHunt-konsistens til dit regulerede workflow

Omdan en driftende ChatGPT-prompt til en låst, stateless agent, der producerer revisionsklare notater hver gang. Vi hjælper dig med at hærde prompten og vælge den rigtige model.

Lær mere

Real-tids domænespecifik RAG Chatbot
Real-tids domænespecifik RAG Chatbot

Real-tids domænespecifik RAG Chatbot

En realtidschatbot, der bruger Google Søgning begrænset til dit eget domæne, henter relevant webindhold og udnytter OpenAI LLM til at besvare brugerforespørgsle...

4 min læsning
ChatGPT Vidensbaseassistent
ChatGPT Vidensbaseassistent

ChatGPT Vidensbaseassistent

AI chatbot-assistent drevet af OpenAI GPT-4o, der automatisk søger i og udnytter interne virksomheds-dokumenter for at besvare brugerens spørgsmål. Leverer kont...

3 min læsning
AI Captcha Billedløser
AI Captcha Billedløser

AI Captcha Billedløser

Dette AI-drevne workflow løser automatisk CAPTCHA-billeder, der uploades af brugere. Det guider brugerne med instruktioner, behandler det uploadede billede ved ...

3 min læsning