
Real-tids domænespecifik RAG Chatbot
En realtidschatbot, der bruger Google Søgning begrænset til dit eget domæne, henter relevant webindhold og udnytter OpenAI LLM til at besvare brugerforespørgsle...
ChatGPT drifter, hallucinerer tal og bryder husstilen i reguleret compliance-arbejde. Her er metoden med prompt-hardening og en stateless agent, der gjorde et britisk Responsible Gambling-workflow revisionsklart — med modeltestning på tværs af 9 modeller og 27 kørsler.
Et britisk Responsible Gambling-team (RG) kom til os med et problem, som alle der automatiserer reguleret arbejde vil genkende. De bruger ChatGPT til at omdanne automatiske compliance-triggere til formelle analytikernotater. Når en kunde overskrider en tærskel — omsætning op mere end 100% på 30 dage, en session der kører forbi sin grænse — kopierer en analytiker de relevante data ind i ChatGPT, og modellen udarbejder, ud fra en forhåndsuploadet prompt, et notat til kundens compliance-sag.
Det notat er ikke et udkast til en e-mail. Det er et juridisk dokument, som UK Gambling Commission kan gennemgå. Og efter et stykke tid begyndte ChatGPT at hallucinere tal, udelade vigtig information, indsætte tankestreger der brød husstilen, og stille og roligt drifte væk fra reglerne hen på eftermiddagen. På en reguleret sag er hver af disse ting et compliance-problem.
Spørgsmålet, de stillede, var enkelt: kan vi overhovedet få den konsistens, som reguleret arbejde kræver, fra en sprogmodel? Svaret er ja — men ikke ved at pille ved formuleringen af en prompt inde i et chatvindue. Det kræver en ændring i arkitektur plus en disciplineret omskrivning. Denne artikel gennemgår den præcise metode med RG-workflowet som det gennemarbejdede eksempel, så du kan anvende den på enhver reguleret proces, hvor det samme input skal producere det samme troværdige output hver eneste gang.
Før man retter noget, hjælper det at navngive fejltilstandene præcist. På RG-workflowet reproducerede vi fem forskellige måder, outputtet gik i stykker på, lige fra kritisk til blot irriterende.
De to kritiske er det farlige par. Hallucinerede tal sætter et forkert indskuds- eller resultattal på en reguleret sag — modellen udfylder et hul fra træningshukommelsen i stedet for at indrømme, at dataene mangler. Omvendt konvention er mere subtil: denne operatør bruger en omvendt profit-og-tab-konvention, hvor et positivt tal betyder, at kunden taber. Det er kontraintuitivt, så modellen falder tilbage til den standardkonvention, den lærte under træning, og skriver, at en kunde taber, når vedkommende faktisk vinder.
De højtsevere problemer — tankestreger der bryder husstilen, og session drift hvor regler ignoreres senere på dagen — sætter ikke et forkert tal på sagen, men de underminerer tilliden til outputtet og skaber ekstra arbejde. Det middelsvære problem, uformelle interventionsnavne i stedet for de præcise lovmæssige termer, korrumperer stille og roligt compliance-registreringen.
Fire af de fem fejl har én fælles grundårsag. I en enkelt ChatGPT-session bliver hver sag, du gennemgår, føjet til context window. Gennemgår du sag ét, ser modellen prompten og én sag. Ved sag femten ser den prompten plus det statistiske restindhold fra fjorten tidligere udvekslinger. Promptens regler er der stadig, men de konkurrerer med en voksende bunke kontekst, og opmærksomheden på dem forringes.
Det er derfor, den samme prompt producerer et perfekt notat kl. 9 og et mangelfuldt et kl. 16. Den arkitektoniske løsning er statelessness: hver sag skal være et helt nyt, isoleret kald, der kun ser den låste prompt og den aktuelle sag. Intet bæres videre. En AI-agent konfigureret på denne måde giver prompten den samme opmærksomhed ved sag halvtreds, som den fik ved sag ét.
Statelessness er nødvendigt, men ikke tilstrækkeligt. Det stopper driftet, men vil trofast reproducere en dårlig prompt ved hvert kald. Så selve prompten skal hærdes.
Sprogmodeller vægter ikke hver linje i en prompt lige. Opmærksomheden er groft set U-formet — stærkest i begyndelsen og slutningen, svagest i midten. Den oprindelige RG-prompt kæmpede imod dette. Dens vigtigste regel, den omvendte profit-og-tab-konvention, lå midt i prompten, nævnt én gang. Forbuddet mod tankestreger var den allersidste linje, også nævnt én gang.
Omskrivningen flyttede de kritiske regler hen, hvor modellen rent faktisk kigger, og genarbejdede de svage dele af system-prompten . Her er, hvad der blev ændret, og hvorfor.
| Original | Hærdet v2.0 | Hvorfor det betyder noget |
|---|---|---|
| P/L-reglen begravet midt i prompten, nævnt én gang | Regel 1 helt øverst med et selvtjek-trin, gentaget i skrivestil-sektionen | Primacy-vægtning — den vigtigste regel skal komme først |
| Forbud mod tankestreger helt til sidst, én gang | Regel 2 øverst, gentaget som den sidste regel nederst | Fanger både primacy- og recency-vægtning |
| Ingen instruktion for ufuldstændigt input | Regel 4 — protokol for manglende data med et præcist svarformat | Eliminerer hallucination og skaber et revisionsspor |
| Ingen instruktion for inputformat | Regel 3 — accepter ethvert format, omskriv altid fra bunden | Forhindrer modellen i blot at omformatere et indsat notat |
| 19 påkrævede felter, alle med samme vægt | 15 påkrævede + 4 valgfrie felter, klart adskilt | Valgfrie felter udelades tavst; påkrævede felter blokerer generering, hvis de mangler |
| “Professionel. Naturlig. Ikke robotagtig.” | Konkrete regler: forbindende sprog, varieret sætningslængde, forbudte konstruktioner | Vage adjektiver følges ikke; konkrete regler gør |
| Eksempelnotat inkluderet | Eksempel fjernet helt | Modellen behandlede eksemplet som input, den skulle svare på |
Den enkelt vigtigste lærdom her: vage adjektiver er ikke instruktioner. At bede en model om at være “naturlig” opmuntrede aktivt til de tankestreger og retoriske krusseduller, der brød husstilen. At erstatte det med konkrete, testbare regler var det, der gjorde stilen konsistent.
Hallucination bliver ofte fremstillet som en modelfejl. I struktureret arbejde er det som regel en prompt-fejl: prompten fortalte aldrig modellen, hvad den skulle gøre, når et felt manglede, så den gjorde det statistisk sandsynlige og producerede en plausibel værdi.
Løsningen er en protokol for manglende data. Del dine felter op i påkrævede og valgfrie. Valgfrie felter udelades tavst, når de mangler. Påkrævede felter gør det modsatte — hvis ét mangler, skal modellen stoppe og bede om det i et præcist format i stedet for at generere et notat. Denne ene regel omdanner en tavs hallucination til en synlig, reviderbar anmodning om flere data. Det er forskellen mellem et forkert tal på en reguleret sag og et notat, der aldrig blev produceret, fordi inputtet var ufuldstændigt.
Med en hærdet prompt skal selve agenten låses ned, så intet genindfører variabilitet. Hele flowet er bevidst minimalt — tre noder og ikke andet.
De konfigurationsvalg, der gjorde en forskel:
Alle ovenstående fikser bliver ophævet af én dårlig vane: at genbruge den samme chat. Den vigtigste operationelle regel for analytikerteamet er at starte en ny samtale for hver eneste sag. Fortsæt aldrig med at gennemgå sager i det samme vindue. Det er den regel, der eliminerer session drift — grundårsagen til de fleste af de oprindelige fejl — og det koster intet at følge den.
Hvis dit team kæmper med en driftende prompt inde i et chatvindue, er løsningen en hærdet prompt kørende på en stateless agent. FlowHunt lader dig låse prompten, fastlåse modellen og temperaturen, og køre et rent kald pr. sag. Lad os hjælpe dig derhen.
En metode er kun så god som dens beviser. Vi testede ni modeller mod den hærdede prompt ved brug af en identisk, reel sag (en Gambling Intensity-trigger med tidligere session-varighedshistorik) på tværs af tre kørsler hver — 27 kørsler i alt — og scorede hver kørsel mod 16 compliance-kriterier.
På tværs af alle 27 kørsler hallucinerede ingen produktionsklar model et tal, vendte P/L-konventionen om, brugte en tankestreg eller afkortede output. Den hærdede prompt eliminerede hver eneste af de oprindelige fejltilstande hos de modeller, der kvalificerede sig. De forskelle, der stod tilbage, handlede om analytisk dybde og konsistens, ikke korrekthed.
| Model | Leverandør | Gns. score | Produktion | Noter |
|---|---|---|---|---|
| GPT-5.6 Luna | OpenAI | 10 / 10 | Ja | Perfekt på alle tre kørsler; højeste konsistens |
| Claude Fable 5 | Anthropic | 10 / 10 | Ja | Mest ræsonnerede resultatafsnit; bedste enkeltnotat |
| Claude Sonnet 5 | Anthropic | 9,8 / 10 | Ja | Ingen hallucination på nogen kørsel; bedste Claude alt taget i betragtning |
| Claude Opus 4.8 | Anthropic | 9,8 / 10 | Ja | Dybeste analyse; premium-omkostning |
| GPT-5.4 Default | OpenAI | 9,5 / 10 | Ja | Én navngivningsfejl; bedste budgetvalg |
| Claude Sonnet 4.6 | Anthropic | 8,7 / 10 | Nej | Forvekslede trigger-tærsklen med indskudsgrænsen i 2/3 kørsler |
| Claude Haiku 4.5 | Anthropic | 8,5 / 10 | Nej | Konsistent, men svag begrundelse for resultatet |
| Billigste tier | Budget | 8,0 / 10 | Nej | Præcist interventionsnavn i kun 1/3 kørsler |
| DeepSeek V4 Pro | DeepSeek | 7,8 / 10 | Nej | Afkortet output i kørsel 1; inkonsistent |
Diskvalifikationerne er lærerige. Claude Sonnet 4.6 producerede smuk prosa, men forvekslede trigger-tærsklen med indskudsgrænsen — et faktuelt forkert tal på en reguleret sag, hvilket er diskvalificerende, uanset hvor godt det læser. DeepSeeks udsving fra kørsel til kørsel (6, 8,5, 9) er det reelle problem: i reguleret arbejde er kvalitet, der afhænger af held, ikke kvalitet overhovedet.
Det er fristende at optimere efter pris, men tallene taler imod det. Selv den dyreste produktionsklare model, Claude Opus 4.8, koster omkring seks cent pr. notat. For et team, der gennemgår 50 sager om dagen, er det under $90 om måneden. Omkostningen ved et enkelt reguleringsfund fra et forkert notat ville overgå den årlige omkostning ved enhver model på listen langt. For reguleret compliance, vælg den mest pålidelige model, du kan, ikke den billigste.
Det bedste enkeltnotat på tværs af alle 27 kørsler kom fra Claude Fable 5. Læg mærke til, hvad det gør: det angiver positionen i den korrekte konvention, citerer tal ordret, bruger det præcise interventionsnavn og — afgørende — forklarer hvorfor en eskalering ville være uforholdsmæssig i stedet for blot at fastslå et resultat.
The customer is currently in a winning position of £1,612.50 with an account balance of £8,962.50, which represents an improvement on the winning position of £1,275.00 recorded at the previous review… Session duration was reviewed under Session Duration Level 1 on 19/07 and again on 20/07… Given that those decisions were made within the last few days, insufficient time has elapsed to assess their effectiveness, and repeating or escalating on the same behaviour at this stage would be disproportionate… In this context, No Further Action Required is the proportionate outcome.
Det er den standard, reguleret arbejde kræver: evidensbaseret, proportional og af identisk kvalitet ved dagens første sag og den halvtredsindstyvende.
RG-notatgeneratoren er et specifikt tilfælde, men metoden generaliserer til enhver proces, hvor en sprogmodel skal producere troværdigt, gentageligt output på reguleret eller kritisk data:
Gør de fem ting, og du omdanner en model, der hallucinerer hen på eftermiddagen, til én, der producerer revisionsklart output hver gang. Den konsistens, reguleret arbejde kræver, er opnåelig — det er et arkitektur- og prompt-engineering-problem, og begge dele kan løses.
Arshia er AI Workflow Engineer hos FlowHunt. Med en baggrund inden for datalogi og en passion for AI, specialiserer han sig i at skabe effektive workflows, der integrerer AI-værktøjer i daglige opgaver og øger produktivitet og kreativitet.

Omdan en driftende ChatGPT-prompt til en låst, stateless agent, der producerer revisionsklare notater hver gang. Vi hjælper dig med at hærde prompten og vælge den rigtige model.

En realtidschatbot, der bruger Google Søgning begrænset til dit eget domæne, henter relevant webindhold og udnytter OpenAI LLM til at besvare brugerforespørgsle...

AI chatbot-assistent drevet af OpenAI GPT-4o, der automatisk søger i og udnytter interne virksomheds-dokumenter for at besvare brugerens spørgsmål. Leverer kont...

Dette AI-drevne workflow løser automatisk CAPTCHA-billeder, der uploades af brugere. Det guider brugerne med instruktioner, behandler det uploadede billede ved ...
Cookie Samtykke
Vi bruger cookies til at forbedre din browsingoplevelse og analysere vores trafik. See our privacy policy.