
Pochopenie a prevencia halucinácií v AI chatbotoch
Čo sú halucinácie v AI, prečo vznikajú a ako sa im vyhnúť? Zistite, ako udržať odpovede vášho AI chatbota presné vďaka praktickým, na človeka zameraným stratégi...
ChatGPT sa odkláňa od témy, halucinuje čísla a porušuje firemný štýl pri poznámkach o regulovanej compliance. Toto je metóda spevnenia promptu a bezstavového agenta, ktorá spravila z workflow pre UK Responsible Gambling niečo pripravené na audit — s testovaním modelov naprieč 9 modelmi a 27 behmi.
Tím pre UK Responsible Gambling (RG) prišiel za nami s problémom, ktorý spozná každý, kto automatizuje regulovanú prácu. Používajú ChatGPT na premenu automatizovaných compliance spúšťačov na formálne poznámky analytika. Keď zákazník prekročí prah — obrat vzrastie o viac ako 100 % za 30 dní, relácia prebehne za jej limit — analytik skopíruje relevantné dáta do ChatGPT a model podľa vopred nahraného promptu vypracuje poznámku do compliance spisu zákazníka.
Táto poznámka nie je koncept e-mailu. Je to právny dokument, ktorý môže preskúmať UK Gambling Commission. A po čase začal ChatGPT halucinovať čísla, vynechávať kľúčové informácie, vkladať pomlčky em-dash, ktoré porušovali firemný štýl, a potichu sa odkláňať od pravidiel poobede. V regulovanom spise je každá z týchto vecí compliance problémom.
Otázka, ktorú si položili, bola jednoduchá: dá sa vôbec od jazykového modelu dosiahnuť konzistencia, akú regulovaná práca vyžaduje? Odpoveď je áno — ale nie úpravou formulácie promptu v chatovom okne. Vyžaduje si to zmenu architektúry plus disciplinovaný prepis. Tento článok prechádza presnú metódu na príklade workflow RG, aby ste ju mohli aplikovať na akýkoľvek regulovaný proces, kde ten istý vstup musí vždy priniesť ten istý dôveryhodný výstup.
Predtým, než niečo opravíme, pomôže presne pomenovať zlyhania. Pri workflow RG sme reprodukovali päť odlišných spôsobov, akými sa výstup pokazil, od kritických až po len otravné.
Dve kritické sú nebezpečnou dvojicou. Halucinované čísla vložia nesprávnu sumu vkladu alebo profitu/straty do regulovaného spisu — model dopĺňa medzeru z tréningovej pamäte namiesto toho, aby priznal, že dáta chýbajú. Obrátenie konvencie je jemnejšie: tento prevádzkovateľ používa obrátenú konvenciu profitu/straty, kde kladné číslo znamená, že zákazník prehráva. Je to protiintuitívne, takže sa model vracia k štandardnej konvencii, ktorú sa naučil počas tréningu, a napíše, že zákazník prehráva, keď v skutočnosti vyhráva.
Zlyhania s vysokou závažnosťou — pomlčky em-dash, ktoré porušujú firemný štýl, a odklon relácie, keď sa pravidlá neskôr počas dňa ignorujú — nevkladajú do spisu nesprávne číslo, ale narúšajú dôveru vo výstup a vytvárajú viacnásobnú prácu. Stredne závažný problém, neformálne názvy intervencií namiesto presných regulačných pojmov, potichu poškodzuje compliance záznam.
Štyri z týchto piatich zlyhaní majú spoločnú jednu hlavnú príčinu. V jednej relácii ChatGPT sa každý posudzovaný prípad pripája do kontextového okna. Pri posudzovaní prvého prípadu model vidí prompt a jeden prípad. Pri pätnástom prípade vidí prompt plus štatistický zvyšok štrnástich predchádzajúcich výmen. Pravidlá promptu tam stále sú, ale súperia s narastajúcou hromadou kontextu a pozornosť voči nim upadá.
Preto ten istý prompt vytvorí o 9:00 dokonalú poznámku a o 16:00 chybnú. Architektonickým riešením je bezstavovosť: každý prípad musí byť úplne nové, izolované volanie, ktoré vidí len uzamknutý prompt a aktuálny prípad. Nič sa neprenáša. AI agent takto nakonfigurovaný venuje promptu rovnakú pozornosť pri päťdesiatom prípade ako pri prvom.
Bezstavovosť je nevyhnutná, no nie postačujúca. Zastaví odklon, ale pri každom volaní verne zreprodukuje aj zlý prompt. Preto treba spevniť samotný prompt.
Jazykové modely neváhajú rovnako každý riadok promptu. Pozornosť má približne tvar U — najsilnejšia na začiatku a na konci, najslabšia v strede. Pôvodný prompt RG proti tomu bojoval. Jeho najdôležitejšie pravidlo, obrátená konvencia profitu/straty, sedelo v strede promptu, uvedené len raz. Zákaz pomlčiek em-dash bol úplne posledným riadkom, tiež uvedený len raz.
Prepis presunul kritické pravidlá tam, kam sa model skutočne pozerá, a prepracoval slabé časti systémového promptu . Tu je, čo sa zmenilo a prečo.
| Pôvodný | Spevnený v2.0 | Prečo je to dôležité |
|---|---|---|
| Pravidlo P/L zakopané v strede promptu, uvedené raz | Pravidlo 1 úplne na začiatku so sebakontrolným krokom, opakované v sekcii o štýle písania | Váha primárnosti — najdôležitejšie pravidlo musí byť prvé |
| Zákaz pomlčiek em-dash na samom konci, raz | Pravidlo 2 na začiatku, opakované ako posledné pravidlo na konci | Zachytáva váhu primárnosti aj recencie |
| Žiadna inštrukcia pre neúplný vstup | Pravidlo 4 — protokol pre chýbajúce dáta s presným formátom odpovede | Eliminuje halucinácie a vytvára audítovateľnú stopu |
| Žiadna inštrukcia pre formát vstupu | Pravidlo 3 — akceptovať akýkoľvek formát, vždy prepísať od začiatku | Zabraňuje modelu len ľahko preformátovať vloženú poznámku |
| 19 povinných polí, všetky s rovnakou váhou | 15 povinných + 4 voliteľné polia, jasne oddelené | Voliteľné polia sa potichu vynechajú; povinné polia blokujú generovanie, ak chýbajú |
| „Profesionálne. Prirodzené. Nie robotické." | Konkrétne pravidlá: spojovací jazyk, rôzna dĺžka viet, zakázané konštrukcie | Vágne prídavné mená sa nedodržiavajú; konkrétne pravidlá áno |
| Príklad poznámky bol súčasťou | Príklad úplne odstránený | Model považoval príklad za vstup, na ktorý má reagovať |
Najväčšie poučenie tu je: vágne prídavné mená nie sú inštrukcie. Povedať modelu, aby bol „prirodzený", aktívne podnecovalo pomlčky em-dash a rečnícke ozdoby, ktoré porušovali firemný štýl. Nahradenie tohto konkrétnymi, testovateľnými pravidlami je to, čo spravilo štýl konzistentným.
Halucinácia sa často rámuje ako chyba modelu. Pri štruktúrovanej práci ide zvyčajne o chybu promptu: prompt nikdy nepovedal modelu, čo má robiť, keď pole chýba, tak urobil štatisticky pravdepodobnú vec a vytvoril vierohodnú hodnotu.
Riešením je protokol pre chýbajúce dáta. Rozdeľte polia na povinné a voliteľné. Voliteľné polia sa pri absencii potichu vynechajú. Povinné polia fungujú opačne — ak jedno chýba, model musí zastaviť sa a vyžiadať si ho v presnom formáte namiesto toho, aby generoval poznámku. Toto jedno pravidlo mení tichú halucináciu na viditeľnú, audítovateľnú žiadosť o ďalšie dáta. Je to rozdiel medzi nesprávnym číslom v regulovanom spise a poznámkou, ktorá nikdy nevznikla, pretože vstup bol neúplný.
So spevneným promptom treba uzamknúť aj samotného agenta, aby nič nezaviedlo späť variabilitu. Celý flow je zámerne minimálny — tri uzly a nič iné.
Konfiguračné voľby, na ktorých záležalo:
Každú vyššie uvedenú opravu zmarí jeden zlý zvyk: opätovné použitie toho istého chatu. Najdôležitejším prevádzkovým pravidlom pre tím analytikov je začať novú konverzáciu pre každý jednotlivý prípad. Nikdy nepokračovať v posudzovaní prípadov v tom istom okne. Toto je pravidlo, ktoré eliminuje odklon relácie — hlavnú príčinu väčšiny pôvodných zlyhaní — a nič to nestojí dodržať.
Ak váš tím bojuje s odkláňajúcim sa promptom v chatovom okne, riešením je spevnený prompt bežiaci na bezstavovom agentovi. FlowHunt vám umožňuje uzamknúť prompt, pripnúť model a teplotu a spustiť čisté volanie pre každý prípad. Pomôžeme vám sa tam dostať.
Metóda je dobrá len natoľko, nakoľko ju podporujú dôkazy. Otestovali sme deväť modelov voči spevnenému promptu, pričom sme použili identický reálny prípad (spúšťač Gambling Intensity s predchádzajúcou históriou dĺžky relácie) v troch behoch pre každý — 27 behov celkovo — a ohodnotili sme každý beh voči 16 compliance kritériám.
Naprieč všetkými 27 behmi žiadny model pripravený na produkciu nehalucinoval číslo, neobrátil konvenciu P/L, nepoužil pomlčku em-dash ani neskrátil výstup. Spevnený prompt eliminoval každé z pôvodných zlyhaní u modelov, ktoré sa kvalifikovali. Zostávajúce rozdiely sa týkali analytickej hĺbky a konzistencie, nie správnosti.
| Model | Dodávateľ | Priemerné skóre | Produkčný | Poznámky |
|---|---|---|---|---|
| GPT-5.6 Luna | OpenAI | 10 / 10 | Áno | Perfektný vo všetkých troch behoch; najvyššia konzistencia |
| Claude Fable 5 | Anthropic | 10 / 10 | Áno | Najlepšie zdôvodnené odseky s výsledkom; najlepšia jednotlivá poznámka |
| Claude Sonnet 5 | Anthropic | 9,8 / 10 | Áno | Žiadna halucinácia v žiadnom behu; najlepší celkový Claude |
| Claude Opus 4.8 | Anthropic | 9,8 / 10 | Áno | Najhlbšia analýza; prémiové náklady |
| GPT-5.4 Default | OpenAI | 9,5 / 10 | Áno | Jedno pomýlenie v pomenovaní; najlepšia rozpočtová voľba |
| Claude Sonnet 4.6 | Anthropic | 8,7 / 10 | Nie | V 2/3 behoch zamenil prah spúšťača s limitom vkladu |
| Claude Haiku 4.5 | Anthropic | 8,5 / 10 | Nie | Konzistentný, ale slabé zdôvodnenie výsledku |
| Najlacnejšia úroveň | Rozpočtová | 8,0 / 10 | Nie | Presný názov intervencie len v 1/3 behov |
| DeepSeek V4 Pro | DeepSeek | 7,8 / 10 | Nie | Skrátený výstup v behu 1; nekonzistentný |
Diskvalifikácie sú poučné. Claude Sonnet 4.6 vytvoril krásnu prózu, ale zamenil prah spúšťača s limitom vkladu — fakticky nesprávne číslo v regulovanom spise, čo je diskvalifikujúce bez ohľadu na to, ako dobre sa to číta. Kolísanie DeepSeeku medzi behmi (6, 8,5, 9) je skutočný problém: v regulovanej práci kvalita, ktorá závisí od šťastia, nie je kvalitou vôbec.
Je lákavé optimalizovať na cenu, ale čísla hovoria proti tomu. Aj najdrahší produkčný model, Claude Opus 4.8, stojí zhruba šesť centov na poznámku. Pre tím posudzujúci 50 prípadov denne je to menej ako 90 dolárov mesačne. Náklady na jediné regulačné zistenie spôsobené nesprávnou poznámkou by ďaleko prevýšili ročné náklady na ktorýkoľvek model zo zoznamu. Pri regulovanej compliance vyberte najspoľahlivejší model, aký si môžete dovoliť, nie najlacnejší.
Najlepšia jednotlivá poznámka zo všetkých 27 behov pochádzala od Claude Fable 5. Všimnite si, čo robí: uvádza pozíciu v správnej konvencii, cituje čísla doslovne, používa presný názov intervencie a — čo je kľúčové — vysvetľuje prečo by bola eskalácia neprimeraná, namiesto toho, aby jednoducho konštatovala výsledok.
The customer is currently in a winning position of £1,612.50 with an account balance of £8,962.50, which represents an improvement on the winning position of £1,275.00 recorded at the previous review… Session duration was reviewed under Session Duration Level 1 on 19/07 and again on 20/07… Given that those decisions were made within the last few days, insufficient time has elapsed to assess their effectiveness, and repeating or escalating on the same behaviour at this stage would be disproportionate… In this context, No Further Action Required is the proportionate outcome.
To je štandard, aký regulovaná práca vyžaduje: dôkazmi podložený, primeraný a rovnako kvalitný pri prvom prípade dňa aj pri päťdesiatom.
Generátor poznámok RG je konkrétny prípad, ale metóda sa dá zovšeobecniť na akýkoľvek proces, kde jazykový model musí produkovať dôveryhodný, opakovateľný výstup na regulovaných alebo vysoko rizikových dátach:
Urobte týchto päť vecí a premeníte model, ktorý poobede halucinuje, na taký, ktorý vždy produkuje výstup pripravený na audit. Konzistencia, ktorú regulovaná práca vyžaduje, je dosiahnuteľná — je to architektonický a prompt-inžiniersky problém a oba sú riešiteľné.
Arshia je inžinierka AI workflowov v spoločnosti FlowHunt. S pozadím v informatike a vášňou pre umelú inteligenciu sa špecializuje na tvorbu efektívnych workflowov, ktoré integrujú AI nástroje do každodenných úloh, čím zvyšuje produktivitu a kreativitu.

Premeňte odkláňajúci sa prompt ChatGPT na uzamknutého, bezstavového agenta, ktorý vždy vytvorí poznámku pripravenú na audit. Pomôžeme vám spevniť prompt a vybrať správny model.

Čo sú halucinácie v AI, prečo vznikajú a ako sa im vyhnúť? Zistite, ako udržať odpovede vášho AI chatbota presné vďaka praktickým, na človeka zameraným stratégi...

Zistite, ako najnovší výskum OpenAI odhaľuje dôvody, prečo jazykové modely halucinujú a produkujú sebavedomé nepravdy. Spoznajte hlavné príčiny a praktické rieš...

Halucinácia v jazykových modeloch nastáva vtedy, keď AI generuje text, ktorý sa javí ako vierohodný, ale v skutočnosti je nesprávny alebo vymyslený. Zistite via...
Súhlas s cookies
Používame cookies na vylepšenie vášho prehliadania a analýzu našej návštevnosti. See our privacy policy.