
Audit de Securitate pentru Chatbot AI
Un audit de securitate pentru chatbot AI este o evaluare structurată și cuprinzătoare a posturii de securitate a unui chatbot AI, testând vulnerabilități specif...
ChatGPT deviază, halucinează cifre și încalcă stilul casei în notele de conformitate reglementată. Iată metoda de întărire a prompt-ului și de agent stateless care a făcut ca un flux de lucru de Joc Responsabil din UK să fie pregătit pentru audit — cu testare a modelelor pe 9 modele și 27 de rulări.
O echipă de Joc Responsabil (RG) din Marea Britanie a venit la noi cu o problemă pe care oricine automatizează munca reglementată o va recunoaște. Ei folosesc ChatGPT pentru a transforma declanșatoarele automate de conformitate în note formale de analist. Când un client depășește un prag — cifra de afaceri crește cu peste 100% în 30 de zile, o sesiune care depășește limita — un analist copiază datele relevante în ChatGPT, iar modelul, urmând un prompt pre-încărcat, redactează o notă pentru dosarul de conformitate al clientului.
Acea notă nu este un e-mail ciornă. Este un document legal, revizuibil de către UK Gambling Commission. Și după un timp, ChatGPT a început să halucineze cifre, să omită informații cheie, să introducă liniuțe lungi (em dash) care încălcau stilul casei și să devieze discret de la reguli spre după-amiază. Într-un dosar reglementat, fiecare dintre acestea reprezintă o problemă de conformitate.
Întrebarea pe care au pus-o a fost simplă: putem obține consistența pe care munca reglementată o cere de la un model de limbaj? Răspunsul este da — dar nu prin ajustarea formulării unui prompt într-o fereastră de chat. Este nevoie de o schimbare de arhitectură plus o rescriere disciplinată. Acest articol parcurge metoda exactă, folosind fluxul de lucru RG ca exemplu practic, astfel încât să o poți aplica oricărui proces reglementat în care aceeași intrare trebuie să producă întotdeauna același rezultat de încredere.
Înainte de a repara ceva, ajută să numim precis modurile de eșec. În fluxul de lucru RG am reprodus cinci moduri distincte în care rezultatul a eșuat, variind de la critic la doar deranjant.
Cele două critice sunt perechea periculoasă. Cifrele halucinate pun un depozit greșit sau un număr de profit-și-pierdere greșit pe un dosar reglementat — modelul completează un gol din memoria de antrenament în loc să admită că datele lipsesc. Inversarea convenției este mai subtilă: acest operator folosește o convenție de profit-și-pierdere inversată, în care un număr pozitiv înseamnă că clientul pierde. Este contraintuitiv, așa că modelul revine la convenția standard învățată în antrenament și scrie că un client pierde atunci când de fapt câștigă.
Problemele de severitate ridicată — liniuțele lungi care încalcă stilul casei și deviația de sesiune în care regulile sunt ignorate mai târziu în zi — nu pun o cifră greșită pe dosar, dar erodează încrederea în rezultat și creează muncă suplimentară. Problema medie, numele informale ale intervențiilor în locul termenilor de reglementare exacți, corupe discret evidența de conformitate.
Patru dintre cele cinci eșecuri au o singură cauză comună. Într-o singură sesiune ChatGPT, fiecare caz analizat se adaugă la fereastra de context. La analiza cazului unu, modelul vede promptul și un singur caz. Până la cazul cincisprezece vede promptul plus reziduul statistic al celor paisprezece schimburi anterioare. Regulile promptului sunt încă acolo, dar concurează cu un morman tot mai mare de context, iar atenția acordată lor se degradează.
Acesta este motivul pentru care același prompt produce o notă perfectă la ora 9 dimineața și una defectuoasă la ora 16. Soluția arhitecturală este statelessness: fiecare caz trebuie să fie un apel complet nou, izolat, care vede doar promptul blocat și cazul curent. Nimic nu se reportează. Un agent AI configurat astfel oferă promptului aceeași atenție la cazul cincizeci ca la cazul unu.
Statelessness este necesară, dar nu suficientă. Oprește deviația, dar va reproduce fidel un prompt prost la fiecare apel. Așadar, promptul în sine trebuie întărit.
Modelele de limbaj nu ponderează fiecare linie a unui prompt în mod egal. Atenția are, în linii mari, o formă de U — cea mai puternică la început și la sfârșit, cea mai slabă la mijloc. Promptul RG original lupta împotriva acestui fapt. Cea mai importantă regulă a sa, convenția inversată de profit-și-pierdere, se afla la mijlocul promptului, menționată o singură dată. Interdicția liniuței lungi era ultima linie, de asemenea menționată o singură dată.
Rescrierea a mutat regulile critice acolo unde modelul chiar se uită și a refăcut părțile slabe ale promptului de sistem . Iată ce s-a schimbat și de ce.
| Original | Întărit v2.0 | De ce contează |
|---|---|---|
| Regula P/L ascunsă la mijlocul promptului, menționată o dată | Regula 1 chiar la început, cu un pas de auto-verificare, repetată în secțiunea de stil de scriere | Ponderea de primacy — cea mai importantă regulă trebuie să vină prima |
| Interdicția liniuței lungi la final, o dată | Regula 2 la început, repetată ca regulă finală la sfârșit | Captează atât ponderea de primacy, cât și de recency |
| Nicio instrucțiune pentru intrare incompletă | Regula 4 — protocol pentru date lipsă cu un format de răspuns exact | Elimină halucinația și creează o urmă de audit |
| Nicio instrucțiune pentru formatul intrării | Regula 3 — acceptă orice format, rescrie mereu de la zero | Oprește modelul să reformateze ușor o notă lipită |
| 19 câmpuri obligatorii, toate cu greutate egală | 15 obligatorii + 4 opționale, clar separate | Câmpurile opționale se omit silențios; cele obligatorii blochează generarea dacă lipsesc |
| „Profesional. Natural. Nu robotic." | Reguli concrete: limbaj de legătură, lungime variată a propozițiilor, construcții interzise | Adjectivele vagi nu sunt respectate; regulile concrete da |
| Exemplu de notă inclus | Exemplu eliminat complet | Modelul trata exemplul ca pe o intrare la care trebuie să răspundă |
Cea mai mare lecție de aici: adjectivele vagi nu sunt instrucțiuni. A spune unui model să fie „natural" a încurajat activ liniuțele lungi și înfloriturile retorice care încălcau stilul casei. Înlocuirea acestora cu reguli concrete, testabile, este ceea ce a făcut stilul consistent.
Halucinația este adesea prezentată ca un defect al modelului. În munca structurată, este de obicei un defect al promptului: promptul nu a spus niciodată modelului ce să facă atunci când un câmp lipsește, așa că a făcut lucrul statistic probabil și a produs o valoare plauzibilă.
Soluția este un protocol pentru date lipsă. Împarte câmpurile în obligatorii și opționale. Câmpurile opționale sunt omise silențios când lipsesc. Câmpurile obligatorii fac exact opusul — dacă unul lipsește, modelul trebuie să oprească și să îl solicite într-un format exact în loc să genereze o notă. Această singură regulă transformă o halucinație silențioasă într-o cerere vizibilă, auditabilă, pentru mai multe date. Este diferența dintre o cifră greșită pe un dosar reglementat și o notă care nu a fost niciodată produsă pentru că intrarea era incompletă.
Cu un prompt întărit, agentul în sine trebuie blocat pentru ca nimic să nu reintroducă variabilitatea. Întregul flux este deliberat minimal — trei noduri și nimic altceva.
Alegerile de configurare care au contat:
Fiecare corecție de mai sus este anulată de un singur obicei prost: reutilizarea aceluiași chat. Cea mai importantă regulă operațională pentru echipa de analiști este să înceapă o conversație nouă pentru fiecare caz în parte. Niciodată să nu continue analiza cazurilor în aceeași fereastră. Aceasta este regula care elimină deviația de sesiune — cauza principală a majorității eșecurilor originale — și nu costă nimic să fie respectată.
Dacă echipa ta se luptă cu un prompt care deviază într-o fereastră de chat, soluția este un prompt întărit, rulat pe un agent stateless. FlowHunt îți permite să blochezi promptul, să fixezi modelul și temperatura și să rulezi un apel curat pentru fiecare caz. Lasă-ne să te ajutăm să ajungi acolo.
O metodă este la fel de bună precum dovezile ei. Am testat nouă modele față de promptul întărit, folosind un caz real identic (un declanșator de Intensitate a Jocului cu istoric anterior de durată a sesiunii) pe câte trei rulări fiecare — 27 de rulări în total — și am punctat fiecare rulare față de 16 criterii de conformitate.
În toate cele 27 de rulări, niciun model pregătit pentru producție nu a halucinat o cifră, nu a inversat convenția P/L, nu a folosit o liniuță lungă și nu a trunchiat rezultatul. Promptul întărit a eliminat fiecare dintre modurile de eșec originale la modelele care s-au calificat. Diferențele rămase priveau profunzimea analitică și consistența, nu corectitudinea.
| Model | Furnizor | Punctaj mediu | Producție | Note |
|---|---|---|---|---|
| GPT-5.6 Luna | OpenAI | 10 / 10 | Da | Perfect pe toate cele trei rulări; cea mai mare consistență |
| Claude Fable 5 | Anthropic | 10 / 10 | Da | Cele mai bine argumentate paragrafe de concluzie; cea mai bună notă individuală |
| Claude Sonnet 5 | Anthropic | 9,8 / 10 | Da | Nicio halucinație în nicio rulare; cel mai bun Claude per ansamblu |
| Claude Opus 4.8 | Anthropic | 9,8 / 10 | Da | Cea mai profundă analiză; cost premium |
| GPT-5.4 Default | OpenAI | 9,5 / 10 | Da | O greșeală de denumire; cea mai bună opțiune economică |
| Claude Sonnet 4.6 | Anthropic | 8,7 / 10 | Nu | A confundat pragul declanșatorului cu limita de depozit în 2/3 rulări |
| Claude Haiku 4.5 | Anthropic | 8,5 / 10 | Nu | Consistent, dar cu raționament slab al concluziei |
| Nivelul cel mai ieftin | Buget | 8,0 / 10 | Nu | Numele exact al intervenției doar în 1/3 rulări |
| DeepSeek V4 Pro | DeepSeek | 7,8 / 10 | Nu | Rezultat trunchiat la rularea 1; inconsistent |
Descalificările sunt instructive. Claude Sonnet 4.6 a produs o proză frumoasă, dar a confundat pragul declanșatorului cu limita de depozit — o cifră greșită din punct de vedere factual pe un dosar reglementat, ceea ce este descalificant indiferent cât de bine sună. Variația de la o rulare la alta a DeepSeek (6, 8,5, 9) este problema reală: în munca reglementată, calitatea care depinde de noroc nu este deloc calitate.
Este tentant să optimizezi în funcție de preț, dar cifrele arată contrariul. Chiar și cel mai scump model pregătit pentru producție, Claude Opus 4.8, costă aproximativ șase cenți pe notă. Pentru o echipă care analizează 50 de cazuri pe zi, asta înseamnă sub 90 de dolari pe lună. Costul unei singure constatări de reglementare rezultate dintr-o notă incorectă ar depăși cu mult costul anual al oricărui model din listă. Pentru conformitatea reglementată, alege modelul cel mai fiabil pe care ți-l poți permite, nu cel mai ieftin.
Cea mai bună notă individuală din toate cele 27 de rulări a venit de la Claude Fable 5. Observă ce face: enunță poziția în convenția corectă, citează cifrele exact, folosește numele exact al intervenției și — esențial — explică de ce escaladarea ar fi disproporționată, în loc să afirme pur și simplu un rezultat.
The customer is currently in a winning position of £1,612.50 with an account balance of £8,962.50, which represents an improvement on the winning position of £1,275.00 recorded at the previous review… Session duration was reviewed under Session Duration Level 1 on 19/07 and again on 20/07… Given that those decisions were made within the last few days, insufficient time has elapsed to assess their effectiveness, and repeating or escalating on the same behaviour at this stage would be disproportionate… In this context, No Further Action Required is the proportionate outcome.
Acesta este standardul pe care munca reglementată îl cere: bazat pe dovezi, proporțional și identic ca și calitate la primul caz al zilei și la al cincizecilea.
Generatorul de note RG este un caz specific, dar metoda se generalizează la orice proces în care un model de limbaj trebuie să producă un rezultat de încredere, repetabil, pe date reglementate sau cu mize mari:
Fă aceste cinci lucruri și transformi un model care halucinează spre după-amiază într-unul care produce rezultat pregătit pentru audit de fiecare dată. Consistența pe care munca reglementată o cere este realizabilă — este o problemă de arhitectură și de inginerie a prompt-urilor, iar ambele sunt rezolvabile.
Arshia este Inginer de Fluxuri AI la FlowHunt. Cu o pregătire în informatică și o pasiune pentru inteligența artificială, el este specializat în crearea de fluxuri eficiente care integrează instrumente AI în sarcinile de zi cu zi, sporind productivitatea și creativitatea.

Transformă un prompt ChatGPT care deviază într-un agent stateless, blocat, care produce note pregătite pentru audit de fiecare dată. Te ajutăm să întărești prompt-ul și să alegi modelul potrivit.

Un audit de securitate pentru chatbot AI este o evaluare structurată și cuprinzătoare a posturii de securitate a unui chatbot AI, testând vulnerabilități specif...

Descoperă cele mai eficiente și ușor de folosit metode pentru a conecta ChatGPT la propriile tale date, inclusiv conectori integrați, GPT-uri personalizate și p...

Ce sunt halucinațiile în AI, de ce apar și cum le poți evita? Află cum să menții răspunsurile chatbot-ului tău AI corecte prin strategii practice, centrate pe o...
Consimțământ Cookie
Folosim cookie-uri pentru a vă îmbunătăți experiența de navigare și a analiza traficul nostru. See our privacy policy.