ChatGPT'nin Düzenlenmiş Uyum Çalışmalarında Halüsinasyon Görmesini Nasıl Durdurursunuz

AI Compliance Prompt Engineering AI Agents Responsible Gambling

Bir İngiltere Sorumlu Kumar (RG) ekibi, düzenlenmiş bir işi otomatikleştiren herkesin tanıyacağı bir sorunla bize geldi. Otomatik uyum tetikleyicilerini resmi analist notlarına dönüştürmek için ChatGPT kullanıyorlar. Bir müşteri bir eşiği aştığında -30 günde ciroda %100’den fazla artış, limitini aşan bir oturum- bir analist ilgili veriyi ChatGPT’ye kopyalıyor ve model, önceden yüklenmiş bir promptu izleyerek müşterinin uyum dosyası için bir not taslağı hazırlıyor.

Bu not sıradan bir e-posta taslağı değil. İngiltere Kumar Komisyonu (UK Gambling Commission) tarafından incelenebilecek yasal bir belge. Ve bir süre sonra ChatGPT rakamlarda halüsinasyon görmeye, kritik bilgileri atlamaya, kurumsal yazım stilini bozan tire işaretleri (em dash) eklemeye ve öğleden sonra kurallardan sessizce sapmaya başladı. Düzenlenmiş bir dosyada bunların her biri bir uyum sorunudur.

Sordukları soru basitti: düzenlenmiş işin gerektirdiği tutarlılığı bir dil modelinden gerçekten alabilir miyiz? Cevap evet -ama bir sohbet penceresi içinde bir promptun kelimelerini oynayarak değil. Bunun için mimaride bir değişiklik artı disiplinli bir yeniden yazım gerekiyor. Bu makale, RG iş akışını örnek olay olarak kullanarak yöntemi adım adım anlatıyor; böylece aynı girdinin her seferinde aynı güvenilir çıktıyı üretmesi gereken herhangi bir düzenlenmiş sürece de uygulayabilirsiniz.

ChatGPT düzenlenmiş işlerde neden savruluyor

Herhangi bir şeyi düzeltmeden önce, hata modlarını kesin olarak adlandırmakta fayda var. RG iş akışında, kritikten yalnızca can sıkıcı olana kadar uzanan beş farklı çıktı bozulma biçimini yeniden ürettik.

Beş hata modu: halüsinasyon görülen rakamlar ve K/Z kuralının ters çevrilmesi (kritik), tire işareti eklenmesi ve oturum savrulması (yüksek) ve tutarsız müdahale adlandırması (orta)

İki kritik sorun tehlikeli ikilidir. Halüsinasyon görülen rakamlar, düzenlenmiş bir dosyaya yanlış bir yatırım veya kâr-zarar rakamı koyar -model, verinin eksik olduğunu kabul etmek yerine eğitim belleğinden bir boşluğu doldurur. Kural tersine çevrilmesi ise daha inceliklidir: bu operatör, pozitif bir sayının müşterinin kaybettiği anlamına geldiği ters bir kâr-zarar kuralı kullanıyor. Bu sezgiye aykırı olduğu için model, eğitiminde öğrendiği standart kurala geri döner ve müşteri aslında kazanırken kaybettiğini yazar.

Yüksek önem düzeyindeki sorunlar -kurumsal yazım stilini ihlal eden tire işaretleri ve günün ilerleyen saatlerinde kuralların göz ardı edildiği oturum savrulması- dosyaya yanlış bir rakam koymaz, ancak çıktıya duyulan güveni zedeler ve yeniden çalışma yaratır. Orta düzeydeki sorun ise, tam düzenleyici terimler yerine gayri resmi müdahale adlarının kullanılmasıdır ve uyum kaydını sessizce bozar.

Kök neden durumsuzluk eksikliğidir

Bu beş hatanın dördü tek bir kök nedeni paylaşır. Tek bir ChatGPT oturumunda, incelediğiniz her vaka bağlam penceresine eklenir. Birinci vakayı incelediğinizde model promptu ve tek bir vakayı görür. On beşinci vakada ise promptu artı önceki on dört alışverişin istatistiksel kalıntısını görür. Promptun kuralları hâlâ oradadır, ancak giderek büyüyen bir bağlam yığınıyla rekabet eder ve bunlara verilen dikkat azalır.

Solda: bağlamın vaka vaka biriktiği ve kural uyumunun sabahtan öğleden sonraya bozulduğu bir ChatGPT oturumu. Sağda: her vakanın izole, yeni bir çağrı olduğu ve kural uyumunun sabit kaldığı durumsuz bir ajan.

Aynı promptun sabah saat dokuzda kusursuz bir not, öğleden sonra dörtte ise hatalı bir not üretmesinin nedeni budur. Mimari çözüm durumsuzluktur (statelessness): her vaka, yalnızca kilitli promptu ve mevcut vakayı gören tamamen yeni, izole bir çağrı olmalıdır. Hiçbir şey devredilmez. Bu şekilde yapılandırılmış bir yapay zeka ajanı , promptun ellinci vakada da birinci vakadaki kadar dikkat görmesini sağlar.

Durumsuzluk gerekli ama yeterli değildir. Savrulmayı durdurur, ancak kötü bir promptu her çağrıda sadakatle yeniden üretir. Bu yüzden promptun kendisinin sağlamlaştırılması gerekir.

FlowHunt Logo

İşinizi büyütmeye hazır mısınız?

Bugün ücretsiz denemenizi başlatın ve günler içinde sonuçları görün.

Adım 1: Promptu birincillik ve yakınlık için sağlamlaştırın

Dil modelleri bir promptun her satırına eşit ağırlık vermez. Dikkat kabaca U şeklindedir -en başta ve en sonda en güçlü, ortada en zayıf. Orijinal RG promptu bu gerçeğe aykırıydı. En önemli kuralı, ters çevrilmiş kâr-zarar kuralı, promptun ortasında, yalnızca bir kez belirtiliyordu. Tire işareti yasağı ise en son satırdaydı, o da yalnızca bir kez.

Orijinal prompt, K/Z kuralını dikkatin en düşük olduğu prompt ortasına gömmüştü; sağlamlaştırılmış v2.0 promptu ise kritik kuralları en başa yerleştirir ve hem birincillik hem de yakınlık ağırlığını yakalamak için en sonda tekrar eder

Yeniden yazım, kritik kuralları modelin gerçekten baktığı yere taşıdı ve sistem promptunun zayıf kısımlarını yeniden ele aldı. Neyin değiştiği ve nedeni şöyle:

OrijinalSağlamlaştırılmış v2.0Neden önemli
K/Z kuralı prompt ortasına gömülü, yalnızca bir kez belirtilmişKural 1 en başta, bir öz kontrol adımıyla, yazım stili bölümünde tekrarlanmışBirincillik ağırlığı -en önemli kural ilk sırada gelmelidir
Tire işareti yasağı en sonda, bir kezKural 2 en başta, en sondaki son kural olarak da tekrarlanmışHem birincillik hem yakınlık ağırlığını yakalar
Eksik girdi için talimat yokKural 4 -tam bir yanıt formatıyla eksik veri protokolüHalüsinasyonu ortadan kaldırır ve bir denetim izi oluşturur
Girdi formatı için talimat yokKural 3 -herhangi bir formatı kabul et, her zaman sıfırdan yeniden yazModelin yapıştırılan bir notu hafifçe yeniden biçimlendirmesini durdurur
19 zorunlu alan, hepsi eşit ağırlıkta15 zorunlu + 4 isteğe bağlı alan, açıkça ayrılmışİsteğe bağlı alanlar sessizce atlanır; zorunlu alanlar eksikse üretimi engeller
“Profesyonel. Doğal. Robotik değil.”Somut kurallar: bağlayıcı dil, değişken cümle uzunluğu, yasaklı yapılarBelirsiz sıfatlar takip edilmez; somut kurallar takip edilir
Örnek not dahil edilmişÖrnek tamamen kaldırılmışModel, örneği yanıt vermesi gereken bir girdi olarak ele alıyordu

Buradaki en büyük ders şu: belirsiz sıfatlar talimat değildir. Bir modele “doğal” olmasını söylemek, kurumsal yazım stilini bozan tire işaretlerini ve retorik süslemeleri fiilen teşvik ediyordu. Bunun yerine somut, test edilebilir kurallar koymak, stili tutarlı hale getiren şeydi.

Adım 2: Eksik veriyi uydurmak yerine yönetin

Halüsinasyon genellikle bir model kusuru olarak çerçevelenir. Yapılandırılmış işlerde bu genellikle bir prompt kusurudur: prompt, modele bir alan eksik olduğunda ne yapması gerektiğini hiç söylememiştir, bu yüzden model istatistiksel olarak olası olanı yapmış ve makul görünen bir değer üretmiştir.

Çözüm bir eksik veri protokolüdür. Alanlarınızı zorunlu ve isteğe bağlı olarak ayırın. İsteğe bağlı alanlar eksik olduğunda sessizce atlanır. Zorunlu alanlar ise tam tersini yapar -biri eksikse model bir not üretmek yerine durmalı ve bunu tam bir formatta talep etmelidir. Bu tek kural, sessiz bir halüsinasyonu görünür, denetlenebilir bir ek veri talebine dönüştürür. Bu, düzenlenmiş bir dosyadaki yanlış bir rakam ile girdi eksik olduğu için hiç üretilmemiş bir not arasındaki farktır.

Adım 3: Ajan yapılandırmasını kilitleyin

Sağlamlaştırılmış bir prompt ile birlikte, hiçbir şeyin değişkenliği yeniden getirmemesi için ajanın kendisinin de kilitlenmesi gerekir. Bütün akış kasıtlı olarak minimaldir -üç düğüm ve başka hiçbir şey yok.

Chat Input, sıcaklık 0,2'de kilitli sistem promptunu tutan, hiçbir aracı olmayan ve her vaka için yeni bir konuşma başlatan bir AI Agent düğümüne akar, ardından Chat Output'a gider

Önemli olan yapılandırma seçimleri şunlardı:

  • Sistem promptu, Input alanında değil System Message alanında yer almalı ki veri olarak değil talimat olarak okunsun.
  • Sıcaklık 0,2. Maksimum tutarlılık için yeterince düşük, robotik nesirden kaçınmak için yeterince yüksek. Sıfır çok katıydı; bir ise çok yaratıcıydı.
  • Hiçbir araç bağlanmadı. Dosya ve URL alıcıları öngörülemezlik yaratır ve ajanın akıl yürütmesini atlayabilir. Bu iş için model, prompt ve yapıştırılan vaka dışında hiçbir şeye ihtiyaç duymuyor.
  • Maksimum token değeri varsayılanda bırakıldı. Token sınırlaması, notların cümle ortasında kesilmesine neden oluyordu ve bir müşteri dosyasında kesilmiş bir not, kendi başına bir düzenleyici risktir.
  • Promptun en başında sessiz başlangıç talimatı yer alır, böylece ajan akış ilk yüklendiğinde kuralları analiste geri onaylamaz.

En önemli tek operasyonel kural

Yukarıdaki her düzeltme, tek bir kötü alışkanlıkla boşa çıkarılır: aynı sohbeti yeniden kullanmak. Analist ekip için en önemli operasyonel kural, her tek vaka için yeni bir konuşma başlatmaktır. Aynı pencerede vakaları incelemeye asla devam etmeyin. Bu, orijinal hataların çoğunun kök nedeni olan oturum savrulmasını ortadan kaldıran kuraldır ve uygulanması hiçbir maliyet gerektirmez.

Tutarlılık Bir Mimari Sorunudur, Kelime Seçimi Sorunu Değil

Ekibiniz bir sohbet penceresi içinde savrulan bir promptla mücadele ediyorsa, çözüm durumsuz bir ajan üzerinde çalışan sağlamlaştırılmış bir promptdur. FlowHunt, promptu kilitlemenize, modeli ve sıcaklığı sabitlemenize ve vaka başına temiz bir çağrı çalıştırmanıza olanak tanır. Oraya ulaşmanıza yardımcı olalım.

Gerçekten işe yarıyor mu? 9 model, 27 çalıştırma

Bir yöntem ancak kanıtı kadar iyidir. Sağlamlaştırılmış promptu dokuz modele karşı test ettik; her biri için aynı gerçek vakayı (önceki oturum süresi geçmişi olan bir Gambling Intensity tetiklemesi) üç kez çalıştırdık -toplamda 27 çalıştırma- ve her çalıştırmayı 16 uyum kriterine göre puanladık.

Dokuz model arasında ortalama uyum puanı. Üretime hazır: GPT-5.6 Luna 10, Claude Fable 5 10, Claude Sonnet 5 9,8, Claude Opus 4.8 9,8, GPT-5.4 Default 9,5. Elenenler: Claude Sonnet 4.6 8,7, Claude Haiku 4.5 8,5, en ucuz katman 8,0, DeepSeek V4 Pro 7,8.

27 çalıştırmanın tamamında, üretime hazır hiçbir model bir rakamda halüsinasyon görmedi, K/Z kuralını tersine çevirmedi, tire işareti kullanmadı veya çıktıyı kesmedi. Sağlamlaştırılmış prompt, uygun bulunan modellerde orijinal hata modlarının tamamını ortadan kaldırdı. Kalan farklar doğrulukla değil, analitik derinlik ve tutarlılıkla ilgiliydi.

ModelSağlayıcıOrtalama puanÜretime hazırNotlar
GPT-5.6 LunaOpenAI10 / 10EvetÜç çalıştırmanın tamamında kusursuz; en yüksek tutarlılık
Claude Fable 5Anthropic10 / 10EvetEn iyi gerekçelendirilmiş sonuç paragrafları; en iyi tekil not
Claude Sonnet 5Anthropic9,8 / 10EvetHiçbir çalıştırmada halüsinasyon yok; en iyi genel Claude
Claude Opus 4.8Anthropic9,8 / 10EvetEn derin analiz; premium maliyet
GPT-5.4 DefaultOpenAI9,5 / 10EvetBir adlandırma hatası; en iyi bütçe seçeneği
Claude Sonnet 4.6Anthropic8,7 / 10Hayır3 çalıştırmanın 2’sinde tetikleme eşiğini yatırım limitiyle karıştırdı
Claude Haiku 4.5Anthropic8,5 / 10HayırTutarlı ama zayıf sonuç gerekçelendirmesi
En ucuz katmanBütçe8,0 / 10HayırTam müdahale adı yalnızca 3 çalıştırmanın 1’inde
DeepSeek V4 ProDeepSeek7,8 / 10Hayır1. çalıştırmada çıktı kesildi; tutarsız

Elenmeler öğreticidir. Claude Sonnet 4.6 güzel bir nesir üretti ama tetikleme eşiğini yatırım limitiyle karıştırdı -bu, ne kadar iyi okunursa okunsun, düzenlenmiş bir dosyada gerçeklere aykırı bir rakam anlamına gelir ve bu eleyici bir durumdur. DeepSeek’in çalıştırmadan çalıştırmaya salınımı (6, 8,5, 9) asıl sorundur: düzenlenmiş işte şansa bağlı kalite, hiç kalite değildir.

Kısıtlayıcı olan maliyet değildir

Fiyata göre optimize etmek cazip gelebilir, ancak rakamlar bunun aleyhine konuşuyor. En pahalı üretime hazır model olan Claude Opus 4.8 bile not başına kabaca altı sent tutuyor. Günde 50 vaka inceleyen bir ekip için bu, ayda 90 dolarının altındadır. Yanlış bir nottan kaynaklanan tek bir düzenleyici bulgunun maliyeti, listedeki herhangi bir modelin yıllık maliyetini gölgede bırakır. Düzenlenmiş uyum işi için en ucuzunu değil, elinizdeki en güvenilir modeli seçin.

Sağlamlaştırılmış bir not neye benziyor

27 çalıştırmanın tamamındaki en iyi tekil not Claude Fable 5’ten geldi. Neler yaptığına dikkat edin: pozisyonu doğru kuralla belirtiyor, rakamları harfiyen aktarıyor, tam müdahale adını kullanıyor ve -en kritik olarak- bir sonucu basitçe belirtmek yerine yükseltmenin (escalation) neden orantısız olacağını açıklıyor.

The customer is currently in a winning position of £1,612.50 with an account balance of £8,962.50, which represents an improvement on the winning position of £1,275.00 recorded at the previous review… Session duration was reviewed under Session Duration Level 1 on 19/07 and again on 20/07… Given that those decisions were made within the last few days, insufficient time has elapsed to assess their effectiveness, and repeating or escalating on the same behaviour at this stage would be disproportionate… In this context, No Further Action Required is the proportionate outcome.

Düzenlenmiş işin talep ettiği standart budur: kanıta dayalı, orantılı ve günün birinci vakasında da ellinci vakasında da kalite bakımından özdeş.

Bunu kendi düzenlenmiş iş akışınıza uygulamak

RG not üretici belirli bir örnek olay, ancak yöntem, bir dil modelinin düzenlenmiş veya yüksek riskli veri üzerinde güvenilir, tekrarlanabilir çıktı üretmesi gereken her sürece genellenebilir:

  1. Sohbet penceresinden uzaklaşın. Bağlamın birikip savrulmaması için her vakayı durumsuz bir çağrı olarak çalıştırın.
  2. Promptu birincillik ve yakınlık için sağlamlaştırın. Kritik kuralları en başa koyun ve en sonda tekrarlayın. Öz kontroller ekleyin.
  3. Modele bir eksik veri protokolü verin. Zorunlu alanlar eksik olduğunda üretimi engeller; isteğe bağlı alanlar sessizce atlanır. Asla tahmin etmesine izin vermeyin.
  4. Yapılandırmayı kilitleyin. Düşük ama sıfır olmayan sıcaklık, gereksiz araç yok, sınırsız çıktı, sistem mesajında prompt.
  5. Güvenmeden önce test edin. Aynı vakayı aday modeller arasında birden çok kez çalıştırın ve açık kriterlere göre puanlayın. Önemli olan metrik, çalıştırmalar arasındaki tutarlılıktır.

Bu beş şeyi yapın ve öğleden sonra halüsinasyon gören bir modeli, her seferinde denetime hazır çıktı üreten bir modele dönüştürün. Düzenlenmiş işin gerektirdiği tutarlılık ulaşılabilirdir -bu bir mimari ve prompt mühendisliği sorunudur ve ikisi de çözülebilir.

Sıkça sorulan sorular

Arshia, FlowHunt'ta bir Yapay Zeka İş Akışı Mühendisidir. Bilgisayar bilimi geçmişi ve yapay zekaya olan tutkusu ile, yapay zeka araçlarını günlük görevlere entegre eden verimli iş akışları oluşturmada uzmanlaşmıştır ve bu sayede verimlilik ile yaratıcılığı artırır.

Arshia Kahani
Arshia Kahani
Yapay Zeka İş Akışı Mühendisi

Düzenlenmiş İş Akışınıza FlowHunt Tutarlılığını Getirin

Savrulan bir ChatGPT promptunu, her seferinde denetime hazır notlar üreten kilitli, durumsuz bir ajana dönüştürün. Promptu sağlamlaştırmanıza ve doğru modeli seçmenize yardımcı oluruz.

Daha fazla bilgi

Yapay Zekâ Sohbet Botlarında Halüsinasyonları Anlamak ve Önlemek
Yapay Zekâ Sohbet Botlarında Halüsinasyonları Anlamak ve Önlemek

Yapay Zekâ Sohbet Botlarında Halüsinasyonları Anlamak ve Önlemek

Yapay zekâda halüsinasyonlar nedir, neden olur ve bunlardan nasıl kaçınılır? Pratik, insan odaklı stratejilerle yapay zekâ sohbet botu cevaplarınızı doğru tutma...

4 dakika okuma
Theory Intermediate
Dil Modelleri Neden Halüsinasyon Görüyor? OpenAI Araştırması
Dil Modelleri Neden Halüsinasyon Görüyor? OpenAI Araştırması

Dil Modelleri Neden Halüsinasyon Görüyor? OpenAI Araştırması

OpenAI'nin en son araştırmasının, dil modellerinin neden halüsinasyon gördüğünü ve kendinden emin yanlışlar ürettiğini nasıl belirlediğini keşfedin. Halüsinasyo...

11 dakika okuma
AI Language Models +3
Halüsinasyon
Halüsinasyon

Halüsinasyon

Dil modellerinde halüsinasyon, yapay zekanın makul görünen ancak aslında yanlış veya uydurma metinler üretmesiyle oluşur. Nedenleri, tespit yöntemlerini ve yapa...

2 dakika okuma
AI Hallucination +3