Cách Ngăn ChatGPT Ảo Giác Khi Xử Lý Công Việc Tuân Thủ Trong Ngành Quy Định

AI Compliance Prompt Engineering AI Agents Responsible Gambling

Một đội ngũ Cờ bạc Có Trách Nhiệm (Responsible Gambling - RG) tại Anh đã tìm đến chúng tôi với một vấn đề mà bất kỳ ai đang tự động hóa công việc trong ngành quy định cũng sẽ nhận ra. Họ dùng ChatGPT để chuyển các cảnh báo tuân thủ tự động thành các ghi chú phân tích chính thức. Khi một khách hàng vượt qua một ngưỡng — doanh thu tăng hơn 100% trong 30 ngày, một phiên chơi kéo dài quá giới hạn — một chuyên viên phân tích sao chép dữ liệu liên quan vào ChatGPT, và mô hình, theo một prompt đã được tải sẵn, soạn thảo một ghi chú cho hồ sơ tuân thủ của khách hàng đó.

Ghi chú đó không phải là một bản nháp email. Đó là một tài liệu pháp lý có thể bị Ủy ban Cờ bạc Anh (UK Gambling Commission) xem xét. Và sau một thời gian, ChatGPT bắt đầu tạo ảo giác về số liệu, bỏ sót thông tin quan trọng, chèn thêm dấu gạch ngang dài (em dash) phá vỡ quy chuẩn văn phong, và âm thầm trôi khỏi các quy tắc vào buổi chiều. Trên một hồ sơ thuộc ngành quy định, mỗi lỗi trong số đó đều là một vấn đề tuân thủ.

Câu hỏi họ đặt ra rất đơn giản: liệu chúng ta có thể đạt được mức độ nhất quán mà công việc trong ngành quy định đòi hỏi từ một mô hình ngôn ngữ hay không? Câu trả lời là có — nhưng không phải bằng cách chỉnh sửa câu chữ của một prompt trong cửa sổ chat. Nó đòi hỏi một thay đổi về kiến trúc cộng với một cuộc viết lại có kỷ luật. Bài viết này trình bày chi tiết phương pháp đó, sử dụng quy trình RG làm ví dụ minh họa, để bạn có thể áp dụng cho bất kỳ quy trình nào thuộc ngành quy định, nơi cùng một đầu vào phải luôn tạo ra cùng một kết quả đầu ra đáng tin cậy mỗi lần.

Tại sao ChatGPT bị trôi khi xử lý công việc trong ngành quy định

Trước khi khắc phục bất cứ điều gì, việc gọi tên chính xác các dạng lỗi sẽ rất hữu ích. Trên quy trình RG, chúng tôi đã tái hiện năm cách khác nhau khiến kết quả đầu ra bị hỏng, từ mức nghiêm trọng đến mức chỉ gây khó chịu.

Năm dạng lỗi: số liệu ảo giác và đảo ngược quy ước lãi/lỗ (nghiêm trọng), chèn dấu gạch ngang dài và trôi phiên (cao), và đặt tên biện pháp can thiệp không nhất quán (trung bình)

Hai lỗi nghiêm trọng nhất là cặp nguy hiểm. Số liệu ảo giác đặt một con số tiền gửi hoặc lãi/lỗ sai lên một hồ sơ thuộc ngành quy định — mô hình lấp đầy một khoảng trống từ bộ nhớ huấn luyện thay vì thừa nhận rằng dữ liệu đó vắng mặt. Đảo ngược quy ước thì tinh vi hơn: nhà điều hành này sử dụng một quy ước lãi/lỗ đảo ngược, trong đó số dương có nghĩa là khách hàng đang thua. Điều này phản trực giác, nên mô hình quay về quy ước tiêu chuẩn mà nó đã học trong quá trình huấn luyện và viết rằng khách hàng đang thua trong khi thực tế họ đang thắng.

Các vấn đề mức độ cao — dấu gạch ngang dài vi phạm quy chuẩn văn phong, và trôi phiên khiến các quy tắc bị bỏ qua vào cuối ngày — không đặt một con số sai lên hồ sơ, nhưng chúng làm xói mòn niềm tin vào kết quả đầu ra và tạo ra công việc phải làm lại. Vấn đề mức trung bình, đặt tên biện pháp can thiệp một cách không chính thức thay vì dùng đúng thuật ngữ quy định, âm thầm làm sai lệch hồ sơ tuân thủ.

Nguyên nhân gốc rễ là tính trạng thái — hay sự thiếu vắng của tính phi trạng thái

Bốn trong số năm lỗi đó có chung một nguyên nhân gốc rễ. Trong một phiên ChatGPT duy nhất, mỗi hồ sơ bạn xem xét đều được nối thêm vào cửa sổ ngữ cảnh. Xem xét hồ sơ đầu tiên, mô hình thấy prompt và một hồ sơ. Đến hồ sơ thứ mười lăm, nó thấy prompt cộng với phần dư thống kê của mười bốn lượt trao đổi trước đó. Các quy tắc của prompt vẫn còn đó, nhưng chúng đang phải cạnh tranh với một khối lượng ngữ cảnh ngày càng lớn, và sự chú ý dành cho chúng suy giảm dần.

Bên trái: một phiên ChatGPT nơi ngữ cảnh tích lũy dần theo từng hồ sơ và việc tuân thủ quy tắc suy giảm từ sáng đến chiều. Bên phải: một tác nhân phi trạng thái nơi mỗi hồ sơ là một lượt gọi biệt lập hoàn toàn mới và việc tuân thủ quy tắc luôn ổn định.

Đây là lý do tại sao cùng một prompt tạo ra một ghi chú hoàn hảo lúc 9 giờ sáng và một ghi chú lỗi lúc 4 giờ chiều. Giải pháp về mặt kiến trúc là tính phi trạng thái: mỗi hồ sơ phải là một lượt gọi hoàn toàn mới, biệt lập, chỉ nhìn thấy prompt đã khóa và hồ sơ hiện tại. Không có gì được mang sang từ trước. Một tác nhân AI được cấu hình theo cách này sẽ dành cho prompt cùng một mức độ chú ý ở hồ sơ số năm mươi như ở hồ sơ số một.

Tính phi trạng thái là điều kiện cần nhưng chưa đủ. Nó ngăn chặn hiện tượng trôi, nhưng nó sẽ trung thực tái tạo một prompt tồi ở mỗi lượt gọi. Vì vậy, bản thân prompt cũng phải được tăng cường.

FlowHunt Logo

Sẵn sàng phát triển doanh nghiệp của bạn?

Bắt đầu dùng thử miễn phí ngay hôm nay và xem kết quả trong vài ngày.

Bước 1: Tăng cường prompt để tận dụng hiệu ứng vị trí đầu và cuối

Các mô hình ngôn ngữ không đánh trọng số như nhau cho mọi dòng trong một prompt. Sự chú ý có dạng gần giống chữ U — mạnh nhất ở đầu và ở cuối, yếu nhất ở giữa. Prompt RG ban đầu đã đi ngược lại điều này. Quy tắc quan trọng nhất của nó, quy ước lãi/lỗ đảo ngược, nằm ở giữa prompt, chỉ được nêu một lần. Lệnh cấm dấu gạch ngang dài là dòng cuối cùng, cũng chỉ được nêu một lần.

Prompt ban đầu chôn vùi quy tắc lãi/lỗ ở giữa prompt, nơi sự chú ý thấp nhất; prompt v2.0 đã được tăng cường đặt các quy tắc quan trọng ở đầu và lặp lại chúng ở cuối để tận dụng cả hiệu ứng vị trí đầu và vị trí cuối

Bản viết lại đã chuyển các quy tắc quan trọng đến nơi mà mô hình thực sự chú ý tới và tái cấu trúc lại các phần yếu của prompt hệ thống . Dưới đây là những thay đổi và lý do.

Ban đầuĐã tăng cường v2.0Vì sao điều này quan trọng
Quy tắc lãi/lỗ bị chôn vùi ở giữa prompt, chỉ nêu một lầnQuy tắc 1 nằm ngay đầu kèm bước tự kiểm tra, được lặp lại ở phần văn phongHiệu ứng vị trí đầu — quy tắc quan trọng nhất phải được nêu trước tiên
Lệnh cấm dấu gạch ngang dài ở cuối cùng, chỉ một lầnQuy tắc 2 ở đầu, được lặp lại như quy tắc cuối cùng ở phần dướiTận dụng cả hiệu ứng vị trí đầu lẫn vị trí cuối
Không có hướng dẫn cho đầu vào không đầy đủQuy tắc 4 — quy trình xử lý dữ liệu thiếu với định dạng phản hồi chính xácLoại bỏ ảo giác và tạo ra dấu vết kiểm toán
Không có hướng dẫn cho định dạng đầu vàoQuy tắc 3 — chấp nhận mọi định dạng, luôn viết lại từ đầuNgăn mô hình chỉ định dạng lại nhẹ nhàng một ghi chú đã dán vào
19 trường bắt buộc, tất cả đều có trọng số ngang nhau15 trường bắt buộc + 4 trường tùy chọn, được phân tách rõ ràngTrường tùy chọn bị bỏ qua âm thầm; trường bắt buộc chặn việc tạo nội dung nếu thiếu
“Chuyên nghiệp. Tự nhiên. Không máy móc.”Các quy tắc cụ thể: ngôn ngữ liên kết, độ dài câu đa dạng, các cấu trúc bị cấmTính từ mơ hồ không được tuân theo; quy tắc cụ thể thì có
Có kèm ví dụ ghi chúLoại bỏ hoàn toàn ví dụMô hình đã coi ví dụ như một đầu vào cần phản hồi

Bài học lớn nhất ở đây: các tính từ mơ hồ không phải là chỉ dẫn. Việc bảo mô hình phải “tự nhiên” đã vô tình khuyến khích các dấu gạch ngang dài và các cách diễn đạt hoa mỹ vốn phá vỡ quy chuẩn văn phong. Thay thế điều đó bằng các quy tắc cụ thể, có thể kiểm chứng chính là điều đã giúp văn phong trở nên nhất quán.

Bước 2: Xử lý dữ liệu thiếu thay vì bịa ra nó

Ảo giác thường được coi là một lỗi của mô hình. Nhưng trong công việc có cấu trúc, đó thường là một lỗi của prompt: prompt chưa bao giờ nói cho mô hình biết phải làm gì khi một trường bị thiếu, vì vậy nó đã làm điều có khả năng thống kê cao nhất và tạo ra một giá trị nghe có vẻ hợp lý.

Giải pháp là một quy trình xử lý dữ liệu thiếu. Hãy chia các trường của bạn thành bắt buộc và tùy chọn. Các trường tùy chọn sẽ bị bỏ qua âm thầm khi vắng mặt. Các trường bắt buộc thì ngược lại — nếu một trường bị thiếu, mô hình phải dừng lại và yêu cầu bổ sung theo một định dạng chính xác thay vì tạo ra một ghi chú. Chỉ riêng quy tắc đó đã biến một sự ảo giác âm thầm thành một yêu cầu bổ sung dữ liệu rõ ràng, có thể kiểm toán. Đó là sự khác biệt giữa một con số sai trên một hồ sơ thuộc ngành quy định và một ghi chú chưa bao giờ được tạo ra vì đầu vào không đầy đủ.

Bước 3: Khóa cấu hình tác nhân

Với một prompt đã được tăng cường, bản thân tác nhân cũng phải được khóa chặt để không có gì tái tạo lại sự thiếu nhất quán. Toàn bộ luồng xử lý được thiết kế cố ý tối giản — chỉ ba nút và không gì khác.

Chat Input chảy vào một nút AI Agent chứa prompt hệ thống đã khóa ở temperature 0.2, không có công cụ nào và một cuộc hội thoại mới cho mỗi hồ sơ, sau đó đến Chat Output

Các lựa chọn cấu hình có ý nghĩa quan trọng:

  • Prompt hệ thống nằm trong trường System Message, không bao giờ nằm trong trường Input, để nó được đọc như một chỉ dẫn chứ không phải như dữ liệu.
  • Temperature 0.2. Đủ thấp để đạt độ nhất quán tối đa, đủ cao để tránh văn phong máy móc. Bằng 0 thì quá cứng nhắc; bằng 1 thì quá sáng tạo.
  • Không gắn công cụ nào. Các bộ truy xuất tệp và URL tạo ra sự khó lường và có thể bỏ qua khả năng suy luận của tác nhân. Với tác vụ này, mô hình không cần gì ngoài prompt và hồ sơ đã dán vào.
  • Giới hạn token để mặc định. Việc giới hạn token khiến các ghi chú bị cắt ngắn giữa chừng, và một ghi chú bị cắt ngắn trên hồ sơ khách hàng tự nó đã là một rủi ro về mặt quy định.
  • Một chỉ dẫn khởi động im lặng ở đầu prompt, để tác nhân không xác nhận lại các quy tắc với chuyên viên phân tích khi luồng xử lý được tải lần đầu.

Quy tắc vận hành duy nhất quan trọng nhất

Mọi giải pháp ở trên đều có thể bị phá hỏng bởi một thói quen xấu: tái sử dụng cùng một cuộc trò chuyện. Quy tắc vận hành quan trọng nhất đối với đội ngũ chuyên viên phân tích là phải bắt đầu một cuộc trò chuyện mới cho mỗi hồ sơ. Không bao giờ tiếp tục xem xét các hồ sơ trong cùng một cửa sổ. Đây là quy tắc loại bỏ hiện tượng trôi phiên — nguyên nhân gốc rễ của hầu hết các lỗi ban đầu — và nó không tốn kém gì để tuân theo.

Tính Nhất Quán Là Vấn Đề Về Kiến Trúc, Không Phải Vấn Đề Về Câu Chữ

Nếu đội ngũ của bạn đang phải vật lộn với một prompt hay trôi ngữ cảnh trong một cửa sổ chat, giải pháp là một prompt đã được tăng cường chạy trên một tác nhân phi trạng thái. FlowHunt cho phép bạn khóa prompt, cố định mô hình và temperature, và chạy một lượt gọi sạch cho mỗi hồ sơ. Hãy để chúng tôi giúp bạn đạt được điều đó.

Nó có thực sự hiệu quả không? 9 mô hình, 27 lượt chạy

Một phương pháp chỉ tốt khi có bằng chứng đi kèm. Chúng tôi đã thử nghiệm chín mô hình với prompt đã được tăng cường, sử dụng một hồ sơ thực tế giống hệt nhau (một cảnh báo Cường độ Cờ bạc kèm lịch sử thời lượng phiên trước đó) qua ba lượt chạy cho mỗi mô hình — tổng cộng 27 lượt chạy — và chấm điểm mỗi lượt chạy theo 16 tiêu chí tuân thủ.

Điểm tuân thủ trung bình trên chín mô hình. Sẵn sàng cho sản xuất: GPT-5.6 Luna 10, Claude Fable 5 10, Claude Sonnet 5 9.8, Claude Opus 4.8 9.8, GPT-5.4 Default 9.5. Bị loại: Claude Sonnet 4.6 8.7, Claude Haiku 4.5 8.5, gói rẻ nhất 8.0, DeepSeek V4 Pro 7.8.

Trên toàn bộ 27 lượt chạy, không mô hình nào đã sẵn sàng cho sản xuất tạo ảo giác về một con số, đảo ngược quy ước lãi/lỗ, dùng dấu gạch ngang dài, hoặc cắt ngắn nội dung đầu ra. Prompt đã được tăng cường đã loại bỏ mọi dạng lỗi ban đầu trên các mô hình đạt yêu cầu. Những khác biệt còn lại nằm ở chiều sâu phân tích và tính nhất quán, chứ không phải ở độ chính xác.

Mô hìnhNhà cung cấpĐiểm trung bìnhSẵn sàng sản xuấtGhi chú
GPT-5.6 LunaOpenAI10 / 10Hoàn hảo trên cả ba lượt chạy; độ nhất quán cao nhất
Claude Fable 5Anthropic10 / 10Các đoạn lập luận kết luận hợp lý nhất; ghi chú đơn lẻ tốt nhất
Claude Sonnet 5Anthropic9.8 / 10Không ảo giác ở bất kỳ lượt chạy nào; Claude toàn diện tốt nhất
Claude Opus 4.8Anthropic9.8 / 10Phân tích sâu nhất; chi phí cao cấp
GPT-5.4 DefaultOpenAI9.5 / 10Một lần sai sót về tên gọi; lựa chọn tiết kiệm tốt nhất
Claude Sonnet 4.6Anthropic8.7 / 10KhôngNhầm lẫn ngưỡng kích hoạt cảnh báo với giới hạn tiền gửi ở 2/3 lượt chạy
Claude Haiku 4.5Anthropic8.5 / 10KhôngNhất quán nhưng lập luận kết luận yếu
Gói rẻ nhấtBudget8.0 / 10KhôngChỉ đúng tên biện pháp can thiệp chính xác trong 1/3 lượt chạy
DeepSeek V4 ProDeepSeek7.8 / 10KhôngCắt ngắn nội dung đầu ra ở lượt chạy 1; không nhất quán

Các trường hợp bị loại rất đáng để rút kinh nghiệm. Claude Sonnet 4.6 tạo ra văn phong đẹp nhưng nhầm lẫn ngưỡng kích hoạt cảnh báo với giới hạn tiền gửi — một con số sai về mặt thực tế trên một hồ sơ thuộc ngành quy định, điều này khiến nó bị loại bất kể văn phong hay đến đâu. Sự dao động giữa các lượt chạy của DeepSeek (6, 8.5, 9) mới là vấn đề thực sự: trong công việc thuộc ngành quy định, chất lượng phụ thuộc vào may rủi thì không phải là chất lượng.

Chi phí không phải là yếu tố hạn chế

Thật hấp dẫn khi muốn tối ưu theo giá cả, nhưng các con số lại cho thấy điều ngược lại. Ngay cả mô hình đắt nhất đã sẵn sàng cho sản xuất, Claude Opus 4.8, cũng chỉ tốn khoảng sáu xu cho mỗi ghi chú. Với một đội ngũ xem xét 50 hồ sơ mỗi ngày, con số đó chưa đến 90 đô la mỗi tháng. Chi phí của một lần bị cơ quan quản lý phát hiện sai phạm do một ghi chú không chính xác sẽ vượt xa chi phí hàng năm của bất kỳ mô hình nào trong danh sách. Đối với công việc tuân thủ trong ngành quy định, hãy chọn mô hình đáng tin cậy nhất mà bạn có thể, chứ không phải mô hình rẻ nhất.

Một ghi chú đã được tăng cường trông như thế nào

Ghi chú đơn lẻ tốt nhất trên toàn bộ 27 lượt chạy đến từ Claude Fable 5. Hãy chú ý những gì nó làm: nó nêu vị thế theo đúng quy ước, trích dẫn số liệu nguyên văn, sử dụng đúng tên biện pháp can thiệp, và — quan trọng hơn cả — giải thích tại sao việc leo thang biện pháp sẽ là không tương xứng thay vì chỉ đơn thuần nêu ra một kết luận.

The customer is currently in a winning position of £1,612.50 with an account balance of £8,962.50, which represents an improvement on the winning position of £1,275.00 recorded at the previous review… Session duration was reviewed under Session Duration Level 1 on 19/07 and again on 20/07… Given that those decisions were made within the last few days, insufficient time has elapsed to assess their effectiveness, and repeating or escalating on the same behaviour at this stage would be disproportionate… In this context, No Further Action Required is the proportionate outcome.

Đó là tiêu chuẩn mà công việc trong ngành quy định đòi hỏi: dựa trên bằng chứng, tương xứng, và có chất lượng giống hệt nhau ở hồ sơ đầu tiên trong ngày và hồ sơ thứ năm mươi.

Áp dụng phương pháp này vào quy trình tuân thủ của riêng bạn

Bộ tạo ghi chú RG là một trường hợp cụ thể, nhưng phương pháp này có thể khái quát hóa cho bất kỳ quy trình nào mà một mô hình ngôn ngữ phải tạo ra kết quả đầu ra đáng tin cậy, có thể lặp lại trên dữ liệu thuộc ngành quy định hoặc có rủi ro cao:

  1. Thoát khỏi cửa sổ chat. Chạy mỗi hồ sơ như một lượt gọi phi trạng thái để ngữ cảnh không thể tích lũy và gây trôi.
  2. Tăng cường prompt để tận dụng hiệu ứng vị trí đầu và cuối. Đặt các quy tắc quan trọng nhất lên đầu và lặp lại chúng ở cuối. Thêm các bước tự kiểm tra.
  3. Cung cấp cho mô hình một quy trình xử lý dữ liệu thiếu. Các trường bắt buộc chặn việc tạo nội dung khi vắng mặt; các trường tùy chọn bị bỏ qua âm thầm. Không bao giờ để mô hình đoán mò.
  4. Khóa cấu hình. Temperature thấp nhưng khác không, không có công cụ không cần thiết, không giới hạn nội dung đầu ra, prompt nằm trong tin nhắn hệ thống.
  5. Kiểm thử trước khi tin tưởng. Chạy cùng một hồ sơ nhiều lần trên các mô hình ứng viên khác nhau và chấm điểm theo các tiêu chí rõ ràng. Tính nhất quán qua các lượt chạy chính là chỉ số quan trọng nhất.

Hãy thực hiện năm điều đó và bạn sẽ biến một mô hình hay tạo ảo giác vào buổi chiều thành một mô hình luôn tạo ra kết quả đầu ra sẵn sàng cho kiểm toán mỗi lần. Tính nhất quán mà công việc trong ngành quy định đòi hỏi là điều có thể đạt được — đó là một vấn đề về kiến trúc và kỹ thuật prompt, và cả hai đều có thể giải quyết được.

Câu hỏi thường gặp

Arshia là Kỹ sư Quy trình AI tại FlowHunt. Với nền tảng về khoa học máy tính và niềm đam mê AI, anh chuyên tạo ra các quy trình hiệu quả tích hợp công cụ AI vào các nhiệm vụ hàng ngày, nâng cao năng suất và sự sáng tạo.

Arshia Kahani
Arshia Kahani
Kỹ sư Quy trình AI

Mang Sự Nhất Quán Của FlowHunt Đến Quy Trình Tuân Thủ Của Bạn

Biến một prompt ChatGPT hay trôi ngữ cảnh thành một tác nhân phi trạng thái, được khóa chặt, luôn tạo ra ghi chú sẵn sàng cho kiểm toán mỗi lần. Chúng tôi sẽ giúp bạn tăng cường prompt và chọn đúng mô hình.

Tìm hiểu thêm

Chatbot GPT là gì? Tìm hiểu về ChatbotGPT, Cách Hoạt Động và Vì Sao Nó Đang Thay Đổi Cuộc Trò Chuyện Số
Chatbot GPT là gì? Tìm hiểu về ChatbotGPT, Cách Hoạt Động và Vì Sao Nó Đang Thay Đổi Cuộc Trò Chuyện Số

Chatbot GPT là gì? Tìm hiểu về ChatbotGPT, Cách Hoạt Động và Vì Sao Nó Đang Thay Đổi Cuộc Trò Chuyện Số

Khám phá chatbot GPT là gì, công nghệ chatbotgpt hoạt động ra sao, lợi ích nổi bật, các ứng dụng thực tế và so sánh với chatbot truyền thống—tất cả trong một hư...

10 phút đọc
chatbotgpt GPT chatbot +1
Hướng Dẫn Quản Lý Rủi Ro và Kiểm Soát AI từ KPMG
Hướng Dẫn Quản Lý Rủi Ro và Kiểm Soát AI từ KPMG

Hướng Dẫn Quản Lý Rủi Ro và Kiểm Soát AI từ KPMG

Khám phá Hướng Dẫn Quản Lý Rủi Ro và Kiểm Soát AI của KPMG—một khung thực tiễn giúp các tổ chức quản lý rủi ro AI một cách đạo đức, đảm bảo tuân thủ và xây dựng...

20 phút đọc
AI Risk AI Governance +5
Jailbreaking AI Chatbots: Kỹ Thuật, Ví Dụ và Phòng Thủ
Jailbreaking AI Chatbots: Kỹ Thuật, Ví Dụ và Phòng Thủ

Jailbreaking AI Chatbots: Kỹ Thuật, Ví Dụ và Phòng Thủ

Jailbreaking AI chatbots bỏ qua các rào cản an toàn để khiến mô hình hoạt động ngoài ranh giới dự định. Tìm hiểu các kỹ thuật phổ biến nhất — DAN, nhập vai, tha...

12 phút đọc
AI Security Jailbreaking +3