AI phân loại sai yêu cầu khách hàng: workflow nên xử lý confidence score thế nào?
Cách thiết kế workflow dùng confidence score theo intent và mức rủi ro, có vùng hỏi lại, review, fail-closed, calibration và monitoring để hạn chế AI phân loại sai yêu cầu khách hàng.

Khi AI phân loại yêu cầu khách hàng, không nên dùng một ngưỡng confidence duy nhất để quyết định cho mọi intent. Workflow production cần hiệu chỉnh score trên dữ liệu thật, đặt threshold riêng theo intent và mức rủi ro, rồi kết hợp score với độ chênh giữa hai nhãn đứng đầu, tín hiệu ngoài phạm vi, dữ liệu bắt buộc và business rules. Kết quả nên đi vào một trong bốn nhánh: tự động xử lý, hỏi lại khách hàng, chuyển review hoặc dừng an toàn. Confidence chỉ là tín hiệu routing; nó không phải bằng chứng yêu cầu đã được hiểu đúng.
Vấn đề
Vì sao confidence cao vẫn có thể phân loại sai?
Score phản ánh hành vi của mô hình trong một cấu hình cụ thể, không tự chứng minh dự đoán đúng ngoài thực tế.
Một khách hàng viết: “Tôi muốn ngừng gia hạn gói tháng sau nhưng vẫn cần dùng đến cuối kỳ.” Mô hình có thể gán nhãn cancel_immediately với score cao vì thấy cụm “ngừng” và “gói”, trong khi ý định thật là disable_auto_renew. Nếu workflow gọi API hủy dịch vụ ngay, lỗi phân loại trở thành tác động nghiệp vụ.
Có ba lý do score cao vẫn sai. Thứ nhất, dữ liệu huấn luyện có thể thiếu cách diễn đạt của người Việt, câu không dấu, từ viết tắt hoặc yêu cầu chứa nhiều ý. Thứ hai, các intent có ranh giới gần nhau như khiếu nại, yêu cầu hoàn tiền và tra soát giao dịch dễ bị chồng lấn. Thứ ba, mô hình có thể cho điểm quá tự tin khi gặp dữ liệu ngoài phân phối đã dùng để đánh giá. Vì vậy, đừng diễn giải thành “92% chắc chắn đúng” nếu chưa kiểm tra calibration.




