Human-in-the-Loop Labeling
Định nghĩa
Human-in-the-Loop Labeling kết hợp model/automation với reviewer người thật để tạo hoặc kiểm tra label, thường để model xử lý case dễ và con người xử lý case mơ hồ.
Cách hiểu bằng lời của tôi
Không phải humans vs AI. Spotify dùng LLM để pre-label case rõ, còn domain expert và quality analyst tập trung vào judgement, ambiguity và policy nuance. Điểm quan trọng là có escalation path và metrics để biết khi nào automation đang lệch.
Trong chatbot
Trong dialog system, human-in-the-loop không chỉ là gán nhãn dữ liệu. Con người có thể đưa feedback khi bot hiểu sai câu hỏi, chọn sai action, hoặc gặp tình huống ngoài phạm vi. Feedback đó có thể trở thành reward/penalty hoặc negative example để cải thiện model.
Với dialog generation, human-in-the-loop thực tế hơn hệ tự động hoàn toàn vì response sinh tự động có thể nghe tự nhiên nhưng sai fact hoặc không giúp user hoàn thành mục tiêu. Hệ hybrid dùng model để xử lý nhiều lượt hội thoại, nhưng giữ đường feedback từ người thật cho case mơ hồ, lỗi hoặc rủi ro cao.