LLM-as-Judge
Định nghĩa
LLM-as-judge là cách dùng một model để chấm output của model/hệ thống khác theo rubric định nghĩa trước.
Cách hiểu bằng lời của tôi
LLM-as-judge không biến đánh giá thành chân lý tuyệt đối. Nó là một công cụ scale review: chấm nhiều case nhanh hơn người, nhưng phải được calibrate bằng human labels và failure analysis.
Khi hữu ích
- Output có nhiều cách đúng, khó exact match.
- Cần chấm factuality, completeness, citation hoặc tone.
- Cần regression check nhanh giữa prompt/model versions.
Rủi ro
- Judge có bias riêng.
- Rubric mơ hồ làm score nhiễu.
- Có thể chấm hay về văn phong nhưng bỏ qua evidence thật.
- Không thay thế human review ở case high-stakes hoặc metric chưa ổn định.