LLM-as-Judge

Định nghĩa

LLM-as-judge là cách dùng một model để chấm output của model/hệ thống khác theo rubric định nghĩa trước.

Cách hiểu bằng lời của tôi

LLM-as-judge không biến đánh giá thành chân lý tuyệt đối. Nó là một công cụ scale review: chấm nhiều case nhanh hơn người, nhưng phải được calibrate bằng human labels và failure analysis.

Khi hữu ích

  • Output có nhiều cách đúng, khó exact match.
  • Cần chấm factuality, completeness, citation hoặc tone.
  • Cần regression check nhanh giữa prompt/model versions.

Rủi ro

  • Judge có bias riêng.
  • Rubric mơ hồ làm score nhiễu.
  • Có thể chấm hay về văn phong nhưng bỏ qua evidence thật.
  • Không thay thế human review ở case high-stakes hoặc metric chưa ổn định.

Liên kết