How to Evaluate LLM Systems

Tôi đang thắc mắc gì?

  • Làm thế nào để đánh giá hệ thống LLM thay vì chỉ đánh giá một model đơn lẻ?

Vì sao câu hỏi này quan trọng?

  • Một ứng dụng LLM thường gồm nhiều phần: retrieval, prompt, model, post-processing, evaluation và UX.
  • Nếu chỉ đo model output chung chung, dễ bỏ sót lỗi retrieval, grounding hoặc latency/cost.

Giải thích hiện tại

Cần kiểm tra thêm

  • Với RAG, cần đo retrieval, grounding và answer quality riêng như thế nào?
  • Với generative tasks, cần kết hợp human eval, automatic eval và regression tests ra sao?
  • Khi nào cần đánh giá theo cost/latency/safety thay vì chỉ accuracy?

Source evidence