How to Evaluate LLM Systems
Tôi đang thắc mắc gì?
- Làm thế nào để đánh giá hệ thống LLM thay vì chỉ đánh giá một model đơn lẻ?
Vì sao câu hỏi này quan trọng?
- Một ứng dụng LLM thường gồm nhiều phần: retrieval, prompt, model, post-processing, evaluation và UX.
- Nếu chỉ đo model output chung chung, dễ bỏ sót lỗi retrieval, grounding hoặc latency/cost.
Giải thích hiện tại
Cần kiểm tra thêm
- Với RAG, cần đo retrieval, grounding và answer quality riêng như thế nào?
- Với generative tasks, cần kết hợp human eval, automatic eval và regression tests ra sao?
- Khi nào cần đánh giá theo cost/latency/safety thay vì chỉ accuracy?
Source evidence