2022 - Chain-of-Thought Prompting Elicits Reasoning in Large Language Models - arXiv 2201.11903v6
Nguồn
- PDF gốc: 2022 - Chain-of-Thought Prompting Elicits Reasoning in Large Language Models - arXiv 2201.11903v6.pdf
- Vai trò trong CS224N: paper nền cho chain-of-thought prompting và reasoning traces trong LLM.
Câu hỏi trung tâm
Prompt yêu cầu model viết các bước trung gian có giúp LLM giải bài reasoning tốt hơn không?
Kiến thức cốt lõi
- Chain-of-thought prompting thêm reasoning examples có lời giải từng bước vào prompt.
- Kỹ thuật này đặc biệt hiệu quả hơn khi model đủ lớn.
- CoT giúp model phân rã bài toán phức tạp thành các bước nhỏ.
- Nó không đảm bảo reasoning trace đúng, nhưng thường cải thiện final answer ở arithmetic/commonsense reasoning.
- Paper mở đường cho reasoning prompting và inference-time reasoning.
Cơ chế / công thức / kiến trúc
question + examples có reasoning steps
-> model bắt chước format suy luận từng bước
-> sinh intermediate reasoning
-> đưa ra final answerKhi áp dụng
- Dùng cho bài toán cần nhiều bước suy luận.
- Không dùng CoT như bằng chứng tuyệt đối rằng model “hiểu”.
- Nên kết hợp verification/self-consistency khi độ đúng quan trọng.
Kết quả / bằng chứng đáng giữ
- Title nêu CoT prompting elicits reasoning in large language models.
- Lecture 12/13 đặt CoT trong cụm reasoning và decoding.
- Self-consistency paper sau đó mở rộng CoT bằng sampling nhiều reasoning paths.
Cách hiểu bằng lời của tôi
CoT là cách dùng prompt để cho model thêm “không gian làm nháp”. Nhưng nháp nghe hợp lý vẫn có thể sai, nên cần kiểm tra kết quả.
Câu hỏi review
- CoT prompting thay đổi prompt như thế nào?
- Vì sao CoT hiệu quả hơn ở model lớn?
- CoT trace có phải bằng chứng reasoning đúng không?