2022 - Chain-of-Thought Prompting Elicits Reasoning in Large Language Models - arXiv 2201.11903v6

Nguồn

Câu hỏi trung tâm

Prompt yêu cầu model viết các bước trung gian có giúp LLM giải bài reasoning tốt hơn không?

Kiến thức cốt lõi

  • Chain-of-thought prompting thêm reasoning examples có lời giải từng bước vào prompt.
  • Kỹ thuật này đặc biệt hiệu quả hơn khi model đủ lớn.
  • CoT giúp model phân rã bài toán phức tạp thành các bước nhỏ.
  • Nó không đảm bảo reasoning trace đúng, nhưng thường cải thiện final answer ở arithmetic/commonsense reasoning.
  • Paper mở đường cho reasoning prompting và inference-time reasoning.

Cơ chế / công thức / kiến trúc

question + examples có reasoning steps
-> model bắt chước format suy luận từng bước
-> sinh intermediate reasoning
-> đưa ra final answer

Khi áp dụng

  • Dùng cho bài toán cần nhiều bước suy luận.
  • Không dùng CoT như bằng chứng tuyệt đối rằng model “hiểu”.
  • Nên kết hợp verification/self-consistency khi độ đúng quan trọng.

Kết quả / bằng chứng đáng giữ

  • Title nêu CoT prompting elicits reasoning in large language models.
  • Lecture 12/13 đặt CoT trong cụm reasoning và decoding.
  • Self-consistency paper sau đó mở rộng CoT bằng sampling nhiều reasoning paths.

Cách hiểu bằng lời của tôi

CoT là cách dùng prompt để cho model thêm “không gian làm nháp”. Nhưng nháp nghe hợp lý vẫn có thể sai, nên cần kiểm tra kết quả.

Câu hỏi review

  1. CoT prompting thay đổi prompt như thế nào?
  2. Vì sao CoT hiệu quả hơn ở model lớn?
  3. CoT trace có phải bằng chứng reasoning đúng không?

Liên kết