Coding Agent System Design

Luồng hệ thống

user task
-> harness builds context
-> model proposes action or answer
-> harness executes tool in sandbox
-> output returns as observation
-> model decides next step
-> verification produces evidence

Ý chính

Coding agent đáng tin không đến từ model đơn lẻ. Nó cần một hệ thống quanh model: context retrieval để đọc đúng code, tool harness để thao tác an toàn, sandbox để chạy command, compaction để tránh context phình, và eval/verification để biết edit có thật sự chạy.

Ba áp lực production

  • Correct edits: diff phải apply đúng, giữ phần không liên quan, không phá format.
  • Compounded latency: nhiều vòng search/edit/test làm vài giây nhỏ cộng thành phút.
  • Safe execution: test/build cần chạy thật nhưng không được mở quyền terminal vô hạn.

Bài học thiết kế

  • Train/evaluate trên trajectory, không chỉ final answer.
  • Tối ưu cost per successful task, không chỉ token latency từng call.
  • Giữ prompt prefix ổn định và tool discovery gọn để cache không bị phá.
  • Verification là một phần của product loop, không phải bước trang trí cuối.

Liên kết