CS224N 2019 - Notes - Computing Neural Network Gradients
Nguồn
- PDF gốc: CS224N 2019 - Notes - Computing Neural Network Gradients.pdf
- Vai trò trong CS224N: note phụ trợ về tính gradient neural network có kiểm soát shape.
Câu hỏi trung tâm
Làm sao tính gradient cho neural network bằng vector/matrix calculus mà không lẫn dimensions?
Kiến thức cốt lõi
- Jacobian biểu diễn đạo hàm vector-to-vector.
- Chain rule trong vector case tương ứng nhân Jacobian đúng thứ tự.
- Error terms giúp viết backprop gọn theo layer.
- Dimension matching là công cụ debug gradient quan trọng.
- Note giúp nối toán Lecture 03 với code assignment.
Cơ chế / công thức / kiến trúc
layer output z = Wx + b
loss L
upstream gradient dL/dz
-> dL/dW, dL/db, dL/dx
-> truyền tiếp về layer trướcKhi áp dụng
- Dùng khi tự derive gradient cho affine layer, activation và loss.
- Nếu tích ma trận gradient không khớp shape, công thức sai.
- Nên viết dimensions bên cạnh từng tensor.
Kết quả / bằng chứng đáng giữ
- Source text trình bày Jacobian identities và gradient dimensions.
- Note kết thúc với kiểm tra dimensions của các gradient terms.
- Đây là tài liệu học sâu hơn cho Lecture 03.
Cách hiểu bằng lời của tôi
Tính gradient không chỉ là nhớ công thức; đó là giữ một bản đồ shape nhất quán từ loss quay ngược về từng tensor.
Câu hỏi review
- Jacobian của theo là gì?
- Vì sao thứ tự nhân Jacobian quan trọng?
- Error term trong backprop giúp gì?