Transformers
Fundamentals
Attention Stack
Transformer Block
Architectures
- Encoder-only vs Decoder-only vs Encoder-Decoder
- Decoder
- Encoder-Decoder Architecture
- Autoregressive Language Model
Production And Inference
- Transformer Inference Optimization
- Model Benchmarking
- Knowledge Distillation
- Quantization
- Pruning
- ONNX
- ONNX Runtime
Sources
- NLP Transformers - Chapter 03 - Transformer Anatomy
- NLP Transformers - Chapter 08 - Making Transformers Efficient in Production
- Hands-On LLM - Chapter 03 - Looking Inside Large Language Models