Quartz 4

Home

❯

09 MOCs

❯

Transformers

Transformers

Sep 24, 20261 min read

  • moc
  • transformer
  • nlp

Transformers

Fundamentals

  • Transformer
  • Embedding
  • Tokenization
  • Positional Embeddings

Attention Stack

  • Self-Attention
  • Multi-Head Attention
  • Attention Mask
  • Bidirectional Attention
  • Cross-Attention

Transformer Block

  • How Transformer Block Works
  • Feed-Forward Layer
  • Layer Normalization
  • Classification Head

Architectures

  • Encoder-only vs Decoder-only vs Encoder-Decoder
  • Decoder
  • Encoder-Decoder Architecture
  • Autoregressive Language Model

Production And Inference

  • Transformer Inference Optimization
  • Model Benchmarking
  • Knowledge Distillation
  • Quantization
  • Pruning
  • ONNX
  • ONNX Runtime

Sources

  • NLP Transformers - Chapter 03 - Transformer Anatomy
  • NLP Transformers - Chapter 08 - Making Transformers Efficient in Production
  • Hands-On LLM - Chapter 03 - Looking Inside Large Language Models

Questions

  • When to Prefer Pre-LN Over Post-LN
  • How Do Positional Embeddings Scale Context Length

Graph View

  • Transformers
  • Fundamentals
  • Attention Stack
  • Transformer Block
  • Architectures
  • Production And Inference
  • Sources
  • Questions

Backlinks

  • How Do Positional Embeddings Scale Context Length
  • When to Prefer Pre-LN Over Post-LN
  • Encoder-only vs Decoder-only vs Encoder-Decoder
  • How Transformer Block Works
  • Continual Learning

Created with Quartz v4.5.2 © 2026

  • GitHub
  • Discord Community