Transformer architecture evolutions, RoPE long-context scaling, Mixture-of-Experts (MoE) sparse routing, DeepSeek MLA attention, and chain-of-thought reasoning models.
Dense Transformer foundations, KV cache architectures (MHA/GQA/MQA), RoPE position embeddings with YaRN/ALiBi long-context extrapolation, RMSNorm, SwiGLU, and BPE tokenizer designs.
Top-k sparse expert routing, auxiliary-loss-free dynamic load balancing, DeepSeek Multi-Head Latent Attention (MLA) low-rank KV compression, and chain-of-thought reasoning models.