20 Attention 在算什么:Q/K/V、Softmax 与 O(N²)2026-08-09·7931 字·16 分钟LLM LLM Attention Q/K/V Softmax 自注意力 KV Cache 复杂度 Transformer
19 训练是并行的:Teacher Forcing 与 Causal Mask2026-08-01·7263 字·15 分钟LLM LLM Teacher Forcing Causal Mask 并行训练 自回归 Exposure Bias Transformer
18 归一化的选择:LayerNorm → RMSNorm,Pre-LN vs Post-LN2026-07-27·7936 字·16 分钟LLM LLM 归一化 LayerNorm RMSNorm Pre-Norm 残差流 训练稳定性 Transformer
17 一个 Transformer Block 的「最小骨架」2026-07-19·5024 字·11 分钟LLM LLM Transformer Decoder-Only 残差连接 归一化 Pre-Norm FFN 注意力
16 位置编码进化史:从正弦波到 RoPE 旋转位置编码2026-07-12·5803 字·12 分钟LLM LLM 位置编码 RoPE 旋转位置编码 正弦编码 相对位置 Self-Attention Transformer