
LLM
全图 · LLM 主线 26 / 129 篇已发
大语言模型的系统性梳理,13 章 129 篇,按章节顺序展开
一、语言建模:概率、Loss 与采样
7 / 7
二、表示与分词:Token、Embedding、位置
9 / 9
三、Transformer 架构:训练视角 vs 推理视角
10 / 10
- 17 一个 Transformer Block 的「最小骨架」
- 18 归一化的选择:LayerNorm → RMSNorm,Pre-LN vs Post-LN
- 19 训练是并行的:Teacher Forcing 与 Causal Mask
- 20 Attention 在算什么:Q/K/V、Softmax 与 O(N²)
- 21 多头注意力的现代变体:MHA → MQA/GQA → MLA
- 22 推理是串行的:Prefill 与 Decode 的两阶段
- 23 FFN/MLP 子层:容量来源与「事实记忆」的直觉
- 24 MoE(Mixture of Experts):稀疏激活与路由策略
- 25 KV Cache:增量复用的本质
- 26 训练 vs 推理的成本结构:计算密集 vs 访存密集
四、数据工程:清洗、去重、配比与合成
0 / 12
五、训练动力学:从「能收敛」到「能泛化」
0 / 11
六、规模化与能力:Scaling、上下文长度与 ICL
0 / 11
七、指令与对齐:Base vs Chat、模板与偏好
0 / 12
七A、微调与适配(PEFT 路线)
0 / 5
七B、Prompt 与上下文工程
0 / 5
八、检索与增强:RAG、工具调用与 Agent
0 / 15
九、推理系统工程:吞吐 / 延迟、量化与显存算术
0 / 13
十、评测与观测:指标、陷阱与线上真实表现
0 / 14
十A、安全与攻防(LLM Security)
0 / 5
2026

