论文里程碑 #14:Sequence to Sequence Learning with Neural Networks2026-08-09·5612 字·12 分钟LLM LLM 论文里程碑 Seq2Seq LSTM 机器翻译 Encoder-Decoder Sutskever
20 Attention 在算什么:Q/K/V、Softmax 与 O(N²)2026-08-09·7931 字·16 分钟LLM LLM Attention Q/K/V Softmax 自注意力 KV Cache 复杂度 Transformer
论文里程碑 #13:Dropout: A Simple Way to Prevent Neural Networks from Overfitting2026-08-01·8090 字·17 分钟LLM LLM 论文里程碑 Dropout 正则化 过拟合 集成学习 Hinton Srivastava
19 训练是并行的:Teacher Forcing 与 Causal Mask2026-08-01·7263 字·15 分钟LLM LLM Teacher Forcing Causal Mask 并行训练 自回归 Exposure Bias Transformer
论文里程碑 #12:Recursive Deep Models for Semantic Compositionality Over a Sentiment Treebank2026-07-27·6690 字·14 分钟LLM LLM 论文里程碑 SST RNTN 情感分析 组合性 句法树 Socher
18 归一化的选择:LayerNorm → RMSNorm,Pre-LN vs Post-LN2026-07-27·7936 字·16 分钟LLM LLM 归一化 LayerNorm RMSNorm Pre-Norm 残差流 训练稳定性 Transformer
论文里程碑 #11:Distributed Representations of Words and Phrases and Their Compositionality2026-07-19·4950 字·10 分钟LLM LLM 论文里程碑 Word2Vec 负采样 子采样 词向量 Skip-Gram Mikolov
17 一个 Transformer Block 的「最小骨架」2026-07-19·5024 字·11 分钟LLM LLM Transformer Decoder-Only 残差连接 归一化 Pre-Norm FFN 注意力
论文里程碑 #10:Efficient Estimation of Word Representations in Vector Space2026-07-12·4873 字·10 分钟LLM LLM 论文里程碑 Word2Vec 词向量 Skip-Gram CBOW 词类比 Mikolov
16 位置编码进化史:从正弦波到 RoPE 旋转位置编码2026-07-12·5803 字·12 分钟LLM LLM 位置编码 RoPE 旋转位置编码 正弦编码 相对位置 Self-Attention Transformer
论文里程碑 #9:Learning Phrase Representations using RNN Encoder-Decoder for Statistical Machine Translation2026-07-03·4773 字·10 分钟LLM LLM 论文里程碑 GRU Encoder-Decoder Seq2Seq 机器翻译 RNN Cho
15 Weight Tying:输入输出的镜像关系2026-07-03·4482 字·9 分钟LLM LLM Weight Tying 权重绑定 Embedding Logits Softmax 参数量 输出层