最新文章
模型训练的初始化
从二阶矩传播推导 LeCun、Xavier 与 Kaiming 初始化,分析 Transformer 的残差缩放,并用特征变化与谱范数解释 μP 的初始化和学习率如何随模型宽度变化。
2026-09-08
从 Linear Attention 到 Tensor Transformer:如果 Transformer 不再需要显式 Activation?
从 DeepSeek-V4 对 SwiGLU 开销的讨论出发,借助 Bilinear FFN、Linear Attention 与多项式函数族,分析 Transformer 是否需要显式激活函数。
2026-09-03
从 Adam 到在线矩阵 Whitening
从 Adam 的对角二阶矩出发,理解在线矩阵 Whitening、KL-Root-Kron 及其 Kronecker 实现。
2026-09-01
模型架构:1. MoE
模型架构系列第一篇,围绕 MoE 的基本结构、SwiGLU 与细粒度专家设计,梳理共享专家、路由函数、负载均衡和专家并行等关键取舍。
2026-08-30