跳转到内容

输入关键词开始搜索

    LLM架构演进:Transformer已死?

    综合分析更新 2026-05-17置信度 medium#综述#架构#注意力#长青#进阶

    基于 2019-2026 年 67 个核心开源模型的架构演进回顾,论证 Transformer Decoder-Only 架构五大组件的创新空间已基本枯竭。这里的“死”并非技术消失,而是创新的低垂果实被摘完,进入边际效益递减的微调阶段。

    1. 位置编码收束于 RoPE:从固定 PE → RoPE → YaRN → NoPE,RoPE 已成为事实标准,后续创新都是边界微调
    2. 归一化的排列组合已穷尽:从 LayerNorm 到 RMSNorm,从 Pre-Norm 到 Post-Norm 到 QK/KV-Norm,所有组合都被尝试
    3. 残差连接的变体空间有限:RC → HC → mHC → AttnResidual 的演进路径短且窄
    4. FFN 层被 MoE 完全吸收:Dense → Sparse 的范式转换已完成,FFN 创新本质上都在走向 MoE
    5. 注意力层百花齐放但无定论:Dense / Sparse / Linear / Hybrid 四条路线并进,但每条的创新空间也在收窄

    LLM架构演进 五大组件图
    LLM架构演进 五大组件图
    组件 创新阶段 剩余空间 收束方向 代表论文数
    位置编码 成熟 极低 RoPE + 变体 ~6
    归一化 成熟 极低 RMSNorm + Pre-Norm ~5
    残差连接 早期探索 无定论 ~4
    FFN → MoE 收敛中 低-中 MoE 化 + 细粒度专家 ~8
    注意力层 活跃 无定论(4路线并进) ~15

    开源与闭源模型性能差距持续缩小(如 Llama 3 405B 对标 GPT-4,DeepSeek-V3 对标 Claude 3.5),说明:

    • 架构层面的“秘密武器”越来越少
    • 性能差异更多来自数据工程和训练规模,而非架构创新
    • S 型曲线顶部:同样投入带来的边际收益递减
    1. 注意力层的终局是什么? Dense/Sparse/Linear/Hybrid 四条路线最终谁会胜出,还是永远共存?
    2. Transformer 之外的路能走多远? Mamba/SSM 等非 Transformer 架构能否在某个拐点超越?
    3. 架构创新的“质变”还会来吗? Bitter Lesson 暗示下一个突破可能来自规模而非设计,但 Scaling Law 也在放缓
    4. 世界模型到底指什么? 定义模糊,但被寄予厚望成为下一个突破口
    1. 不要高估单个架构创新的贡献 — 在 S 型曲线顶部,每个新技巧的增量收益越来越小
    2. 不要低估量变积累的价值 — 多个 1-2% 的改进叠加仍能产生可观提升
    3. 关注数据工程和训练方法 — 架构之外,数据质量、训练配方、后训练方法的提升空间可能更大
    4. 多模态和世界模型值得关注 — 这些可能打开新的能力维度,而非仅在语言能力上内卷