从注意力到长程记忆:把 Transformer 从机制讲到它做不到什么 阿信 · 北京四点半软件工作室 2026年9月28日 #Transformer #LLM #深度学习 #架构 本文目录先回到 2017 年之前Self-Attention:每个 token 直接看其他所有 tokenMulti-head:一个注意力不够,就来 N 个Positional Encoding:模型不知道词序一个完整的 Transformer Block为什么它能 Scaling回到 agent 问题:注意力的结构性短板注意力是”平面”的,没有程序计数器