transformer结构

为什么原始 Transformer 的 Decoder 有两层注意力,而 GPT、Qwen 等 decoder-only 模型通常只有一类注意力?本文从信息流和矩阵形状出发梳理 Transformer 结构。

2026 年 07 月 23 日 · 5 分钟 · 2087 字 · Ge Zhang