transformer结构为什么原始 Transformer 的 Decoder 有两层注意力,而 GPT、Qwen 等 decoder-only 模型通常只有一类注意力?本文从信息流和矩阵形状出发梳理 Transformer 结构。