跳到正文
原文
Hugging Face Blog·· 2026-01-20精选AI 评分62

微软发布 Differential Transformer V2:差分注意力无需自定义 kernel

Differential Transformer V2

AI 导读

微软团队发布 Differential Transformer V2,通过为每个 token 和每个 head 投影 λ 并只增加 query head 数量、保持 KV head 不变,使解码速度与标准 Transformer 持平且无需自定义注意力 kernel。

推荐理由

微软团队给出 Differential Transformer V2 的注意力实现与消融对比,读者可了解差分注意力在解码速度与训练稳定性上的取舍。

来源:Hugging Face Blog · huggingface.co