Hugging Face Blog·· 2026-01-20精选AI 评分62
微软发布 Differential Transformer V2:差分注意力无需自定义 kernel
Differential Transformer V2
AI 导读
微软团队发布 Differential Transformer V2,通过为每个 token 和每个 head 投影 λ 并只增加 query head 数量、保持 KV head 不变,使解码速度与标准 Transformer 持平且无需自定义注意力 kernel。
推荐理由
微软团队给出 Differential Transformer V2 的注意力实现与消融对比,读者可了解差分注意力在解码速度与训练稳定性上的取舍。
来源:Hugging Face Blog · huggingface.co