Hugging Face Blog·· 2024-08-14AI 评分34
Hugging Face 复现 Infini-Attention 失败:压缩次数越多性能越差
A failed experiment: Infini-Attention, and why we should keep trying?
AI 导读
Hugging Face 复现 Google 的 Infini-attention 实验发现,随着记忆压缩次数增加,模型性能反而持续下降。团队尝试将 Llama 3 8B 的 8k 上下文扩展至 100 万 token,但结论是 ring attention、YaRN 和 rope scaling 仍是扩展预训练模型上下文长度的最佳方案。训练好的 checkpoint 已公开,代码按原样提供。
来源:Hugging Face Blog · huggingface.co