跳到正文

#DeepSeek

今日 0 条
9月16日周三
4月24日周五
  1. Hugging Face Blog88

    DeepSeek-V4 发布:百万 token 上下文面向智能体任务

    DeepSeek 发布 V4,在 Hub 上提供两个 MoE 检查点:DeepSeek-V4-Pro 为 1.6T 总参数、49B 激活,DeepSeek-V4-Flash 为 284B 总参数、13B 激活,均支持 1M token 上下文窗口。

    推荐理由:原文拆解了 V4 混合注意力如何把 1M 上下文的 KV cache 压到约 2%,并给出智能体基准对比,便于判断长任务部署成本。

3月18日周三
2月3日周二
1月27日周二
  1. Hugging Face Blog28

    中国开源 AI 生态的架构选择:超越 DeepSeek 之后

    中国开源模型已几乎一致转向 MoE 架构,Kimi K2、MiniMax M2、Qwen3 均采用该路线,以在成本约束下兼顾能力与灵活部署。0.5B–30B 小模型成为本地运行与微调主力,Apache 2.0 接近默认许可证。DeepSeek-V3.2-Exp 获华为昇腾与寒武纪 day-zero 支持,蚂蚁 Ling 用国产芯片训练 1 万亿 token 成本降约 20%。

1月20日周二
10月29日周三
  1. Hugging Face Blog65

    Hugging Face 博客:全球算力格局正在如何变化

    Hugging Face 发布博客《On the Shifting Global Compute Landscape》,梳理中国开源权重模型与国产芯片互相牵引的现状:过去几个月,华为昇腾、寒武纪等芯片已开始承载部分高性能开源模型的推理,部分模型开始用国产芯片训练。

    推荐理由:梳理中国开源模型与国产芯片互相牵引的路径,帮助读者理解算力受限如何影响模型架构与部署选择。

7月17日周四
  1. Hugging Face Blog34

    Hugging Face 发布 FutureBench:评估 AI 智能体预测未来事件的能力

    Hugging Face 推出 FutureBench,用真实预测市场和新闻生成的问题评估 AI 智能体预测未来事件的能力。该基准通过 smolagents 智能体抓取新闻并用 DeepSeek-V3 生成预测问题,每周从 Polymarket 引入约 8 个问题,另每轮抓取生成 5 个问题、时间跨度为一周。FutureBench 认为预测类任务无法被数据污染,且结果可随时间客观验证。

3月27日周四
3月12日周三
2月14日周五
  1. Hugging Face Blog62

    Hugging Face 用 Math-Verify 重评 Open LLM Leaderboard 全部 3751 个模型

    Hugging Face 用 Math-Verify 替换旧评测器,重新评估了 Open LLM Leaderboard 上提交过的全部 3751 个模型。旧评测器因答案格式、SymPy 解析和比较环节的问题把正确答案判错,新方案平均让模型多解出 61 道题、整体提升 4.66 分,Algebra 与 Prealgebra 子集分别提升 8.27 和 6.93 分。

    推荐理由:原文给出旧评测器失效的具体案例和重评后的分数变化,可据此判断数学评测口径对榜单排名的影响。

2月11日周二
  1. Hugging Face Blog67

    Open R1 发布 OpenR1-Math-220k 数学推理数据集

    Open R1 项目发布首个大规模数学推理数据集 OpenR1-Math-220k,在 512 张 H100 上用 vLLM 和 SGLang 本地生成 80 万条 R1 推理轨迹,经 Math Verify 与 Llama3.3-70B-Instruct 过滤后保留 22 万个含正确推理轨迹的问题。

    推荐理由:Open R1 项目公开了 220k 数学推理数据集的构建流程与本地生成方案,可了解复现 R1 训练管线的具体做法。

2月2日周日
  1. Hugging Face Blog62

    Open-R1 更新:复现 DeepSeek-R1 评测分数与训练管线进展

    Hugging Face 的 Open-R1 项目在启动一周后,复现了 DeepSeek-R1 蒸馏模型在 MATH-500 上的评测分数,例如 DeepSeek-R1-Distill-Qwen-1.5B 得 81.6、7B 得 91.8、32B 得 95.0。

    推荐理由:Open-R1 一周内复现了 DeepSeek-R1 蒸馏模型的评测分数,并公开了 GRPO 训练与合成数据生成的具体工程取舍。

1月31日周五
1月30日周四
1月28日周二
  1. Hugging Face Blog62

    Hugging Face 启动 Open-R1 项目,完整开源复现 DeepSeek-R1

    Hugging Face 发起 Open-R1 项目,计划系统重建 DeepSeek-R1 的数据与训练流程,补上官方未公开的数据集和训练代码。项目分三步:从 DeepSeek-R1 蒸馏高质量推理数据集复现 R1-Distill 模型,复现 R1-Zero 所用的纯强化学习流程并整理数学、推理、代码数据集,以及展示从基座模型经 SFT 到 RL 的多阶段训练。

    推荐理由:Hugging Face 公开复现 DeepSeek-R1 的三步计划,读者可了解开源推理模型训练链路的缺口与补全路径。

7月11日周四
  1. Hugging Face Blog62

    NuminaMath 如何赢得首届 AIMO 进步奖

    Numina 与 Hugging Face 合作的 NuminaMath 7B TIR 赢得首届 AIMO 进步奖,在私有测试集 50 题中解出 29 题。方案基于 DeepSeekMath-Base 7B 做两阶段全量微调,先学自然语言链式推理,再学工具集成推理,配合 SC-TIR 解码生成 N=48、深度 M=4 的候选并多数投票。

    推荐理由:获胜方案完整公开了两阶段微调、SC-TIR 解码与内部验证集设计,可迁移到其他推理任务。