跳到正文

DeepSeek

DeepSeek(深度求索)的模型发布、开源权重与技术报告——开源大模型价格与性能双卷的风向标。

最新精选

第 1–9 条 · 共 9 条
4月24日周五
  1. Hugging Face Blog88

    DeepSeek-V4 发布:百万 token 上下文面向智能体任务

    DeepSeek 发布 V4,在 Hub 上提供两个 MoE 检查点:DeepSeek-V4-Pro 为 1.6T 总参数、49B 激活,DeepSeek-V4-Flash 为 284B 总参数、13B 激活,均支持 1M token 上下文窗口。

    推荐理由:原文拆解了 V4 混合注意力如何把 1M 上下文的 KV cache 压到约 2%,并给出智能体基准对比,便于判断长任务部署成本。

3月18日周三
3月27日周四
3月12日周三
2月14日周五
  1. Hugging Face Blog62

    Hugging Face 用 Math-Verify 重评 Open LLM Leaderboard 全部 3751 个模型

    Hugging Face 用 Math-Verify 替换旧评测器,重新评估了 Open LLM Leaderboard 上提交过的全部 3751 个模型。旧评测器因答案格式、SymPy 解析和比较环节的问题把正确答案判错,新方案平均让模型多解出 61 道题、整体提升 4.66 分,Algebra 与 Prealgebra 子集分别提升 8.27 和 6.93 分。

    推荐理由:原文给出旧评测器失效的具体案例和重评后的分数变化,可据此判断数学评测口径对榜单排名的影响。

2月11日周二
  1. Hugging Face Blog67

    Open R1 发布 OpenR1-Math-220k 数学推理数据集

    Open R1 项目发布首个大规模数学推理数据集 OpenR1-Math-220k,在 512 张 H100 上用 vLLM 和 SGLang 本地生成 80 万条 R1 推理轨迹,经 Math Verify 与 Llama3.3-70B-Instruct 过滤后保留 22 万个含正确推理轨迹的问题。

    推荐理由:Open R1 项目公开了 220k 数学推理数据集的构建流程与本地生成方案,可了解复现 R1 训练管线的具体做法。

2月2日周日
  1. Hugging Face Blog62

    Open-R1 更新:复现 DeepSeek-R1 评测分数与训练管线进展

    Hugging Face 的 Open-R1 项目在启动一周后,复现了 DeepSeek-R1 蒸馏模型在 MATH-500 上的评测分数,例如 DeepSeek-R1-Distill-Qwen-1.5B 得 81.6、7B 得 91.8、32B 得 95.0。

    推荐理由:Open-R1 一周内复现了 DeepSeek-R1 蒸馏模型的评测分数,并公开了 GRPO 训练与合成数据生成的具体工程取舍。

1月31日周五
1月28日周二
  1. Hugging Face Blog62

    Hugging Face 启动 Open-R1 项目,完整开源复现 DeepSeek-R1

    Hugging Face 发起 Open-R1 项目,计划系统重建 DeepSeek-R1 的数据与训练流程,补上官方未公开的数据集和训练代码。项目分三步:从 DeepSeek-R1 蒸馏高质量推理数据集复现 R1-Distill 模型,复现 R1-Zero 所用的纯强化学习流程并整理数学、推理、代码数据集,以及展示从基座模型经 SFT 到 RL 的多阶段训练。

    推荐理由:Hugging Face 公开复现 DeepSeek-R1 的三步计划,读者可了解开源推理模型训练链路的缺口与补全路径。