跳到正文

#DeepSeek

今日 1 条
今天10月2日周五
  1. The Decoder72

    DeepSeek 联合华为发布昇腾芯片开源编程工具

    DeepSeek 与华为合作,为华为昇腾芯片打造开源编程工具,核心是 TileLang 语言,DeepSeek 称其编程模型比 CUDA 更简单。发布内容还包括计算库和芯片间数据传输库,双方还优化了由 128 颗昇腾 950 芯片组成的超级节点。TileLang 最初由北京大学研究人员开发,DeepSeek 已使用约一年,目前是其 AGI 工作的主要工具。

9月30日周三
9月25日周五
9月22日周二
9月17日周四
9月16日周三
7月20日周一
4月24日周五
  1. Hugging Face Blog88

    DeepSeek-V4 发布:百万 token 上下文面向智能体任务

    DeepSeek 发布 V4,在 Hub 上提供两个 MoE 检查点:DeepSeek-V4-Pro 为 1.6T 总参数、49B 激活,DeepSeek-V4-Flash 为 284B 总参数、13B 激活,均支持 1M token 上下文窗口。

    推荐理由:原文拆解了 V4 混合注意力如何把 1M 上下文的 KV cache 压到约 2%,并给出智能体基准对比,便于判断长任务部署成本。

3月18日周三
2月3日周二
1月27日周二
  1. Hugging Face Blog28

    中国开源 AI 生态的架构选择:超越 DeepSeek 之后

    中国开源模型已几乎一致转向 MoE 架构,Kimi K2、MiniMax M2、Qwen3 均采用该路线,以在成本约束下兼顾能力与灵活部署。0.5B–30B 小模型成为本地运行与微调主力,Apache 2.0 接近默认许可证。DeepSeek-V3.2-Exp 获华为昇腾与寒武纪 day-zero 支持,蚂蚁 Ling 用国产芯片训练 1 万亿 token 成本降约 20%。

1月20日周二
10月29日周三
  1. Hugging Face Blog65

    Hugging Face 博客:全球算力格局正在如何变化

    Hugging Face 发布博客《On the Shifting Global Compute Landscape》,梳理中国开源权重模型与国产芯片互相牵引的现状:过去几个月,华为昇腾、寒武纪等芯片已开始承载部分高性能开源模型的推理,部分模型开始用国产芯片训练。

    推荐理由:梳理中国开源模型与国产芯片互相牵引的路径,帮助读者理解算力受限如何影响模型架构与部署选择。

7月17日周四
  1. Hugging Face Blog34

    Hugging Face 发布 FutureBench:评估 AI 智能体预测未来事件的能力

    Hugging Face 推出 FutureBench,用真实预测市场和新闻生成的问题评估 AI 智能体预测未来事件的能力。该基准通过 smolagents 智能体抓取新闻并用 DeepSeek-V3 生成预测问题,每周从 Polymarket 引入约 8 个问题,另每轮抓取生成 5 个问题、时间跨度为一周。FutureBench 认为预测类任务无法被数据污染,且结果可随时间客观验证。

3月27日周四
3月12日周三
2月14日周五
  1. Hugging Face Blog62

    Hugging Face 用 Math-Verify 重评 Open LLM Leaderboard 全部 3751 个模型

    Hugging Face 用 Math-Verify 替换旧评测器,重新评估了 Open LLM Leaderboard 上提交过的全部 3751 个模型。旧评测器因答案格式、SymPy 解析和比较环节的问题把正确答案判错,新方案平均让模型多解出 61 道题、整体提升 4.66 分,Algebra 与 Prealgebra 子集分别提升 8.27 和 6.93 分。

    推荐理由:原文给出旧评测器失效的具体案例和重评后的分数变化,可据此判断数学评测口径对榜单排名的影响。

2月11日周二
  1. Hugging Face Blog67

    Open R1 发布 OpenR1-Math-220k 数学推理数据集

    Open R1 项目发布首个大规模数学推理数据集 OpenR1-Math-220k,在 512 张 H100 上用 vLLM 和 SGLang 本地生成 80 万条 R1 推理轨迹,经 Math Verify 与 Llama3.3-70B-Instruct 过滤后保留 22 万个含正确推理轨迹的问题。

    推荐理由:Open R1 项目公开了 220k 数学推理数据集的构建流程与本地生成方案,可了解复现 R1 训练管线的具体做法。

2月2日周日
  1. Hugging Face Blog62

    Open-R1 更新:复现 DeepSeek-R1 评测分数与训练管线进展

    Hugging Face 的 Open-R1 项目在启动一周后,复现了 DeepSeek-R1 蒸馏模型在 MATH-500 上的评测分数,例如 DeepSeek-R1-Distill-Qwen-1.5B 得 81.6、7B 得 91.8、32B 得 95.0。

    推荐理由:Open-R1 一周内复现了 DeepSeek-R1 蒸馏模型的评测分数,并公开了 GRPO 训练与合成数据生成的具体工程取舍。

1月31日周五
1月30日周四
1月28日周二
  1. Hugging Face Blog62

    Hugging Face 启动 Open-R1 项目,完整开源复现 DeepSeek-R1

    Hugging Face 发起 Open-R1 项目,计划系统重建 DeepSeek-R1 的数据与训练流程,补上官方未公开的数据集和训练代码。项目分三步:从 DeepSeek-R1 蒸馏高质量推理数据集复现 R1-Distill 模型,复现 R1-Zero 所用的纯强化学习流程并整理数学、推理、代码数据集,以及展示从基座模型经 SFT 到 RL 的多阶段训练。

    推荐理由:Hugging Face 公开复现 DeepSeek-R1 的三步计划,读者可了解开源推理模型训练链路的缺口与补全路径。

7月11日周四
  1. Hugging Face Blog62

    NuminaMath 如何赢得首届 AIMO 进步奖

    Numina 与 Hugging Face 合作的 NuminaMath 7B TIR 赢得首届 AIMO 进步奖,在私有测试集 50 题中解出 29 题。方案基于 DeepSeekMath-Base 7B 做两阶段全量微调,先学自然语言链式推理,再学工具集成推理,配合 SC-TIR 解码生成 N=48、深度 M=4 的候选并多数投票。

    推荐理由:获胜方案完整公开了两阶段微调、SC-TIR 解码与内部验证集设计,可迁移到其他推理任务。