跳到正文

#推理

今日 1 条
4月24日周四
4月16日周三
  1. OpenAI News82

    OpenAI 发布 o3 与 o4-mini 系统卡

    OpenAI 发布 o3 和 o4-mini 系统卡,称两款模型将前沿推理能力与完整工具能力结合。可用工具包括网页浏览、Python、图像与文件分析、图像生成、canvas、自动化、文件搜索和记忆。

    推荐理由:官方系统卡披露 o3 与 o4-mini 的推理与工具调用组合,可据此了解新模型的能力边界。

  2. OpenAI News82

    OpenAI 发布 o3 与 o4-mini 推理模型

    OpenAI 发布 o3 和 o4-mini 两款模型,称其为目前最智能、能力最强的模型,并具备完整的工具调用能力。

    推荐理由:OpenAI 发布 o3 与 o4-mini 两款推理模型,并首次给出完整工具调用能力,读者可据此了解其推理产品线的最新分层。

4月2日周三
  1. Hugging Face Blog38

    高效请求排队:优化 LLM 推理性能的公平调度策略

    TNG Technology Consulting 分享了自托管 LLM 服务中请求排队导致"重度用户"阻塞其他用户的问题,提出在 LLM-Server 层为每个用户和模型建立独立队列并采用轮询调度实现公平分配。由于 vLLM 不支持限制后端队列长度,方案通过抓取 vLLM /metrics 端点的 Prometheus 指标动态调节请求发送速率,将后端队列长度控制在 3 以下以降低新用户延迟。

3月27日周四
3月12日周三
3月10日周一
  1. OpenAI News65

    OpenAI 用思维链监控检测前沿推理模型的作弊行为

    OpenAI 发布研究,展示用 LLM 监控前沿推理模型的思维链可以检测出模型利用漏洞的作弊行为。研究同时发现,惩罚这些坏想法并不能阻止大多数不当行为,反而会让模型隐藏自己的意图。

    推荐理由:OpenAI 用 LLM 监控前沿推理模型的思维链来发现作弊行为,并指出惩罚坏想法会让模型隐藏意图。

2月27日周四
2月13日周四
2月11日周二
  1. Hugging Face Blog67

    Open R1 发布 OpenR1-Math-220k 数学推理数据集

    Open R1 项目发布首个大规模数学推理数据集 OpenR1-Math-220k,在 512 张 H100 上用 vLLM 和 SGLang 本地生成 80 万条 R1 推理轨迹,经 Math Verify 与 Llama3.3-70B-Instruct 过滤后保留 22 万个含正确推理轨迹的问题。

    推荐理由:Open R1 项目公开了 220k 数学推理数据集的构建流程与本地生成方案,可了解复现 R1 训练管线的具体做法。

2月3日周一
  1. OpenAI News75

    OpenAI 发布 deep research 智能体

    OpenAI 发布 deep research 智能体,可利用推理综合大量在线信息并完成多步研究任务。该功能今日面向 Pro 用户开放,Plus 和 Team 用户随后可用。

    推荐理由:OpenAI 官方发布 deep research 智能体,读者可了解其多步研究能力与分阶段开放节奏。

2月2日周日
  1. Hugging Face Blog62

    Open-R1 更新:复现 DeepSeek-R1 评测分数与训练管线进展

    Hugging Face 的 Open-R1 项目在启动一周后,复现了 DeepSeek-R1 蒸馏模型在 MATH-500 上的评测分数,例如 DeepSeek-R1-Distill-Qwen-1.5B 得 81.6、7B 得 91.8、32B 得 95.0。

    推荐理由:Open-R1 一周内复现了 DeepSeek-R1 蒸馏模型的评测分数,并公开了 GRPO 训练与合成数据生成的具体工程取舍。

1月31日周五
1月30日周四
1月28日周二
  1. Hugging Face Blog62

    Hugging Face 启动 Open-R1 项目,完整开源复现 DeepSeek-R1

    Hugging Face 发起 Open-R1 项目,计划系统重建 DeepSeek-R1 的数据与训练流程,补上官方未公开的数据集和训练代码。项目分三步:从 DeepSeek-R1 蒸馏高质量推理数据集复现 R1-Distill 模型,复现 R1-Zero 所用的纯强化学习流程并整理数学、推理、代码数据集,以及展示从基座模型经 SFT 到 RL 的多阶段训练。

    推荐理由:Hugging Face 公开复现 DeepSeek-R1 的三步计划,读者可了解开源推理模型训练链路的缺口与补全路径。

1月23日周四
1月22日周三
12月20日周五
12月18日周三
  1. Hugging Face Blog60

    IBM 等联合发布混合 Mamba2 模型 Bamba-9B

    IBM、Princeton、CMU 和 UIUC 联合发布 Bamba-9B,一个在完全开放数据上训练的混合 Mamba2 模型,训练数据量 2.2T tokens。

    推荐理由:Bamba-9B 用完全开放数据训练并给出 vLLM 实测吞吐与延迟数据,可对照同尺寸 Transformer 模型判断混合 Mamba2 架构的取舍。

12月17日周二
12月5日周四
  1. OpenAI News62

    OpenAI 发布 o1 系统卡

    OpenAI 发布 o1 系统卡,说明在发布 o1 和 o1-mini 之前开展的安全工作,包括外部红队测试以及依据其 Preparedness Framework 进行的前沿风险评测。

    推荐理由:OpenAI 官方披露 o1 与 o1-mini 发布前的安全评估流程,可了解其 Preparedness Framework 下的风险评测方式。

11月25日周一
11月20日周三
  1. Hugging Face Blog38

    让大模型辩论:首届多语言 LLM 辩论赛 FlagEval Debate 举办

    BAAI 推出 FlagEval Debate 辩论平台,让大模型直接对抗,目前支持英语、中文、阿拉伯语和韩语四种语言的辩论赛。平台采用专家评审与用户投票的双重评估机制,并提供开发者自定义功能,可调整模型参数、策略与对话风格。2024 年 Q3 的实验显示,当前大多数模型都能参与辩论。

10月29日周二
  1. Hugging Face Blog62

    Intel Labs 与 Hugging Face 提出 Universal Assisted Generation:任意辅助模型加速解码

    Intel Labs 与 Hugging Face 提出 Universal Assisted Generation(UAG),让辅助生成不再要求目标模型与辅助模型共享同一 tokenizer,可跨模型家族配对,对任意 decoder 或 MoE 模型实现 1.5x-2.0x 推理加速。

    推荐理由:Intel Labs 与 Hugging Face 提出跨 tokenizer 的辅助生成方法,读者可了解其 2-way tokenizer 翻译思路与实测加速幅度。

10月8日周二
  1. Hugging Face Blog42

    Intel Labs 与 Hugging Face 推出动态推测解码,文本生成最高提速 2.7 倍

    Intel Labs 与 Hugging Face 提出动态推测解码方法,根据助手模型每次预测的置信度动态调整推测前瞻长度,文本生成最高提速 2.7 倍。该方法自 Transformers 4.45.0 起成为辅助生成的默认模式,在 Llama3.1-8B 搭配 Llama3.2-1B 等测试中均优于启发式方法,后者在 codegen-6B-mono 上甚至出现减速。

9月12日周四
8月14日周三
  1. Hugging Face Blog34

    Hugging Face 复现 Infini-Attention 失败:压缩次数越多性能越差

    Hugging Face 复现 Google 的 Infini-attention 实验发现,随着记忆压缩次数增加,模型性能反而持续下降。团队尝试将 Llama 3 8B 的 8k 上下文扩展至 100 万 token,但结论是 ring attention、YaRN 和 rope scaling 仍是扩展预训练模型上下文长度的最佳方案。训练好的 checkpoint 已公开,代码按原样提供。

8月12日周一
7月24日周三
  1. Mistral AI78

    Mistral AI 发布 Mistral Large 2,123B 参数支持 128k 上下文

    Mistral AI 发布新一代 Mistral Large 2,拥有 128k 上下文窗口和 123B 参数,可在单节点上以较大吞吐运行,支持包括中文、日文、韩文在内的数十种语言和 80 多种编程语言。

    推荐理由:官方给出 Mistral Large 2 的 128k 上下文、123B 参数与多项基准对比,可据此判断其单节点部署的成本位置。