跳到正文

#推理

今日 0 条
9月24日周四
9月23日周三
8月25日周二
8月21日周五
  1. Hugging Face Blog62

    Liquid AI 发布 LFM2.5-DSpark 草稿模型,推理最高提速 3.2 倍

    Liquid AI 为 LFM2.5 家族的三款模型 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 发布 DSpark 草稿模型检查点,通过投机解码在不改变输出质量的前提下提升解码速度,GPU 上吞吐最高提升 3.18 倍,端侧最高 2.87 倍。

    推荐理由:官方给出三款 LFM2.5 草稿模型的加速数据与 llama.cpp、SGLang 接入方式,可据此评估端侧推理提速的落地成本。

7月29日周三
  1. OpenAI News62

    GPT-5.6 如何兼顾前沿智能与效率

    OpenAI 发布文章说明 GPT-5.6 在模型、推理和智能体工作流上提升了 AI 效率,目标是让每一美元带来更多可用智能。文章标题强调 GPT-5.6 将前沿智能与前沿效率结合。

    推荐理由:OpenAI 官方解释 GPT-5.6 如何在模型、推理与智能体工作流上提升效率,读者可了解其单位成本智能的改进方向。

7月2日周四
  1. Mistral AI66

    Mistral 发布 Leanstral 1.5:119B 总参数、6B 激活的形式化验证模型

    Mistral 发布 Leanstral 1.5,一个 Apache-2.0 许可的形式化验证模型,119B 总参数、6B 激活参数,在 miniF2F 上达到 100%,解出 PutnamBench 672 题中的 587 题,并在 FATE-H 取得 87%、FATE-X 取得 34%。

    推荐理由:原文给出模型规模、基准成绩与每道题成本对比,读者可据此判断形式化验证的实用门槛。

6月27日周六
6月11日周四
6月3日周三
  1. OpenAI News62

    OpenAI 为 GPT-Rosalind 引入生命科学新能力

    OpenAI 为 GPT-Rosalind 引入新能力,用于推进生命科学研究。该模型增强了生物推理、药物化学专业知识、基因组分析和实验工作流能力。

    推荐理由:OpenAI 为 GPT-Rosalind 增加生命科学能力,读者可了解该模型在生物推理与基因组分析上的定位。

5月20日周三
  1. OpenAI News78

    OpenAI 模型推翻离散几何核心猜想

    OpenAI 称其模型解决了有 80 年历史的单位距离问题,推翻了离散几何中的一个重要猜想,被视为 AI 驱动数学研究的一个里程碑。

    推荐理由:OpenAI 模型推翻离散几何中悬置 80 年的核心猜想,可观察 AI 在数学证明上的实际进展。

4月24日周五
  1. Hugging Face Blog88

    DeepSeek-V4 发布:百万 token 上下文面向智能体任务

    DeepSeek 发布 V4,在 Hub 上提供两个 MoE 检查点:DeepSeek-V4-Pro 为 1.6T 总参数、49B 激活,DeepSeek-V4-Flash 为 284B 总参数、13B 激活,均支持 1M token 上下文窗口。

    推荐理由:原文拆解了 V4 混合注意力如何把 1M 上下文的 KV cache 压到约 2%,并给出智能体基准对比,便于判断长任务部署成本。

3月17日周二
  1. Mistral AI78

    Mistral 发布 Mistral Small 4,统一推理、多模态与编码能力

    Mistral AI 发布 Mistral Small 4,这是 Mistral Small 系列的下一个重要版本,也是 Mistral 首个把 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码能力统一到单一模型中的模型,采用 Apache 2.0 许可开源。

    推荐理由:Mistral 首次把推理、多模态与编码能力合并进单一小模型,并给出可调推理强度与部署门槛。

  2. Mistral AI62

    Mistral 发布 Leanstral:面向 Lean 4 的开源代码智能体

    Mistral AI 发布 Leanstral,称其为首个面向 Lean 4 的开源代码智能体,采用 6B 激活参数的稀疏架构,权重以 Apache 2.0 许可开放,并接入 Mistral Vibe 与免费 API 端点 labs-leanstral-2603。

    推荐理由:Mistral 开源面向 Lean 4 的代码智能体,给出与 Claude 系列及开源模型的成本与得分对比,可据此判断形式化验证路线的性价比。

3月4日周三
  1. Google DeepMind66

    Google DeepMind 发布 Gemini 3.1 Flash-Lite

    Google DeepMind 发布 Gemini 3.1 Flash-Lite,这是 Gemini 3 系列中速度最快、成本最低的模型,已在 Google AI Studio 和 Vertex AI 以预览形式向开发者开放。

    推荐理由:官方给出定价、速度与基准数据,读者可据此判断高并发场景下是否值得替换 2.5 Flash。

2月20日周五
2月13日周五
  1. OpenAI News75

    GPT-5.2 在理论物理中推导出新结果

    OpenAI 发布新预印本,显示 GPT-5.2 为胶子振幅提出了一个新公式,随后由 OpenAI 与学术合作者完成形式化证明与验证。

    推荐理由:OpenAI 与学术合作者披露 GPT-5.2 提出胶子振幅新公式并被形式化证明,可观察大模型参与理论物理推导的边界。

  2. Google DeepMind82

    Google DeepMind 发布 Gemini 3 Deep Think 升级版

    Google DeepMind 发布 Gemini 3 Deep Think 重大升级,这一专用推理模式面向科学、研究与工程难题。官方称其在 Humanity's Last Exam 上取得 48.4%(无工具)、ARC-AGI-2 上 84.6%、Codeforces 上 Elo 3455,并在 2025 国际数学奥林匹克达到金牌水平。

    推荐理由:官方给出 Deep Think 在 HLE、ARC-AGI-2、Codeforces 等基准上的具体成绩,并说明 API 早期访问入口,便于判断其科研与工程定位。

1月6日周二
12月17日周三
  1. Google DeepMind87

    Google DeepMind 发布 Gemini 3 Flash

    Google DeepMind 发布 Gemini 3 Flash,主打前沿智能与速度兼顾,在 GPQA Diamond 得 90.4%、Humanity's Last Exam 无工具得 33.7%、MMMU Pro 得 81.2%、SWE-bench Verified 得 78%。

    推荐理由:官方给出 Gemini 3 Flash 的基准分数、定价与上线渠道,可据此判断速度与成本之间的取舍。

12月11日周四
  1. OpenAI News82

    OpenAI 发布 GPT-5.2,面向科学与数学任务

    OpenAI 发布 GPT-5.2,称其为目前数学与科学能力最强的模型,在 GPQA Diamond 和 FrontierMath 等基准上取得新的 SOTA 结果。官方表示这些提升已转化为实际研究进展,包括解决一个开放理论问题并生成可靠的数学证明。

    推荐理由:官方给出 GPT-5.2 在数学与科学基准上的新结果,并说明这些提升如何落到实际研究进展。

12月3日周三
9月12日周五
8月7日周四
  1. OpenAI News85

    OpenAI 在 API 平台推出 GPT-5

    OpenAI 在 API 平台推出 GPT-5,主打高推理性能、面向开发者的新控制项,以及在真实编码任务上的领先结果。

    推荐理由:OpenAI 在 API 平台上线 GPT-5,开发者可据此了解新模型在推理与真实编码任务上的定位。

8月5日周二
  1. OpenAI News85

    OpenAI 发布 gpt-oss-120b 与 gpt-oss-20b 开放权重模型

    OpenAI 发布 gpt-oss-120b 和 gpt-oss-20b 两款开放权重语言模型,采用 Apache 2.0 许可。官方称这两款模型在推理任务上优于同规模开放模型,具备较强的工具调用能力,并针对消费级硬件的高效部署做了优化。

    推荐理由:OpenAI 开源两款权重模型,给出参数量、许可与部署定位,便于判断本地推理的可用边界。

7月10日周四
7月8日周二
6月10日周二
5月21日周三
4月16日周三
  1. OpenAI News82

    OpenAI 发布 o3 与 o4-mini 系统卡

    OpenAI 发布 o3 和 o4-mini 系统卡,称两款模型将前沿推理能力与完整工具能力结合。可用工具包括网页浏览、Python、图像与文件分析、图像生成、canvas、自动化、文件搜索和记忆。

    推荐理由:官方系统卡披露 o3 与 o4-mini 的推理与工具调用组合,可据此了解新模型的能力边界。

  2. OpenAI News82

    OpenAI 发布 o3 与 o4-mini 推理模型

    OpenAI 发布 o3 和 o4-mini 两款模型,称其为目前最智能、能力最强的模型,并具备完整的工具调用能力。

    推荐理由:OpenAI 发布 o3 与 o4-mini 两款推理模型,并首次给出完整工具调用能力,读者可据此了解其推理产品线的最新分层。

3月27日周四
3月12日周三
1月31日周五
12月18日周三
  1. Hugging Face Blog60

    IBM 等联合发布混合 Mamba2 模型 Bamba-9B

    IBM、Princeton、CMU 和 UIUC 联合发布 Bamba-9B,一个在完全开放数据上训练的混合 Mamba2 模型,训练数据量 2.2T tokens。

    推荐理由:Bamba-9B 用完全开放数据训练并给出 vLLM 实测吞吐与延迟数据,可对照同尺寸 Transformer 模型判断混合 Mamba2 架构的取舍。

12月17日周二
9月12日周四