Mistral 发布 Mistral Small 4,统一推理、多模态与编码能力
Mistral AI 发布 Mistral Small 4,这是 Mistral Small 系列的下一个重要版本,也是 Mistral 首个把 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码能力统一到单一模型中的模型,采用 Apache 2.0 许可开源。
推荐理由:Mistral 首次把推理、多模态与编码能力合并进单一小模型,并给出可调推理强度与部署门槛。
Mistral AI 发布 Mistral Small 4,这是 Mistral Small 系列的下一个重要版本,也是 Mistral 首个把 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码能力统一到单一模型中的模型,采用 Apache 2.0 许可开源。
推荐理由:Mistral 首次把推理、多模态与编码能力合并进单一小模型,并给出可调推理强度与部署门槛。
Mistral AI 发布 Leanstral,称其为首个面向 Lean 4 的开源代码智能体,采用 6B 激活参数的稀疏架构,权重以 Apache 2.0 许可开放,并接入 Mistral Vibe 与免费 API 端点 labs-leanstral-2603。
推荐理由:Mistral 开源面向 Lean 4 的代码智能体,给出与 Claude 系列及开源模型的成本与得分对比,可据此判断形式化验证路线的性价比。
Mistral 基于其开源编码助手 Vibe 构建了一个自主智能体,可读取 Rails 源码文件、生成或改进 RSpec 测试,并在 CI/CD 流水线中无需人工干预地运行。该智能体通过仓库级 AGENTS.md 执行计划、按文件类型划分的 skills 文件以及 Rubocop、SimpleCov 校验工具运作,仅靠一份 markdown 指令文件就将质量分从 0.68 提升至 0.74。
OpenAI 发布 AI 应用安全智能体 Codex Security,目前处于研究预览阶段。该智能体通过分析项目上下文来检测、验证并修补复杂漏洞,官方称其置信度更高、噪声更少。
推荐理由:OpenAI 官方给出 Codex Security 的定位与三项核心能力,可据此判断它在安全审计流程中的切入点。
OpenAI 发布 GPT-5.4,称其为面向专业工作能力最强且高效的前沿模型,具备 SOTA 编码、计算机操作、工具搜索和 1M token 上下文。
推荐理由:OpenAI 官方发布 GPT-5.4,给出编码、计算机操作与 1M token 上下文等能力定位,便于判断其面向专业工作的边界。
OpenAI 与 Pacific Northwest National Laboratory 联合推出 DraftNEPABench,用于评估 AI 编程智能体如何加速联邦许可审批。该基准显示,NEPA 草案撰写时间最多可缩短 15%,有望推动基础设施审查现代化。
OpenAI 与 Figma 推出 Codex 集成,打通代码与设计,让团队在实现与 Figma canvas 之间自由切换、加快迭代与交付。
OpenAI 宣布不再评估 SWE-bench Verified,原因是该基准日益受到污染,且无法准确衡量前沿编码能力。其分析指出该基准存在测试缺陷与训练数据泄漏问题,并建议改用 SWE-bench Pro。
OpenAI 发布 GPT-5.3-Codex-Spark,称其为首个实时编码模型,生成速度提升 15 倍,支持 128k 上下文。该模型目前以研究预览形式面向 ChatGPT Pro 用户开放。
推荐理由:OpenAI 发布首个实时编码模型,15 倍生成速度与 128k 上下文让读者了解编码模型的实时化方向。
OpenAI 技术人员 Ryan Lopopolo 提出 Harness engineering,主张在智能体优先的世界中利用 Codex。文章围绕这一理念展开,探讨如何借助 Codex 构建以智能体为核心的工程实践。
OpenAI 发布 GPT-5.3-Codex,这是一个 Codex 原生的智能体,将前沿编码能力与通用推理结合,用于支持长周期、真实世界的技术工作。
推荐理由:OpenAI 发布 Codex 原生的 GPT-5.3-Codex,读者可了解其在编码与通用推理上的定位。
Mistral 发布终端原生编码智能体 Mistral Vibe 2.0,由 Devstral 2 模型系列驱动,新增自定义子智能体、多选澄清、斜杠命令技能、统一智能体模式和自动更新。
推荐理由:官方给出 Vibe 2.0 的自定义子智能体、斜杠命令技能等能力与定价入口,可据此判断终端编码智能体的工作流变化。
OpenAI 发布 Codex 智能体循环技术解析,说明 Codex CLI 如何借助 Responses API 编排模型、工具、提示词与性能。文章为技术深度剖析,未披露具体版本号、参数规模或性能数字。
Datadog 使用 OpenAI 的 Codex 进行系统级代码审查。该实践面向系统层面的代码审查场景,具体做法与效果原文未披露更多细节。
OpenAI 发布 GPT-5.2-Codex,称其为该公司最先进的编码模型。该模型具备长程推理、大规模代码转换和增强的网络安全能力。
推荐理由:OpenAI 官方给出 GPT-5.2-Codex 的定位与三项能力方向,可据此了解其编码模型迭代重点。
OpenAI 发布 GPT-5.2 系统卡增补文件,涉及 GPT-5.2-Codex。
OpenAI 借助 Codex 在 28 天内完成 Android 版 Sora 的交付,通过 AI 辅助规划、翻译和并行编码工作流,让小团队实现快速可靠的开发。
Mistral AI 发布下一代编码模型系列 Devstral 2,含 123B 的 Devstral 2 和 24B 的 Devstral Small 2,分别采用修改版 MIT 和 Apache 2.0 许可,均为开源。
推荐理由:官方给出两款开源编码模型的参数、SWE-bench 成绩与许可差异,并附独立人工评测对比,可据此判断开源编码模型与闭源模型的差距。
Google 发布智能体开发平台 Antigravity,即日起公开预览且免费,支持 macOS、Linux 和 Windows。它保留 AI 驱动的 IDE 编辑器视图,同时新增面向智能体的 Manager 界面,可并行编排多个工作区中的智能体,并通过任务列表、实现方案、截图和浏览器录制等 Artifacts 呈现工作过程。
推荐理由:Google 把 IDE 拆成同步编辑器与异步 Agent Manager 两层,读者可据此判断智能体编程工具的产品形态走向。
BigCode 项目发布 BigCodeArena,这是首个通过实际执行代码来评估代码生成模型的人类参与平台,用户提交编程任务后可对比两个模型的生成结果、运行程序并投票,结果汇总为排行榜。
推荐理由:平台把代码执行结果纳入人类投票,并公开 5 个月社区数据与两个新基准,可据此了解代码模型评测的新做法。
OpenAI Codex 现已正式可用(generally available),面向开发者新增多项功能:Slack 集成、Codex SDK,以及用量看板和工作区管理等管理工具。官方称这些更新让 Codex 更易使用,也更容易在规模化场景下管理。
推荐理由:Codex 从预览转为正式可用,并给出 Slack 集成、SDK 与管理工具,读者可据此判断团队规模化使用的门槛变化。
OpenAI 宣布升级 Codex,使其更快、更可靠,并增强实时协作与独立处理任务的能力。升级后的 Codex 可在终端、IDE、网页乃至手机上使用。
推荐理由:官方给出 Codex 在速度、可靠性与实时协作上的升级方向,读者可据此判断多端编码工作流的变化。
OpenAI 发布 GPT-5 系统卡增补,公开新模型 GPT-5-Codex,这是 GPT-5 针对 Codex 中智能体编码进一步优化的版本。GPT-5-Codex 会根据任务复杂度更动态地调整思考投入,对简单对话查询或小任务快速响应,对更复杂任务则独立工作更长时间。
推荐理由:GPT-5 系统卡增补披露了面向 Codex 智能体编码优化的新模型,读者可了解其动态调整思考投入的机制。
OpenAI 在 API 平台推出 GPT-5,主打高推理性能、面向开发者的新控制项,以及在真实编码任务上的领先结果。
推荐理由:OpenAI 在 API 平台上线 GPT-5,开发者可据此了解新模型在推理与真实编码任务上的定位。
OpenAI 发布文章介绍 GPT-5 在编码与设计方面带来的新可能,但摘要未给出具体功能、能力数据或使用方式。
OpenAI 发文介绍 Cursor 如何使用 GPT-5。原文未披露具体功能细节、参数或性能数据。
OpenAI 发布 GPT-5,称其为目前最强的 AI 系统,在智能水平上较此前所有模型有显著跃升。GPT-5 在编码、数学、写作、健康、视觉感知等方面达到 SOTA 表现。
推荐理由:OpenAI 官方公布 GPT-5 的定位与能力覆盖范围,读者可据此了解其相对前代模型的升级方向。
Hugging Face 推出 3LM(علم),一个评估阿拉伯语 LLM 在 STEM 与代码生成上表现的多组件基准,包含 865 道原生 STEM 选择题、1744 道合成 STEM 选择题,以及翻译自 HumanEval+ 和 MBPP+ 的阿拉伯语代码任务。
Mistral AI 发布 Codestral 25.08,并推出覆盖补全、语义检索与智能体工作流的企业级编码栈。官方称 Codestral 25.08 相比此前版本补全采纳率提升 30%、建议后保留代码增加 10%、失控生成减少 50%,chat 模式下指令遵循与代码能力各提升 5%。
推荐理由:Mistral 官方给出编码栈各组件的能力数字与私有化部署路径,可据此判断企业自建编码助手的可行边界。
Mistral AI 与 All Hands AI 合作发布 Devstral Medium,并升级 Devstral Small 1.1。
推荐理由:Mistral 与 All Hands AI 联合发布两款编码智能体模型,给出了 SWE-Bench Verified 分数与 API 定价,便于对比现有方案。
Mistral AI 发布企业级 AI 编码助手 Mistral Code,整合 Codestral、Codestral Embed、Devstral 和 Mistral Medium 四个模型,支持云端、专属容量或气隙本地 GPU 部署,代码留在企业边界内。
推荐理由:官方给出企业级编码助手的模型组合、部署形态与首批客户,可据此判断私有化编码方案的落地路径。
Mistral AI 发布首个面向代码的嵌入模型 Codestral Embed,官方称其在真实代码检索场景中明显优于 Voyage Code 3、Cohere Embed v4.0 和 OpenAI 的大嵌入模型。
推荐理由:官方给出代码嵌入模型与三家竞品的对比,以及维度与精度可调的取舍方式,便于评估检索成本。
CodeRabbit 采用 OpenAI 的 o3、o4-mini 和 GPT-4.1 模型改造代码审查流程,提升准确率并加快 PR 合并速度。该方案帮助开发者更快交付代码,减少 bug 并提高投资回报率。
Mistral AI 与 All Hands AI 合作发布面向软件工程任务的智能体模型 Devstral,在 SWE-Bench Verified 上得分 46.8%,比此前开源 SOTA 模型高出 6 个百分点以上,并以 Apache 2.0 许可开源。
推荐理由:Mistral 与 All Hands AI 联合发布开源编码智能体模型,给出 SWE-Bench Verified 分数与本地部署门槛,便于判断其可用性。
OpenAI 发布 o3 和 o4-mini 系统卡的补充说明,介绍云端编码智能体 Codex。Codex 由 codex-1 驱动,后者是 OpenAI o3 针对软件工程优化的版本,通过强化学习在多种环境的真实编码任务上训练,以生成贴近人类风格和 PR 偏好的代码、精确遵循指令,并反复运行测试直至通过。
推荐理由:系统卡补充说明披露了 Codex 背后的 codex-1 训练方式,可了解编码智能体的工程取向。
OpenAI 发布 Codex。
OpenAI 在 API 中推出 GPT-4.1 系列模型,官方称其在编码、指令遵循和长上下文理解方面均有提升。该系列同时包含 OpenAI 首个 nano 模型,即日起面向全球开发者开放。
推荐理由:OpenAI 在 API 上线 GPT-4.1 系列并首次推出 nano 版本,读者可据此了解模型家族的能力变化与可用范围。
DeepSeek 本周在 Hugging Face Hub 上线 DeepSeek-V3 0324,这是 R1 推理模型基座 DeepSeek-V3 的更新版本,架构不变但改用 MIT 许可,此前 V3 使用自定义模型许可。
推荐理由:梳理 DeepSeek-V3 0324 的基准提升与 MIT 许可变化,并给出多种本地部署与量化运行方式。
Hugging Face 发布教程,介绍如何在本地通过 LM Studio 加载 4bit GGUF 量化的 OlympicCoder 7B,并接入 VS Code 的 Continue 扩展实现代码补全、生成、解释、重构和写测试。
Hugging Face Open R1 项目发布 OlympicCoder-7B 和 OlympicCoder-32B 两个代码模型,基于 Qwen2.5 Coder Instruct 微调,在 IOI 问题上超过 Claude 3.7 Sonnet 等闭源前沿模型。
推荐理由:Open R1 复现 R1 代码推理配方,给出数据集、IOI 基准与 7B/32B 模型,并附训练经验。