Google DeepMind 发布 Co-Scientist 多智能体科研系统
Google DeepMind 在 Nature 发表 Co-Scientist 研究,推出基于 Gemini 的多智能体 AI 系统,可迭代生成、辩论并演化复杂科学问题的新假设。
推荐理由:原文披露了多智能体系统的三阶段架构与辩论式排序机制,并给出多个实验室的落地案例,可据此判断 AI 参与科学假设生成的实际边界。
Google DeepMind 在 Nature 发表 Co-Scientist 研究,推出基于 Gemini 的多智能体 AI 系统,可迭代生成、辩论并演化复杂科学问题的新假设。
推荐理由:原文披露了多智能体系统的三阶段架构与辩论式排序机制,并给出多个实验室的落地案例,可据此判断 AI 参与科学假设生成的实际边界。
OpenAI 的 Parameter Golf 活动吸引 1,000+ 名参与者、收到 2,000+ 份提交,探索严格约束下的 AI 辅助机器学习研究、编码智能体、量化与新型模型设计。
OpenAI 通过沙箱隔离、审批机制、网络策略和智能体原生遥测来安全运行 Codex,以支持编程智能体的安全合规采用。
Parloa 基于 OpenAI 模型构建可扩展的语音驱动 AI 客服智能体,让企业能够设计、模拟并部署可靠的实时交互。
Google DeepMind 汇总了 Gemini 驱动的编码智能体 AlphaEvolve 发布一年来的应用成果,覆盖数学、量子物理、电网优化和 AI 基础设施等领域。
推荐理由:官方汇总 AlphaEvolve 一年落地案例,涵盖基因组、电网、TPU 与多家企业应用,可据此判断算法智能体的实际边界。
OpenAI 的 B2B Signals 研究显示,前沿企业正通过深化 AI 应用、规模化 Codex 驱动的智能体工作流来构建持久竞争优势。
Jack Clark 在 Import AI 455 中判断,到 2028 年底出现无需人类参与、能自主训练出后继模型的 AI 研发的概率约为 60%,2027 年前出现的概率约 30%。
Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下协助患者诊疗。
推荐理由:Google DeepMind 公布 AI co-clinician 研究计划,给出医生盲评与远程问诊模拟中的具体对比结果。
Google Research 介绍其 Empirical Research Assistance(ERA)在四个真实科研场景中的应用:公共卫生领域,团队每周向 CDC 的流感。
推荐理由:Google 官方梳理 ERA 在流行病预测、宇宙学、碳监测与神经科学四类真实科研任务中的落地方式,可看到 AI 辅助科研的具体边界。
NVIDIA 发布 Nemotron 3 Nano Omni,一款覆盖文本、图像、视频与音频的全模态理解模型,基于 Nemotron 3 Nano 30B-A3B 骨干,搭配 C-RADIOv4-H 视觉编码器和 Parakeet-TDT-0.6B-v2 音频编码器。
推荐理由:原文给出架构、训练配方与多模态基准对比,读者可据此判断开源全模态模型在文档、音视频与 GUI 智能体上的能力边界。
Mistral AI 发布企业 AI 编排层 Workflows 公开预览版,基于 Temporal 持久执行引擎,提供持久化执行、可观测性和人工介入审批能力。
推荐理由:Mistral 把企业级 AI 编排的持久化执行、可观测与人工审批打包进 Studio,读者可据此判断生产化落地的门槛变化。
Choco 利用 OpenAI API 构建 AI 智能体,实现食品分销流程自动化,以提升生产力并推动业务增长。这是 OpenAI 发布的一则客户案例,展示 AI 在真实场景中的落地效果。
OpenAI 发布开源规范 Symphony,用于 Codex 编排,可把 issue tracker 变成常驻运行的智能体系统。该规范旨在提升工程产出并减少上下文切换。
DeepSeek 发布 V4,在 Hub 上提供两个 MoE 检查点:DeepSeek-V4-Pro 为 1.6T 总参数、49B 激活,DeepSeek-V4-Flash 为 284B 总参数、13B 激活,均支持 1M token 上下文窗口。
推荐理由:原文拆解了 V4 混合注意力如何把 1M 上下文的 KV cache 压到约 2%,并给出智能体基准对比,便于判断长任务部署成本。
OpenAI 发布 GPT-5.5,官方称其为面向编码、研究和数据分析等跨工具复杂任务打造的模型。
推荐理由:OpenAI 官方发布 GPT-5.5,面向编码、研究与数据分析等跨工具复杂任务,可据此了解其定位。
Hugging Face 发布教程,讲解如何在 Manifest V3 约束下用 Transformers.js 在 Chrome 扩展中运行本地 AI,并以官方发布的 Gemma 4 浏览器助手扩展为参照。
推荐理由:以官方发布的 Gemma 4 浏览器扩展为参照,拆解 MV3 下后台托管模型、侧边栏与内容脚本分工的架构取舍。
ChatGPT 推出工作区智能体(Workspace agents),可自动执行重复性工作流、连接工具并简化团队协作。该功能面向团队运营场景,帮助用户在 ChatGPT 内构建并使用这类智能体。
OpenAI 在 ChatGPT 中推出工作区智能体(workspace agents),由 Codex 驱动,可自动化复杂工作流并在云端运行。官方称其能帮助团队跨工具安全地扩展工作。
推荐理由:官方给出 ChatGPT 工作区智能体的定位与云端运行方式,可据此判断团队自动化流程的形态。
Google Research 在 ICLR 论文中提出 ReasoningBank,一个从成功和失败经验中提炼高层结构化记忆的智能体记忆框架,代码已开源。
Google DeepMind 宣布与 Accenture、Bain & Company、BCG、Deloitte、McKinsey 五家咨询公司合作,推动前沿 AI 在企业规模化落地。
Hugging Face 发布一个 Skill 和配套测试工具,帮助贡献者把 transformers 中的语言模型移植到 mlx-lm,使模型加入 transformers 后能较快在 MLX 上可用。
推荐理由:Hugging Face 公开了把 transformers 模型移植到 mlx-lm 的 Skill 与测试工具,读者可了解其流程与对评审者的减负设计。
Hugging Face 将 RLVE 框架从单轮推理题扩展到多轮、工具增强的电商对话,推出 EcomRLVE-GYM,包含商品发现、替代品、购物车搭建、退货、订单跟踪、政策问答、组合规划、多意图旅程 8 个可验证环境,每个环境配有程序化出题、12 轴难度课程和算法可验证奖励。团队用 DAPO 训练 Qwen 3 8B 模型 300 步,早期结果显示环境扩展与自适应难度可迁移到真实智能体任务。
Hugging Face 推出 VAKRA,一个面向企业级环境的工具调用可执行基准,用完整执行轨迹评估 AI 智能体的组合式推理能力。VAKRA 提供 8,000+ 本地托管 API、覆盖 62 个领域,任务需 3-7 步推理链,包含 API 链式调用、工具选择、多跳推理等四类任务,模型整体表现不佳。
HCompany 发布 Chrome 扩展 HoloTab,把其 3 月 31 日推出的计算机操作模型 Holo3 直接接入浏览器,用户描述需求后由智能体在网页内导航界面、填写字段并做决策,无需配置或技术背景。HoloTab 支持例程功能:开始录制后实时捕捉用户在标签页中的点击与口述,录制结束即生成可重复运行或定时调度的例程。该扩展目前免费开放使用。
推荐理由:HCompany 把自家 Holo3 计算机操作模型封装成浏览器扩展,读者可了解录制即生成例程的交互方式。
Google 在 Google Labs 上线研究实验 Vantage,用生成式 AI 构建模拟对话环境,评估高中与大学生的问题解决、协作等未来技能,目前提供英文版并可注册。
Google Research 推出 ConvApparel,一个包含 4000 多组人机多轮对话(近 15000 轮)的服饰购物领域数据集,用于量化 LLM 用户模拟器与真实人类的真实感差距。
Google 发布两个学术智能体框架:PaperVizAgent(原 PaperBanana)从论文文本生成出版级图表,ScholarPeer 则自动完成文献检索与论文评审。
Google DeepMind 发布 Gemma 4 开源模型家族,包含 E2B、E4B、26B MoE 和 31B Dense 四个尺寸,采用 Apache 2.0 许可。
推荐理由:Gemma 4 以四个尺寸覆盖端侧到工作站,并给出 Apache 2.0 许可与首日工具链支持,便于开发者判断本地部署与微调路径。
Mistral AI 发布 Spaces CLI,同时面向人类开发者和编码智能体。该工具通过 `spaces init`、`spaces dev` 等命令,三条命令即可从零搭建带热重载、数据库和 Dockerfile 的多服务项目。每个交互式提示都有对应的 flag 等价物,并在每次 init 时生成 context.json 和 AGENTS.md,让智能体无需人工干预即可自主完成配置与部署。
Google DeepMind 公布 AI 指针的四条交互原则,并展示由 Gemini 驱动的实验性指针演示,用户可通过指向和语音在 Google AI Studio 中编辑图片或查找地点。该指针已开始集成到 Chrome,用户可用指针选中网页内容让 Gemini 处理,Googlebook 也将推出 Magic Pointer。研究团队称这些原则旨在把传达上下文和意图的工作从用户转移到计算机。
Google DeepMind 发布 Gemini 3.1 Flash Live,称其为目前质量最高的音频与语音模型,精度更高、延迟更低。该模型在 ComplexFuncBench Audio 上得分 90.8%,在 Scale AI 的 Audio MultiChallenge 上开启 thinking 后得分 36.1%。
推荐理由:官方给出语音模型在函数调用与长程推理基准上的分数,并说明开发者与普通用户的使用入口。
Google DeepMind 发布关于 AI 有害操纵的新研究,称其为首个经实证验证的测量工具包,并公开运行同类人类受试者研究所需的全部材料。研究覆盖英国、美国、印度共九项实验、超过 10000 名参与者,聚焦金融与健康等高风险场景,结果显示 AI 在健康话题上的有害操纵效果最弱,且在一个领域的成功无法预测另一个领域。
推荐理由:Google DeepMind 公开了首个经实证验证的 AI 有害操纵测量工具包,并给出跨英、美、印三国万人实验的关键结论。
Google 发布 Vibe Coding XR 工作流,将 Gemini 的长上下文推理与开源 WebXR 框架 XR Blocks 结合,把自然语言提示词直接转成具备物理感知的 Android XR 应用,官方称耗时在 60 秒以内。
ServiceNow 在 Hugging Face 发布 EVA,一个面向对话式语音智能体的端到端评测框架,同时给出 EVA-A(准确率)和 EVA-X(体验)两个分数,并开源代码与数据集。
Google Research 在 The Check Up 活动上展示了医疗 AI 的多项进展,包括与 Fitbit 合作研究的 Personal Health Agent(PHA),发现其比单一任务应用更能支持长期健康。
Mistral AI 推出 Forge,一套让企业基于自有专有知识构建前沿级 AI 模型的系统,支持预训练、后训练和强化学习等阶段。Forge 支持 dense 与 MoE 架构,并可按需支持多模态输入,模型可在企业自有基础设施内训练和治理。该平台以 Agent 优先设计,Mistral Vibe 等自主智能体可用其微调模型、寻找最优超参数、调度任务并生成合成数据,用户只需用自然语言即可定制模型。
推荐理由:Forge 把预训练、后训练与强化学习打包成企业自建模型的入口,读者可据此判断企业级定制模型的落地路径。
H Company 发布 Holotron-12B,一个基于 NVIDIA Nemotron-Nano-2 VL 后训练的多模态 computer-use 模型,现已上线 Hugging Face,采用 NVIDIA Open Model License。
推荐理由:原文给出模型架构、吞吐对比与基准提升,读者可据此判断它在高并发 computer-use 场景的可用性。
Mistral 基于其开源编码助手 Vibe 构建了一个自主智能体,可读取 Rails 源码文件、生成或改进 RSpec 测试,并在 CI/CD 流水线中无需人工干预地运行。该智能体通过仓库级 AGENTS.md 执行计划、按文件类型划分的 skills 文件以及 Rubocop、SimpleCov 校验工具运作,仅靠一份 markdown 指令文件就将质量分从 0.68 提升至 0.74。
OpenAI 发布 AI 应用安全智能体 Codex Security,目前处于研究预览阶段。该智能体通过分析项目上下文来检测、验证并修补复杂漏洞,官方称其置信度更高、噪声更少。
推荐理由:OpenAI 官方给出 Codex Security 的定位与三项核心能力,可据此判断它在安全审计流程中的切入点。
Balyasny Asset Management 通过严格的模型评估、全平台使用 OpenAI 以及智能体工作流,重构了投资研究流程。该机构将模型评估、OpenAI 全平台能力与 agent 工作流结合,用于改造投资研究工作方式。