跳到正文

#Agent

今日 2 条
9月9日周三
  1. OpenAI News82

    OpenAI 发布 GPT-6 Astra,面向商业场景强化推理与计算机使用能力

    OpenAI 发布 GPT-6 Astra,称其为面向商业场景能力最强的模型,具备高级推理、计算机使用以及更强的写作与设计判断力。目前官方仅给出简要介绍,未披露具体参数、可用时间或定价信息。

    推荐理由:OpenAI 官方发布 GPT-6 Astra,读者可据此了解其面向商业场景的推理与计算机使用能力定位。

9月6日周日
9月5日周六
  1. GitHub Blog · AI & ML71

    GitHub 推出 Project HydraFusion:多模型编排实现前沿级编码质量

    GitHub 发布研究预览 Project HydraFusion,在 GitHub Copilot CLI 中通过运行时编排多个提供商的模型,自动选择 Single、Cascade、Critique 三种执行模式来平衡质量、成本与延迟。

    推荐理由:GitHub 官方给出多模型编排的三种执行模式与三项基准的成本质量对比,可据此判断路由式编排在编码任务上的取舍。

9月4日周五
  1. GitHub Blog · AI & ML38

    GitHub Copilot 应用入门:如何同时运行多个智能体

    GitHub Copilot 应用支持同时运行多个智能体会话,每个会话运行在独立的 Git worktree 上,互不干扰且各自保留上下文,可随时切换并从中断处继续。用户可在 sessions 视图中查看各会话标题与任务进度,例如在同一项目中并行完成 funded sort 功能开发、无障碍审查和测试运行。

9月3日周四
  1. Google DeepMind62

    Google DeepMind 推出 Fairwind Program,向政府与企业开放 Gemini 3.8 Flash Cyber 网络防御能力

    Google 推出 Fairwind Program,面向政府机构、关键基础设施运营商和网络安全合作伙伴限量开放其最先进的网络防御能力,首批提供 Gemini 3.8 Flash Cyber 模型与 CodeMender 工具链,用于自主发现、验证并修复漏洞。

    推荐理由:Google 把 Gemini 3.8 Flash Cyber 与 CodeMender 组合成受限访问项目,读者可了解前沿模型在漏洞修复上的落地方式与准入条件。

9月2日周三
8月28日周五
  1. Google Research66

    Google 发布行星预测引擎 PPE,自动完成地理空间建模全流程

    Google 在 Earth AI 计划下推出实验性研究能力 planetary prediction engine(PPE),可依据自然语言查询自主完成地理空间数据发现、特征工程、模型训练与评估,并生成报告,把原本需要数周人工数据工程的建模过程压缩到几分钟。

    推荐理由:Google 官方给出 PPE 在公共卫生、粮食安全与疫情预测上的基准对比,可看自主地理空间建模的自动化程度。

8月27日周四
8月26日周三
8月25日周二
8月22日周六
  1. Google Research39

    Google 推出 Biomarker Discovery Framework:从可穿戴传感器数据中优先筛选候选生物标志物

    Google 推出 Biomarker Discovery Framework,一个在人类监督下将候选生物标志物优先级排序结构化为迭代研究循环的多智能体系统。该系统在三个队列共 9,279 条参与者观测中自主识别出 41 个心理健康候选数字生物标志物和 25 个代谢候选标志物,并构建出睡眠时长变异性、心血管适能指数(步数除以静息心率)等新复合特征。

8月21日周五
8月20日周四
  1. Mistral AI66

    Mistral 发布 Agentic Search 检索层

    Mistral 发布 Agentic Search,一个让模型在多步检索循环中查找、打开、导航、阅读和验证信息的检索层,通过 Mistral Search Toolkit 提供,并内置于 Studio 和 Vibe 的 Libraries。

    推荐理由:原文给出多步检索循环在 FinanceBench 与 OfficeQA Pro 上的准确率、token 与延迟变化,可据此判断它相对一次性 RAG 的取舍。

8月19日周三
  1. Hugging Face Blog62

    IBM 研究:智能体到底需要多少记忆?

    IBM Research 在 Hugging Face 博客发布 ALTK-Evolve 研究,用 AppWorld 的 585 个多步任务测试八款模型后发现,智能体记忆不是开关而是需要按模型校准的剂量。

    推荐理由:八模型横评显示智能体记忆的合适剂量随模型能力分层,并给出检索与提示词缓存的成本对照。

8月14日周五
  1. Hugging Face Blog68

    Hugging Face 发布 2026 夏季开源模型观察报告

    Hugging Face 发布 2026 年 1 月至 8 月的开源模型观察报告,基于 Hub 数据给出六项发现。报告显示模型仓库从 243 万增至 296 万,数据集从 71.1 万增至 100 万,Spaces 从 100 万增至 144 万,但 85.6% 的模型累计下载不足 200 次,1.5% 的仓库占据 99.2% 的下载量。

    推荐理由:Hugging Face 用 Hub 七个月数据拆解开源模型格局,可看到中美实验室规模路线与下载依赖的分野。

8月13日周四
  1. Hugging Face Blog72

    Hugging Face 复盘 ICML 2026 论文复现活动:19 天复现 2226 篇论文

    Hugging Face 在 7 月 15 日至 8 月 2 日举办 ICML 2026 Open Reproductions 挑战,1221 名社区成员用 Claude Code、Codex、Cursor 等编码智能体逐条复现论文主张,共发布 6816 份 Trackio logbook,覆盖 2226 篇论文,约占大会论文总数的 34%。

    推荐理由:Hugging Face 用 1200 多名社区成员和编码智能体复现 ICML 2026 论文,给出了大规模论文审计的可行路径与人类角色的具体分工。

8月12日周三
8月11日周二
8月10日周一
8月4日周二
  1. Microsoft Research71

    微软研究院开源 Orchard:可扩展智能体 AI 框架

    微软研究院发布开源框架 Orchard,核心是 Orchard Env 这一可复用的 Kubernetes 环境服务,支持软件工程、网页导航和个人助理等任务,并可直接在 Codex、OpenClaw、ZeroClaw 等真实部署 harness 中训练智能体。

    推荐理由:微软研究院开源 Orchard 框架,公开环境服务、训练流程与数据,读者可据此了解小模型在真实 harness 中训练智能体的路径。

7月31日周五
  1. Google Research62

    Google Research 提出 Science One Framework:用 Chain-of-Evidence 实现可验证的自主科研

    Google Research 提出 Chain-of-Evidence(CoE)可验证性框架,并据此构建自主科研原型 Science One Framework 与自动化审计指标 CoE Audit。

    推荐理由:原文给出可验证性框架与审计指标,并对比基线系统的引用幻觉率,读者可据此理解自主科研智能体的可信度问题。

7月30日周四
  1. Google DeepMind71

    Google DeepMind 发布 Gemini Robotics ER 2 具身推理模型

    Google DeepMind 发布 Gemini Robotics ER 2,定位为机器人的高层大脑,可理解物理世界、规划多步任务,并把动作执行交给底层 VLA 模型,还能原生调用 Google Search 等工具。

    推荐理由:官方给出 ER 2 在进度分类、时刻定位与多机器人协作上的具体指标,可据此判断机器人大脑的落地边界。

7月29日周三
  1. OpenAI News62

    GPT-5.6 如何兼顾前沿智能与效率

    OpenAI 发布文章说明 GPT-5.6 在模型、推理和智能体工作流上提升了 AI 效率,目标是让每一美元带来更多可用智能。文章标题强调 GPT-5.6 将前沿智能与前沿效率结合。

    推荐理由:OpenAI 官方解释 GPT-5.6 如何在模型、推理与智能体工作流上提升效率,读者可了解其单位成本智能的改进方向。

7月28日周二
7月27日周一
7月26日周日
  1. Berkeley AI Research35

    Berkeley AI Research 提出 ABBEL:用信念状态监督让 LLM 高效完成长程交互

    Berkeley AI Research 提出 ABBEL 框架,将 LLM 的交互摘要隔离为自然语言"信念状态"并对其内容进行监督评分,以缓解递归摘要带来的性能损失。在协作编程基准 CollabBench 上,采用重建式信念评分的 ABBEL-rec-BG 将相对全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 长度也低于全上下文设置。

7月23日周四
  1. Google Research62

    Google 发布 SymptomAI:面向日常症状评估的对话式 AI 智能体研究

    Google Research 发布论文 SymptomAI,用五个 Gemini Flash 2.0 症状问诊智能体开展 n=13,917 的全国随机研究,参与者向智能体描述症状并得到鉴别诊断(DDx)与后续建议。

    推荐理由:Google 用 13917 人随机对照研究比较五种 Gemini Flash 2.0 症状问诊智能体,并给出临床专家盲评与 Fitbit 生理信号对照结果。

7月22日周三