跳到正文

全部动态

今日 35 条
4月22日周三
  1. OpenAI News62

    OpenAI 在 ChatGPT 中推出工作区智能体

    OpenAI 在 ChatGPT 中推出工作区智能体(workspace agents),由 Codex 驱动,可自动化复杂工作流并在云端运行。官方称其能帮助团队跨工具安全地扩展工作。

    推荐理由:官方给出 ChatGPT 工作区智能体的定位与云端运行方式,可据此判断团队自动化流程的形态。

  2. OpenAI News62

    OpenAI 发布 Privacy Filter 开放权重模型

    OpenAI 发布 Privacy Filter,一个用于检测和脱敏文本中个人身份信息(PII)的开放权重模型,官方称其准确率达到 state-of-the-art。目前公开信息仅有这一句摘要,未披露模型规模、许可协议或具体评测数据。

    推荐理由:OpenAI 开源 PII 检测模型,读者可了解其在文本脱敏场景的定位与开放权重形态。

4月21日周二
  1. OpenAI News62

    OpenAI 发布 ChatGPT Images 2.0

    OpenAI 发布 ChatGPT Images 2.0,改进了文字渲染、多语言支持和视觉推理能力。原文同时提到可查看 Images 2.5 的新变化。

    推荐理由:官方给出图像生成在文字渲染、多语言与视觉推理上的改进方向,可据此判断图像能力升级重点。

  2. Hugging Face Blog36

    AI 与网络安全的未来:为什么开放性至关重要

    Hugging Face 发文讨论 Mythos 与 Project Glasswing 发布后的 AI 网络安全格局,指出 Mythos 的漏洞发现与修补能力来自模型、算力、软件数据与自主性组成的系统配方,而非单一模型。文章认为开源代码与工具能通过分布式检测、验证、协调与补丁传播缩小攻防能力差距,并主张采用半自主 AI 智能体在人类控制下进行防御。

4月20日周一
  1. Berkeley AI Research42

    GRASP:面向世界模型的梯度规划器,让长时程规划更稳健

    伯克利 AI 研究团队提出 GRASP,一种面向学习型世界模型的梯度规划器,通过将轨迹提升到虚拟状态实现跨时间并行优化、在状态迭代上直接注入随机性以探索、并重塑梯度让动作获得清晰信号,同时避开高维视觉模型中脆弱的“状态-输入”梯度。该方法针对长时程规划中优化病态、非贪心结构导致的局部极小值以及高维潜空间失效模式等问题,使基于梯度的规划更稳健。

4月16日周四
  1. Google Research42

    Google 提出 Simula:用机制设计从第一性原理生成合成数据

    Google 提出推理优先的合成数据框架 Simula,无需种子数据,将生成过程拆解为全局多样化、局部多样化、复杂化和质量检查四个可控步骤。该框架用 Gemini 2.5 Flash 作教师模型、Gemma-3 4B 作学生模型,在网络安全、法律推理、GSM8k 和 Global MMLU 五个领域各生成最多 512K 数据点,完整系统在所有领域均优于简单基线。

  2. Google Research36

    Google Research 用 AI 合成神经元加速脑图谱绘制,重建误差降低 4.4%

    Google Research 提出神经元形态生成模型 MoGen,通过 PointInfinity 点云流匹配生成合成神经元形状,为 PATHFINDER 重建模型补充训练数据,使小鼠轴突重建误差降低 4.4%,主要来自合并错误的减少。在完整小鼠脑规模下,这相当于节省 157 人年的手动校对工作。MoGen 已开源,相关论文将在 ICLR 2026 展示。

  3. Hugging Face Blog33

    Ecom-RLVE:面向电商对话智能体的自适应可验证环境

    Hugging Face 将 RLVE 框架从单轮推理题扩展到多轮、工具增强的电商对话,推出 EcomRLVE-GYM,包含商品发现、替代品、购物车搭建、退货、订单跟踪、政策问答、组合规划、多意图旅程 8 个可验证环境,每个环境配有程序化出题、12 轴难度课程和算法可验证奖励。团队用 DAPO 训练 Qwen 3 8B 模型 300 步,早期结果显示环境扩展与自适应难度可迁移到真实智能体任务。

4月15日周三
  1. Hugging Face Blog39

    Hugging Face 发布 VAKRA:评测 AI 智能体推理、工具调用与失败模式的可执行基准

    Hugging Face 推出 VAKRA,一个面向企业级环境的工具调用可执行基准,用完整执行轨迹评估 AI 智能体的组合式推理能力。VAKRA 提供 8,000+ 本地托管 API、覆盖 62 个领域,任务需 3-7 步推理链,包含 API 链式调用、工具选择、多跳推理等四类任务,模型整体表现不佳。

  2. Hugging Face Blog62

    HCompany 发布 HoloTab:浏览器里的 AI 操作助手

    HCompany 发布 Chrome 扩展 HoloTab,把其 3 月 31 日推出的计算机操作模型 Holo3 直接接入浏览器,用户描述需求后由智能体在网页内导航界面、填写字段并做决策,无需配置或技术背景。HoloTab 支持例程功能:开始录制后实时捕捉用户在标签页中的点击与口述,录制结束即生成可重复运行或定时调度的例程。该扩展目前免费开放使用。

    推荐理由:HCompany 把自家 Holo3 计算机操作模型封装成浏览器扩展,读者可了解录制即生成例程的交互方式。

4月14日周二
4月13日周一
  1. Google DeepMind66

    Google DeepMind 发布 Gemini Robotics-ER 1.6,增强具身推理与仪表读数

    Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其推理优先机器人模型的升级版,强化了空间推理与多视角理解,并新增仪表读数能力,可读取压力表、液位计和数字读数。

    推荐理由:官方给出与上一代及 Gemini 3.0 Flash 的对比,并说明仪表读数等新能力如何落地机器人巡检。

4月10日周五
  1. OpenAI News15

    ChatGPT 如何服务营销团队

    OpenAI 介绍营销团队如何使用 ChatGPT 规划营销活动、创作内容、分析效果,并把洞察转化为行动。文章围绕实际 AI 工作流展开,未披露具体模型版本、参数或价格信息。