跳到正文

#Agent

今日 2 条
7月21日周二
7月17日周五
  1. Google DeepMind74

    Google DeepMind 发布 Gemini 3.5 Flash Cyber 安全模型

    Google DeepMind 发布 Gemini 3.5 Flash Cyber,一款基于 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证和修补漏洞,在 CyberGym 等基准上以多次调用取得接近更大模型的表现。

    推荐理由:官方给出轻量安全模型在多个漏洞基准上的对比数据与受限开放方式,可据此判断专用小模型在代码安全场景的定位。

7月16日周四
  1. Hugging Face Blog88

    Hugging Face 披露 7 月安全事件:自主 AI 智能体驱动的入侵

    Hugging Face 披露本周检测到一起针对其部分生产基础设施的入侵,该事件由一套自主 AI 智能体系统端到端驱动,攻击者通过恶意数据集利用数据集处理中的远程代码加载器和模板注入两条代码执行路径,从处理节点升级到节点级访问、窃取云和集群凭证并横向移动至多个内部集群。

    推荐理由:Hugging Face 披露首起由自主 AI 智能体端到端驱动的入侵事件,并说明防御方在托管模型护栏受限时改用开源模型完成取证。

7月15日周三
  1. Hugging Face Blog85

    Thinking Machines 在 Hugging Face 发布 Inkling 多模态大模型及 Inkling-Small

    Thinking Machines 在 Hugging Face 发布 Inkling,一个约 1T 参数、支持 1M 上下文、原生接收图像文本音频输入的开源多模态 MoE 模型,同时发布 276B 总参数 12B 激活参数的 Inkling-Small。

    推荐理由:原文给出 Inkling 的架构细节、部署配置与基准对比,读者可据此判断这一开源多模态模型的落地门槛。

7月13日周一
  1. Google DeepMind28

    Google DeepMind 推出 Gemini 驱动的 ATL Saathi,助力印度 Atal Tinkering Labs

    Google DeepMind 在印度启动 ATL Saathi 试点,这是一款由 Gemini 驱动的 Web 应用,为 Atal Tinkering Labs 教育者提供 24/7 备课与培训助手。该工具基于 NotebookLM 整理 12 个核心模块内容,支持 10 个模块的项目生成,初期覆盖 8 种语言,底层采用 Gemini 3.5 Flash 模型。首批试点覆盖印度 100 所学校。

7月9日周四
  1. Mistral AI52

    Mistral Studio 上线 Prompts 与 Skills 管理系统

    Mistral AI 在 Studio 中推出 Prompts 和 Skills 管理系统,为每个提示词和技能提供版本化、归属和可追溯的单一记录。每个版本不可变,支持对比、回滚、分类标签和审计日志,非开发者也能编辑并即时测试,发布仍走企业已有的 CI/CD 流程。技能可作为 MCP 服务器直接从 Studio 调用,确保生产执行的是同一受治理资产,该功能现已向 Studio 客户开放。

  2. Google Research62

    Google 发布 SensorFM:面向可穿戴健康数据的通用基础模型

    Google Research 发布 SensorFM,一个从无标注可穿戴数据中学习的大型传感器基础模型,预训练语料超过一万亿分钟多模态信号,来自 500 万名同意参与者、100 多个国家和 20 多款 Fitbit 与 Pixel Watch 设备。

    推荐理由:Google 用一万亿分钟可穿戴数据预训练通用生理表征,并给出跨 35 项健康任务的泛化与标签效率证据。

7月7日周二
  1. Hugging Face Blog62

    微软在 Foundry Managed Compute 上线 Hugging Face 模型集合

    微软在 Build 2026 宣布 Foundry Managed Compute 及 Hugging Face 模型集合,将 Hugging Face 生态的开源权重模型以每周刷新的方式引入 Foundry 模型目录,可一键部署到托管 GPU 平台。

    推荐理由:微软把 Hugging Face 开源模型的部署运维层接进 Foundry,读者可据此判断开源模型进入企业生产环境的门槛变化。

  2. Hugging Face Blog75

    LeRobot v0.6.0 发布:世界模型策略、奖励模型与部署 CLI 闭环

    LeRobot v0.6.0 发布,围绕机器人学习闭环引入世界模型策略(VLA-JEPA、FastWAM、LingBot-VA)、新一批 VLA(GR00T N1.7、MolmoAct2、EO-1、EVO1、Multitask DiT)以及统一奖励模型 API(Robometer、TOPReward)。

    推荐理由:LeRobot v0.6.0 把世界模型策略、奖励模型与部署 CLI 串成闭环,读者可据此判断开源机器人学习栈的当前能力边界。

7月1日周三
  1. Hugging Face Blog38

    ScarfBench:面向企业级 Java 框架迁移的 AI 智能体基准测试

    Hugging Face 发布开源基准 ScarfBench,用于评估 AI 智能体在企业级 Java 跨框架迁移中的表现,涵盖 Spring、Jakarta EE、Quarkus 三大生态,包含 34 个应用、102 个框架实现和 204 个迁移任务。测试显示,即便最强智能体行为成功率也不足 10%,且 Claude Code 报告 30 个应用中 29 个构建成功,实际仅 22 个通过。

6月25日周四
  1. Google DeepMind78

    Google DeepMind 将 computer use 内置到 Gemini 3.5 Flash

    Google DeepMind 宣布 computer use 成为 Gemini 3.5 Flash 的内置工具,此前它仅作为独立的 Gemini 2.5 computer use 模型提供。

    推荐理由:原文说明 computer use 从独立模型并入 Gemini 3.5 Flash 主模型,并给出企业级安全护栏,读者可据此判断智能体跨平台自动化的可用边界。

6月24日周三
6月23日周二
  1. Mistral AI66

    Mistral 发布 OCR 4,支持边界框、块分类与置信度输出

    Mistral 发布 OCR 4,在提取文本之外新增边界框、块类型分类和逐页逐词置信度,支持 170 种语言,可单容器自托管部署。官方称独立标注者在 600+ 份文档的盲评中平均 72% 更偏好 OCR 4,并在 OlmOCRBench 上取得 85.20 的最高分。

    推荐理由:官方给出 OCR 4 的边界框、块分类与置信度输出,以及自托管和定价细节,便于判断其在 RAG 与智能体流程中的接入方式。

6月22日周一
  1. Hugging Face Blog62

    如何用本地模型免费分诊 OpenClaw 仓库的 issue 和 PR

    Hugging Face 博客分享了用本地模型加 agent harness 对 OpenClaw 仓库的 issue 和 PR 做实时分类分诊的方案,作者在 NVIDIA GB10 上运行 gemma-4-26b-a4b 和 qwen3.6-35b-a3b,通过受限的 reposhell 只读命令补充上下文后输出结构化标签。

    推荐理由:作者用本地模型加受限 shell 做 PR 分类的完整配方,含 330 行评测对比与吞吐数据,可迁移到其他分诊场景。

6月19日周五
  1. Hugging Face Blog41

    Hugging Face 提出 MosaicLeaks:深度研究智能体能否守住秘密?

    Hugging Face 发布 MosaicLeaks,用 1001 条多跳研究链评测深度研究智能体的隐私泄露风险,测试模型普遍泄露私有信息,且只训练任务性能会加剧泄露。其提出的 Privacy-Aware Deep Research(PA-DR)强化学习方法将严格链成功率从 48.7% 提升至 58.7%,同时把答案/全信息泄露从 34.0% 降至 9.9%。

6月18日周四
  1. Hugging Face Blog62

    Hugging Face 发布 agent-eval:用自有工具链评测开源模型的智能体能力

    Hugging Face 发布 agent-eval 评测工具,以 transformers 为案例,在 bare、clone、skill 三种层级下测量智能体完成任务所需的轮次、token 与错误率,而非只看最终答案。

    推荐理由:Hugging Face 用自建 harness 实测 transformers 的 CLI 与 Skill 改动,发现同一改动对大模型提速、对小模型反而拖慢甚至破坏正确率。

6月17日周三
  1. Hugging Face Blog88

    GLM-5.2 发布:面向长周期任务,支持 1M token 上下文

    智谱发布旗舰模型 GLM-5.2,主打长周期任务能力,首次在 1M token 上下文上稳定支撑长程工作,并采用 MIT 开源许可。新架构 IndexShare 让每 4 层稀疏注意力共享同一 indexer,在 1M 上下文下将每 token FLOPs 降低 2.9×,MTP 层改进使投机解码接受长度最高提升 20%。

    推荐理由:GLM-5.2 把 1M 上下文落到长周期编码任务上,并给出与闭源前沿模型的逐项对比,可据此判断开源模型在长程工程任务中的位置。

  2. Google DeepMind60

    Google DeepMind 与英国政府共建 AI 规划原型,目标将审批时间减半

    Google DeepMind 与英国政府、Google Cloud、Faculty 及 Barnet、Dorset、Camden 地方规划部门合作,开发一款基于 Gemini 的 AI 规划原型,目标是帮助审批人员将住户规划申请的决定时间缩短 50%。

    推荐理由:原文给出英国规划审批原型的目标、试点范围与上线时间,读者可据此判断 AI 介入公共服务的落地路径。

6月16日周二
  1. Google DeepMind62

    Google DeepMind 发布 AI Control Roadmap 与智能体安全技术框架

    Google DeepMind 发布 AI Control Roadmap,用于在 Google 内部构建和管理高级 AI 的防御纵深框架,将内部智能体视为可能未对齐的潜在内部威胁,并基于 MITRE ATT&CK 拆解攻击战术与技术。

    推荐理由:Google DeepMind 公开内部 AI 控制路线图,给出分级检测与响应机制,可供部署智能体的团队参考。

6月12日周五
6月11日周四
6月10日周三
6月9日周二
6月8日周一
  1. Hugging Face Blog66

    OpenEnv 转为委员会共管,成为智能体 RL 的开源环境协议层

    Hugging Face 宣布 OpenEnv 改由委员会协调,成员包括 Meta-PyTorch、Reflection、Unsloth、Modal、Prime Intellect、Nvidia、Mercor、Fleet AI、Microsoft、Hugging Face 和 RadixArk,项目迁至 huggingface/OpenEnv。

    推荐理由:OpenEnv 从单一项目转为多方共管的协议层,读者可据此判断开源智能体 RL 环境标准化的走向。

6月5日周五
6月4日周四
  1. Hugging Face Blog62

    Hugging Face 将 hf CLI 重构为面向智能体优化的 Hub 操作方式

    Hugging Face 重构官方命令行工具 hf CLI,使其同时适配人类用户和 Claude Code、Codex、Cursor 等编码智能体。CLI 通过环境变量自动识别智能体并切换输出格式,在复杂多步任务上,用 curl 或 Python SDK 的基线消耗的 token 最多是 hf CLI 的 6 倍。官方还提供可安装的 hf-cli skill,让智能体减少约 30% 的工具调用。

    推荐理由:官方给出 hf CLI 面向智能体重构的细节与基准数据,可据此判断智能体操作 Hub 的 token 成本差异。

6月2日周二
  1. Hugging Face Blog71

    H Company 发布 Holo3.1 计算机使用智能体模型家族

    H Company 发布 Holo3.1 计算机使用智能体模型家族,基于 Qwen 系列,覆盖 0.8B、4B、9B 和 35B-A3B 四种尺寸,并首次提供 FP8、Q4 GGUF 和 NVFP4 量化权重用于本地推理。

    推荐理由:原文给出 Holo3.1 在移动端、跨框架与量化本地部署上的具体提升,可据此判断计算机使用智能体的落地边界。

6月1日周一
  1. Hugging Face Blog62

    JetBrains 发布 Mellum2:12B 参数 MoE 模型

    JetBrains 发布 Mellum2,一个从零训练的 12B 参数 Mixture-of-Experts 模型,覆盖自然语言与代码,每个 token 仅激活 2.5B 参数,采用 Apache 2.0 许可。官方称其相比同规模模型推理速度超过 2 倍,可用于路由、RAG、摘要、子智能体和高吞吐编码场景,模型已在 Hugging Face 开放下载。

    推荐理由:JetBrains 给出 Mellum2 的参数量、激活规模与推理速度,读者可据此判断它在多模型系统中的定位。