用 Amazon Bedrock AgentCore 构建环境智能体:从事件驱动信号到 human-in-the-loop 工作流
Amazon Bedrock AgentCore 支持构建响应事件流的 ambient agent:Amazon S3 文件上传或定时事件触发后,智能体在 AgentCore Runtime 上自动运行并分析内容,需要时通过单个 ask_human 工具暂停等待人工批准,再从中断处恢复。
Amazon Bedrock AgentCore 支持构建响应事件流的 ambient agent:Amazon S3 文件上传或定时事件触发后,智能体在 AgentCore Runtime 上自动运行并分析内容,需要时通过单个 ask_human 工具暂停等待人工批准,再从中断处恢复。
NVIDIA NeMo Agent Toolkit(NAT)可通过自定义 memory provider 接入 Amazon S3 Vectors,作为多智能体系统的持久化记忆层,并部署在 Amazon EKS 上。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展至开发者、企业和消费者,起步价每百万输入 token 2 美元、输出 token 10 美元。
推荐理由:官方给出 Argon 在编码、企业知识与网络安全上的基准成绩和分阶段开放方式,可据此判断前沿模型的能力边界与落地节奏。
Amazon Bedrock Knowledge Bases 现可通过 AgenticRetrieveStream API 用自然语言查询理赔文档,支持多轮追问、按 claim ID 和 claim type 等元数据过滤检索,并返回带引用的答案。
AWS 官方博客演示如何在 Amazon Bedrock AgentCore Runtime Instances 上部署三智能体音乐制作流水线:作曲智能体用 Claude Sonnet 4.6 生成音乐简报并在实例自带的 NVIDIA L4 上运行 ACE-Step 渲染音频。
推荐理由:AWS 官方给出三智能体共享 GPU 实例的完整代码与实测耗时,可迁移到其他长时多智能体流水线。
CoreWeave 宣布 NVIDIA Vera Rubin NVL72 系统搭配 Spectrum-X 102.4T 以太网在 CoreWeave Cloud 上可用,Cognition 成为首个在生产负载上运行该系统的客户。
推荐理由:材料给出 Vera Rubin NVL72 上线 CoreWeave 云及 Devin 实测吞吐数据,可据此判断智能体编码负载的算力供给变化。
GPT-6.1 Sol 现已在 Amazon Bedrock 正式可用,面向智能体编码、计算机使用和专业工作负载提供更强的推理能力。据 OpenAI 称,它在 DeepSWE v1.1 上以约五分之一的单任务成本达到 GPT-6 Astra 的水平,并比 GPT-6 Sol 的最佳成绩高出 6.4 个百分点。
推荐理由:原文给出 GPT-6.1 Sol 在 Bedrock 上的可用范围与成本对比,读者可据此判断智能体编码任务的性价比。
Amazon Quick 的提示词工程决定其 AI 功能对自然语言请求的响应质量。官方给出核心原则:以具体细节替代模糊表述、补充业务上下文、用示例而非描述来定义输出格式,并提供 CRISPE 结构化框架用于复杂请求。
AWS 发文拆解 Amazon Quick 各组件的提示词写法:Quick Research 需明确目标、受众与时间范围,并自行拆解子问题、限定来源(Quick Index。
针对 RAG 只能检索 top-k 文本块、无法跨数百份合同做聚合的问题,AWS 给出了一套合同智能平台架构:用 Claude Sonnet 系列模型做 AI 提取智能体,从每份 PDF 中抽取 8 个关键字段并附置信度,再由 Claude Haiku 驱动的验证智能体独立复核,签名识别分歧时由 Amazon Textract 用计算机视觉做确定性裁决。
Hugging Face 博客介绍论文 ProvenanceGuard,一种面向 MCP 智能体的生成后验证层,可在不重训智能体的前提下读取 MCP 调用轨迹,逐条核查答案中的声明是否由所标注来源支持,并输出逐条来源判定与整体放行或拦截决定。在医疗智能体的 281 条真实轨迹上,专家判定应拦截的 139 条声明中它拦下 138 条,来源识别准确率约 86%,在四项对比检查器中得分最高。
OpenAI 发布 GPT-6.1 Sol,官方称其在编码、电脑操作和专业工作上接近 Astra 的智能水平,标准 API 输入与输出 token 价格仅为 Astra 的五分之一。
推荐理由:官方给出 GPT-6.1 Sol 的定位与定价对比,读者可据此判断它在编码和电脑操作任务上的成本取舍。
OpenAI 发布 DevDay 2026 回顾,汇总了 20 多项发布,涵盖 GPT-6 Astra、ChatGPT、Codex、API、安全以及面向开发者的新工具。
OpenAI 推出名为 dots 的主动式助手,可在复杂项目与日常任务中持续推进工作。dots 让用户在工作推进过程中保持掌控。
xAI 的 Grok 4.7 已在 Amazon Bedrock 上线,提供 500K token 上下文窗口和 low、medium、high、xhigh 四档可配置推理强度,通过跨区域推理配置在 bedrock-runtime 端点上提供服务,支持 Responses、Chat Completions 和 Converse API。
推荐理由:文章给出 Grok 4.7 在 Bedrock 上的接入方式与四档推理强度,读者可据此判断长任务智能体的成本与延迟取舍。
微软亚洲研究院新加坡分院(MSRA – Singapore)作为微软在东南亚的首个研究实验室,成立一年来聚焦下一代 AI 模型与智能体系统、领域专用 AI、AI 原生研究实践及生态与人才培养四大方向。该实验室与新加坡医疗生态伙伴合作推进多模态医疗 AI 和自进化诊断智能体,并联合 EDB 于 2026 年 2 月举办物流与交通 AI 高管圆桌会。
AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上可用,定位为面向编码与知识工作的更高效 Sonnet 模型,多数任务单任务成本更低、速度更快。
推荐理由:原文给出 Sonnet 5.5 在 Bedrock 上的能力定位与调用方式,读者可据此判断它与 Opus 5.5 的分工。
AWS 介绍了一种基于 Amazon Nova Act 和 Amazon Bedrock AgentCore 的智能体驱动合成监控方案,用自然语言动作替代 Selenium、Playwright 的 DOM 选择器脚本。
H 公司发布 Holo4 系列智能体模型,包含 27B 稠密版和 35B-A3B MoE 版,两者均已上线 H Models API,权重以 BF16、FP8、NVFP4 和 4-bit GGUF 格式开源在 Hugging Face。
推荐理由:Holo4 同时开源权重与全部评测轨迹,读者可据此判断通用计算机操作智能体的成本与能力边界。
GitHub Copilot 应用中的 canvas 是一种可自定义界面,用户只需在 agent 会话中输入 /create-canvas 并用自然语言描述工作流,agent 即可生成看板、发布清单或仪表盘等界面。
GitHub Copilot 提出用 canvas 替代 chat 作为与 AI 交互的主要界面:canvas 是运行在 GitHub Copilot app 内的全栈应用,可与 agent 双向通信,也能调用第三方 API 或在本地执行代码。
Google Research 发布 AI video co-director 研究,这是一个构建在 Gemini 和 Veo 之上的多智能体编排框架,用于生成多镜头连贯的长视频。
推荐理由:Google 把长视频生成拆成四个协同框架,并给出多镜头一致性与角色保持的评测结果,可了解其技术路线。
GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,只需指向一个 GitHub 仓库,它就会识别入口点、分析构建系统、编写 harness、运行 AFL++、读取覆盖率报告并改进 harness,最后对每个崩溃做分诊并生成漏洞报告。
推荐理由:GitHub Security Lab 把模糊测试的 harness 编写、覆盖率追踪与崩溃分诊交给 LLM 智能体,读者可据此判断自动化安全测试的边界。
Google Private AI Compute 团队公布为 Private AI Compute 平台引入私密的服务端持久记忆,让 AI 助手在跨设备场景下保留上下文,同时维持接近端侧的隐私标准。
推荐理由:Google 公开了云端持久记忆的隐私架构,读者可了解跨设备 AI 记忆如何在加密隔离环境中实现。
NVIDIA 在新加坡 AI Day 上联合合作伙伴展示东南亚 AI 进展,新加坡 HTX 正基于 Nemotron 3 Super 和 Nemotron 3 Nano Omni 模型研究公共安全 AI。
NVIDIA 在加拿大多伦多 ROSCon 大会上发布 Isaac ROS 5.0,这是一套基于 ROS 的 GPU 加速软件包集合,新增智能体工作流与平台支持,免费开源。
推荐理由:Isaac ROS 5.0 把智能体工作流引入机器人开发,并给出多家厂商的落地案例,可据此判断开源机器人栈的演进方向。
NVIDIA 提出 AI 安全是工程问题,需在 Agent 栈每一层落实可执行边界、明确责任人和验证证据。其开源安全运行时 NVIDIA OpenShell 在智能体可控范围之外强制执行策略并提供沙箱执行,Cisco DefenseClaw 在其上增加治理层,JFrog 则集成 OpenShell 扫描并校验智能体技能。
GitHub Podcast 最新一期拆解了五个 AI 热门论断:AI 生成的代码仍需阅读和负责,但审查力度应按风险分级;Skills 与 MCP 解决不同问题,前者是打包的 Markdown 经验,后者是智能体连接工具与数据的标准,二者可组合使用;RAG 并未死亡,检索能让模型从更接近答案的位置起步,减少 token 浪费和不完整回答。
Google Research 公布一项研究实验,让教师借助生成式 UI(GenUI)为课程目标动态生成互动式学习模拟,并发布 30 多个面向中学 STEM 的英文示例库,覆盖物理、化学、生物和数学。
GitHub 用 GitHub Copilot app 和 Copilot CLI 把 Copilot agent runtime 从 TypeScript 完全重写为超过 80 万行生产级 Rust,AI 智能体写了其中大部分代码,跨 128 个 PR 增量合入 main 而非一次性切换。
推荐理由:作者以亲历者身份给出把 80 万行运行时从 TypeScript 迁到 Rust 的完整工程细节,可迁移到大规模 Agent 协作开发。
Mistral 宣布与 Mozilla 达成合作,Firefox 的 AI 浏览助手 Smart Window(beta)由 Mistral 模型驱动,先面向法国和北美用户,英国和德国预计今年晚些时候跟进。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时对话模型,前者面向规模与成本效率,后者面向高复杂度任务与多步推理。
推荐理由:两款语音对话模型同时发布,给出语音智能体基准成绩与开发者接入路径,可据此判断实时语音 Agent 的当前水位。
IBM Research 在 Hugging Face 博客介绍 ALTK-Evolve 新增的一致性指南与 Consistency Analyzer,用于衡量并改善智能体重复运行同一任务时的稳定性。
推荐理由:原文提出用 Pass^k 衡量智能体重复运行的一致性,并给出把一致性差距减半的检测与改进方法。
GitHub 日本和韩国区营销负责人把活动运营流程交给 GitHub Copilot,用 GitHub Issue 表单、标签和 Actions 搭建自动化流水线,活动从单个 Issue 自动完成建站、UTM 链接生成、报名者筛选和收尾清理。
Google Research 提出 ToolGrad,一种“先答案后问题”的工具调用数据生成范式:先生成真实工具调用链,再反推对应用户提示,只需一步 LLM 调用。
GitHub Copilot 应用内置 diff、终端和浏览器三个面板,让开发者无需离开应用即可审查、运行并预览 AI 智能体生成的代码改动。diff 面板以绿色和红色高亮显示新增、删除或修改的行,支持接受改动、留言或让 Copilot 继续修改;终端面板可直接运行项目命令,浏览器面板则通过 Pick & Polish 工具选中页面元素并让智能体调整。
Mistral 帮助一家欧洲能源运营商将 4 万行 Fortran 77 迁移至 C++,目标是一个无测试套件、无集中文档的物理储层模拟器。团队先构建数值一致性校验框架,再用 Vibe CLI 调度上百个智能体解析调用树并生成文档,最终采用人工监督 coder、tester、reviewer 智能体的工作流逐模块迁移。
GitHub 发布研究预览 Project HydraFusion,在 GitHub Copilot CLI 中通过运行时编排多个提供商的模型,自动选择 Single、Cascade、Critique 三种执行模式来平衡质量、成本与延迟。
推荐理由:GitHub 官方给出多模型编排的三种执行模式与三项基准的成本质量对比,可据此判断路由式编排在编码任务上的取舍。
GitHub Copilot 应用支持同时运行多个智能体会话,每个会话运行在独立的 Git worktree 上,互不干扰且各自保留上下文,可随时切换并从中断处继续。用户可在 sessions 视图中查看各会话标题与任务进度,例如在同一项目中并行完成 funded sort 功能开发、无障碍审查和测试运行。
Hugging Face 发布 funes,一个面向 Claude Code、Codex、pi 和 Hermes 的持久记忆层,从本机已有会话构建索引,一条命令即可接入。
推荐理由:Hugging Face 官方发布的本地记忆层,给出安装命令与检索管线细节,可判断跨 Agent 记忆的落地方式。