如何在 AWS 上为 Claude Platform 配置多环境访问
AWS 博客给出 Claude Platform on AWS(CPonAWS)多环境访问的完整实现方案,采用专用 AI Services 账户承载订阅与工作区,形成付款账户、AI Services 账户、工作负载账户的三账户结构。
AWS 博客给出 Claude Platform on AWS(CPonAWS)多环境访问的完整实现方案,采用专用 AI Services 账户承载订阅与工作区,形成付款账户、AI Services 账户、工作负载账户的三账户结构。
Amazon Bedrock AgentCore 支持构建响应事件流的 ambient agent:Amazon S3 文件上传或定时事件触发后,智能体在 AgentCore Runtime 上自动运行并分析内容,需要时通过单个 ask_human 工具暂停等待人工批准,再从中断处恢复。
Amazon Payments 在 Amazon SageMaker AI 上用多目标上下文多臂 bandit(LinUCB)做产品获客漏斗个性化,七周线上 A/B 测试中,一个人群最终漏斗转化率获得高个位数百分比相对提升,另一人群则未见改善,问题出在内容而非模型。
NVIDIA NeMo Agent Toolkit(NAT)可通过自定义 memory provider 接入 Amazon S3 Vectors,作为多智能体系统的持久化记忆层,并部署在 Amazon EKS 上。
DeepSeek 与华为合作,为华为昇腾芯片打造开源编程工具,核心是 TileLang 语言,DeepSeek 称其编程模型比 CUDA 更简单。发布内容还包括计算库和芯片间数据传输库,双方还优化了由 128 颗昇腾 950 芯片组成的超级节点。TileLang 最初由北京大学研究人员开发,DeepSeek 已使用约一年,目前是其 AGI 工作的主要工具。
柏林初创公司 Restate 完成 2000 万美元 A 轮融资,由 Singular 领投,Redpoint Ventures 和 Capital One Ventures 参投。Restate 提供持久化工作流执行引擎,自建存储、复制与冗余层,已签下多个六位数和七位数客户合同,客户包括 vibe-coding 平台 Replit。新资金将用于组建市场团队、扩充工程师并扩展旧金山湾区办公室。
Cerebras Systems CEO 兼联合创始人 Andrew Feldman 将在 TechCrunch Disrupt 2026 的 Disrupt Stage 发表“Can AI Keep Scaling?
Destro 结束隐身模式并获得 800 万美元种子轮融资,其 AI 智能体层让机器人在物流场景中作业,同时指挥人类工人,而非自研机器人本体。
uniopen 通过 Amazon SageMaker AI 对 Amazon Nova 2 Lite 进行监督微调,并做提示词级输出优化,使其适配自身零售审核策略。在 737 个对话窗口的留出测试集上,基线模型 Per Behavior Macro F1 为 0.5852。方案将纠错数据、训练、评估与部署纳入同一套可重复流程,人工复核仍是模糊案例和训练数据的必要环节。
AI2 发布 Olmo-core 3,这是其大语言模型开发框架的一次重大升级,重新设计了开放的 MoE 训练系统,目标是把 MoE 训练扩展到万亿参数规模并保持计算效率。
推荐理由:原文给出 MoE 训练栈的吞吐与显存实测数据,读者可据此判断万亿参数 MoE 训练的开源方案成熟度。
Anthropic 推出面向美国联邦和州级机构的 Claude for Government,该平台自 7 月起开放测试,运行在 FedRAMP High 环境。由于五角大楼禁用 Claude,该产品主要面向民事机构。机构可获得与企业客户相同的功能,按用量付费并设固定上限,管理员可按部门设置预算和模型访问权限,敏感操作需双人审批,聊天记录保留在机构设备上。
NVIDIA 提出 AI 工厂投资回报取决于三个要素:每兆瓦产出能力、硬件使用寿命和 token 需求。SemiAnalysis AgentX 数据显示,Vera Rubin NVL72 每兆瓦吞吐量比 GB300 NVL72 高 30 倍以上,在 DeepSeek V4 Pro 上每百万 token 成本低至 45 倍。
由前 Google 云业务、SpaceX Starlink 工程师 Rama Afullo 联合创办的 Satlyt 完成 800 万美元种子轮,由休斯顿 Non Sibi Ventures 领投,用于为卫星打造可在轨运行 AI 模型的软件。
硬件设计 AI 工具公司 Flow Engineering 完成 5000 万美元 B 轮融资,估值达 7.5 亿美元,由 Valor Equity Partners 的 Antonio Gracias 与 Atreides Management 的 Gavin Baker 联合领投,红杉资本参投。
微软研究院开发了一套端到端机器学习流水线,利用 L1 太阳风观测、AE 与 Dst 指数预报及变电站所在地的纬度与地质电导率数据,为美国本土 66,935 座变电站生成 30 至 60 分钟前的局地风险估计。
Amazon Bedrock Knowledge Bases 现可通过 AgenticRetrieveStream API 用自然语言查询理赔文档,支持多轮追问、按 claim ID 和 claim type 等元数据过滤检索,并返回带引用的答案。
AWS 官方博客演示如何在 Amazon Bedrock AgentCore Runtime Instances 上部署三智能体音乐制作流水线:作曲智能体用 Claude Sonnet 4.6 生成音乐简报并在实例自带的 NVIDIA L4 上运行 ACE-Step 渲染音频。
推荐理由:AWS 官方给出三智能体共享 GPU 实例的完整代码与实测耗时,可迁移到其他长时多智能体流水线。
CoreWeave 宣布 NVIDIA Vera Rubin NVL72 系统搭配 Spectrum-X 102.4T 以太网在 CoreWeave Cloud 上可用,Cognition 成为首个在生产负载上运行该系统的客户。
推荐理由:材料给出 Vera Rubin NVL72 上线 CoreWeave 云及 Devin 实测吞吐数据,可据此判断智能体编码负载的算力供给变化。
Amazon Bedrock 在印度上线 Anthropic 的 Claude Opus 5、Claude Sonnet 5 和 Claude Haiku 4.5,通过印度地理跨区域推理让数据在印度境内处理。
Amazon Bedrock 现已在首尔和新加坡支持 Anthropic Claude 模型的区域内推理,首尔支持 Claude Opus 5 和 Claude Sonnet 5,新加坡支持 Claude Sonnet 5,通过 bedrock-runtime 端点调用。
GPT-6.1 Sol 现已在 Amazon Bedrock 正式可用,面向智能体编码、计算机使用和专业工作负载提供更强的推理能力。据 OpenAI 称,它在 DeepSWE v1.1 上以约五分之一的单任务成本达到 GPT-6 Astra 的水平,并比 GPT-6 Sol 的最佳成绩高出 6.4 个百分点。
推荐理由:原文给出 GPT-6.1 Sol 在 Bedrock 上的可用范围与成本对比,读者可据此判断智能体编码任务的性价比。
针对 RAG 只能检索 top-k 文本块、无法跨数百份合同做聚合的问题,AWS 给出了一套合同智能平台架构:用 Claude Sonnet 系列模型做 AI 提取智能体,从每份 PDF 中抽取 8 个关键字段并附置信度,再由 Claude Haiku 驱动的验证智能体独立复核,签名识别分歧时由 Amazon Textract 用计算机视觉做确定性裁决。
Condé Nast 联合 AWS 生成式 AI 创新中心,基于 Amazon Bedrock 和 Amazon OpenSearch Service 构建多模态视频检索方案,并选用 TwelveLabs Marengo 嵌入模型联合编码画面、音频与转录文本。
HPE 提出企业应从按 token 消费转向自建 AI 容量,当需求稳定且规模足够时,拥有容量的单位成本可能低于逐次购买。Deloitte 2026 企业 AI 报告显示,2025 年员工 AI 使用率上升 5%,至少 40% AI 项目投产的公司比例预计半年内翻倍。企业需按实际工作负载测算交叉点,并通过采用、治理和用例扩展保持容量产出。
xAI 的 Grok 4.7 已在 Amazon Bedrock 上线,提供 500K token 上下文窗口和 low、medium、high、xhigh 四档可配置推理强度,通过跨区域推理配置在 bedrock-runtime 端点上提供服务,支持 Responses、Chat Completions 和 Converse API。
推荐理由:文章给出 Grok 4.7 在 Bedrock 上的接入方式与四档推理强度,读者可据此判断长任务智能体的成本与延迟取舍。
AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上可用,定位为面向编码与知识工作的更高效 Sonnet 模型,多数任务单任务成本更低、速度更快。
推荐理由:原文给出 Sonnet 5.5 在 Bedrock 上的能力定位与调用方式,读者可据此判断它与 Opus 5.5 的分工。
AWS 发布教程,演示如何用 vLLM-Omni DLC 在 Amazon SageMaker AI 上部署 Qwen3-TTS,通过 SageMaker 双向流式连接实现文本流入、24 kHz PCM 音频分块流出,并配 Gradio 应用试用。
AWS 发布教程,演示在 SageMaker AI 上用同一个 vLLM-Omni DLC 镜像部署两个端点:实时端点跑 FLUX.2-klein-4B 生成图像,异步端点跑 Wan2.1-VACE-1.3B 做图像条件视频生成。文本提示词先生成 PNG,再连同运动提示词送入视频端点,生成的 MP4 存入 Amazon S3,示例提供 CLI 与 Streamlit 界面。
Mistral 在慕尼黑开设德国中心,组建专注 Physics AI 与工业 AI 的研究团队,并计划到 2030 年建成 1 吉瓦欧洲算力。该中心将与 BMW 合作碰撞仿真与工程 AI、与 Siemens Energy 合作工业 AI 应用,并与慕尼黑工业大学(TUM)合作利用风洞设施开发汽车空气动力学数字孪生。Mistral 强调其开放权重架构让模型可在客户自有基础设施上运行,数据不出组织。
AWS 介绍了一种基于 Amazon Nova Act 和 Amazon Bedrock AgentCore 的智能体驱动合成监控方案,用自然语言动作替代 Selenium、Playwright 的 DOM 选择器脚本。
H 公司发布 Holo4 系列智能体模型,包含 27B 稠密版和 35B-A3B MoE 版,两者均已上线 H Models API,权重以 BF16、FP8、NVFP4 和 4-bit GGUF 格式开源在 Hugging Face。
推荐理由:Holo4 同时开源权重与全部评测轨迹,读者可据此判断通用计算机操作智能体的成本与能力边界。
Simon Willison 在 WeAreDevelopers World Congress North America 的主题演讲中,按时间线梳理了 2026 年 LLM 的关键进展。
Liquid AI 发布实验性 DSpark 草稿模型 LFM2.5-VL-DSpark,为视觉语言模型 LFM2.5-VL-3B 加入投机解码路径,解码最高提速 3.13x(端侧)和 2.66x(H100),端到端最高提升 2.62x 和 2.27x。
Remedy Entertainment 的 CONTROL Resonant 在发售当日登陆 GeForce NOW,Ultimate 会员可以 GeForce RTX 5080 级性能串流,支持 NVIDIA DLSS 4、光线追踪、NVIDIA Reflex 与最高 5K HDR,无需 100GB 本地安装。
GitHub Copilot 应用重建了 pull request 视图,以应对含 2,200 个文件、超百万行改动和 400 多条行内评论的超大 PR。其做法是把文档高度拆成确定性的代码几何与动态评论块两套体系,评论高度按需测量并锚定到文件、行与侧,避免滚动跳变。
微软研究院对移动操作机器人工作负载做了系统性测量,发现把物理 AI 推理从机载 GPU 卸载到边缘或云端 GPU 可提升任务表现。
推荐理由:微软研究院系统测量了机器人端侧推理与卸载到边缘或云端 GPU 的差异,并给出可复用的 Kubernetes 卸载工具链。
Google Private AI Compute 团队公布为 Private AI Compute 平台引入私密的服务端持久记忆,让 AI 助手在跨设备场景下保留上下文,同时维持接近端侧的隐私标准。
推荐理由:Google 公开了云端持久记忆的隐私架构,读者可了解跨设备 AI 记忆如何在加密隔离环境中实现。
Simon Willison 发布 llm 0.36。该版本于 2026 年 9 月 22 日发布,具体更新内容未在原文中说明。
NVIDIA 在加拿大多伦多 ROSCon 大会上发布 Isaac ROS 5.0,这是一套基于 ROS 的 GPU 加速软件包集合,新增智能体工作流与平台支持,免费开源。
推荐理由:Isaac ROS 5.0 把智能体工作流引入机器人开发,并给出多家厂商的落地案例,可据此判断开源机器人栈的演进方向。
TypeSafe AI 上周发布 Jev,这是其称为 System One 模型的新类别,输入文本后不返回文本,而是返回类别、是/否问题、评分对应的浮点数及置信度。