Ideogram 发布 Ideogram 4.5,称可局部编辑图像而不影响其余部分
Ideogram 发布新模型 Ideogram 4.5,称其只修改用户指定的区域,其余画面保持不变,用于解决多次编辑后出现伪影的问题。该模型提供四档质量档位,单张价格从 0.8 美分到 22 美分,均为原生 2K 分辨率,目标场景包括产品摄影、室内设计、照片修复和图像内文字编辑。
Ideogram 发布新模型 Ideogram 4.5,称其只修改用户指定的区域,其余画面保持不变,用于解决多次编辑后出现伪影的问题。该模型提供四档质量档位,单张价格从 0.8 美分到 22 美分,均为原生 2K 分辨率,目标场景包括产品摄影、室内设计、照片修复和图像内文字编辑。
Amazon Quick Sight 发布层级筛选器,作者可在单个紧凑控件中提供最多五级的多层级筛选,替代多个独立筛选控件。该控件支持 Region → Sub-Region → Country → City 逐级下钻,也可在同一控件中混选不同层级,如同时选中整个国家与单个城市。
Instagram 宣布其独立剪辑应用 Edits 新增 AI“创作助手”,可调取账号的点赞、播放、留存和分享等数据,回答创作者关于趋势、视频表现差异和内容创意的开放式提问。该功能对创作者免费,用量超出后需购买 Meta One 订阅。
Airbnb 在秋季产品更新中首次推出 AI 搜索,用户可通过文字或语音提示查找房源,界面会基于偏好显示动态筛选条件,例如输入“baby”会自动给出婴儿床、游乐场、儿童书籍和玩具等选项。平台还用 AI 生成房源亮点摘要,并支持对心愿单房源进行 AI 对比。社交方面,用户可在地图上查看好友过往或即将进行的行程及其入住地点和体验,也可选择不分享自己的行程。
AI 智能体 Instinct 上线名为 Instinct Selections 的商品推荐功能,联合本地厨师、设计师、建筑师、旅行向导等提供餐饮、旅行、购物等领域的个性化清单。
DoorDash 宣布推出文本点餐 AI 智能体,用户可通过 Apple Messages 下单,例如发送“order my usual”即可被理解为常点的那份周五晚餐。该智能体支持指定菜品、请求本地推荐、搜索附近餐厅并给出购物车建议,还能发送推荐食物的照片,并在一次订单中处理多人不同的饮食偏好和数量。DoorDash 面向美国用户开放候补名单,同时宣布将在北加州部分餐厅测试配送无人机。
Shopify 发布建站工具 Canvas,商家通过与 AI 智能体 Sidekick 对话即可搭建店铺。Canvas 实时渲染店铺真实代码而非静态预览,商家可测试页面交互与动画,并查看不同屏幕尺寸下的效果;Sidekick 还会截图以便与商家看到同样的画面。Shopify 为此让 Sidekick 直接操作主题文件,并简化了主题架构,产品目前仍处于早期阶段。
AI2 发布 Olmo-core 3,这是其大语言模型开发框架的一次重大升级,重新设计了开放的 MoE 训练系统,目标是把 MoE 训练扩展到万亿参数规模并保持计算效率。
推荐理由:原文给出 MoE 训练栈的吞吐与显存实测数据,读者可据此判断万亿参数 MoE 训练的开源方案成熟度。
OpenAI 在 DevDay 上发布由 GPT-6 Astra 驱动的智能体 Dots,定位为可委派长周期知识工作的专业工具,目前仅面向每月 20 美元的 Pro 及以上订阅用户开放。
Anthropic 推出面向美国联邦和州级机构的 Claude for Government,该平台自 7 月起开放测试,运行在 FedRAMP High 环境。由于五角大楼禁用 Claude,该产品主要面向民事机构。机构可获得与企业客户相同的功能,按用量付费并设固定上限,管理员可按部门设置预算和模型访问权限,敏感操作需双人审批,聊天记录保留在机构设备上。
听力科技初创公司 Legato 宣布其 AI 助听眼镜 Legato Frames 正式开售,起售价 999 美元,面向轻中度听力损失的成年人。该眼镜把助听技术集成在镜腿中,用 AI 区分人声与背景噪音并放大语音,采用双扬声器定向传声,耳外几英寸处声音可降低 99%。
SpaceXAI 旗下 AI 百科 Grokipedia 发布 v0.3 更新,启用新 logo 并重新设计首页和实时编辑页。新首页新增精选文章、最多阅读文章列表和“最新编辑”追踪器,实时编辑页可同时查看更多近期改动。该站 2025 年 10 月下旬以 v0.1 上线,v0.2 于一个月后推出,此前曾停止更新逾三个月。
在 OpenAI DevDay 后的播客中,负责 Computer Use 产品与工程的 Ari Weinstein 和 API 产品负责人 Nikunj Handa 介绍了 Dots、GPT-6.1 Sol、Agents API 与 Decisions API 等发布。
OpenAI 在 Dev Day 上由 Sam Altman 宣布推出 Decisions API,可为 Luna 模型预设一组选项供其选择,例如图像分类类别或不同的智能体行为,从而在保留图像理解、多语言支持和安全防护的同时提升速度。
Google 在 Gemini 聊天中面向全球推出 Skills,即针对特定任务的详细提示词,AI 可协助撰写和优化,用户输入“/”加名称即可调用。Skills 格式源自 Anthropic,并作为开放标准提供,支持文本、PDF 和图片作为参考材料,Gemini 还能从历史对话生成 Skills 并在匹配时自动运行。
Meta 推出 Muse AI 智能体,称可帮用户发邮件、在线购物等,但需要用户信任 Meta 并交出信用卡信息。发布后 Meta 还宣布了类似 Tamagotchi 的 Muse Charm 设备,并陆续扩展小企业工具、企业平台、Mac 应用和智能眼镜端支持。汇总还提到 Muse 曾把一名 YouTuber 的地址发给陌生人、出现可被攻击者控制智能体的漏洞,以及亚马逊屏蔽该智能体等事件。
Google DeepMind 发布 SynthID Bio,将水印技术引入合成生物学,把不可感知的签名直接嵌入生物代码,使水印不仅能在数字模型上验证,也能在合成出的实体蛋白质上验证,同时实验室测试显示其生物功能未受影响。
推荐理由:SynthID 从图像音频扩展到合成生物学,读者可了解水印如何嵌入蛋白质序列与结构而不影响功能。
CoreWeave 宣布 NVIDIA Vera Rubin NVL72 系统搭配 Spectrum-X 102.4T 以太网在 CoreWeave Cloud 上可用,Cognition 成为首个在生产负载上运行该系统的客户。
推荐理由:材料给出 Vera Rubin NVL72 上线 CoreWeave 云及 Devin 实测吞吐数据,可据此判断智能体编码负载的算力供给变化。
Amazon Bedrock 在印度上线 Anthropic 的 Claude Opus 5、Claude Sonnet 5 和 Claude Haiku 4.5,通过印度地理跨区域推理让数据在印度境内处理。
Amazon Bedrock 现已在首尔和新加坡支持 Anthropic Claude 模型的区域内推理,首尔支持 Claude Opus 5 和 Claude Sonnet 5,新加坡支持 Claude Sonnet 5,通过 bedrock-runtime 端点调用。
GPT-6.1 Sol 现已在 Amazon Bedrock 正式可用,面向智能体编码、计算机使用和专业工作负载提供更强的推理能力。据 OpenAI 称,它在 DeepSWE v1.1 上以约五分之一的单任务成本达到 GPT-6 Astra 的水平,并比 GPT-6 Sol 的最佳成绩高出 6.4 个百分点。
推荐理由:原文给出 GPT-6.1 Sol 在 Bedrock 上的可用范围与成本对比,读者可据此判断智能体编码任务的性价比。
Simon Willison 用 GPT-6 Astra 构建了实验性工具 Photo Scrubber,可自动识别并模糊照片中的人脸。该工具基于 Google 的 MediaPipe C++ 库,通过 @mediapipe/tasks-vision 编译为 WebAssembly,并使用 BlazeFace 人脸检测模型,全部处理在本地完成。
微软研究院发布 Quine,一个面向生物学复杂性的 AI 研究系统,由生物世界模型和连接模型、科学工具、文献与实验人员的交互式 harness 两部分组成。该系统与 Broad Institute 合作用于胰腺导管腺癌研究,预测并优先排序数千种化合物,最高排名化合物在湿实验中产生了最大的经典态向基底态转变,从缩小化合物搜索空间到选出候选验证仅用一个周末。
推荐理由:微软研究院公开 Quine 的多模态生物世界模型与实验闭环设计,并给出胰腺癌化合物筛选的湿实验验证结果。
OpenAI 推出名为 dots 的主动式助手,可在复杂项目与日常任务中持续推进工作。dots 让用户在工作推进过程中保持掌控。
xAI 的 Grok 4.7 已在 Amazon Bedrock 上线,提供 500K token 上下文窗口和 low、medium、high、xhigh 四档可配置推理强度,通过跨区域推理配置在 bedrock-runtime 端点上提供服务,支持 Responses、Chat Completions 和 Converse API。
推荐理由:文章给出 Grok 4.7 在 Bedrock 上的接入方式与四档推理强度,读者可据此判断长任务智能体的成本与延迟取舍。
Simon Willison 用 Opus 5.5 开发了 Bluesky reply bot checker,可分析账号近期发帖的输入速度、发帖时间、互动模式等行为信号,识别疑似自动回复机器人。工具会展示每项测量与规则,便于验证判断依据,并给出触发信号最多的示例回复。它重点检测秒级跟帖回复、从不发布原创内容或图片链接、只回复高粉丝账号,以及含问号的回复等特征。
GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,只需指向一个 GitHub 仓库,它就会识别入口点、分析构建系统、编写 harness、运行 AFL++、读取覆盖率报告并改进 harness,最后对每个崩溃做分诊并生成漏洞报告。
推荐理由:GitHub Security Lab 把模糊测试的 harness 编写、覆盖率追踪与崩溃分诊交给 LLM 智能体,读者可据此判断自动化安全测试的边界。
Remedy Entertainment 的 CONTROL Resonant 在发售当日登陆 GeForce NOW,Ultimate 会员可以 GeForce RTX 5080 级性能串流,支持 NVIDIA DLSS 4、光线追踪、NVIDIA Reflex 与最高 5K HDR,无需 100GB 本地安装。
Google 发布 gemini-3.8-flash-tts 和 gemini-3.8-flash-lite-tts 两款文本转语音模型,提供超过 2000 种音色,并支持用 30 秒音频样本创建自定义音色。
Google Private AI Compute 团队公布为 Private AI Compute 平台引入私密的服务端持久记忆,让 AI 助手在跨设备场景下保留上下文,同时维持接近端侧的隐私标准。
推荐理由:Google 公开了云端持久记忆的隐私架构,读者可了解跨设备 AI 记忆如何在加密隔离环境中实现。
Simon Willison 发布 llm 0.36。该版本于 2026 年 9 月 22 日发布,具体更新内容未在原文中说明。
Simon Willison 发布 llm-anthropic 0.29。该版本属于其 llm 命令行工具生态下的 Anthropic 插件,具体更新内容原文未披露。
Simon Willison 发布 LLM 插件 llm-typesafe 0.1a0,为 TypeSafe AI 的新模型 Jev 提供支持,可通过 `llm install llm-typesafe` 安装并设置 API key 使用。
NVIDIA 在加拿大多伦多 ROSCon 大会上发布 Isaac ROS 5.0,这是一套基于 ROS 的 GPU 加速软件包集合,新增智能体工作流与平台支持,免费开源。
推荐理由:Isaac ROS 5.0 把智能体工作流引入机器人开发,并给出多家厂商的落地案例,可据此判断开源机器人栈的演进方向。
Hugging Face 为 transformers 加入 GGUF 支持,用户可从 Hub 选取量化检查点,通过 from_pretrained 传入 gguf_file 在本地生成,无需额外配置。
推荐理由:Hugging Face 官方给出在 transformers 中加载 GGUF 的具体方式与性能对比,读者可据此判断本地推理工作流是否值得迁移。
TypeSafe AI 上周发布 Jev,这是其称为 System One 模型的新类别,输入文本后不返回文本,而是返回类别、是/否问题、评分对应的浮点数及置信度。
Hugging Face 发布 tokenizers v1,输出 token ID、API、词表和 merge ranks 与 v0.23 保持一致,速度常达 v0.23 的数十倍。
Pawprint Studio 的开放世界捉宠 RPG《Aniimo》本周首发登陆 GeForce NOW,玩家无需等待 45GB 下载即可在 Steam Deck、新支持的 Firefox 浏览器等设备上串流游玩。
Hugging Face 发布 Workflow1111,用 Gradio Workflow 把 AUTOMATIC1111 的大部分功能重建为一张工作流画布,由 11 条媒体流水线和 73 个节点组成,覆盖文生图、高清修复、图生图、提示词矩阵、VLM 反推、检测生成 inpaint 掩码、ControlNet 风格标注器、背景移除、PNG Info 与图生视频。
推荐理由:Hugging Face 用 73 个节点复刻 A1111 全部功能,并给出与 ComfyUI 的路线对比,可看节点式工作流的新形态。
Google DeepMind 发布 AlphaGenome Atlas,一个包含人类基因组 90 亿个单核苷酸变异效应预测的平台,规模达 1PB,是 AlphaFold Database 的 30 多倍,已通过网站门户免费开放给学术研究使用。
推荐理由:DeepMind 把 AlphaGenome 的预测预计算成 1PB 全基因组图谱,读者可据此判断变异解读的门槛与规模变化。