比 ACE 更省 Token:ALTK-Evolve 如何用按需检索替代全量注入
Hugging Face 的 ALTK-Evolve 与 ACE 同为无需更新权重的智能体记忆方案,区别在交付方式:ACE 每步注入完整 playbook,ALTK-Evolve 按任务检索少量高支持度 guideline。
Hugging Face 的 ALTK-Evolve 与 ACE 同为无需更新权重的智能体记忆方案,区别在交付方式:ACE 每步注入完整 playbook,ALTK-Evolve 按任务检索少量高支持度 guideline。
Mistral 宣布三项推进 AI 主权的举措:Mistral Regional Endpoints 正式可用,客户可选择推理在欧洲或美国运行;Mistral Priority Tier 进入公开预览,为关键业务负载提供自定义速率限制和带 SLA 的正常运行时间承诺。
推荐理由:Mistral 把区域推理、优先服务层级和第三方开源模型接入放进同一套基础设施,读者可据此判断主权 AI 的落地方式。
OpenAI CFO Sarah Friar 分享了打造 AI 原生财务团队的五条经验,涵盖自动化预测、更强的管控以及 AI 投资回报(ROI)。
NVIDIA 发布 Magpie TTS Multilingual,一个 364M 参数的开源权重语音合成模型,支持 12 种语言,新增现代标准阿拉伯语、韩语和巴西葡萄牙语,并通过更新训练数据提升了多种既有语言的质量。
推荐理由:原文给出 364M 开源权重模型的多语言扩展与 TTFA 实测数据,读者可据此判断自建语音链路的延迟与部署成本。
OpenAI 致信得克萨斯州州长 Greg Abbott,阐述其在得州负责任建设 AI 基础设施的承诺。信中表示支持可靠、透明的增长,让得州民众受益。
Import AI 第 468 期收录了智库 IFP 提出的 23 条政策建议,分属 7 个类别,用于帮助政策制定者应对 AI 研发自动化风险。MIT 与 Columbia 的论文 Racing to Ruin 用博弈模型分析企业竞速,认为透明度和对对手可信度的判断是能否实现协同放缓的关键。本期还介绍了 PostTrainBench+ 以及一篇关于智能机器与机器人身体的虚构短篇故事。
Model ML 借助 GPT-5.6 Sol 将金融工作从研究与分析一路推进到可编辑、可追溯的 PowerPoint 演示文稿和 Excel 工作簿。
Hugging Face 最新论文提出两项系统改动降低 LLM 知识蒸馏成本:离线缓存教师模型每位置的 top-100 logits,使教师无需与学生同时驻留显存;融合分块 KL 损失避免生成完整的词表×序列长度矩阵。
OpenAI 发布网络安全专用模型 GPT-5.6-Cyber,通过 Daybreak Red 提供,用于授权的漏洞研究、漏洞利用验证和安全测试。
推荐理由:OpenAI 推出网络安全专用模型并限定授权用途,读者可据此了解其能力边界与开放方式。
OpenAI 允许获批的 Daybreak 合作伙伴使用其前沿网络安全模型,为客户提供经授权、受治理的网络安全服务。
ChatGPT Business 新增 Premium 席位,用量提升至 5 倍,且取消五小时使用上限。该席位提供灵活的席位选项,供团队中每位成员按需选用。
Zapier 企业营销团队使用 ChatGPT Work 减少线索漏斗流失、构建营销活动素材并自动化报告。原文未披露具体模型版本、效率倍数或价格等细节。
Meta 发布开源多模态模型 Muse Glimmer,从 Muse 蒸馏至 30B 参数,采用 Apache 2.0 许可,面向本地智能体场景,可用于编码、文档分析和个人助手。
推荐理由:Meta 开源 30B 多模态模型并给出本地智能体部署路径,读者可据此判断本地化方案是否可行。
Virgin Atlantic 正借助 ChatGPT Work 加速研究、产品规划与决策,帮助团队打通客户旅程中的各类信号。
OpenAI 公布针对 Astra 的初步网络安全评估结果,并同步说明正在加强安全防护与管控措施。
HSP GRUPPE 借助 ChatGPT Enterprise 提升生产力、改善工作质量,并为税务咨询与客户服务释放更多产能。该案例展示了这家税务咨询机构如何围绕 ChatGPT Enterprise 构建自身的 AI 能力。
Google DeepMind 发布 WeatherNext AI 模型,在气旋路径、强度和风场结构预报上达到 SOTA,平均多出一天预报提前量,三天预报精度相当于此前模型的两天水平。
推荐理由:原文给出气旋路径与强度预报的领先幅度和开源范围,读者可据此判断气象预报的可用性变化。
OpenAI 在 ChatGPT 中推出改进版 GPT-5.6 Sol,准确性和一致性有所提升。同时,免费用户获得 GPT-5.6 Luna 的更大访问权限,可进行不限量的日常对话。
推荐理由:OpenAI 在 ChatGPT 中改进 GPT-5.6 Sol 并扩大 GPT-5.6 Luna 的免费用户访问,读者可据此了解可用范围变化。
OpenAI 与美国心理学会(APA)合作,推进循证指导、资源与防护措施,以支持 AI 在青少年心理健康领域的负责任使用。双方将围绕证据基础的指南、可用资源和安全保障展开工作。
OpenAI 发布 Signals 数据,展示全球用户使用 ChatGPT 的情况,并给出国家层面的采用率、使用趋势与行为变化洞察。数据呈现了人们从提问到实际完成任务的使用方式转变。
Baseten 正式加入 Hugging Face Hub 的 Inference Providers 生态,首批支持对话与文本生成任务,可调用 Kimi K3、DeepSeek V4 Flash、GLM-5.2 等热门开源权重 LLM。
OpenAI 就近期涉及 OpenAI 模型的第三方网络安全评估事件作出说明,并公布新的保障措施,以加强 AI 模型测试与评估。
Mistral AI 发布 Shieldstral,一个 3B 开源权重多模态安全分类器,以 Apache 2.0 许可开放下载。它把内容审核建模为策略自适应的问答任务,推理时用自然语言策略提问并输出校准后的安全分数,无需重新训练即可适配新策略,统一处理文本与图像。
推荐理由:3B 开源安全分类器把内容审核变成可推理时替换策略的问答任务,读者可据此判断小模型在审核场景的可用边界。
OpenAI 为 ChatGPT Work 和 Codex 推出全新教育插件,面向 K–12 教师、高校教育者与学生,用于学习、教学、研究和构建。
OpenAI 回应 Apple 提起的诉讼,称其指控毫无依据,并纠正了有关其员工的说法。OpenAI 同时公开了记录事件经过的沟通信息。
微软研究院发布开源框架 Orchard,核心是 Orchard Env 这一可复用的 Kubernetes 环境服务,支持软件工程、网页导航和个人助理等任务,并可直接在 Codex、OpenClaw、ZeroClaw 等真实部署 harness 中训练智能体。
推荐理由:微软研究院开源 Orchard 框架,公开环境服务、训练流程与数据,读者可据此了解小模型在真实 harness 中训练智能体的路径。
多伦多大学、Vector Institute、剑桥大学与ServiceNow的研究者构建了一个原型AI蠕虫,利用被攻陷机器的GPU运行开源权重LLM进行推理,自主发现漏洞并发起攻击,漏洞检测成功率约80%、利用成功率约53%、自我复制成功率88%,整体攻击成功率约37%。
OpenAI 披露其 GPT-Live 实时语音系统的构建过程,该系统采用无轮次(turnless)语音模型与低延迟架构,实现与 AI 的连续语音交互,让对话更快、更自然。
Circles 使用 OpenAI API 和 Codex 打造 AI 原生电信体验,使 ARPU 提升 22%、用户流失率降低 9%,并提升开发效率。
OpenAI 公布在数学与理论计算机科学长期未解问题上的新结果,涵盖几何、密码学和复杂度等方向。材料仅提供摘要,未给出具体问题、方法或数据。
推荐理由:OpenAI 公布数学与理论计算机科学十项进展,读者可了解其在几何、密码学与复杂度上的问题覆盖范围。
OpenAI 提出以全栈方式让先进 AI 更强、更便宜、更普及。该思路覆盖从底层到应用的完整链条,目标是提升能力的同时降低成本并扩大使用范围。
OpenAI 分享了其在安全、安保、透明度与内容溯源方面的实践,以支持欧洲的负责任 AI 治理。相关工作将随着 EU AI Act 的推进而继续。
Univé 借助 ChatGPT Enterprise 打造 AI 就绪的员工队伍,做法是结合领导层推动、负责任的治理与员工主导的创新,从而规模化地改变工作方式。
OpenAI 捣毁了一个位于柬埔寨的诈骗团伙,该团伙利用 ChatGPT 支持投资、情感、赌博和冒充类诈骗活动。
Google Research 提出 Chain-of-Evidence(CoE)可验证性框架,并据此构建自主科研原型 Science One Framework 与自动化审计指标 CoE Audit。
推荐理由:原文给出可验证性框架与审计指标,并对比基线系统的引用幻觉率,读者可据此理解自主科研智能体的可信度问题。
Hugging Face 博客指出,AI 的下一个真正约束不是智能而是利用率:GPU 按日历小时计费,产出却只按计算小时累积,两家 GPU 预算相当的公司会因硬件实际使用率而拉开差距。文章以航空业为类比,称即便集群 GPU 满载也可能浪费大部分潜力,因为 GPU 全天运行而需求并非如此,基础设施必须按峰值配置。
Google DeepMind 发布 Gemini Robotics ER 2,定位为机器人的高层大脑,可理解物理世界、规划多步任务,并把动作执行交给底层 VLA 模型,还能原生调用 Google Search 等工具。
推荐理由:官方给出 ER 2 在进度分类、时刻定位与多机器人协作上的具体指标,可据此判断机器人大脑的落地边界。
OpenAI 宣布下调 GPT-5.6 在 Luna 和 Terra 上的价格,并说明更高效的模型如何帮助企业规模化部署 AI 工作流。
推荐理由:OpenAI 下调 GPT-5.6 在 Luna 与 Terra 上的价格,读者可据此评估企业级 AI 工作流的部署成本变化。
avatarin 基于 OpenAI 的 GPT-Realtime 为山田电机(Yamada Denki)顾客提供 24/7 多语言支持。上线两周内,该智能体被 30,000 人使用,92% 的问卷反馈为正面评价。
Google DeepMind 发布新一代音乐生成模型 Lyria 3.5,并已在 Google Flow Music 中上线。官方称其在音乐性、歌词和人声质量上均有提升:可生成更丰富复杂的旋律结构,歌词的提示词遵循度和结构感知更好,人声更具表现力与情感细节、发音也更准确。用户还能更便捷地控制输出的节奏和时长。
推荐理由:官方给出 Lyria 3.5 在旋律、歌词、人声与创作控制上的具体改进方向,可据此判断音乐生成能力的变化。