Hugging Face 提出 MosaicLeaks:深度研究智能体能否守住秘密?
Hugging Face 发布 MosaicLeaks,用 1001 条多跳研究链评测深度研究智能体的隐私泄露风险,测试模型普遍泄露私有信息,且只训练任务性能会加剧泄露。其提出的 Privacy-Aware Deep Research(PA-DR)强化学习方法将严格链成功率从 48.7% 提升至 58.7%,同时把答案/全信息泄露从 34.0% 降至 9.9%。
Hugging Face 发布 MosaicLeaks,用 1001 条多跳研究链评测深度研究智能体的隐私泄露风险,测试模型普遍泄露私有信息,且只训练任务性能会加剧泄露。其提出的 Privacy-Aware Deep Research(PA-DR)强化学习方法将严格链成功率从 48.7% 提升至 58.7%,同时把答案/全信息泄露从 34.0% 降至 9.9%。
Google DeepMind 发布 AI Control Roadmap,用于在 Google 内部构建和管理高级 AI 的防御纵深框架,将内部智能体视为可能未对齐的潜在内部威胁,并基于 MITRE ATT&CK 拆解攻击战术与技术。
推荐理由:Google DeepMind 公开内部 AI 控制路线图,给出分级检测与响应机制,可供部署智能体的团队参考。
OpenAI 推出 Deployment Simulation,通过真实对话数据在模型部署前预测其行为,以提升安全性和评估准确性。该方法旨在让发布前的模型行为预测更贴近实际部署场景。
英国 AI Security Institute 对齐团队与 Timaeus 联合成立非营利研究机构 Sequent,目标两三年内扩至 40-80 名全职员工,初期拟募资 1 亿至 1.5 亿美元,研究方向包括可扩展监督、学习理论、启发式论证、博弈论与 personas。
Google Research 在 AISTATS 2026 提出 Regularized f-Divergence Kernel Tests,用相对距离检验判断遗忘后的模型在分布上更接近安全重训模型还是原始受损模型。
OpenAI 发布新报告,披露与中国相关的账号利用 AI 影响美国技术议题,涉及数据中心叙事、关税以及对 ChatGPT 的不实说法。
推荐理由:OpenAI 官方披露与中国相关的账号利用 AI 影响美国技术议题,读者可了解平台方如何界定此类行动。
Google DeepMind 联合 Schmidt Sciences、Cooperative AI Foundation、ARIA 发起最高 1000 万美元的多智能体 AI 安全研究资助,Google.org 提供支持。
伦敦国王学院、复旦大学与 Alan Turing Institute 构建了 SocioHack 基准,包含 72 个沙盒社会环境,测试 AI 在信用卡积分、学校成绩等场景中"钻制度空子"的能力,RL 训练的 LLM 能以 61.25% 召回率和 90.85% 精确率重新发现历史上已被修补的漏洞策略。
OpenAI 发布“Built to benefit everyone: our plan”,阐述其对 AI 未来的愿景,聚焦可及性、安全与共同繁荣,目标是确保 AGI 惠及所有人。
NVIDIA 发布 Nemotron 3.5 Content Safety,基于 Gemma 3 4B IT 微调,把多模态输入、多语言覆盖、自定义企业策略执行和可审计推理整合进一次推理调用。
OpenAI 发布《智能时代的生物防御》行动计划,提出面向 AI 驱动的生物韧性建设方案。该计划聚焦利用 AI 能力应对生物安全风险,具体措施与实施细节尚未在文中展开。
OpenAI 呼吁就青少年 AI 安全采取全球行动,并提出设立一个国际机构,以加强针对青少年的防护措施、标准与机会。
Import AI 459 讨论了 AI 监管的困难、蛋白质折叠模型的缩放定律,以及为 AI 系统灭绝风险定价。弗吉尼亚大学、Anthropic 和加拿大银行的经济学家估算,2025 年美国名义 AI GDP 约 2500 亿美元,质量调整后实际年增速约 2600%;美国 AI 算力支出从 2023 年 370 亿美元增至 2025 年 2190 亿美元。
OpenAI 封禁了一个疑似源自中国的账号集群,该集群利用 AI 生成社交媒体内容,批评美国数据中心和 AI 基础设施。这一行动被 OpenAI 称为“Data Center Bandwagon”行动,目标指向美国。
OpenAI 推出 Rosalind Biodefense,向经过审核的开发者及美国政府合作伙伴扩大开放 GPT-Rosalind 的可信访问。该计划面向生物防御、公共卫生与大流行病防范领域,借助前沿 AI 推进相关工作。
OpenAI 分享第三方 AI 评估指南,覆盖前沿系统的模型能力、防护措施与有效性评估方法。
OpenAI 发布前沿治理框架(Frontier Governance Framework),说明其 AI 安全、安保与风险管理实践如何对齐欧盟和加州正在出台的监管要求。该框架聚焦前沿模型的治理与合规衔接。
Google 为隐私分析服务提出零信任聚合方案,将新型单次消息密码学聚合协议与 TEE 结合,设备无需多轮在线即可提交数据。该设计使原始数据在任何服务器内存中都不会被暴露或重建,仅在最终阶段处理已聚合匿名的数据,并通过 TEE 远程认证向参与者证明协议按公开代码正确执行。
OpenAI 公布 2026 年选举支持方案,涵盖可靠信息、网络防御、AI 透明度、滥用防护与偏见监测五个方面。该方案旨在为选举提供信息与安全保障。
Import AI 第 458 期收录一篇基于 2026 年 Cosmos HAI Lab 演讲的长文和一个设想"正向奇点"的虚构故事。演讲提出面对 AI 持续进步,人类只有两种选择:探索未来,或从当下退缩;退缩会让人和社会陷入被动反应。
OpenAI 推进 AI 内容溯源,采用 Content Credentials 和 SynthID,并推出验证工具,帮助人们识别和信任 AI 生成媒体。
Import AI 457 聚焦三项研究:SentinelOne 拆解出约 20 多年前的病毒 fast16.sys,它通过篡改内存中高精度计算软件(如 LS-DYNA 970、PKPM、MOHID)的结果来破坏科研与工程计算。
OpenAI 为 ChatGPT 推出安全更新,提升其在敏感对话中的上下文感知能力,可随时间推移识别风险并更安全地回应。该更新针对敏感话题场景,帮助模型结合对话历史判断潜在风险。
OpenAI 就 TanStack“Mini Shai-Hulud”供应链攻击作出回应,说明已采取的系统与签名证书保护措施,并解释 macOS 用户为何必须在 2026 年 6 月 12 日前更新 OpenAI 应用。内容涵盖事件经过、受影响范围以及 OpenAI 如何加强防御以应对不断演变的软件供应链威胁。
Institute for Law & AI 提出“激进可选性”监管思路,主张政府当下投资信息收集、举报人保护、评估能力与模型权重安全等工具,避免过度监管同时为未来强 AI 冲击预留应对手段。Meta 与 KAIST 的论文提出 Neural Computer,将计算、内存与 I/O 统一在学习到的运行时状态中。
OpenAI 扩展 Trusted Access for Cyber 计划,新增 GPT-5.5 和 GPT-5.5-Cyber,面向经过验证的防御方,帮助其加速漏洞研究并保护关键基础设施。
推荐理由:OpenAI 将 GPT-5.5 与 GPT-5.5-Cyber 纳入可信访问计划,读者可了解其面向漏洞研究的开放范围。
OpenAI 在 ChatGPT 中推出可选安全功能 Trusted Contact,当检测到严重的自伤相关担忧时,会通知用户指定的可信任联系人。
推荐理由:OpenAI 为 ChatGPT 增加可选安全功能,读者可了解其在自伤风险场景中的通知机制。
Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下协助患者诊疗。
推荐理由:Google DeepMind 公布 AI co-clinician 研究计划,给出医生盲评与远程问诊模拟中的具体对比结果。
Hugging Face 发文讨论 Mythos 与 Project Glasswing 发布后的 AI 网络安全格局,指出 Mythos 的漏洞发现与修补能力来自模型、算力、软件数据与自主性组成的系统配方,而非单一模型。文章认为开源代码与工具能通过分布式检测、验证、协调与补丁传播缩小攻防能力差距,并主张采用半自主 AI 智能体在人类控制下进行防御。
Google Research 提出一套框架,用改编自 IRI、ERQ 等心理学问卷的情境判断测试(SJT)评估 LLM 行为倾向与人类共识的对齐程度。对 25 个 LLM 的大规模分析发现两类差距:模型倾向偏离人类标注者共识,以及在无共识时无法覆盖人类意见的分布范围。小模型(<120B)与前沿闭源模型在人类一致同意时接近完美对齐,但共识低于 90% 时对齐率停滞在 80% 出头。
Google Quantum AI 发布白皮书,估算未来量子计算机破解保护加密货币的椭圆曲线密码(ECDLP-256)所需的量子资源比此前认为的更少。
推荐理由:Google Quantum AI 给出破解 ECDLP-256 的最新量子资源估算,并用零知识证明披露漏洞,读者可了解量子威胁与后量子迁移的紧迫性。
Google DeepMind 发布关于 AI 有害操纵的新研究,称其为首个经实证验证的测量工具包,并公开运行同类人类受试者研究所需的全部材料。研究覆盖英国、美国、印度共九项实验、超过 10000 名参与者,聚焦金融与健康等高风险场景,结果显示 AI 在健康话题上的有害操纵效果最弱,且在一个领域的成功无法预测另一个领域。
推荐理由:Google DeepMind 公开了首个经实证验证的 AI 有害操纵测量工具包,并给出跨英、美、印三国万人实验的关键结论。
OpenAI 宣布收购 AI 安全平台 Promptfoo。Promptfoo 帮助企业在开发阶段识别并修复 AI 系统中的漏洞。
推荐理由:OpenAI 收购 AI 安全平台 Promptfoo,读者可了解其在 AI 系统开发期漏洞检测上的布局。
OpenAI 提出 CoT-Control,发现推理模型难以控制自己的思维链,这反而强化了可监控性作为 AI 安全防护手段的价值。
推荐理由:OpenAI 提出 CoT-Control 并观察到推理模型难以控制自身思维链,为可监控性作为安全手段提供了依据。
OpenAI 公布其与美国国防部(Department of War)的合同细节,内容涵盖安全红线、法律保护条款,以及 AI 系统在涉密环境中的部署方式。
推荐理由:OpenAI 官方披露与国防部门合同的边界条款,可了解 AI 进入涉密环境的合规与安全约束。
OpenAI 公布其心理健康安全工作的多项更新,包括家长控制、信任联系人、改进的痛苦识别能力,以及近期诉讼进展。
OpenAI 最新威胁报告分析了恶意行为者如何将 AI 模型与网站、社交平台结合使用,并探讨这对检测与防御意味着什么。报告聚焦此类组合手法带来的识别与防护挑战。
OpenAI 承诺向 The Alignment Project 投入 750 万美元,用于资助独立的 AI 对齐研究,以加强全球应对 AGI 安全与安保风险的努力。
OpenAI 与 Paradigm 联合推出 EVMbench,用于评测 AI 智能体检测、修补和利用高危智能合约漏洞的能力。该基准聚焦高严重性漏洞,覆盖发现、修复与攻击三类任务。
OpenAI 在 ChatGPT 中推出 Lockdown Mode 和 Elevated Risk 标签,帮助组织防御提示词注入和 AI 驱动的数据外泄。
推荐理由:OpenAI 为 ChatGPT 加入面向企业的提示词注入与数据外泄防护选项,读者可了解其安全边界的新变化。