OpenAI 为何要让青少年安全使用 AI
OpenAI 正通过适龄保护、学习工具、家长控制和专家合作,让 ChatGPT 对青少年更安全。
OpenAI 正通过适龄保护、学习工具、家长控制和专家合作,让 ChatGPT 对青少年更安全。
Google DeepMind 与 Isomorphic Labs 公布联合生物韧性方案,一方面防止威胁行为者滥用其模型,另一方面让政府、科学家与生物安全专家借助 AI 应对疫情。过去 12 个月,双方已推进超过 15 项合作,覆盖预防、检测与响应三个方向,包括将 SynthID 水印技术适配到生物学领域,以及用智能体 AlphaEvolve 优化宏基因组测序数据分析算法。
Hugging Face 披露本周检测到一起针对其部分生产基础设施的入侵,该事件由一套自主 AI 智能体系统端到端驱动,攻击者通过恶意数据集利用数据集处理中的远程代码加载器和模板注入两条代码执行路径,从处理节点升级到节点级访问、窃取云和集群凭证并横向移动至多个内部集群。
推荐理由:Hugging Face 披露首起由自主 AI 智能体端到端驱动的入侵事件,并说明防御方在托管模型护栏受限时改用开源模型完成取证。
OpenAI 预告下一代模型 GPT-5.6 Sol,称其在编码、科学和网络安全方面能力更强,并搭配其最先进的安全栈。
推荐理由:OpenAI 官方预告 GPT-5.6 Sol 在编码、科学与网络安全上的能力提升,并同步给出安全栈信息。
OpenAI 宣布通过 Appia Foundation 参与构建先进 AI 的共享标准,支持评测框架、安全实践与全球合作。
OpenAI 推出 Daybreak 系列新工具,包括 Codex Security 和 GPT-5.5-Cyber,用于帮助各类组织大规模发现、验证并修补漏洞。
推荐理由:OpenAI 官方发布面向漏洞发现与修复的安全工具,读者可了解其能力定位与适用场景。
OpenAI 推出 Patch the Planet,这是 Daybreak 计划下的一项新举措,帮助开源维护者借助 AI 与专家审核发现、验证并修复漏洞。
Hugging Face 发布 MosaicLeaks,用 1001 条多跳研究链评测深度研究智能体的隐私泄露风险,测试模型普遍泄露私有信息,且只训练任务性能会加剧泄露。其提出的 Privacy-Aware Deep Research(PA-DR)强化学习方法将严格链成功率从 48.7% 提升至 58.7%,同时把答案/全信息泄露从 34.0% 降至 9.9%。
Google DeepMind 发布 AI Control Roadmap,用于在 Google 内部构建和管理高级 AI 的防御纵深框架,将内部智能体视为可能未对齐的潜在内部威胁,并基于 MITRE ATT&CK 拆解攻击战术与技术。
推荐理由:Google DeepMind 公开内部 AI 控制路线图,给出分级检测与响应机制,可供部署智能体的团队参考。
OpenAI 推出 Deployment Simulation,通过真实对话数据在模型部署前预测其行为,以提升安全性和评估准确性。该方法旨在让发布前的模型行为预测更贴近实际部署场景。
Google Research 在 AISTATS 2026 提出 Regularized f-Divergence Kernel Tests,用相对距离检验判断遗忘后的模型在分布上更接近安全重训模型还是原始受损模型。
OpenAI 发布新报告,披露与中国相关的账号利用 AI 影响美国技术议题,涉及数据中心叙事、关税以及对 ChatGPT 的不实说法。
推荐理由:OpenAI 官方披露与中国相关的账号利用 AI 影响美国技术议题,读者可了解平台方如何界定此类行动。
Google DeepMind 联合 Schmidt Sciences、Cooperative AI Foundation、ARIA 发起最高 1000 万美元的多智能体 AI 安全研究资助,Google.org 提供支持。
OpenAI 发布“Built to benefit everyone: our plan”,阐述其对 AI 未来的愿景,聚焦可及性、安全与共同繁荣,目标是确保 AGI 惠及所有人。
NVIDIA 发布 Nemotron 3.5 Content Safety,基于 Gemma 3 4B IT 微调,把多模态输入、多语言覆盖、自定义企业策略执行和可审计推理整合进一次推理调用。
OpenAI 发布《智能时代的生物防御》行动计划,提出面向 AI 驱动的生物韧性建设方案。该计划聚焦利用 AI 能力应对生物安全风险,具体措施与实施细节尚未在文中展开。
OpenAI 呼吁就青少年 AI 安全采取全球行动,并提出设立一个国际机构,以加强针对青少年的防护措施、标准与机会。
OpenAI 封禁了一个疑似源自中国的账号集群,该集群利用 AI 生成社交媒体内容,批评美国数据中心和 AI 基础设施。这一行动被 OpenAI 称为“Data Center Bandwagon”行动,目标指向美国。
OpenAI 推出 Rosalind Biodefense,向经过审核的开发者及美国政府合作伙伴扩大开放 GPT-Rosalind 的可信访问。该计划面向生物防御、公共卫生与大流行病防范领域,借助前沿 AI 推进相关工作。
OpenAI 分享第三方 AI 评估指南,覆盖前沿系统的模型能力、防护措施与有效性评估方法。
OpenAI 发布前沿治理框架(Frontier Governance Framework),说明其 AI 安全、安保与风险管理实践如何对齐欧盟和加州正在出台的监管要求。该框架聚焦前沿模型的治理与合规衔接。
Google 为隐私分析服务提出零信任聚合方案,将新型单次消息密码学聚合协议与 TEE 结合,设备无需多轮在线即可提交数据。该设计使原始数据在任何服务器内存中都不会被暴露或重建,仅在最终阶段处理已聚合匿名的数据,并通过 TEE 远程认证向参与者证明协议按公开代码正确执行。
OpenAI 公布 2026 年选举支持方案,涵盖可靠信息、网络防御、AI 透明度、滥用防护与偏见监测五个方面。该方案旨在为选举提供信息与安全保障。
OpenAI 推进 AI 内容溯源,采用 Content Credentials 和 SynthID,并推出验证工具,帮助人们识别和信任 AI 生成媒体。
OpenAI 为 ChatGPT 推出安全更新,提升其在敏感对话中的上下文感知能力,可随时间推移识别风险并更安全地回应。该更新针对敏感话题场景,帮助模型结合对话历史判断潜在风险。
OpenAI 就 TanStack“Mini Shai-Hulud”供应链攻击作出回应,说明已采取的系统与签名证书保护措施,并解释 macOS 用户为何必须在 2026 年 6 月 12 日前更新 OpenAI 应用。内容涵盖事件经过、受影响范围以及 OpenAI 如何加强防御以应对不断演变的软件供应链威胁。
OpenAI 扩展 Trusted Access for Cyber 计划,新增 GPT-5.5 和 GPT-5.5-Cyber,面向经过验证的防御方,帮助其加速漏洞研究并保护关键基础设施。
推荐理由:OpenAI 将 GPT-5.5 与 GPT-5.5-Cyber 纳入可信访问计划,读者可了解其面向漏洞研究的开放范围。
OpenAI 在 ChatGPT 中推出可选安全功能 Trusted Contact,当检测到严重的自伤相关担忧时,会通知用户指定的可信任联系人。
推荐理由:OpenAI 为 ChatGPT 增加可选安全功能,读者可了解其在自伤风险场景中的通知机制。
Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下协助患者诊疗。
推荐理由:Google DeepMind 公布 AI co-clinician 研究计划,给出医生盲评与远程问诊模拟中的具体对比结果。
Hugging Face 发文讨论 Mythos 与 Project Glasswing 发布后的 AI 网络安全格局,指出 Mythos 的漏洞发现与修补能力来自模型、算力、软件数据与自主性组成的系统配方,而非单一模型。文章认为开源代码与工具能通过分布式检测、验证、协调与补丁传播缩小攻防能力差距,并主张采用半自主 AI 智能体在人类控制下进行防御。
Google Research 提出一套框架,用改编自 IRI、ERQ 等心理学问卷的情境判断测试(SJT)评估 LLM 行为倾向与人类共识的对齐程度。对 25 个 LLM 的大规模分析发现两类差距:模型倾向偏离人类标注者共识,以及在无共识时无法覆盖人类意见的分布范围。小模型(<120B)与前沿闭源模型在人类一致同意时接近完美对齐,但共识低于 90% 时对齐率停滞在 80% 出头。
Google Quantum AI 发布白皮书,估算未来量子计算机破解保护加密货币的椭圆曲线密码(ECDLP-256)所需的量子资源比此前认为的更少。
推荐理由:Google Quantum AI 给出破解 ECDLP-256 的最新量子资源估算,并用零知识证明披露漏洞,读者可了解量子威胁与后量子迁移的紧迫性。
Google DeepMind 发布关于 AI 有害操纵的新研究,称其为首个经实证验证的测量工具包,并公开运行同类人类受试者研究所需的全部材料。研究覆盖英国、美国、印度共九项实验、超过 10000 名参与者,聚焦金融与健康等高风险场景,结果显示 AI 在健康话题上的有害操纵效果最弱,且在一个领域的成功无法预测另一个领域。
推荐理由:Google DeepMind 公开了首个经实证验证的 AI 有害操纵测量工具包,并给出跨英、美、印三国万人实验的关键结论。
OpenAI 宣布收购 AI 安全平台 Promptfoo。Promptfoo 帮助企业在开发阶段识别并修复 AI 系统中的漏洞。
推荐理由:OpenAI 收购 AI 安全平台 Promptfoo,读者可了解其在 AI 系统开发期漏洞检测上的布局。
OpenAI 提出 CoT-Control,发现推理模型难以控制自己的思维链,这反而强化了可监控性作为 AI 安全防护手段的价值。
推荐理由:OpenAI 提出 CoT-Control 并观察到推理模型难以控制自身思维链,为可监控性作为安全手段提供了依据。
OpenAI 公布其与美国国防部(Department of War)的合同细节,内容涵盖安全红线、法律保护条款,以及 AI 系统在涉密环境中的部署方式。
推荐理由:OpenAI 官方披露与国防部门合同的边界条款,可了解 AI 进入涉密环境的合规与安全约束。
OpenAI 公布其心理健康安全工作的多项更新,包括家长控制、信任联系人、改进的痛苦识别能力,以及近期诉讼进展。
OpenAI 最新威胁报告分析了恶意行为者如何将 AI 模型与网站、社交平台结合使用,并探讨这对检测与防御意味着什么。报告聚焦此类组合手法带来的识别与防护挑战。
OpenAI 承诺向 The Alignment Project 投入 750 万美元,用于资助独立的 AI 对齐研究,以加强全球应对 AGI 安全与安保风险的努力。
OpenAI 与 Paradigm 联合推出 EVMbench,用于评测 AI 智能体检测、修补和利用高危智能合约漏洞的能力。该基准聚焦高严重性漏洞,覆盖发现、修复与攻击三类任务。