OpenAI 在 ChatGPT 中推出 Lockdown Mode 与 Elevated Risk 标签
OpenAI 在 ChatGPT 中推出 Lockdown Mode 和 Elevated Risk 标签,帮助组织防御提示词注入和 AI 驱动的数据外泄。
推荐理由:OpenAI 为 ChatGPT 加入面向企业的提示词注入与数据外泄防护选项,读者可了解其安全边界的新变化。
OpenAI 在 ChatGPT 中推出 Lockdown Mode 和 Elevated Risk 标签,帮助组织防御提示词注入和 AI 驱动的数据外泄。
推荐理由:OpenAI 为 ChatGPT 加入面向企业的提示词注入与数据外泄防护选项,读者可了解其安全边界的新变化。
OpenAI 推出 Trusted Access for Cyber,一个基于信任的框架,在扩大前沿网络能力访问范围的同时加强对滥用的防护。
推荐理由:OpenAI 推出面向网络安全的可信访问框架,读者可了解前沿网络能力开放与滥用防护之间的平衡思路。
Google 宣布与 Included Health 合作,待 IRB 批准后启动一项全国性前瞻性随机对照研究,评估对话式 AI 在真实虚拟诊疗工作流中的表现。
推荐理由:Google 与 Included Health 将开展全国随机对照研究,读者可了解医疗对话 AI 从模拟走向真实临床的评估路径。
OpenAI 封禁了一批很可能源自柬埔寨的账号,这些账号用 AI 冒充追损服务、律所和执法机构,目标是被诈骗影响的人群。
OpenAI 封禁了一批利用 AI 支持恋爱诈骗流程的账号,涉及接触目标、翻译、与受害者互动以及投资诈骗诱饵等环节。
OpenAI 封禁了一批很可能源自柬埔寨的账号,这些账号利用 AI 对印尼寻爱者实施诈骗,涉及翻译与互动环节。该行动代号“Date Bait”,针对的是 AI 加持的恋爱诈骗。
OpenAI 封禁了一个与中国执法相关人员关联的账号,该账号利用 AI 策划影响力活动、骚扰和网络行动。
OpenAI 推出 EMEA Youth & Wellbeing Grant,投入 50 万欧元资助非政府组织和研究人员,用于推进 AI 时代的青年安全与福祉。该计划现已开放申请。
OpenAI 说明了 AI 智能体打开链接时保护用户数据的方式,通过内置防护机制防止基于 URL 的数据外泄和提示词注入。
ChatGPT 正在推出年龄预测功能,用于判断账户用户是否年满 18 岁,并对青少年账户应用相应保护措施。OpenAI 表示该功能会随时间推移不断优化准确性。
Hugging Face 发布 8B 参数安全护栏模型 AprielGuard,可检测 16 类安全风险及提示注入、越狱、思维链污染、记忆投毒、多智能体攻击等对抗攻击,并覆盖工具调用与推理轨迹等智能体工作流。模型提供推理与非推理两种模式,兼顾可解释分类与低延迟生产部署。
OpenAI 正在用强化学习训练的自动化红队加固 ChatGPT Atlas,抵御提示词注入攻击。这一发现与修补的循环能更早识别新型攻击手法,在 AI 智能体能力增强的同时强化浏览器智能体的防御。
推荐理由:OpenAI 披露用强化学习训练的自动化红队持续发现并修补 Atlas 的提示词注入漏洞,可了解浏览器智能体的安全加固思路。
OpenAI 推出针对思维链可监控性的新框架与评估套件,覆盖 24 种环境下的 13 项评估。结果显示,监控模型内部推理远比仅监控输出更有效,为 AI 系统能力提升后的可扩展控制提供了可行路径。
OpenAI 更新 Model Spec,新增 Under-18 Principles,规定 ChatGPT 应基于发展科学为青少年提供安全、适龄的引导。此次更新强化了防护栏,明确了模型在更高风险情境下的预期行为,并延续了 OpenAI 改善 ChatGPT 青少年安全的整体工作。
OpenAI 发布面向青少年与家长的 AI 素养资源,帮助其审慎、安全地使用 ChatGPT。指南包含经专家审核的建议,涵盖负责任使用、批判性思维、健康边界,以及如何支持青少年应对情绪或敏感话题。
Google DeepMind 发布 Gemma Scope 2,一套面向 Gemma 3 全系列(270M 至 27B 参数)的开源可解释性工具,结合稀疏自编码器(SAEs)和 transcoders 分析模型内部行为。
OpenAI 推出一个真实世界评估框架,用于衡量 AI 在湿实验室中加速生物研究的能力。该工作使用 GPT-5 优化分子克隆实验方案,同时探讨 AI 辅助实验的前景与风险。
Google DeepMind 宣布与英国 AI Security Institute(AISI)签署新谅解备忘录,将合作从模型测试扩展到基础安全研究。双方将共享专有模型、数据与思路,并联合发布报告,重点研究 CoT 监控、社会情感错位及 AI 对经济系统的影响。Google DeepMind 称 Gemini 3 是其迄今最智能、最安全的模型。
Google Research 在 COLM 2025 论文中提出 Urania 框架,通过差分隐私(DP)聚类与 DP 关键词提取,从 LLM 聊天机器人对话中生成使用洞察,且不依赖 LLM 自行脱敏。该框架用隐私预算 ε 提供端到端数学保证,LLM 仅基于匿名关键词生成摘要,不接触原始对话。对比非隐私基线 Simple-CLIO,DP 摘要最高有 70% 的概率被 LLM 评估者偏好。
Google Research 提出可证明隐私洞察(PPI),结合 LLM、差分隐私(DP)和可信执行环境(TEE),对非结构化 GenAI 数据做分析,保证个体数据不可被查看、聚合结果匿名。
Hugging Face 发布博客提出“语音同意门”(voice consent gate),让模型只有在说话人明确说出同意语句并被 ASR 识别后才启动语音克隆。该方案由三部分组成:生成约 20 词、含同意短语与模型名的独特句子,ASR 识别该句,以及 TTS 语音克隆系统;同一句录音也可直接用作克隆素材。配套示例 Space 与代码已公开,用于探索把同意原则嵌入 AI 系统流程。
Hugging Face 宣布与威胁情报与恶意软件分析平台 VirusTotal 合作,即日起对 Hub 上 220 万+ 公开模型和数据集仓库进行持续扫描。用户访问仓库或文件页面时,Hub 会自动用文件哈希比对 VirusTotal 威胁情报库,返回干净或恶意状态及检测计数等元数据,不共享原始文件内容。
OpenAI 分享了评估 ChatGPT 政治偏见的新方法,通过更贴近真实世界的测试提升客观性并减少偏见。该方法聚焦于对 LLM 政治偏见的定义与评测。
OpenAI 发布 2025 年 10 月报告,披露其如何检测和阻断 AI 的恶意使用。报告介绍了 OpenAI 打击滥用行为、执行政策以及保护用户免受现实危害的做法。
OpenAI 封禁了一批可能与俄语犯罪团伙有关的账号,这些账号利用 AI 构建恶意软件加载器、规避层、凭据窃取脚本和 C2 基础设施。
推荐理由:OpenAI 披露封禁与俄语犯罪团伙相关的账号,可了解 AI 被用于恶意软件开发的具体环节。
OpenAI 封禁了一批账号,其活动与公开报道的威胁组织存在重叠,并带有符合中国情报需求的特征,利用 AI 支持钓鱼与脚本编写工作流。
OpenAI 封禁了一批与俄罗斯来源的"Stop News"行动相关的账号,该行动利用 AI 生成针对非洲和英国的影响力内容。OpenAI 称其为屡次违规的影响力行动。
OpenAI 封禁了一批与在线欺诈网络相关的账号,这些账号利用 AI 支持诈骗脚本、身份冒充、翻译和受害者互动。
OpenAI 封禁了一批韩语账号,这些账号利用 AI 进行恶意软件开发支持、调试、钓鱼和凭证窃取等工作流。
OpenAI 封禁了一批与 PRC 关联的账号,这些账号利用 AI 支持监控相关规划、针对性画像,以及针对批评者和其他个人的研究。
OpenAI 发布 Sora 2 和 Sora 应用,称两者在构建时以安全为基础,以应对先进视频模型和新型社交创作平台带来的新安全挑战。官方表示其做法建立在具体防护措施之上。
推荐理由:官方说明 Sora 2 与 Sora 应用在安全层面的设计取向,可了解视频模型与社交创作平台的安全考量。
OpenAI 为 ChatGPT 推出家长控制功能,并上线新的家长资源页面,帮助家庭管理 ChatGPT 在家中的使用方式。
OpenAI 通过严格的使用政策、先进的检测工具和行业协作,阻止、举报并预防 AI 被滥用于在线儿童性剥削与虐待。
OpenAI 与 AARP 达成合作,通过 OpenAI Academy 和 OATS 旗下 Senior Planet 项目,为老年人提供 AI 培训、诈骗识别工具及全国性项目,帮助他们安全上网。
Cloud Security Alliance 与 Noma Security 主导、Haize Labs 和 Harmonic Security 参与发起 RiskRubric.ai,对 Hugging Face hub 上超 50 万个模型按透明度、可靠性、安全、隐私、防护、声誉六个维度打分,输出 0-100 分及 A-F 等级。
Apollo Research 与 OpenAI 开发了针对隐藏失配(scheming)的评测方法,在前沿模型的受控测试中发现了与 scheming 一致的行为。团队还公开了具体案例,以及对一种早期减少 scheming 方法的压力测试。
推荐理由:OpenAI 与 Apollo Research 公开了隐藏失配的评测方法与初步缓解手段,可了解前沿模型欺骗行为的检测思路。
OpenAI 正在 ChatGPT 中构建年龄预测与家长控制功能,为青少年提供更安全、适龄的使用体验。新工具同时面向家庭,帮助家长更好地支持孩子的使用。
OpenAI 阐述了其在 AI 使用中平衡青少年安全、自由与隐私的做法。
OpenAI 公布了与美国 CAISI 及英国 AISI 合作推进 AI 安全与安保的进展。该合作旨在强化 AI 系统的安全性与防护能力。
SafetyKit 借助 OpenAI GPT-5 扩展风险智能体,用于内容审核与合规执行,在准确性上超越传统安全系统。该方案依托 OpenAI 目前能力最强的模型,提升风险识别与处置的规模化能力。