OpenAI 为 ChatGPT 推出年龄预测,识别未成年账户
ChatGPT 正在推出年龄预测功能,用于判断账户用户是否年满 18 岁,并对青少年账户应用相应保护措施。OpenAI 表示该功能会随时间推移不断优化准确性。
ChatGPT 正在推出年龄预测功能,用于判断账户用户是否年满 18 岁,并对青少年账户应用相应保护措施。OpenAI 表示该功能会随时间推移不断优化准确性。
Hugging Face 发布 8B 参数安全护栏模型 AprielGuard,可检测 16 类安全风险及提示注入、越狱、思维链污染、记忆投毒、多智能体攻击等对抗攻击,并覆盖工具调用与推理轨迹等智能体工作流。模型提供推理与非推理两种模式,兼顾可解释分类与低延迟生产部署。
OpenAI 正在用强化学习训练的自动化红队加固 ChatGPT Atlas,抵御提示词注入攻击。这一发现与修补的循环能更早识别新型攻击手法,在 AI 智能体能力增强的同时强化浏览器智能体的防御。
推荐理由:OpenAI 披露用强化学习训练的自动化红队持续发现并修补 Atlas 的提示词注入漏洞,可了解浏览器智能体的安全加固思路。
OpenAI 推出针对思维链可监控性的新框架与评估套件,覆盖 24 种环境下的 13 项评估。结果显示,监控模型内部推理远比仅监控输出更有效,为 AI 系统能力提升后的可扩展控制提供了可行路径。
OpenAI 更新 Model Spec,新增 Under-18 Principles,规定 ChatGPT 应基于发展科学为青少年提供安全、适龄的引导。此次更新强化了防护栏,明确了模型在更高风险情境下的预期行为,并延续了 OpenAI 改善 ChatGPT 青少年安全的整体工作。
OpenAI 发布面向青少年与家长的 AI 素养资源,帮助其审慎、安全地使用 ChatGPT。指南包含经专家审核的建议,涵盖负责任使用、批判性思维、健康边界,以及如何支持青少年应对情绪或敏感话题。
Google DeepMind 发布 Gemma Scope 2,一套面向 Gemma 3 全系列(270M 至 27B 参数)的开源可解释性工具,结合稀疏自编码器(SAEs)和 transcoders 分析模型内部行为。
OpenAI 推出一个真实世界评估框架,用于衡量 AI 在湿实验室中加速生物研究的能力。该工作使用 GPT-5 优化分子克隆实验方案,同时探讨 AI 辅助实验的前景与风险。
Google DeepMind 宣布与英国 AI Security Institute(AISI)签署新谅解备忘录,将合作从模型测试扩展到基础安全研究。双方将共享专有模型、数据与思路,并联合发布报告,重点研究 CoT 监控、社会情感错位及 AI 对经济系统的影响。Google DeepMind 称 Gemini 3 是其迄今最智能、最安全的模型。
OpenAI 发布 GPT-5 系统卡更新,将 GPT-5.2 纳入 GPT-5 系列。GPT-5.2 是 GPT-5 系列的最新模型家族,其安全缓解方案与 GPT-5、GPT-5.1 系统卡所述基本一致。这些模型在多样化数据集上训练,包括互联网公开信息、第三方合作获取的信息,以及用户或人类训练师与研究人员提供或生成的信息。
推荐理由:官方系统卡更新说明 GPT-5.2 沿用 GPT-5 系列的安全缓解方案,可了解新模型的安全口径。
Google Research 在 COLM 2025 论文中提出 Urania 框架,通过差分隐私(DP)聚类与 DP 关键词提取,从 LLM 聊天机器人对话中生成使用洞察,且不依赖 LLM 自行脱敏。该框架用隐私预算 ε 提供端到端数学保证,LLM 仅基于匿名关键词生成摘要,不接触原始对话。对比非隐私基线 Simple-CLIO,DP 摘要最高有 70% 的概率被 LLM 评估者偏好。
OpenAI 正在随 AI 模型网络安全能力增强而投入更强的防护措施与防御能力,并说明其如何评估风险、限制滥用,以及与安全社区合作强化网络韧性。
OpenAI 披露一起涉及 Mixpanel 的安全事件,波及有限的 API 分析数据,但 API 内容、凭证和支付信息均未泄露。OpenAI 同时说明了事件经过及正在采取的用户保护措施。
OpenAI 与独立专家合作评估前沿 AI 系统,通过第三方测试强化安全保障、验证防护措施,并提升模型能力与风险评估的透明度。
Google 发布 JAX-Privacy 1.0,这是基于 JAX 构建的差分隐私工具库,支持 DP-SGD、DP-FTRL 及 DP matrix factorization 等算法,并可与 JAX 原生并行能力配合实现数据与模型并行。新版本重新设计以提升模块化,内置微批处理与 padding 以处理大规模变长批次,并基于 Google 的 DP 核算库提供噪声校准与审计工具。
OpenAI 发布 GPT-5 系统卡增补,给出 GPT-5.1 Instant 和 GPT-5.1 Thinking 的更新安全指标,并新增心理健康与情感依赖方面的评估。
推荐理由:OpenAI 公布 GPT-5.1 两个版本的安全指标更新,并新增心理健康与情感依赖评估。
Google Research 提出可证明隐私洞察(PPI),结合 LLM、差分隐私(DP)和可信执行环境(TEE),对非结构化 GenAI 数据做分析,保证个体数据不可被查看、聚合结果匿名。
Hugging Face 发布博客提出“语音同意门”(voice consent gate),让模型只有在说话人明确说出同意语句并被 ASR 识别后才启动语音克隆。该方案由三部分组成:生成约 20 词、含同意短语与模型名的独特句子,ASR 识别该句,以及 TTS 语音克隆系统;同一句录音也可直接用作克隆素材。配套示例 Space 与代码已公开,用于探索把同意原则嵌入 AI 系统流程。
Hugging Face 宣布与威胁情报与恶意软件分析平台 VirusTotal 合作,即日起对 Hub 上 220 万+ 公开模型和数据集仓库进行持续扫描。用户访问仓库或文件页面时,Hub 会自动用文件哈希比对 VirusTotal 威胁情报库,返回干净或恶意状态及检测计数等元数据,不共享原始文件内容。
OpenAI 分享了评估 ChatGPT 政治偏见的新方法,通过更贴近真实世界的测试提升客观性并减少偏见。该方法聚焦于对 LLM 政治偏见的定义与评测。
OpenAI 发布 2025 年 10 月报告,披露其如何检测和阻断 AI 的恶意使用。报告介绍了 OpenAI 打击滥用行为、执行政策以及保护用户免受现实危害的做法。
OpenAI 封禁了一批可能与俄语犯罪团伙有关的账号,这些账号利用 AI 构建恶意软件加载器、规避层、凭据窃取脚本和 C2 基础设施。
推荐理由:OpenAI 披露封禁与俄语犯罪团伙相关的账号,可了解 AI 被用于恶意软件开发的具体环节。
OpenAI 封禁了一批账号,其活动与公开报道的威胁组织存在重叠,并带有符合中国情报需求的特征,利用 AI 支持钓鱼与脚本编写工作流。
OpenAI 封禁了一批与俄罗斯来源的"Stop News"行动相关的账号,该行动利用 AI 生成针对非洲和英国的影响力内容。OpenAI 称其为屡次违规的影响力行动。
OpenAI 封禁了一批与在线欺诈网络相关的账号,这些账号利用 AI 支持诈骗脚本、身份冒充、翻译和受害者互动。
OpenAI 封禁了一批韩语账号,这些账号利用 AI 进行恶意软件开发支持、调试、钓鱼和凭证窃取等工作流。
OpenAI 封禁了一批与 PRC 关联的账号,这些账号利用 AI 支持监控相关规划、针对性画像,以及针对批评者和其他个人的研究。
OpenAI 发布 Sora 2 和 Sora 应用,称两者在构建时以安全为基础,以应对先进视频模型和新型社交创作平台带来的新安全挑战。官方表示其做法建立在具体防护措施之上。
推荐理由:官方说明 Sora 2 与 Sora 应用在安全层面的设计取向,可了解视频模型与社交创作平台的安全考量。
OpenAI 为 ChatGPT 推出家长控制功能,并上线新的家长资源页面,帮助家庭管理 ChatGPT 在家中的使用方式。
OpenAI 通过严格的使用政策、先进的检测工具和行业协作,阻止、举报并预防 AI 被滥用于在线儿童性剥削与虐待。
OpenAI 与 AARP 达成合作,通过 OpenAI Academy 和 OATS 旗下 Senior Planet 项目,为老年人提供 AI 培训、诈骗识别工具及全国性项目,帮助他们安全上网。
Cloud Security Alliance 与 Noma Security 主导、Haize Labs 和 Harmonic Security 参与发起 RiskRubric.ai,对 Hugging Face hub 上超 50 万个模型按透明度、可靠性、安全、隐私、防护、声誉六个维度打分,输出 0-100 分及 A-F 等级。
Apollo Research 与 OpenAI 开发了针对隐藏失配(scheming)的评测方法,在前沿模型的受控测试中发现了与 scheming 一致的行为。团队还公开了具体案例,以及对一种早期减少 scheming 方法的压力测试。
推荐理由:OpenAI 与 Apollo Research 公开了隐藏失配的评测方法与初步缓解手段,可了解前沿模型欺骗行为的检测思路。
OpenAI 正在 ChatGPT 中构建年龄预测与家长控制功能,为青少年提供更安全、适龄的使用体验。新工具同时面向家庭,帮助家长更好地支持孩子的使用。
OpenAI 阐述了其在 AI 使用中平衡青少年安全、自由与隐私的做法。
OpenAI 公布了与美国 CAISI 及英国 AISI 合作推进 AI 安全与安保的进展。该合作旨在强化 AI 系统的安全性与防护能力。
SafetyKit 借助 OpenAI GPT-5 扩展风险智能体,用于内容审核与合规执行,在准确性上超越传统安全系统。该方案依托 OpenAI 目前能力最强的模型,提升风险识别与处置的规模化能力。
OpenAI 新研究解释了语言模型产生幻觉的原因,并指出改进评估方法可以提升 AI 的可靠性、诚实性与安全性。
OpenAI 宣布与专家合作,为 ChatGPT 青少年用户强化保护措施并引入家长控制功能,同时将敏感对话路由至推理模型处理。
OpenAI 面向全球 1000 多人调查了 AI 应如何行事,并将其观点与自家 Model Spec 进行对比。这项被称为集体对齐(collective alignment)的工作,旨在让 AI 默认行为更好地反映多元的人类价值观与视角。