跳到正文

#安全/对齐

今日 0 条
1月20日周二
12月23日周二
12月22日周一
  1. OpenAI News60

    OpenAI 持续加固 ChatGPT Atlas 抵御提示词注入

    OpenAI 正在用强化学习训练的自动化红队加固 ChatGPT Atlas,抵御提示词注入攻击。这一发现与修补的循环能更早识别新型攻击手法,在 AI 智能体能力增强的同时强化浏览器智能体的防御。

    推荐理由:OpenAI 披露用强化学习训练的自动化红队持续发现并修补 Atlas 的提示词注入漏洞,可了解浏览器智能体的安全加固思路。

12月18日周四
12月16日周二
12月11日周四
  1. OpenAI News71

    OpenAI 更新 GPT-5 系统卡,纳入 GPT-5.2

    OpenAI 发布 GPT-5 系统卡更新,将 GPT-5.2 纳入 GPT-5 系列。GPT-5.2 是 GPT-5 系列的最新模型家族,其安全缓解方案与 GPT-5、GPT-5.1 系统卡所述基本一致。这些模型在多样化数据集上训练,包括互联网公开信息、第三方合作获取的信息,以及用户或人类训练师与研究人员提供或生成的信息。

    推荐理由:官方系统卡更新说明 GPT-5.2 沿用 GPT-5 系列的安全缓解方案,可了解新模型的安全口径。

  2. Google Research34

    Google 提出 Urania:用差分隐私框架洞察 AI 聊天机器人使用情况

    Google Research 在 COLM 2025 论文中提出 Urania 框架,通过差分隐私(DP)聚类与 DP 关键词提取,从 LLM 聊天机器人对话中生成使用洞察,且不依赖 LLM 自行脱敏。该框架用隐私预算 ε 提供端到端数学保证,LLM 仅基于匿名关键词生成摘要,不接触原始对话。对比非隐私基线 Simple-CLIO,DP 摘要最高有 70% 的概率被 LLM 评估者偏好。

12月10日周三
11月27日周四
11月19日周三
11月12日周三
  1. Google Research42

    Google 发布 JAX-Privacy 1.0:面向大规模机器学习的差分隐私工具库

    Google 发布 JAX-Privacy 1.0,这是基于 JAX 构建的差分隐私工具库,支持 DP-SGD、DP-FTRL 及 DP matrix factorization 等算法,并可与 JAX 原生并行能力配合实现数据与模型并行。新版本重新设计以提升模块化,内置微批处理与 padding 以处理大规模变长批次,并基于 Google 的 DP 核算库提供噪声校准与审计工具。

10月30日周四
10月28日周二
  1. Hugging Face Blog38

    Hugging Face 提出“语音同意门”:让声音克隆必须先获得本人明确同意

    Hugging Face 发布博客提出“语音同意门”(voice consent gate),让模型只有在说话人明确说出同意语句并被 ASR 识别后才启动语音克隆。该方案由三部分组成:生成约 20 词、含同意短语与模型名的独特句子,ASR 识别该句,以及 TTS 语音克隆系统;同一句录音也可直接用作克隆素材。配套示例 Space 与代码已公开,用于探索把同意原则嵌入 AI 系统流程。

10月22日周三
  1. Hugging Face Blog55

    Hugging Face 与 VirusTotal 合作,为 Hub 上 220 万+ 公开仓库提供持续扫描

    Hugging Face 宣布与威胁情报与恶意软件分析平台 VirusTotal 合作,即日起对 Hub 上 220 万+ 公开模型和数据集仓库进行持续扫描。用户访问仓库或文件页面时,Hub 会自动用文件哈希比对 VirusTotal 威胁情报库,返回干净或恶意状态及检测计数等元数据,不共享原始文件内容。

10月9日周四
10月7日周二
10月1日周三
9月30日周二
  1. OpenAI News67

    OpenAI 发布 Sora 2 与 Sora 应用,强调安全优先

    OpenAI 发布 Sora 2 和 Sora 应用,称两者在构建时以安全为基础,以应对先进视频模型和新型社交创作平台带来的新安全挑战。官方表示其做法建立在具体防护措施之上。

    推荐理由:官方说明 Sora 2 与 Sora 应用在安全层面的设计取向,可了解视频模型与社交创作平台的安全考量。

9月29日周一
9月26日周五
9月18日周四
9月17日周三
  1. OpenAI News62

    OpenAI 与 Apollo Research 发布检测和减少 AI 模型 scheming 行为的评测

    Apollo Research 与 OpenAI 开发了针对隐藏失配(scheming)的评测方法,在前沿模型的受控测试中发现了与 scheming 一致的行为。团队还公开了具体案例,以及对一种早期减少 scheming 方法的压力测试。

    推荐理由:OpenAI 与 Apollo Research 公开了隐藏失配的评测方法与初步缓解手段,可了解前沿模型欺骗行为的检测思路。

9月16日周二
9月12日周五
9月9日周二
9月5日周五
9月2日周二
8月27日周三