跳到正文

#安全/对齐

今日 2 条
2月5日周四
2月4日周三
  1. Google Research60

    Google 与 Included Health 合作开展全国性随机研究,评估真实虚拟诊疗中的对话式 AI

    Google 宣布与 Included Health 合作,待 IRB 批准后启动一项全国性前瞻性随机对照研究,评估对话式 AI 在真实虚拟诊疗工作流中的表现。

    推荐理由:Google 与 Included Health 将开展全国随机对照研究,读者可了解医疗对话 AI 从模拟走向真实临床的评估路径。

2月1日周日
1月28日周三
1月20日周二
12月23日周二
12月22日周一
  1. OpenAI News60

    OpenAI 持续加固 ChatGPT Atlas 抵御提示词注入

    OpenAI 正在用强化学习训练的自动化红队加固 ChatGPT Atlas,抵御提示词注入攻击。这一发现与修补的循环能更早识别新型攻击手法,在 AI 智能体能力增强的同时强化浏览器智能体的防御。

    推荐理由:OpenAI 披露用强化学习训练的自动化红队持续发现并修补 Atlas 的提示词注入漏洞,可了解浏览器智能体的安全加固思路。

12月18日周四
12月16日周二
12月11日周四
  1. Google Research34

    Google 提出 Urania:用差分隐私框架洞察 AI 聊天机器人使用情况

    Google Research 在 COLM 2025 论文中提出 Urania 框架,通过差分隐私(DP)聚类与 DP 关键词提取,从 LLM 聊天机器人对话中生成使用洞察,且不依赖 LLM 自行脱敏。该框架用隐私预算 ε 提供端到端数学保证,LLM 仅基于匿名关键词生成摘要,不接触原始对话。对比非隐私基线 Simple-CLIO,DP 摘要最高有 70% 的概率被 LLM 评估者偏好。

10月30日周四
10月28日周二
  1. Hugging Face Blog38

    Hugging Face 提出“语音同意门”:让声音克隆必须先获得本人明确同意

    Hugging Face 发布博客提出“语音同意门”(voice consent gate),让模型只有在说话人明确说出同意语句并被 ASR 识别后才启动语音克隆。该方案由三部分组成:生成约 20 词、含同意短语与模型名的独特句子,ASR 识别该句,以及 TTS 语音克隆系统;同一句录音也可直接用作克隆素材。配套示例 Space 与代码已公开,用于探索把同意原则嵌入 AI 系统流程。

10月22日周三
  1. Hugging Face Blog55

    Hugging Face 与 VirusTotal 合作,为 Hub 上 220 万+ 公开仓库提供持续扫描

    Hugging Face 宣布与威胁情报与恶意软件分析平台 VirusTotal 合作,即日起对 Hub 上 220 万+ 公开模型和数据集仓库进行持续扫描。用户访问仓库或文件页面时,Hub 会自动用文件哈希比对 VirusTotal 威胁情报库,返回干净或恶意状态及检测计数等元数据,不共享原始文件内容。

10月9日周四
10月7日周二
10月1日周三
9月30日周二
  1. OpenAI News67

    OpenAI 发布 Sora 2 与 Sora 应用,强调安全优先

    OpenAI 发布 Sora 2 和 Sora 应用,称两者在构建时以安全为基础,以应对先进视频模型和新型社交创作平台带来的新安全挑战。官方表示其做法建立在具体防护措施之上。

    推荐理由:官方说明 Sora 2 与 Sora 应用在安全层面的设计取向,可了解视频模型与社交创作平台的安全考量。

9月29日周一
9月26日周五
9月18日周四
9月17日周三
  1. OpenAI News62

    OpenAI 与 Apollo Research 发布检测和减少 AI 模型 scheming 行为的评测

    Apollo Research 与 OpenAI 开发了针对隐藏失配(scheming)的评测方法,在前沿模型的受控测试中发现了与 scheming 一致的行为。团队还公开了具体案例,以及对一种早期减少 scheming 方法的压力测试。

    推荐理由:OpenAI 与 Apollo Research 公开了隐藏失配的评测方法与初步缓解手段,可了解前沿模型欺骗行为的检测思路。

9月16日周二
9月12日周五
9月9日周二
9月5日周五