跳到正文

#安全/对齐

今日 0 条
7月17日周五
7月16日周四
  1. Google DeepMind38

    Google DeepMind 与 Isomorphic Labs 公布生物韧性联合方案

    Google DeepMind 与 Isomorphic Labs 公布联合生物韧性方案,一方面防止威胁行为者滥用其模型,另一方面让政府、科学家与生物安全专家借助 AI 应对疫情。过去 12 个月,双方已推进超过 15 项合作,覆盖预防、检测与响应三个方向,包括将 SynthID 水印技术适配到生物学领域,以及用智能体 AlphaEvolve 优化宏基因组测序数据分析算法。

  2. Hugging Face Blog88

    Hugging Face 披露 7 月安全事件:自主 AI 智能体驱动的入侵

    Hugging Face 披露本周检测到一起针对其部分生产基础设施的入侵,该事件由一套自主 AI 智能体系统端到端驱动,攻击者通过恶意数据集利用数据集处理中的远程代码加载器和模板注入两条代码执行路径,从处理节点升级到节点级访问、窃取云和集群凭证并横向移动至多个内部集群。

    推荐理由:Hugging Face 披露首起由自主 AI 智能体端到端驱动的入侵事件,并说明防御方在托管模型护栏受限时改用开源模型完成取证。

6月26日周五
  1. OpenAI News62

    OpenAI 预告下一代模型 GPT-5.6 Sol

    OpenAI 预告下一代模型 GPT-5.6 Sol,称其在编码、科学和网络安全方面能力更强,并搭配其最先进的安全栈。

    推荐理由:OpenAI 官方预告 GPT-5.6 Sol 在编码、科学与网络安全上的能力提升,并同步给出安全栈信息。

6月23日周二
6月22日周一
6月19日周五
  1. Hugging Face Blog41

    Hugging Face 提出 MosaicLeaks:深度研究智能体能否守住秘密?

    Hugging Face 发布 MosaicLeaks,用 1001 条多跳研究链评测深度研究智能体的隐私泄露风险,测试模型普遍泄露私有信息,且只训练任务性能会加剧泄露。其提出的 Privacy-Aware Deep Research(PA-DR)强化学习方法将严格链成功率从 48.7% 提升至 58.7%,同时把答案/全信息泄露从 34.0% 降至 9.9%。

6月16日周二
  1. Google DeepMind62

    Google DeepMind 发布 AI Control Roadmap 与智能体安全技术框架

    Google DeepMind 发布 AI Control Roadmap,用于在 Google 内部构建和管理高级 AI 的防御纵深框架,将内部智能体视为可能未对齐的潜在内部威胁,并基于 MITRE ATT&CK 拆解攻击战术与技术。

    推荐理由:Google DeepMind 公开内部 AI 控制路线图,给出分级检测与响应机制,可供部署智能体的团队参考。

6月11日周四
6月10日周三
6月8日周一
6月5日周五
6月4日周四
6月2日周二
6月1日周一
5月29日周五
5月28日周四
  1. Google Research36

    Google 推出零信任聚合的隐私分析方案,单次消息即可完成安全聚合

    Google 为隐私分析服务提出零信任聚合方案,将新型单次消息密码学聚合协议与 TEE 结合,设备无需多轮在线即可提交数据。该设计使原始数据在任何服务器内存中都不会被暴露或重建,仅在最终阶段处理已聚合匿名的数据,并通过 TEE 远程认证向参与者证明协议按公开代码正确执行。

5月27日周三
5月19日周二
5月14日周四
5月13日周三
  1. OpenAI News58

    OpenAI 回应 TanStack npm 供应链攻击

    OpenAI 就 TanStack“Mini Shai-Hulud”供应链攻击作出回应,说明已采取的系统与签名证书保护措施,并解释 macOS 用户为何必须在 2026 年 6 月 12 日前更新 OpenAI 应用。内容涵盖事件经过、受影响范围以及 OpenAI 如何加强防御以应对不断演变的软件供应链威胁。

5月7日周四
4月30日周四
4月21日周二
  1. Hugging Face Blog36

    AI 与网络安全的未来:为什么开放性至关重要

    Hugging Face 发文讨论 Mythos 与 Project Glasswing 发布后的 AI 网络安全格局,指出 Mythos 的漏洞发现与修补能力来自模型、算力、软件数据与自主性组成的系统配方,而非单一模型。文章认为开源代码与工具能通过分布式检测、验证、协调与补丁传播缩小攻防能力差距,并主张采用半自主 AI 智能体在人类控制下进行防御。

4月3日周五
  1. Google Research40

    Google Research 评估 LLM 行为倾向与人类的对齐程度

    Google Research 提出一套框架,用改编自 IRI、ERQ 等心理学问卷的情境判断测试(SJT)评估 LLM 行为倾向与人类共识的对齐程度。对 25 个 LLM 的大规模分析发现两类差距:模型倾向偏离人类标注者共识,以及在无共识时无法覆盖人类意见的分布范围。小模型(<120B)与前沿闭源模型在人类一致同意时接近完美对齐,但共识低于 90% 时对齐率停滞在 80% 出头。

3月31日周二
  1. Google Research66

    Google 发布白皮书:量子计算机破解加密货币加密所需资源大幅降低

    Google Quantum AI 发布白皮书,估算未来量子计算机破解保护加密货币的椭圆曲线密码(ECDLP-256)所需的量子资源比此前认为的更少。

    推荐理由:Google Quantum AI 给出破解 ECDLP-256 的最新量子资源估算,并用零知识证明披露漏洞,读者可了解量子威胁与后量子迁移的紧迫性。

3月26日周四
  1. Google DeepMind60

    Google DeepMind 发布 AI 有害操纵测量工具包与万人实验结果

    Google DeepMind 发布关于 AI 有害操纵的新研究,称其为首个经实证验证的测量工具包,并公开运行同类人类受试者研究所需的全部材料。研究覆盖英国、美国、印度共九项实验、超过 10000 名参与者,聚焦金融与健康等高风险场景,结果显示 AI 在健康话题上的有害操纵效果最弱,且在一个领域的成功无法预测另一个领域。

    推荐理由:Google DeepMind 公开了首个经实证验证的 AI 有害操纵测量工具包,并给出跨英、美、印三国万人实验的关键结论。

3月9日周一
3月5日周四
2月28日周六
2月27日周五
2月25日周三
2月19日周四
2月18日周三