跳到正文

#安全/对齐

今日 2 条
1月22日周三
1月13日周一
  1. Hugging Face Blog22

    Hugging Face 发文《AI Agents Are Here. What Now?》:建议不要开发完全自主的 AI 智能体

    Hugging Face 发布文章《AI Agents Are Here. What Now?》,指出 AI 智能体基于 LLM 构建,能自主拆解目标并执行子任务,其自主性可按从"模型不影响程序流程"到"模型自行编写并执行代码"分为多个等级。文章认为系统自主性越高、用户让渡的控制权越多,安全、隐私等风险越大,因此建议不要开发完全自主的 AI 智能体,而半自主智能体在风险与收益之间可能更可取。

12月20日周五
12月5日周四
  1. OpenAI News62

    OpenAI 发布 o1 系统卡

    OpenAI 发布 o1 系统卡,说明在发布 o1 和 o1-mini 之前开展的安全工作,包括外部红队测试以及依据其 Preparedness Framework 进行的前沿风险评测。

    推荐理由:OpenAI 官方披露 o1 与 o1-mini 发布前的安全评估流程,可了解其 Preparedness Framework 下的风险评测方式。

11月21日周四
11月7日周四
  1. Mistral AI57

    Mistral AI 发布内容审核 API

    Mistral AI 发布新的内容审核 API,即 Le Chat 中审核服务所用的同一套接口,现开放给用户按自身应用和安全标准定制。该模型是基于 LLM 的分类器,将文本输入分为 9 个类别,提供原始文本和对话内容两个端点,并针对对话场景分类最后一条消息。模型原生支持多语言,训练语料涵盖阿拉伯语、中文、英语、法语、德语、意大利语、日语、韩语、葡萄牙语、俄语和西班牙语。

10月23日周三
10月22日周二
10月15日周二
10月10日周四
10月1日周二
9月26日周四
9月16日周一
8月8日周四
8月6日周二
7月31日周三
  1. Hugging Face Blog62

    Google 发布 Gemma 2 2B、ShieldGemma 与 Gemma Scope

    Google 在 Gemma 2 发布一个月后扩充 Gemma 模型系列,新增 2.6B 参数的 Gemma 2 2B(含 base 与指令微调版)、安全分类器 ShieldGemma 以及稀疏自编码器套件 Gemma Scope。

    推荐理由:Gemma 2 新增 2B 小模型、安全分类器和可解释性工具,读者可据此判断端侧部署与安全过滤的可用选项。

7月24日周三
7月17日周三
7月10日周三
6月27日周四
6月24日周一
6月20日周四
6月13日周四
6月8日周六
5月30日周四
5月24日周五
  1. Hugging Face Blog38

    Meta 发布 CyberSecEval 2:面向大语言模型网络安全风险与能力的综合评测框架

    Meta 发布 CyberSecEval 2,从代码不安全实践、提示词注入、网络攻击协助、代码解释器滥用和自动化攻击能力五个维度评测 LLM 的网络安全风险。相比 2023 年 12 月的首版,LLM 协助网络攻击的平均合规率从 52% 降至 28%。提示词注入仍是未解难题,代码解释器滥用风险突出,评测代码已全部开源。

5月21日周二
5月7日周二
5月1日周三