OpenAI 提出审议式对齐:推理让语言模型更安全
OpenAI 为 o1 模型提出名为审议式对齐(deliberative alignment)的新对齐策略,直接教模型安全规范以及如何对这些规范进行推理。
OpenAI 为 o1 模型提出名为审议式对齐(deliberative alignment)的新对齐策略,直接教模型安全规范以及如何对这些规范进行推理。
OpenAI 发布 o1 系统卡,说明在发布 o1 和 o1-mini 之前开展的安全工作,包括外部红队测试以及依据其 Preparedness Framework 进行的前沿风险评测。
推荐理由:OpenAI 官方披露 o1 与 o1-mini 发布前的安全评估流程,可了解其 Preparedness Framework 下的风险评测方式。
OpenAI 发布文章阐述如何结合人类与 AI 推进红队测试。红队测试通过模拟对抗性攻击来发现模型的安全漏洞与滥用风险,人类专家与 AI 的协作方式成为其探索方向。
Mistral AI 发布新的内容审核 API,即 Le Chat 中审核服务所用的同一套接口,现开放给用户按自身应用和安全标准定制。该模型是基于 LLM 的分类器,将文本输入分为 9 个类别,提供原始文本和对话内容两个端点,并针对对话场景分类最后一条消息。模型原生支持多语言,训练语料涵盖阿拉伯语、中文、英语、法语、德语、意大利语、日语、韩语、葡萄牙语、俄语和西班牙语。
Google DeepMind 与 Hugging Face 在 Transformers v4.46.0 中发布 SynthID Text,可通过 logits processor 为 AI 生成文本加水印,并用分类器检测。
推荐理由:Google DeepMind 与 Hugging Face 把文本水印做成 Transformers 里的生成配置,读者可据此了解其接入方式与检测流程。
Hugging Face 宣布与 Protect AI 合作,将后者的 Guardian 扫描器集成进 Hub 的扫描套件,所有公开模型仓库在推送文件后会自动被扫描。Guardian 可检测 pickle 任意代码执行及 Keras Lambda 层等漏洞,前端也新增了扫描结果展示。目前已有超过 100 万个模型仓库、数亿个文件被扫描。
OpenAI 分析了 ChatGPT 如何根据用户姓名作出不同回应,并借助 AI 研究助手保护隐私。该评估聚焦 ChatGPT 的公平性问题。
Hugging Face 委托 Trail of Bits 对 Gradio 5 完成独立安全审计,发现的全部安全风险已在 Gradio 5.0 发布前修复并通过验证。
OpenAI 封禁了一批伊朗来源的 STORM-2035 账号,这些账号利用 AI 生成美国和英国选举相关内容并发布到多个网站。
OpenAI 封禁了一批源自卢旺达的账号,这些账号在卢旺达选举前使用 AI 生成党派性评论。
OpenAI 封禁了一批通过一家以色列初创公司访问其模型、用于生成对话并在 X 上发送赌博网站链接的账号。这些账号借助模型批量生成内容,向 X 平台投放赌博站点链接。
OpenAI 封禁了名为“A2Z”的账号网络,这些账号利用 AI 在多个平台生成涉及选举、乌克兰和政治的多语言影响力内容。
OpenAI 封禁了一批账号,这些账号使用 AI 生成针对俄罗斯一家反腐基金会及相关人物的批评评论。
OpenAI 封禁了一个很可能来自美国的账号,该账号用 AI 生成了一条假的 ChatGPT 报错信息,谎称能检测“俄罗斯水军”活动。
OpenAI 封禁了一批俄罗斯来源的“Stop News”账号,这些账号利用 AI 生成多语言文章和帖子,针对乌克兰和西方国家。该行动由 OpenAI 官方披露。
OpenAI 封禁了一批与伊朗关联的 STORM-0817 账号,这些账号利用 AI 调试 Android 恶意软件、抓取社交平台数据并翻译工具。
OpenAI 封禁了一批疑似属于 CyberAv3ngers 的账号,这些账号利用 AI 研究工业控制系统、默认凭据和攻击目标。该活动被 OpenAI 定性为与伊朗关联的网络研究行为。
OpenAI 封禁了一批疑似属于中国相关威胁组织 SweetSpecter 的账号,该组织利用 AI 研究漏洞、编写代码并支持鱼叉式钓鱼活动。
OpenAI 推出基于 GPT-4o 的新多模态审核模型,可更准确地检测有害文本和图像,帮助开发者构建更稳健的审核系统。该模型已用于升级 Moderation API。
OpenAI 发布安全与安保实践更新。
Zico Kolter 加入 OpenAI 董事会,将同时进入安全与安保委员会。OpenAI 表示此举旨在以 AI 安全与对齐领域的专业能力强化公司治理。
Hugging Face 梳理了截至 2024 年 8 月 6 日 Hub 上的安全功能:面向所有用户的细粒度 token、2FA、GPG commit signing、组织访问控制,以及基于 ClamAV、picklescan、trufflehog 的自动化恶意软件、pickle 与密钥扫描。
Google 在 Gemma 2 发布一个月后扩充 Gemma 模型系列,新增 2.6B 参数的 Gemma 2 2B(含 base 与指令微调版)、安全分类器 ShieldGemma 以及稀疏自编码器套件 Gemma Scope。
推荐理由:Gemma 2 新增 2B 小模型、安全分类器和可解释性工具,读者可据此判断端侧部署与安全过滤的可用选项。
OpenAI 开发并应用了一种基于规则的奖励(RBRs)新方法,让模型在无需大量人工数据采集的情况下对齐至安全行为。
OpenAI 提出用证明者-验证者博弈(Prover-Verifier Games)提升语言模型输出的可读性,让 AI 给出的解答更清晰、更易被验证。该方法旨在使模型输出对人类和机器都更可信。
OpenAI 与洛斯阿拉莫斯国家实验室宣布建立研究合作,双方将开发安全评估方法,用于评估和衡量前沿模型相关的生物能力与风险。
Hugging Face 正在 Dataset Hub 上试验一项基于开源 PII 检测工具 Presidio 的新功能,用户可查看数据集 PII 含量的估算报告。Presidio 依靠检测模式和机器学习模型识别 PII,报告可帮助开发者在训练前决定是否进一步过滤数据,也便于数据集所有者验证自身的 PII 过滤流程。
OpenAI 发布基于 GPT-4 的模型 CriticGPT,用于对 ChatGPT 的回复撰写批评意见,帮助人类训练员在 RLHF 过程中发现错误。
推荐理由:OpenAI 提出用 GPT-4 训练的 CriticGPT 辅助人类标注者发现 ChatGPT 回复中的错误,可用于 RLHF 环节。
Hugging Face 发布 Ethics and Society Newsletter #6,探讨高质量数据对 AI 开发的重要性。文章指出好数据应契合具体用途,需具备相关性、全面性、时效性并减少偏见,因为数据质量直接影响模型性能、鲁棒性、效率与公平性。
OpenAI 公布网络安全资助计划,重点展示网络安全领域的创新研究与 AI 集成。
OpenAI 提出一套构建稳健自然语言分类系统的整体性方法,用于真实场景下的内容审核与不良内容检测。该方法强调从整体视角应对真实世界内容审核需求。
OpenAI 任命退役美国陆军上将 Paul M. Nakasone 加入董事会,他将同时进入董事会的安全与安保委员会。Nakasone 为这一持续扩大的董事会带来网络安全领域的经验。
OpenAI 进一步说明其文本转语音模型 Voice Engine 的技术原理与安全研究。该模型可根据文本生成语音,OpenAI 同时公布了围绕这一技术开展的安全研究工作。
OpenAI 封禁了一批与隐蔽影响力行动相关的账号,并称这些账号未因使用其服务获得显著受众增长。
Meta 发布 CyberSecEval 2,从代码不安全实践、提示词注入、网络攻击协助、代码解释器滥用和自动化攻击能力五个维度评测 LLM 的网络安全风险。相比 2023 年 12 月的首版,LLM 协助网络攻击的平均合规率从 52% 降至 28%。提示词注入仍是未解难题,代码解释器滥用风险突出,评测代码已全部开源。
OpenAI 阐述了其安全实践的核心立场:通用人工智能有潜力惠及生活几乎方方面面,因此必须以负责任的方式开发和部署。
OpenAI 推出新技术,帮助研究人员识别由其工具生成的内容,同时加入内容来源与真实性联盟(C2PA)指导委员会以推动行业标准。
OpenAI 封禁了一批与源自中国的"Spamouflage"行动关联的账号,该行动利用 AI 研究社交媒体活动、生成帖文并调试一个此前未被报道的网站。
OpenAI 封禁了与俄罗斯背景行动"Doppelganger"相关的账号,该行动利用 AI 生成反乌克兰的社交媒体评论、翻译及网站文案,覆盖多种语言。
OpenAI 封禁了与伊朗背景行动 "IUVM" 相关的账号,该行动利用 AI 生成并翻译亲伊朗、反以色列和反美的网站内容。