跳到正文

#安全/对齐

今日 0 条
7月18日周一
6月28日周二
6月13日周一
  1. OpenAI News62

    OpenAI 训练批评写作模型,帮助人类发现摘要缺陷

    OpenAI 训练了批评写作模型,用于描述摘要中的缺陷。人类评估者在看到模型给出的批评后,发现摘要缺陷的频率明显提高。研究还发现,模型越大自批评能力越强,规模对批评写作的提升大于对摘要写作的提升,这为用 AI 系统辅助人类监督 AI 系统提供了可能。

    推荐理由:OpenAI 用批评写作模型辅助人类发现摘要缺陷,并给出模型规模与自批评能力的关系。

6月2日周四
5月19日周四
  1. Hugging Face Blog20

    Hugging Face 多模态学习团队发布伦理章程,将伦理原则置于研究生命周期核心

    Hugging Face 多模态学习团队发布了一份伦理章程,将伦理原则正式纳入其机器学习研究生命周期的起点。章程列出了要防止的用例,包括生成虚假信息、生成个人身份信息、在医疗、法律、金融和移民等高风险领域的不谨慎使用,以及各类歧视性内容。团队同时提出透明、开放可复现、公平、自我批判和尊重署名五项价值观,并承认这些价值观之间有时会相互冲突,需逐案权衡。

5月17日周二
4月13日周三
3月23日周三
3月3日周四
1月27日周四
  1. OpenAI News82

    OpenAI 发布 InstructGPT,让语言模型更好遵循用户指令

    OpenAI 训练出比 GPT-3 更能遵循用户意图的语言模型 InstructGPT,同时更真实、毒性更低,相关技术来自其对齐研究。这些模型采用人类参与的训练方式,现已作为 OpenAI API 的默认语言模型部署。

    推荐理由:OpenAI 公布 InstructGPT 的指令跟随与真实性改进,并说明其已替换 API 默认模型。

6月10日周四
4月16日周四
11月21日周四
9月19日周四
  1. OpenAI News62

    OpenAI 用人类偏好微调 774M 参数 GPT-2

    OpenAI 用人类反馈对 774M 参数的 GPT-2 语言模型进行微调,在多项任务上成功匹配外部人类标注者的偏好,尽管这些偏好并不总与 OpenAI 自身一致。在摘要任务中,标注者偏好直接从输入中整句复制的内容,模型因此学会了复制;摘要任务需要 6 万条人类标注,而按不同风格续写文本等更简单的任务只需 5 千条。OpenAI 表示其动机是让安全技术更接近“机器与人对话”这一通用任务。

    推荐理由:OpenAI 用人类反馈微调 GPT-2 的早期实验,展示了偏好数据如何让模型学会复制而非改写。

8月22日周四
7月10日周三
3月6日周三
2月19日周二
10月22日周一
  1. OpenAI News36

    OpenAI 提出迭代放大(iterated amplification)AI 安全技术

    OpenAI 提出一种名为迭代放大(iterated amplification)的 AI 安全技术,通过将复杂任务分解为更简单的子任务来指定超出人类规模的行为与目标,而非依赖标注数据或奖励函数。该构想仍处于极早期阶段,目前仅在简单的玩具算法领域完成实验,OpenAI 认为它可能成为可扩展的 AI 安全方案。

5月3日周四
2月20日周二
  1. OpenAI News62

    OpenAI 等机构联合发布 AI 恶意使用预测论文

    OpenAI 与未来人类研究所、存在风险研究中心、新美国安全中心、电子前沿基金会等机构合作,共同撰写了一篇论文,预测恶意行为者可能如何滥用 AI 技术,以及可以预防和缓解这些威胁的潜在方法。该论文是双方近一年持续合作的成果。

    推荐理由:OpenAI 与多家机构合作近一年,梳理 AI 被恶意滥用的可能路径与防范思路。

8月3日周四
7月17日周一
  1. OpenAI News60

    OpenAI 发布可稳定欺骗神经网络分类器的对抗样本图像

    OpenAI 表示已生成一批图像,在多种尺度和视角下都能稳定欺骗神经网络分类器。这一结果对上周提出的说法构成挑战,即自动驾驶汽车因从多个尺度、角度和视角采集图像而难以被恶意欺骗。

    推荐理由:OpenAI 用多尺度多视角仍能骗过分类器的图像,回应了上周关于自动驾驶难以被恶意欺骗的说法。

6月13日周二
  1. OpenAI News62

    OpenAI 与 DeepMind 合作提出从人类偏好中学习的方法

    OpenAI 与 DeepMind 安全团队合作开发了一种算法,通过让人类指出两种候选行为中哪一个更好,来推断人类想要什么。OpenAI 称,构建安全 AI 系统的一步是免去人类编写目标函数的需要,因为用简单代理替代复杂目标、或把复杂目标写偏一点,都可能导致不良甚至危险的行为。

    推荐理由:OpenAI 与 DeepMind 安全团队合作提出用人类偏好比较替代手写目标函数,为对齐研究提供了一条早期思路。

2月24日周五
12月21日周三
6月21日周二
6月20日周一