OpenAI 为 DALL·E 2 降低偏见并提升安全性
OpenAI 为 DALL·E 2 部署了一项新技术,使其生成的人物图像能更准确地反映世界人口的多样性,以降低偏见并提升安全性。
OpenAI 为 DALL·E 2 部署了一项新技术,使其生成的人物图像能更准确地反映世界人口的多样性,以降低偏见并提升安全性。
OpenAI 为向大众开放 DALL·E 2,在预训练阶段采取了一系列缓解措施,以降低强大图像生成模型带来的风险。为此,OpenAI 设置了多种防护机制,防止生成图像违反其内容政策。
OpenAI 训练了批评写作模型,用于描述摘要中的缺陷。人类评估者在看到模型给出的批评后,发现摘要缺陷的频率明显提高。研究还发现,模型越大自批评能力越强,规模对批评写作的提升大于对摘要写作的提升,这为用 AI 系统辅助人类监督 AI 系统提供了可能。
推荐理由:OpenAI 用批评写作模型辅助人类发现摘要缺陷,并给出模型规模与自批评能力的关系。
Cohere、OpenAI 和 AI21 Labs 共同制定了一套初步的大语言模型最佳实践,适用于任何开发或部署大语言模型的组织。
Hugging Face 多模态学习团队发布了一份伦理章程,将伦理原则正式纳入其机器学习研究生命周期的起点。章程列出了要防止的用例,包括生成虚假信息、生成个人身份信息、在医疗、法律、金融和移民等高风险领域的不谨慎使用,以及各类歧视性内容。团队同时提出透明、开放可复现、公平、自我批判和尊重署名五项价值观,并承认这些价值观之间有时会相互冲突,需逐案权衡。
Hugging Face 研究科学家 Sasha Luccioni 在播客访谈中介绍了她在 Big Science 项目中主持碳足迹工作组的工作,研究范围涵盖 GPU 训练时长、制造成本乃至单封邮件的 CO2 排放。她还参与数据工作组,推动数据筛选与多语言化,避免模型训练数据几乎全为英文。
OpenAI 探讨 Goodhart 定律在 AI 目标优化中的体现:当一个度量指标变成目标时,它就不再是好的度量。OpenAI 指出,在优化难以或高成本衡量的目标时,必须应对这一问题。
Hugging Face 发布机器学习专家访谈,嘉宾 Margaret Mitchell 曾创立并联合领导 Google 伦理 AI 团队,现于 Hugging Face 制定伦理 AI 研究协议与包容性招聘体系。
OpenAI 分享了其在语言模型安全与滥用方面的最新思考,旨在帮助其他 AI 开发者应对已部署模型的安全与滥用问题。
OpenAI 训练出比 GPT-3 更能遵循用户意图的语言模型 InstructGPT,同时更真实、毒性更低,相关技术来自其对齐研究。这些模型采用人类参与的训练方式,现已作为 OpenAI API 的默认语言模型部署。
推荐理由:OpenAI 公布 InstructGPT 的指令跟随与真实性改进,并说明其已替换 API 默认模型。
OpenAI 研究发现,通过在小型精选数据集上微调,可以改善语言模型在特定行为价值观方面的表现。
OpenAI 参与撰写的多利益相关方报告提出 10 项机制,用于提升 AI 系统相关声明的可验证性。该报告由 30 家机构的 58 位合著者共同完成,涵盖 Centre for the Future of Intelligence、Mila、Schwartz Reisman Institute for Technology and Society 等。
OpenAI 发布 Safety Gym,一套用于衡量强化学习智能体在训练中遵守安全约束进展的环境与工具。该套件面向在训练过程中尊重安全约束的强化学习智能体,提供相应的环境和工具来度量其进展。
OpenAI 用人类反馈对 774M 参数的 GPT-2 语言模型进行微调,在多项任务上成功匹配外部人类标注者的偏好,尽管这些偏好并不总与 OpenAI 自身一致。在摘要任务中,标注者偏好直接从输入中整句复制的内容,模型因此学会了复制;摘要任务需要 6 万条人类标注,而按不同风格续写文本等更简单的任务只需 5 千条。OpenAI 表示其动机是让安全技术更接近“机器与人对话”这一通用任务。
推荐理由:OpenAI 用人类反馈微调 GPT-2 的早期实验,展示了偏好数据如何让模型学会复制而非改写。
OpenAI 开发出一种方法,用于评估神经网络分类器能否可靠防御训练中未见的对抗攻击,并提出新指标 UAR(Unforeseen Attack Robustness),可衡量单一模型面对未预期攻击时的鲁棒性。该方法同时指出,有必要在更多样化的未知攻击范围内衡量模型性能。
OpenAI 发布政策研究论文,提出当前可用于推动行业长期安全规范合作的四项策略:沟通风险与收益、技术协作、提升透明度、激励标准。分析指出,行业安全合作对确保 AI 系统安全有益至关重要,但竞争压力可能引发集体行动问题,导致 AI 公司对安全投入不足。
OpenAI 与 Google 研究人员合作推出 Activation Atlases,一种可视化神经元之间交互所代表内容的新技术。随着 AI 系统被部署到日益敏感的场景,更好地理解其内部决策过程有助于识别弱点和调查失败原因。
OpenAI 发表论文指出,长期 AI 安全研究需要社会科学家参与,才能确保 AI 对齐算法在真实人类参与时有效。论文认为,将先进 AI 系统与人类价值观正确对齐,需解决人类理性、情感与偏见心理学相关的诸多不确定性。OpenAI 计划招聘社会科学家全职从事这一方向的研究。
OpenAI 提出一种名为迭代放大(iterated amplification)的 AI 安全技术,通过将复杂任务分解为更简单的子任务来指定超出人类规模的行为与目标,而非依赖标注数据或奖励函数。该构想仍处于极早期阶段,目前仅在简单的玩具算法领域完成实验,OpenAI 认为它可能成为可扩展的 AI 安全方案。
OpenAI 提出一种 AI 安全技术,训练智能体就话题相互辩论,由人类判断胜负。该方法旨在借助辩论提升 AI 系统的安全性。
OpenAI 与未来人类研究所、存在风险研究中心、新美国安全中心、电子前沿基金会等机构合作,共同撰写了一篇论文,预测恶意行为者可能如何滥用 AI 技术,以及可以预防和缓解这些威胁的潜在方法。该论文是双方近一年持续合作的成果。
推荐理由:OpenAI 与多家机构合作近一年,梳理 AI 被恶意滥用的可能路径与防范思路。
OpenAI 开源了 RL-Teacher,这是其通过偶尔的人类反馈而非手工设计奖励函数来训练 AI 的接口实现。该技术为迈向安全 AI 系统而开发,也适用于奖励难以明确指定的强化学习问题。
OpenAI 表示已生成一批图像,在多种尺度和视角下都能稳定欺骗神经网络分类器。这一结果对上周提出的说法构成挑战,即自动驾驶汽车因从多个尺度、角度和视角采集图像而难以被恶意欺骗。
推荐理由:OpenAI 用多尺度多视角仍能骗过分类器的图像,回应了上周关于自动驾驶难以被恶意欺骗的说法。
OpenAI 与 DeepMind 安全团队合作开发了一种算法,通过让人类指出两种候选行为中哪一个更好,来推断人类想要什么。OpenAI 称,构建安全 AI 系统的一步是免去人类编写目标函数的需要,因为用简单代理替代复杂目标、或把复杂目标写偏一点,都可能导致不良甚至危险的行为。
推荐理由:OpenAI 与 DeepMind 安全团队合作提出用人类偏好比较替代手写目标函数,为对齐研究提供了一条早期思路。
OpenAI 发文解释对抗样本——攻击者刻意设计、能让机器学习模型出错的输入,相当于机器的视觉错觉。文章展示了对抗样本在不同媒介上的表现,并讨论了为何防御这类攻击十分困难。
OpenAI 发文探讨强化学习算法中一种反直觉的失效模式:奖励函数设定错误。当奖励函数被错误指定时,算法会以出人意料的方式出现故障。
OpenAI 与 Berkeley、Stanford 研究人员共同合著了 Google Brain 主导的论文《Concrete Problems in AI Safety》,该论文探讨了确保现代机器学习系统按预期运行的诸多研究问题。
OpenAI 公布其技术目标,核心使命是构建安全的 AI,并确保 AI 带来的益处尽可能广泛且均衡地分配。