OpenAI 提出指令层级:训练 LLM 优先执行高优先级指令
OpenAI 提出"指令层级"方法,通过训练让 LLM 优先执行高优先级指令,以抵御提示词注入、越狱等攻击。当前 LLM 易被对抗者用恶意提示词覆盖原始指令,该方法旨在解决这一安全问题。
OpenAI 提出"指令层级"方法,通过训练让 LLM 优先执行高优先级指令,以抵御提示词注入、越狱等攻击。当前 LLM 易被对抗者用恶意提示词覆盖原始指令,该方法旨在解决这一安全问题。
Hugging Face 发布 Cosmopedia,一个由 Mixtral-8x7B-Instruct-v0.1 生成的合成数据集,包含超 3000 万个文件、250 亿 token,用于从零预训练大语言模型,目标是复现 Phi-1.5 的训练数据。
推荐理由:Hugging Face 公开了从提示词设计到去污染、训练评估的完整合成数据流水线,可迁移到自建预训练数据。
Hugging Face 推出 WebSight 数据集,用于训练视觉语言模型将网页截图转换为 HTML 代码。该数据集从 v0.1 的 823,000 对截图/HTML 样本扩展至 v0.2 的 200 万例,改用真实截图和 Tailwind CSS。基于该数据集微调的模型 Sightseer 可将网页截图转为可用的 HTML 代码,并还原截图中的图像。
加州大学洛杉矶分校研究者推出 ConTextual,一个包含 506 条指令的文本密集视觉推理数据集,覆盖时间阅读、购物、导航、信息图等 8 类真实场景,并同步上线排行榜。初步评测 13 个模型显示,GPT-4V 表现最佳,在抽象推理上超过人类,但在时间相关任务上落后;开源模型在多个领域表现不佳,用 OCR 加 caption 增强 LLM 的方案人类通过率仅 17.2%。
OpenAI 发布研究,探索在视频数据上大规模训练生成模型,联合在可变时长、分辨率和宽高比的视频与图像上训练文本条件扩散模型,并采用在视频和图像 latent code 的时空 patch 上运行的 Transformer 架构。其最大模型 Sora 能生成一分钟高保真视频,结果表明扩展视频生成模型是构建通用物理世界模拟器的一条有前景的路径。
推荐理由:OpenAI 首次公开 Sora 的技术路线,说明视频生成模型可扩展为物理世界模拟器。
Hugging Face 推出 NPHardEval 排行榜,基于密歇根大学和罗格斯大学研究者开发的 NPHardEval 基准,通过计算复杂度类评估 LLM 推理能力。
OpenAI 正在为评估大语言模型可能协助制造生物威胁的风险制定蓝图。在一项有生物学专家和学生参与的评测中,OpenAI 发现 GPT-4 对生物威胁制造准确率的提升最多只是轻微的。这一提升幅度尚不足以得出确定结论,但该发现是后续研究和社区讨论的起点。
Hugging Face 推出 Hallucinations Leaderboard,基于 EleutherAI Language Model Evaluation Harness 在 NQ Open、TriviaQA、TruthfulQA、XSum、CNN/DM、RACE、SQuADv2、FEVER、FaithDial、HaluEval 等基准上评测 LLM 的幻觉表现。
Hugging Face 发布 LLM Safety Leaderboard,基于 DecodingTrust 对 LLM 安全性进行评估,该平台曾获 NeurIPS 2023 杰出论文奖。评估覆盖毒性、刻板印象偏见、对抗鲁棒性、OOD 鲁棒性、隐私、机器伦理和公平性等八个可信度维度,并提供针对各维度的红队测试算法。用户可将模型权重转为 safetensors 格式后通过排行榜提交评估。
OpenAI 提出面向超级对齐的新研究方向,探讨能否利用深度学习的泛化特性,用弱监督者控制更强的模型,并给出了初步结果。
Hugging Face 与 Intel Labs 推出 SetFitABSA,一个用于少样本训练领域特定方面级情感分析(ABSA)模型的框架,在少样本场景下表现优于 Llama2 和 T5 等生成式模型。
Hugging Face 博客复现了 OpenAI 2019 年的 RLHF 代码库 openai/lm-human-preferences,在情感和描述性任务上得到与原始代码几乎一致的学习曲线,并整理出一份实现细节清单。
OpenAI 发布 DALL·E 3 系统卡,用于说明该图像生成模型在安全与风险方面的评估情况。
OpenAI 发布 GPT-4V(ision) 系统卡,介绍该多模态模型的能力与安全评估情况。
Hugging Face 在 Open LLM Leaderboard 评估套件中新增 GPT-4 评测,与 Scale AI 的人类标注对比,检验 LLM 能否替代人工标注偏好数据。
OpenAI 训练了一个模型,通过奖励每一步正确推理(过程监督)而非只奖励最终正确答案(结果监督),在数学问题求解上取得新的 SOTA。除性能提升外,过程监督还带来对齐收益:直接训练模型产出人类认可的思维链。
推荐理由:OpenAI 用过程监督替代结果监督提升数学推理,并给出对对齐的额外收益,可了解训练方法差异。
OpenAI 用 GPT-4 自动为大型语言模型的神经元行为撰写解释,并对这些解释打分。团队同时发布了覆盖 GPT-2 全部神经元的解释与评分数据集,并说明这些解释并不完美。
推荐理由:OpenAI 用 GPT-4 自动解释并评分 GPT-2 神经元行为,并公开全部神经元的解释与评分数据集。
OpenAI 发布题为 GPTs are GPTs 的研究,初步考察大语言模型对劳动力市场的潜在影响。原文正文未能抓取,仅标题可用。
OpenAI 联合乔治城大学安全与新兴技术中心及斯坦福互联网天文台,研究大语言模型可能被用于虚假信息宣传的方式,并发布了一份基于一年多研究的联合报告。报告梳理了语言模型若被用于增强虚假信息宣传会对信息环境构成的威胁,并提出了一套分析潜在缓解措施的框架。
Hugging Face 发布 MTEB(Massive Text Embedding Benchmark),用于在多种嵌入任务上衡量文本嵌入模型性能,包含 56 个数据集、8 类任务,覆盖最多 112 种语言,榜单已汇总超过 2000 条结果。
推荐理由:MTEB 把 56 个数据集、8 类任务和 112 种语言汇总成统一榜单,读者可据此理解文本嵌入模型的评测口径与选型依据。
OpenAI 提出 Video PreTraining(VPT)方法,在大量无标注的人类玩 Minecraft 视频上训练神经网络,仅使用少量承包商标注数据。经微调后,模型能学会制作钻石工具,这一任务通常需要熟练人类花费 20 多分钟、约 24000 次操作。模型直接使用键盘按键和鼠标移动这类原生人类交互接口,具有较强通用性,是迈向通用计算机使用智能体的一步。
推荐理由:OpenAI 用少量标注数据加海量无标注视频训练出能玩 Minecraft 的模型,可了解视频预训练在通用计算机智能体上的早期尝试。
OpenAI 训练了批评写作模型,用于描述摘要中的缺陷。人类评估者在看到模型给出的批评后,发现摘要缺陷的频率明显提高。研究还发现,模型越大自批评能力越强,规模对批评写作的提升大于对摘要写作的提升,这为用 AI 系统辅助人类监督 AI 系统提供了可能。
推荐理由:OpenAI 用批评写作模型辅助人类发现摘要缺陷,并给出模型规模与自批评能力的关系。
微软提出 TAPEX,通过让 BART 学习执行合成 SQL 查询来实现表格预训练,无需真实数据。在 WikiSQL、TabFact、SQA 和 WikiTableQuestions 四个基准上均取得 SOTA,其中 WikiSQL 准确率达 89.6%,WikiTableQuestions 达 57.5%。
OpenAI 构建了一个面向 Lean 的神经定理证明器,能够求解多道高难度高中数学奥赛题,包括来自 AMC12 和 AIME 的题目,以及两道改编自 IMO 的题目。
推荐理由:OpenAI 用神经定理证明器在 Lean 中解出 AMC12、AIME 及两道改编自 IMO 的题目,可了解形式化数学推理的早期进展。
OpenAI 对 GPT-3 进行微调,使其能借助基于文本的网页浏览器更准确地回答开放式问题。
OpenAI 训练了一个求解小学数学应用题的系统,准确率约为微调 GPT-3 模型的两倍。该系统能解出约 90% 的题目数量,在一组 9-12 岁儿童样本上,儿童在同一数据集测试中得分 60%,该系统得分为 55%。
推荐理由:读者可了解该数学应用题求解系统与微调 GPT-3 及小学生的准确率对比,判断其能力位置。
OpenAI 提出用人类反馈来扩展 AI 系统在难以评估任务上的监督能力,并以书籍摘要作为测试场景。该方法针对的是评估困难、无法用简单指标衡量的任务,试图让人类监督在规模上可行。
Hugging Face 联合 Yandex Research 等机构提出 DeDLOC 协作式分布式训练方法,可自适应参与者的网络与硬件条件,并通过 40 名志愿者在互联网上预训练出孟加拉语模型 sahajBERT。
推荐理由:Hugging Face 团队用 40 名志愿者在互联网上预训练出孟加拉语模型,给出了分布式协作训练在真实场景中的可行路径。
OpenAI 研究发现,通过在小型精选数据集上微调,可以改善语言模型在特定行为价值观方面的表现。
Hugging Face 博客 2021 年 2 月阅读小组聚焦长程注意力,梳理了 Longformer、Compressive Transformer、Linformer、Performer 四类降低 Transformer 序列长度二次开销的思路。
OpenAI 在 CLIP 中发现了一类多模态神经元,无论概念以文字、符号还是概念形式呈现,这些神经元都会产生响应。这可能解释 CLIP 为何能准确分类出人意料的概念视觉变体,也是理解 CLIP 及类似模型所学关联与偏见的重要一步。
推荐理由:OpenAI 在 CLIP 中发现对同一概念的多模态神经元,为理解其分类准确性与习得偏见提供线索。
OpenAI 将人类反馈强化学习(RLHF)应用于语言模型训练,使其在摘要任务上表现更好。
OpenAI 发现,正如在语言上训练的大型 Transformer 能生成连贯文本,同一模型在像素序列上训练后也能生成连贯的图像补全与样本。研究还建立了样本质量与图像分类准确率之间的相关性,表明其最佳生成模型在无监督设定下所含特征可与顶级卷积网络竞争。
推荐理由:原文给出用同一 Transformer 处理像素序列生成图像并做无监督分类的早期思路,可了解生成与表征学习的关联。
OpenAI 发布题为《Language models are few-shot learners》的论文,提出语言模型具备少样本学习能力。
OpenAI 发布一项分析,指出自 2012 年以来,在 ImageNet 分类上训练达到同等性能的神经网络所需算力每 16 个月减少一半。与 2012 年相比,如今训练到 AlexNet 水平所需的算力减少了 44 倍,而同期摩尔定律带来的成本改善约为 11 倍。分析认为,在近期投入较高的 AI 任务上,算法进步带来的收益超过传统硬件效率提升。
推荐理由:OpenAI 用 ImageNet 训练算力数据量化算法进步速度,可与摩尔定律对照理解 AI 效率来源。
OpenAI 发布关于神经语言模型缩放定律的研究,探讨模型性能与规模之间的关系。
OpenAI 发布关于 Dota 2 大规模深度强化学习的研究,标题为 Dota 2 with large scale deep reinforcement learning,正文内容未能获取。
OpenAI 发现双重下降现象在 CNN、ResNet 和 Transformer 中普遍存在:随着模型规模、数据量或训练时间增加,性能先提升、再变差、然后再次提升。这一效应通常可通过精细的正则化避免,但其成因尚不完全清楚,OpenAI 将其视为重要研究方向。
OpenAI 发布 Procgen Benchmark,包含 16 个易于使用的程序化生成环境,用于直接衡量强化学习智能体学习可泛化技能的速度。
OpenAI 训练了一对神经网络,让类人机械手解开魔方。两个网络完全在仿真中训练,使用与 OpenAI Five 相同的强化学习代码,并搭配名为 Automatic Domain Randomization(ADR)的新技术。系统能应对训练中从未见过的情况,例如被毛绒长颈鹿戳碰,说明强化学习不只适用于虚拟任务,也能解决需要高灵巧度的物理世界问题。
推荐理由:OpenAI 用仿真训练加自动域随机化让机械手解魔方,可了解强化学习迁移到物理操作任务的思路。