Hugging Face 与 LangChain 联合推出 langchain-huggingface 合作包
Hugging Face 与 LangChain 联合发布合作包 langchain_huggingface,这是一个由双方共同维护的 Python 包,用于将 Hugging Face 最新能力接入 LangChain 并保持同步更新。
Hugging Face 与 LangChain 联合发布合作包 langchain_huggingface,这是一个由双方共同维护的 Python 包,用于将 Hugging Face 最新能力接入 LangChain 并保持同步更新。
Hugging Face 发布 Transformers Agents 2.0,在原有 agent 类型之外新增两类可基于历史观察迭代的 agent,并加入共享功能。
推荐理由:官方给出 Agents 2.0 的模块划分与 GAIA 榜单成绩,可据此判断开源智能体框架的可用边界。
Hugging Face 发布通用智能体项目 Jack of All Trades(JAT),基于 GPT-Neo 的 Transformer 架构,用单一网络在 Atari 57。
Klarna 的 AI 助手承担了相当于 700 名全职客服的工作量。该 AI 助手被用于革新个性化购物、客户服务和员工生产力。
Hugging Face 与 Lighthouz AI 联合推出 Chatbot Guardrails Arena,让用户与两个匿名 LLM 聊天,尝试诱导其泄露虚构银行 XYZ001 客户的敏感信息,并投票选出隐私保护更强的模型。
Mistral AI 发布最新旗舰文本生成模型 Mistral Large,可通过 la Plateforme 使用,并首次通过 Azure 分发。官方称其在常用基准上表现强劲,是继 GPT-4 之后第二个可通过 API 获得的顶级模型,具备 32K token 上下文窗口、原生函数调用与 JSON 格式输出,原生支持英语、法语、西班牙语、德语和意大利语。
推荐理由:官方给出 Mistral Large 的基准对比、32K 上下文与函数调用能力,可据此判断其与 GPT-4 的定位差异。
Mistral AI 发布对话助手 Le Chat,作为与 Mistral 各模型交互的对话入口,底层可调用 Mistral Large、Mistral Small 或原型模型 Mistral Next。同时推出面向企业的 Le Chat Enterprise,支持自部署和细粒度审核机制。Le Chat 目前无法访问互联网,可能给出不准确或过时的信息,现以 beta 形式开放注册。
推荐理由:Mistral 官方发布对话助手 Le Chat 及企业版,读者可了解其模型接入方式与自部署能力。
OpenAI 正在测试让 ChatGPT 记住用户讨论过的内容,以便让后续对话更有帮助。用户对 ChatGPT 的记忆拥有控制权。
推荐理由:OpenAI 官方说明 ChatGPT 记忆功能的测试范围与用户控制方式,可据此了解该能力如何改变多轮对话体验。
Hugging Face 为 Text Generation Inference(TGI)和 Inference Endpoints 推出 Messages API,从 TGI 1.4.0 起提供与 OpenAI Chat Completion API 兼容的接口,可直接使用 OpenAI 客户端库或 LangChain、LlamaIndex 等第三方工具。
Hugging Face 发布博客,介绍如何用新集成的 ChatHuggingFace 在 LangChain 中把开源模型搭建成 ReAct 智能体,并给出完整代码示例。
推荐理由:原文给出 ReAct 智能体的完整搭建代码与开源模型对比基准,读者可据此判断哪些模型适合驱动智能体工作流。
Mistral AI 开放首个平台服务 La Plateforme 的 beta 访问,提供三个 chat 端点和一 个 embedding 端点,各有不同的性能与价格取舍。
推荐理由:Mistral 首次开放平台 API,给出三个 chat 端点与 embedding 端点的性能价格取舍,可据此判断其服务化路线。
OpenAI 在 DevDay 上发布 GPT-4 Turbo,支持 128K 上下文并下调价格,同时推出 Assistants API、GPT-4 Turbo with Vision 和 DALL·E 3 API 等开发者产品。
推荐理由:OpenAI 在 DevDay 一次性公布 GPT-4 Turbo、Assistants API 等多项更新,可据此了解其模型与开发者产品的整体走向。
OpenAI 发布 GPTs,用户现在可以创建自定义版本的 ChatGPT,将指令、额外知识和任意技能组合在一起。该功能由 OpenAI 官方推出,具体开放范围与使用细节原文未进一步说明。
推荐理由:OpenAI 官方发布 GPTs,读者可了解自定义 ChatGPT 的构成方式与开放范围。
Hugging Face 在 huggingface.js 下发布 Agents.js,一个可在浏览器或服务端为 LLM 提供工具访问的 JavaScript 库,通过 npm install @huggingface/agents 安装。
推荐理由:原文给出库的安装方式、代码示例和自定义工具接口,读者可据此判断如何在 JS 项目中接入工具调用。
Hugging Face 团队基于 BigCode 的 16B 参数 StarCoder 模型,用 OpenAssistant 对话数据集微调出编码助手 StarChat,并公开了代码、数据集与模型。
推荐理由:原文完整给出了用对话数据微调 StarCoder 的流程与代码,读者可据此复现一个开源编码助手。
OpenAI 宣布为 ChatGPT 实现插件的初步支持。插件是专为语言模型设计的工具,以安全为核心原则,可帮助 ChatGPT 获取最新信息、执行计算或使用第三方服务。
推荐理由:OpenAI 官方给出 ChatGPT 插件的最初支持范围,读者可据此了解模型接入外部工具与实时信息的早期形态。
Hugging Face 博客"AI for Game Development"系列第 5 篇演示了如何用 ChatGPT 为农场游戏生成故事,包括故事梗概、游戏内文本和商店物品描述。
Hugging Face 发布开源工具 AI vs. AI,用于在深度强化学习多智能体场景中对模型进行相对排名。该工具由 Space 匹配算法、Dataset 结果存储和展示 ELO 评分的 Leaderboard 三部分组成,模型上传至 Hub 后即自动参与对战评估,初始 ELO 为 1200。
Hugging Face 博客梳理了让对话智能体有用的关键技术,包括指令微调(IFT)、监督微调(SFT)、思维链(CoT)和基于人类反馈的强化学习(RLHF),并对比了 LaMDA、BlenderBot 3、Sparrow、ChatGPT/InstructGPT 和 Anthropic Assistant 在访问方式、模型规模、训练数据和评测标准上的差异。
OpenAI 提出 Video PreTraining(VPT)方法,在大量无标注的人类玩 Minecraft 视频上训练神经网络,仅使用少量承包商标注数据。经微调后,模型能学会制作钻石工具,这一任务通常需要熟练人类花费 20 多分钟、约 24000 次操作。模型直接使用键盘按键和鼠标移动这类原生人类交互接口,具有较强通用性,是迈向通用计算机使用智能体的一步。
推荐理由:OpenAI 用少量标注数据加海量无标注视频训练出能玩 Minecraft 的模型,可了解视频预训练在通用计算机智能体上的早期尝试。
Hugging Face 将离线强化学习方法 Decision Transformer 集成进 transformers 库和 Hugging Face Hub,并发布 9 个 Gym 环境连续控制任务的预训练 checkpoint,覆盖 Hopper、Walker2D 和 Halfcheetah,Atari 环境 checkpoint 即将推出。
Hugging Face 发布首个自研深度强化学习环境 Snowball Fight 1vs1,基于 Unity ML-Agents 构建,玩家可与深度强化学习智能体对战扔雪球,游戏已托管在 Hugging Face Spaces 并可在线游玩。训练环境已在 Hugging Face Hub 开源,后续将推出 2vs2 版本,使用 MA-POCA 算法训练智能体团队协作。
OpenAI 发布关于 Dota 2 大规模深度强化学习的研究,标题为 Dota 2 with large scale deep reinforcement learning,正文内容未能获取。
OpenAI 发布 Safety Gym,一套用于衡量强化学习智能体在训练中遵守安全约束进展的环境与工具。该套件面向在训练过程中尊重安全约束的强化学习智能体,提供相应的环境和工具来度量其进展。
OpenAI 在模拟捉迷藏环境中训练智能体,观察到它们逐步学会使用更复杂的工具,并形成六种不同的策略与反策略,其中一些是该环境原本未设计支持的。OpenAI 认为,这种在简单环境中自监督涌现出的复杂性,说明多智能体共同适应未来可能产生极其复杂且智能的行为。
推荐理由:OpenAI 在多智能体捉迷藏环境中观察到智能体自发形成六种策略与反策略,可了解涌现式工具使用的实验设定。
OpenAI 发布 Neural MMO,一个面向强化学习智能体的大规模多智能体游戏环境,支持在持久、开放式的任务中容纳大量且数量可变的智能体。该平台引入众多智能体与物种,带来更好的探索、差异化的生态位形成以及整体能力的提升。
OpenAI Five 在一场三局两胜的比赛中击败了由 Blitz、Cap、Fogged、Merlini 和 MoonMeander 组成的 99.95 百分位 Dota 玩家队伍,其中四人曾打过职业 Dota。比赛在直播观众和 10 万名同时在线观看者面前进行。
OpenAI Five Benchmark 比赛已结束。该消息由 OpenAI 发布,正文未披露更多细节。
OpenAI 训练出一个智能体,仅凭单次人类演示就在 Montezuma's Revenge 上取得 74,500 分的高分,超过此前所有已发表结果。其算法思路是让智能体从演示中精心挑选的状态出发连续进行多局游戏,并用 PPO 优化游戏得分,PPO 也是 OpenAI Five 所依赖的强化学习算法。
推荐理由:OpenAI 用单次人类演示加 PPO 在 Montezuma's Revenge 上取得 74,500 分,可了解其从演示状态起步的训练思路。
OpenAI 宣布其由五个神经网络组成的 OpenAI Five 已开始在 Dota 2 中击败业余人类战队。
OpenAI 首届 Retro Contest 已完成,该比赛旨在探索能够从过往经验中泛化迁移的算法。
OpenAI 发布 Learning with Opponent-Learning Awareness(LOLA)算法,该算法在建模时考虑其他智能体也在学习,从而在迭代囚徒困境中发现"以牙还牙"这类既自利又合作的策略。OpenAI 称这是迈向能够建模他方心智的智能体的一小步。
OpenAI 发文说明其 Dota 2 结果表明,在算力充足的前提下,自对弈能把机器学习系统的表现从远低于人类水平提升到超人水平。该系统在一个月内从勉强与高排名玩家打平,发展到击败顶尖职业选手,此后仍在持续进步。OpenAI 指出,监督式深度学习系统的上限取决于训练数据集,而自对弈系统的可用数据会随着智能体变强而自动改善。
推荐理由:OpenAI 用 Dota 2 结果说明自对弈在算力充足时能把系统从远低于人类提升到超人水平。
OpenAI 宣布其打造的机器人在标准锦标赛规则下的 Dota 2 1v1 对战中击败了世界顶尖职业选手。该机器人完全通过自我对弈从零学习游戏,未使用模仿学习或树搜索。OpenAI 称这是迈向在涉及真实人类的混乱复杂情境中完成明确目标的一步。
推荐理由:OpenAI 用自我对弈从零训练出在标准赛制 1v1 中击败顶尖选手的 Dota 2 机器人,可作为复杂环境中目标导向 AI 的早期样本。
OpenAI 发文指出,智能体争夺资源的多智能体环境是通往 AGI 的踏脚石。这类环境具备两个有用特性:难度由竞争对手的水平决定,与自身克隆体竞争时难度恰好匹配自身水平;同时不存在稳定均衡,智能体再聪明也始终面临变得更聪明的压力。
OpenAI 发布一项新研究,介绍智能体在其中发展出自己的语言。该帖仅给出研究概要,未提供完整正文。
OpenAI 发布 Universe,一个用于衡量和训练 AI 通用智能的软件平台,覆盖全球范围内的游戏、网站及其他应用。
推荐理由:OpenAI 发布 Universe 平台,读者可了解其用游戏与网站训练和衡量 AI 通用智能的定位。