Hugging Face 就美国国家 AI 研究资源(NAIRR)中期报告提交建议
Hugging Face 于 2022 年 6 月下旬就美国国家 AI 研究资源(NAIRR)中期报告提交了回应,建议任命技术与伦理专家担任顾问、制定模型与数据文档标准、为非技术专家提供低代码或无代码工具。其还建议 NAIRR 监测开源与开放科学的高风险滥用,并通过多语言工具与资源支持多元研究者视角。
Hugging Face 于 2022 年 6 月下旬就美国国家 AI 研究资源(NAIRR)中期报告提交了回应,建议任命技术与伦理专家担任顾问、制定模型与数据文档标准、为非技术专家提供低代码或无代码工具。其还建议 NAIRR 监测开源与开放科学的高风险滥用,并通过多语言工具与资源支持多元研究者视角。
Hugging Face 为 🤗 Datasets 补充了音频和图像数据集的文档,Quickstart 新增端到端加载与处理示例,并引入 to_tf_dataset 函数,可将数据集转换为 tf.data.Dataset 供 TensorFlow 或 Keras 训练。
Hugging Face 的 transformers 库在 TensorFlow 下现可通过 XLA 编译文本生成,速度最高提升 100 倍,甚至快于 PyTorch。该功能需 transformers >= 4.21.0,支持采样、贪心解码、Beam Search 及 temperature、max_new_tokens 等参数控制。
Hugging Face 博客介绍动态对抗数据收集(DADC):让用户用千奇百怪的手写数字骗过模型,再把骗成功的样本存下来继续训练,循环多轮以提升鲁棒性。教程以 MNIST 手写数字识别为例,用 🤗 Spaces 搭建交互 demo,模型训练 20 个 epoch 后在测试集上达到 89% 准确率,并通过 flag 机制收集对抗样本。
Hugging Face 披露了 176B 参数多语言模型 BLOOM 的训练技术细节,该模型基于 GPT3 架构,使用 Megatron-DeepSpeed 框架在 384 张 80GB A100 GPU 上训练,耗时约 3.5 个月。训练数据为 59 种语言、350B token,模型词表大小 250,680,采用 3D 并行(数据、张量、流水线并行)方案。
Hugging Face 发布 BLOOM,一个 176B 参数的多语言大语言模型,可生成 46 种自然语言和 13 种编程语言的文本,由 70 多个国家 1000 多名研究者协作完成,在法国 Jean Zay 超算上训练 117 天。
推荐理由:BLOOM 以 176B 参数覆盖 46 种自然语言,并公开训练中间检查点与优化器状态,为研究大模型内部行为提供了少见的开放样本。
Hugging Face 展示了用 Accelerate 库调用 DeepSpeed ZeRO 加速大模型训练的方法,无需改动代码即可启用 ZeRO Stage-2。
Hugging Face 推出 Evaluation on the Hub,由 AutoTrain 驱动,用户无需写代码即可在 Hub 上用任意数据集评测任意模型。评测结果会以 PR 形式写入模型卡元数据,并可在数据集排行榜上比较不同模型的表现。官方已用该工具在多个关键数据集上评测了数百个模型,并给出文本分类、命名实体识别和文本摘要等可直接试用的数据集示例。
推荐理由:Hugging Face 把模型评测做成 Hub 上的零代码流程,读者可据此了解评测结果如何进入模型卡与排行榜。
Hugging Face 介绍了将 Transformers 模型转为 ONNX 的三种方式:底层 torch.onnx、中层 transformers.onnx 和 Optimum 高层 API。
Intel 正式加入 Hugging Face 硬件合作伙伴计划,双方将基于开源库 Optimum 合作构建面向 Transformer 的硬件加速方案,覆盖训练、微调与推理。
Hugging Face 深度强化学习课程第三单元讲解 Deep Q-Learning:不再维护 Q-table,而是用神经网络根据状态逼近每个动作的 Q 值,并训练智能体玩 Space Invaders 等 Atari 环境。输入为 4 帧堆叠、缩放至 84x84 的灰度画面,经三层卷积和全连接层输出各动作 Q 值,训练借助基于 Stable-Baselines 的 RL-Zoo 完成。
Hugging Face 博客发布《The Annotated Diffusion Model》,基于 Ho 等人 2020 年的 DDPM 论文,用 PyTorch 逐步实现去噪扩散概率模型,代码参考 Phil Wang 的实现。
推荐理由:从 DDPM 论文出发逐步用 PyTorch 复现扩散模型,并梳理后续关键改进方向,适合想理解扩散模型原理的读者。
Hugging Face 在 Hub 上线 Pull Requests 和 Discussions,覆盖 models、datasets 和 Spaces 三类仓库,任何社区成员都可在 Community 标签页发起和参与。
Hugging Face 多模态学习团队发布了一份伦理章程,将伦理原则正式纳入其机器学习研究生命周期的起点。章程列出了要防止的用例,包括生成虚假信息、生成个人身份信息、在医疗、法律、金融和移民等高风险领域的不谨慎使用,以及各类歧视性内容。团队同时提出透明、开放可复现、公平、自我批判和尊重署名五项价值观,并承认这些价值观之间有时会相互冲突,需逐案权衡。
Hugging Face 深度强化学习课程更新第二单元第一部分,讲解基于价值的方法,并区分蒙特卡洛与时序差分学习。内容涵盖状态价值函数、动作价值函数与贝尔曼方程,为下一部分实现首个 Q-Learning 智能体做铺垫。
Hugging Face 宣布启动 Fellowship 计划,由团队成员或现任 Fellow 提名,面向推动开源机器学习民主化的贡献者。首批 Fellow 包括创建西语 NLP 社区的 María Grandury、向 Hub 贡献超 300 个模型的 Manuel Romero 等。
Hugging Face 发布 Gradio 3.0,对 Gradio 库进行彻底重设计,前端改用 Svelte 等现代技术,页面体积更小、加载更快,并新增 Gallery 组件和 TabbedInterface 类。
推荐理由:Gradio 3.0 重写前端并推出 Blocks 低层 API,读者可了解它如何让 Python 直接搭建复杂自定义 ML 演示。
Hugging Face 开放首届 Student Ambassador Program 申请,截止日期为 2022 年 6 月 13 日,计划于 6 月 30 日启动、12 月 31 日结束。
Hugging Face 开源库 Optimum 发布 1.2 版本,新增对 Transformers pipelines 的推理支持,首批接入 ONNX Runtime,用户可将 AutoModelForXxx 替换为对应的 ORTModelForXxx 类。
Hugging Face 宣布完成 1 亿美元 C 轮融资,由 Lux Capital 领投,Sequoia、Coatue 等参投。官方称平台已托管 10 万个预训练模型和 1 万个数据集,超过 1 万家公司使用其产品与服务,团队在过去 12 个月从 30 人扩展到 120 多人。新资金将投入研究、开源、产品以及 AI 的负责任普及。
推荐理由:Hugging Face 官方披露 C 轮融资规模与投资方,并给出平台模型、数据集和客户体量,可据此判断开源机器学习平台的商业化进展。
fastai 现已接入 Hugging Face Hub,开发者用一行 Python 的 push_to_hub_fastai 就能把 Learner 上传到 Hub,并通过 from_pretrained_fastai 加载他人模型。
Hugging Face 推出免费深度强化学习课程,第一单元讲解深度强化学习基础,涵盖 RL 框架、马尔可夫性质、观测/状态空间、动作空间、奖励与折扣、探索/利用权衡,以及基于策略和基于价值两类方法。
HuggingFace AutoTrain 与数据标注平台 Kili 可组合成一套主动学习流水线,用于文本分类:在 Kili 中标注数据、用 AutoTrain 自动完成数据清洗、模型选择与超参数优化,再迭代重训模型。
Hugging Face 发布教育计划,目标在 2023 年底前教会 500 万人机器学习。该计划面向所有人、初学者和教师,提供 NLP、深度强化学习、Gradio 演示构建等免费课程,以及已翻译成 8 种语言的教师工具包,并可通过 ML demo.cratization tour 申请团队授课。
Hugging Face 机器学习工程师 Lewis Tunstall 在访谈中介绍了他为 transformers 库开发的功能:将 PyTorch 模型导出为 ONNX 格式,只需一行代码即可完成转换,从而获得更低的延迟和更高的吞吐量。他还与 Leandro von Werra 合著了《NLP with Transformers》一书,并谈到大规模模型评估等话题。
Habana Labs 与 Hugging Face 宣布合作,将 Habana 的 SynapseAI 软件套件与 Hugging Face Optimum 开源库集成,开发者只需几行代码即可在 Habana Gaudi 处理器上加速 Transformer 训练。
Hugging Face 的 Transformers 库有意不遵循 DRY 原则,转而采用"单一模型文件策略":模型前向传播所需的全部代码只放在一个模型文件中,注意力机制代码在不同模型文件里被复制超过 50 次。官方给出的理由包括该库由开源社区共建、建模代码本身就是产品、机器学习领域演进极快,以及模型发布后基本静态不变。
Hugging Face 发布机器学习专家访谈,嘉宾 Margaret Mitchell 曾创立并联合领导 Google 伦理 AI 团队,现于 Hugging Face 制定伦理 AI 研究协议与包容性招聘体系。
Hugging Face 推出为期 9 个月的 AI Research Residency Program,入选者将与 Science Team 研究员合作选定研究课题、开发新的机器学习技术并争取发表成果。该项目为全职,申请截止 2022 年 4 月 3 日,无需搬迁,欢迎各类背景申请者。
Hugging Face 展示了如何用 🤗 datasets 的 Image 特征类型结合 sentence_transformers 和 faiss,为图像数据集构建相似度搜索应用。
Hugging Face 在 Transformers 中推出约束束搜索(constrained beam search),通过 model.generate() 的 force_words_ids 参数让用户指定输出中必须包含的词或短语。
Hugging Face Hub 上已有超过 215 个公开的情感分析模型,用 Python 的 transformers pipeline 只需 5 行代码即可调用,默认模型对 "I love you" 和 "I hate you" 分别给出 0.9998 和 0.9991 的置信度。
Hugging Face 博客介绍如何利用 Wav2Vec2 所用 CTC 架构的特性,在 Transformers 中对任意长音频乃至实时流做语音识别。
推荐理由:原文给出 CTC 模型分块加 stride 的具体参数与代码,读者可据此在长音频和实时场景中复用。
🤗 Transformers 现已集成 Kensho Technologies 的 pyctcdecode 库,可将 n-gram 语言模型与微调后的 Wav2Vec2 checkpoint 结合解码音频。
Hugging Face 收购机器学习初创公司 Gradio,Gradio 联合创始人发文确认这一消息。Gradio 自 2019 年发布以来已有超过 30 万个 demo 用它构建,用于让非技术用户也能使用和反馈机器学习模型。作者表示加入 Hugging Face 后会继续发展 Gradio,让任何有浏览器和网络连接的人都能用上机器学习。
推荐理由:Gradio 创始人以当事方身份讲述被 Hugging Face 收购的经过,读者可了解这次收购的来龙去脉与双方在开源机器学习可及性上的共同目标。
Hugging Face 发布教程,介绍如何从零训练名为 CodeParrot 的 GPT-2 代码生成模型,用于自动补全 Python 代码。
推荐理由:完整给出从数据清洗、分词器训练到多卡训练循环的代码,可迁移到自建代码生成模型的预训练流程。
Hugging Face 与 Graphcore 合作推出 Optimum Graphcore,首个 IPU 优化模型为 BERT,开发者可借助 Hugging Face Transformers 在 IPU 上训练、微调和加速模型。
Hugging Face 发布博客,讲解如何用 🤗 Transformers 将预训练模型 Wav2Vec2-XLS-R-300M 微调用于低资源语音识别(ASR)。
Hugging Face 发文质疑微软与 NVIDIA 发布的 Megatron-Turing NLG 530B 这类超大模型趋势,指出复现该实验需花费近 1 亿美元,且训练 BERT 的碳排放已相当于一次跨美飞行。文章主张改用预训练模型、更小模型(如 DistilBERT 保留 97% 语言理解能力、体积小 40%、速度快 60%)和微调等务实方案。
Hugging Face Course 第二部分将于 11 月 15 日发布,聚焦 token 分类、语言建模、翻译、摘要和问答等 NLP 任务,并深入讲解 Datasets 与 Tokenizers。配套社区活动包含两天讲座和团队微调项目,AWS 通过 Amazon SageMaker 提供免费算力,完成 demo 的参与者可获结业证书。