Hugging Face Hub 上线 CO2 排放追踪与筛选功能
Hugging Face Hub 推出 emissions_threshold 参数,可按训练碳排放量筛选模型,例如搜索排放不超过 100 克的模型可返回 191 个结果。Transformers 集成 codecarbon,训练时自动记录排放数据并生成 emissions.csv,方便写入模型卡。
Hugging Face Hub 推出 emissions_threshold 参数,可按训练碳排放量筛选模型,例如搜索排放不超过 100 克的模型可返回 191 个结果。Transformers 集成 codecarbon,训练时自动记录排放数据并生成 emissions.csv,方便写入模型卡。
Habana Labs 与 Hugging Face 宣布合作,将 Habana 的 SynapseAI 软件套件与 Hugging Face Optimum 开源库集成,开发者只需几行代码即可在 Habana Gaudi 处理器上加速 Transformer 训练。
Hugging Face Hub 上已有超过 215 个公开的情感分析模型,用 Python 的 transformers pipeline 只需 5 行代码即可调用,默认模型对 "I love you" 和 "I hate you" 分别给出 0.9998 和 0.9991 的置信度。
Hugging Face 的 AutoNLP 与 Explosion 的标注工具 Prodigy 可组合成主动学习流水线:用 Prodigy 对 BBC News 数据集做 NER 标注,每积累约 20 条样本就用 AutoNLP 重新训练模型。
Hugging Face 发布教程,介绍如何从零训练名为 CodeParrot 的 GPT-2 代码生成模型,用于自动补全 Python 代码。
推荐理由:完整给出从数据清洗、分词器训练到多卡训练循环的代码,可迁移到自建代码生成模型的预训练流程。
Hugging Face 发布开源 Python 库与无代码界面 Data Measurements Tool,基于 Dataset 和 Spaces Hub 及 Streamlit 构建,可在线构建、测量和比较数据集。该工具提供数据集基础信息、描述性统计和分布统计三类指标,包括缺失值、词汇量、标签分布、实例长度及 Zipf 定律拟合度等,帮助开发者在无需编程的情况下审查数据集质量与偏差。
在 Intel Xeon Scalable CPU(Ice Lake 架构)集群上分布式微调 BERT 模型,可将 PyTorch 训练任务加速。演示在 MRPC 数据集(GLUE 基准任务之一,含 5,800 对句子)上微调 BERT,从单节点扩展到 2 节点、4 节点并测量加速比。
Hugging Face 发文质疑微软与 NVIDIA 发布的 Megatron-Turing NLG 530B 这类超大模型趋势,指出复现该实验需花费近 1 亿美元,且训练 BERT 的碳排放已相当于一次跨美飞行。文章主张改用预训练模型、更小模型(如 DistilBERT 保留 97% 语言理解能力、体积小 40%、速度快 60%)和微调等务实方案。
Hugging Face Course 第二部分将于 11 月 15 日发布,聚焦 token 分类、语言建模、翻译、摘要和问答等 NLP 任务,并深入讲解 Datasets 与 Tokenizers。配套社区活动包含两天讲座和团队微调项目,AWS 通过 Amazon SageMaker 提供免费算力,完成 demo 的参与者可获结业证书。
Hugging Face 在社区周期间用 10 亿句对训练出 SOTA 句嵌入模型,硬件为 7 块 TPU v3-8。方法采用 Transformer 加池化,并以 in-batch negatives 对比学习目标训练,通过增大 batch、引入 hard negatives 和跨数据集组批提升质量。模型与数据集已在模型卡中公开。
一个跨 12 个时区的团队用 RSICD、UCM 和 Sydney 三个遥感数据集微调了 OpenAI 的 CLIP,让模型支持用文本查询检索卫星图像。RSICD 约含 10,000 张来自 Google Earth、百度地图等的图像,每张最多 5 条描述;训练采用对比学习,并用图像增强与 Marian MT 回译文本增强抑制过拟合。模型已开放下载,并提供在线 demo。
OpenAI 提出用人类反馈来扩展 AI 系统在难以评估任务上的监督能力,并以书籍摘要作为测试场景。该方法针对的是评估困难、无法用简单指标衡量的任务,试图让人类监督在规模上可行。
Hugging Face 联合 Yandex Research 等机构提出 DeDLOC 协作式分布式训练方法,可自适应参与者的网络与硬件条件,并通过 40 名志愿者在互联网上预训练出孟加拉语模型 sahajBERT。
推荐理由:Hugging Face 团队用 40 名志愿者在互联网上预训练出孟加拉语模型,给出了分布式协作训练在真实场景中的可行路径。
OpenAI 研究发现,通过在小型精选数据集上微调,可以改善语言模型在特定行为价值观方面的表现。
Hugging Face 工程师分享构建和调试神经网络的思考流程,核心观点是先放下机器学习、专注理解数据,再像初学者一样从简单基线做起,并敢于拆解那些"5 行代码"模板。文中建议通过在小批量样本(如 16 条)上过拟合、观察是否达到 0 loss 来验证实现是否正确,并强调要建立合理的对比基线。
Hugging Face 发布教程,介绍如何用 BERT、GPT2 等预训练检查点热启动编码器-解码器模型,从而跳过昂贵的预训练。基于 Rothe et al. (2020) 的方法,这类热启动模型在多个序列到序列任务上可达到 T5、Pegasus 等大型预训练模型的竞争力,训练成本仅为后者一小部分。教程包含理论、分析及基于 🤗Transformers 的完整代码示例。
Hugging Face Transformers 在 3.1 版本中与 Ray Tune 集成,用户只需几行代码即可调用 HyperBand、Bayesian Optimization、Population-Based Training 等调参算法。
OpenAI 将人类反馈强化学习(RLHF)应用于语言模型训练,使其在摘要任务上表现更好。
Hugging Face 博客详解 Reformer 模型,它能在不到 8GB 内存下训练长度达 50 万 token 的序列,而 bert-base-uncased 仅支持 512 token。Reformer 通过局部自注意力、LSH 自注意力、分块前馈层、可逆残差层和轴向位置编码四项改造降低内存占用,并已集成进 Transformers 库。
OpenAI 发布题为《Language models are few-shot learners》的论文,提出语言模型具备少样本学习能力。
OpenAI 发布一项分析,指出自 2012 年以来,在 ImageNet 分类上训练达到同等性能的神经网络所需算力每 16 个月减少一半。与 2012 年相比,如今训练到 AlexNet 水平所需的算力减少了 44 倍,而同期摩尔定律带来的成本改善约为 11 倍。分析认为,在近期投入较高的 AI 任务上,算法进步带来的收益超过传统硬件效率提升。
推荐理由:OpenAI 用 ImageNet 训练算力数据量化算法进步速度,可与摩尔定律对照理解 AI 效率来源。
Hugging Face 发布教程,演示如何用 transformers 和 tokenizers 库从零训练一个 84M 参数的语言模型 EsperBERTo,并在世界语上完成词性标注微调。
推荐理由:Hugging Face 官方给出从零训练语言模型的完整流程,读者可据此复现分词器训练与下游微调。
OpenAI 发布关于神经语言模型缩放定律的研究,探讨模型性能与规模之间的关系。
OpenAI 发现双重下降现象在 CNN、ResNet 和 Transformer 中普遍存在:随着模型规模、数据量或训练时间增加,性能先提升、再变差、然后再次提升。这一效应通常可通过精细的正则化避免,但其成因尚不完全清楚,OpenAI 将其视为重要研究方向。
OpenAI 发布 Procgen Benchmark,包含 16 个易于使用的程序化生成环境,用于直接衡量强化学习智能体学习可泛化技能的速度。
OpenAI 训练了一对神经网络,让类人机械手解开魔方。两个网络完全在仿真中训练,使用与 OpenAI Five 相同的强化学习代码,并搭配名为 Automatic Domain Randomization(ADR)的新技术。系统能应对训练中从未见过的情况,例如被毛绒长颈鹿戳碰,说明强化学习不只适用于虚拟任务,也能解决需要高灵巧度的物理世界问题。
推荐理由:OpenAI 用仿真训练加自动域随机化让机械手解魔方,可了解强化学习迁移到物理操作任务的思路。
OpenAI 用人类反馈对 774M 参数的 GPT-2 语言模型进行微调,在多项任务上成功匹配外部人类标注者的偏好,尽管这些偏好并不总与 OpenAI 自身一致。在摘要任务中,标注者偏好直接从输入中整句复制的内容,模型因此学会了复制;摘要任务需要 6 万条人类标注,而按不同风格续写文本等更简单的任务只需 5 千条。OpenAI 表示其动机是让安全技术更接近“机器与人对话”这一通用任务。
推荐理由:OpenAI 用人类反馈微调 GPT-2 的早期实验,展示了偏好数据如何让模型学会复制而非改写。
OpenAI 开发了 Sparse Transformer,这是一种深度神经网络,在预测文本、图像或声音序列中下一个内容的任务上创下新纪录。它通过对注意力机制做算法改进,从比以往长 30 倍的序列中提取模式。
推荐理由:OpenAI 用稀疏注意力把序列建模长度提升 30 倍,可了解长序列建模的早期技术路线。
OpenAI 训练了一个大规模无监督语言模型,能够生成连贯的段落文本,在多项语言建模基准上取得当时最优表现。该模型无需针对特定任务训练,即可完成基础的阅读理解、机器翻译、问答和摘要任务。
推荐理由:OpenAI 公布一个无监督语言模型在多项语言任务上取得当时最优表现,可了解大模型早期路线。
OpenAI 发现梯度噪声尺度这一统计指标可预测神经网络训练在多种任务上的可并行性。复杂任务的梯度噪声更大,因此未来更大的 batch size 可能变得有用,从而消除 AI 系统继续扩展的一项潜在限制。该结果还表明,神经网络训练并非神秘技艺,而是可以被严谨化和系统化。
OpenAI 发布训练环境 CoinRun,用于衡量智能体将经验迁移到新情境的能力,并已帮助厘清强化学习领域一个长期存在的难题。该环境在复杂度上取得平衡:比《刺猬索尼克》等传统平台游戏更简单,但仍对当前最先进算法构成值得一试的泛化挑战。
OpenAI 发布深度强化学习教育资源 Spinning Up in Deep RL,旨在让任何人都能学习成为深度强化学习的熟练实践者。该资源包含清晰的 RL 代码示例、教学练习、文档和教程。
OpenAI 开发了一种基于能量的模型,仅需五次演示就能学会识别和生成以 2D 点集表达的概念,如 near、above、between、closest 和 furthest。该模型还展示了跨域迁移能力:在 2D 粒子环境中学习的概念可用于解决 3D 物理机器人任务。
OpenAI 用 Transformer 与无监督预训练结合的可扩展、任务无关系统,在一组多样化的语言任务上取得当时最优结果,并对外发布了该系统。这一结果说明监督学习方法与无监督预训练搭配效果很好,作者希望它推动在更大、更多样数据集上继续探索这一思路。
推荐理由:OpenAI 用 Transformer 加无监督预训练在多项语言任务上取得当时最优结果,并公开了可扩展的任务无关系统。
OpenAI 发布一项分析,指出自 2012 年以来,最大规模 AI 训练所用算力呈指数增长,翻倍周期为 3.4 个月,而摩尔定律的翻倍周期为 2 年。同一时期该指标增长超过 300,000 倍,若按 2 年翻倍则仅增长 7 倍。OpenAI 表示算力提升是 AI 进展的关键组成部分,若这一趋势延续,值得为远超当前能力的系统做准备。
推荐理由:OpenAI 用 3.4 个月翻倍这一量化指标,给出 AI 训练算力增速与摩尔定律的对比参照。
OpenAI 发布实验性元学习方法 Evolved Policy Gradients(EPG),通过进化学习智能体的损失函数,使其能在新任务上快速训练。用 EPG 训练的智能体可在测试时完成训练范围之外的基础任务,例如学会导航到房间中与训练时放置位置相反一侧的物体。
OpenAI 推出 Retro Contest 迁移学习竞赛,用于衡量强化学习算法从既往经验中泛化的能力。
OpenAI 开发出可扩展元学习算法 Reptile,通过反复采样任务、对其执行随机梯度下降,并将初始参数朝该任务最终学到的参数更新。Reptile 是将 Shortest Descent 算法应用于元学习场景,数学上与一阶 MAML 相似,只需对 SGD 或 Adam 等优化器进行黑盒访问,计算效率与性能相近。
OpenAI 启动 Scholars 项目,为来自 underrepresented 群体的个人提供 6–10 份津贴和导师指导,支持其全职学习深度学习 3 个月并开源一个项目。
OpenAI 设计了一种让 AI 互相教学的方法,所选取的示例同样能被人类理解。该方法自动挑选最具信息量的示例来教授某个概念,例如用最适合描述"狗"这一概念的图像,实验显示其对 AI 教学有效。