Cosmopedia:如何为 LLM 预训练构建大规模合成数据
Hugging Face 发布 Cosmopedia,一个由 Mixtral-8x7B-Instruct-v0.1 生成的合成数据集,包含超 3000 万个文件、250 亿 token,用于从零预训练大语言模型,目标是复现 Phi-1.5 的训练数据。
推荐理由:Hugging Face 公开了从提示词设计到去污染、训练评估的完整合成数据流水线,可迁移到自建预训练数据。
Hugging Face 发布 Cosmopedia,一个由 Mixtral-8x7B-Instruct-v0.1 生成的合成数据集,包含超 3000 万个文件、250 亿 token,用于从零预训练大语言模型,目标是复现 Phi-1.5 的训练数据。
推荐理由:Hugging Face 公开了从提示词设计到去污染、训练评估的完整合成数据流水线,可迁移到自建预训练数据。
Hugging Face 博客介绍 GaLore 优化器,通过将梯度投影到低秩子空间,可把优化器状态显存占用降低 82.5% 以上,从而在 NVIDIA RTX 4090 等消费级 GPU 上训练最高 70 亿参数的 Llama 架构模型。
推荐理由:原文给出 GaLore 与 8-bit 优化器结合的训练流程和可运行代码,读者可据此在消费级显卡上复现大模型训练。
Hugging Face 推出 WebSight 数据集,用于训练视觉语言模型将网页截图转换为 HTML 代码。该数据集从 v0.1 的 823,000 对截图/HTML 样本扩展至 v0.2 的 200 万例,改用真实截图和 Tailwind CSS。基于该数据集微调的模型 Sightseer 可将网页截图转为可用的 HTML 代码,并还原截图中的图像。
Argilla 与 Hugging Face 推出 Data is Better Together 实验,几天内吸引 350 名社区贡献者完成超 11,000 条 prompt 评分,并发布含 10,000 条 prompt 用户评分的 10k_prompts_ranked 数据集。
Hugging Face 发布 Matryoshka 嵌入模型入门指南,这类模型可将嵌入截断到多种维度而性能损失不大,灵感来自俄罗斯套娃。
Hugging Face 发布教程,介绍如何用 Transformers 和 PEFT 库对 Google DeepMind 的开源模型 Gemma(2B 和 7B 参数)进行 LoRA 微调。
Hugging Face 在 PEFT 中新增面向 LoRA 适配器的合并方法,包括 cat、linear、svd、TIES、DARE 和 magnitude_prune 等,可通过 add_weighted_adapter() 调用。
推荐理由:PEFT 新增多种 LoRA 合并方法并给出选型顺序,读者可据此判断不同适配器组合该用哪种策略。
Hugging Face 博客给出用开源 LLM 生成合成数据、再蒸馏出专用小模型的完整流程,并以金融新闻投资者情绪识别为案例。
推荐理由:用开源 LLM 生成合成数据再蒸馏小模型的完整流程,附可复用 notebook 与成本、延迟、碳排放对比。
Hugging Face 博客给出 PatchTST 的上手示例,先在 Electricity 数据集上做预测,再用预训练模型对 ETTh1 数据集做零样本预测,随后进行线性探测与微调。PatchTST 由 Yuqi Nie 等人提出、发表于 ICLR 2023,通过将时间序列切分为 patch 作为输入 token,并采用通道独立设计,在保留局部语义的同时二次方降低注意力计算与内存开销。
Patronus 团队基于 Hugging Face Leaderboard Template 推出 Enterprise Scenarios Leaderboard,用于评估语言模型在真实企业场景中的表现。
IBM Research 与 Hugging Face 团队合作,在 Transformers 库中发布了轻量级时序建模模型 PatchTSMixer。该模型基于 MLP-Mixer 架构,支持跨 patch、通道和隐藏特征的轻量混合,可预训练后用于预测、分类和回归等下游任务。
Hugging Face 在 OpenHermes-2.5-Mistral-7B 和 Zephyr-7b-beta-sft 两个 7B 模型上,用 MT-Bench 对比了 DPO、IPO、KTO 三种无需强化学习的偏好对齐方法,并扫描 β 等关键超参数。结果显示其中一种方法明显优于其他两种,但需调好关键超参数才能达到最佳效果;相关代码已在 alignment-handbook 开源。
Hugging Face 博客介绍社区开发的轻量库 Unsloth,与 TRL 的 SFTTrainer、DPOTrainer 等配合可将 LLM 微调提速约 2 倍,显存占用最多降低 74%,且相对标准 QLoRA 精度损失为 0%。
推荐理由:原文给出 Unsloth 与 TRL 集成的实测加速与显存数据,读者可据此判断微调成本能降到什么程度。
Hugging Face 回顾 2023 年开源 LLM 进展,指出公众对开源与闭源之争的关注度大幅上升。文章梳理了预训练大模型的构成要素,包括架构、训练数据、tokenizer、训练超参数与模型权重,并回顾 2022 年的代表模型:176B 参数的 BLOOM、175B 参数的 OPT 以及 GLM-130B。
Hugging Face 发布长文《Mixture of Experts Explained》,系统讲解 MoE 的构成、训练与推理取舍。文章指出 MoE 用稀疏层替换部分 FFN 层并配路由网络,预训练更快、推理比同参数量稠密模型更快,但需把全部专家载入显存,例如 Mixtral 8x7B 需容纳 47B 参数。
推荐理由:系统梳理 MoE 的构成、训练与推理取舍,并给出并行与部署的实践要点,适合理解稀疏模型为何省算力却吃显存。
Open LLM Leaderboard 新增的 DROP 基准出现异常:绝大多数模型 f1-score 低于 10。Hugging Face 排查发现,归一化步骤在数字后跟非空格空白字符时无法匹配正确答案,且以 . 作为停止词会截断浮点答案、让高质量模型生成过多内容反而拉低 f1。改用 \n 作为停止词重新计算后,分数与整体表现的相关性明显改善。
OpenAI 启动 Data Partnerships 计划,与各方合作创建用于 AI 训练的开源和私有数据集。
一项对比实验用 LoRA 微调 RoBERTa-large(355M)、Llama-2-7b 和 Mistral-7B-v0.1 三个模型,在灾难推文二分类任务上评测性能。实验统一设置 MAX_LEN=512,在单张 A6000(48GB)上完成训练,并使用 Weights & Biases 做超参数调优与实验记录。
Explosion 发布 Prodigy-HF 插件,让 Prodigy 标注工具直接对接 Hugging Face 生态。
Renumics Spotlight 现可直接读取 Hugging Face datasets,只需一行 spotlight.show(ds) 即可交互式可视化数据集。它支持加载模型预测与嵌入向量,通过相似度图、混淆矩阵等定位关键数据簇与模型失败模式,并可在 GUI 或 Python API 中自定义检查布局。
Hugging Face 博客复现了 OpenAI 2019 年的 RLHF 代码库 openai/lm-human-preferences,在情感和描述性任务上得到与原始代码几乎一致的学习曲线,并整理出一份实现细节清单。
Hugging Face 为 tokenizers 新增 chat_template 属性,用 Jinja 模板保存模型训练时使用的对话格式,并随 tokenizer 一起加载。
推荐理由:Hugging Face 把聊天格式从硬编码改为随 tokenizer 保存的模板,读者可了解格式错配为何造成静默性能下降。
Hugging Face 在 trl 库中集成 DDPOTrainer,可用 DDPO(Denoising Diffusion Policy Optimization)对 Stable Diffusion 做强化学习微调。
Mistral AI 发布首个 7B 参数模型 Mistral 7B,称其在所有标准英文与代码基准上超过现有 13B 参数以下的开源模型,并以 Apache 2.0 许可发布、可无限制使用。
推荐理由:Mistral AI 官方阐述开源模型路线,并给出 Mistral 7B 在标准基准上超越同规模开源模型的具体结果。
Hugging Face 发布教程,介绍如何用 PyTorch FSDP 结合 Transformers、Accelerate 和 TRL 微调 Llama 2 70B,并在 2 节点 16 张 A100 80GB 上完成训练,耗时约 13.5 小时。
推荐理由:原文给出 70B 模型多节点微调的三个具体瓶颈及对应配置改法,可迁移到其他大模型训练场景。
TII 发布 Falcon 180B 并上线 Hugging Face,参数规模 1800 亿,在 3.5 万亿 token 的 RefinedWeb 数据上预训练,是当时最大的公开可用语言模型。
推荐理由:Falcon 180B 以 1800 亿参数和 3.5 万亿 token 预训练规模进入开源生态,读者可据此了解当时开源模型与闭源模型的差距。
OpenAI 与 Scale 达成合作,企业客户可借助 Scale 的 AI 专业能力微调 OpenAI 最先进的模型。该支持面向企业微调场景,帮助客户定制模型。
OpenAI 宣布开发者现在可以自带数据对 GPT-3.5 Turbo 进行微调,以适配各自的使用场景,同时更新了 API。
推荐理由:OpenAI 开放 GPT-3.5 Turbo 微调,开发者可用自有数据定制模型,值得关注其对应用落地的影响。
Hugging Face 博客介绍 TRL 库新增的 DPO 训练支持,并演示如何用 QLoRA 在 stack-exchange 偏好数据上微调 Llama v2 7B。
推荐理由:TRL 官方给出 DPO 微调 Llama 2 的完整代码与数据格式,读者可据此在自己的偏好数据上复现。
Hugging Face 用 facebook/fasttext-language-identification 模型为 Hub 上缺少语言标注的数据集预测语言,该模型可识别 217 种语言,通过 dataset viewer API 取每个数据集 20 行文本进行预测,再由 librarian-bots 提交 PR 补充元数据。
Hugging Face 梳理其开源文本生成与 LLM 生态,涵盖因果语言模型与 text-to-text 模型、许可协议、LLM 服务工具及 PEFT 微调。
Hugging Face 展示了在 Intel 第四代 Xeon(Sapphire Rapids)CPU 集群上微调 Stable Diffusion 的完整流程,借助 AMX 加速器与 IPEX、oneCCL 实现分布式训练。
Hugging Face Hub 目前托管超 190,000 个机器学习模型、33,000 个数据集和超 100,000 个应用与 demo,覆盖文本、图像、音频及多模态任务。这篇博客面向美术馆、图书馆、档案馆与博物馆(GLAM)从业者,介绍如何在 Hub 上按任务和语言筛选模型、用 model widget 测试效果,并以 CSV 格式上传 GLAM 数据集。
Hugging Face 在 Open LLM Leaderboard 评估套件中新增 GPT-4 评测,与 Scale AI 的人类标注对比,检验 LLM 能否替代人工标注偏好数据。
Hugging Face Hub 新增 DuckDB 集成,用户可直接用 SQL 查询 Hub 上任意公开数据集。数据集查看器会自动将所有公开数据集转换为 Parquet 文件,通过 /parquet 端点获取 URL 后,配合 DuckDB 的 httpfs 扩展即可查询远程文件,大型数据集被分片为 500MB 块。
Hugging Face 开始托管 Meta AI 开源的 fastText 官方镜像,涵盖全部 157 种语言的词向量和最新语言识别模型,用户可通过 huggingface_hub 的 hf_hub_download 几行命令下载使用。该集成还支持文本分类与特征提取 widget,模型页面提供语言识别和词向量最近邻查询的在线试用。
阿布扎比技术创新研究院发布 Apache 2.0 许可的 Falcon 语言模型家族,包含 Falcon-40B 和 Falcon-7B 两个基础模型及对应 Instruct 版本。
推荐理由:介绍 Falcon 系列的开源许可、训练数据与多查询注意力设计,并给出在 Hugging Face 生态中推理和微调的具体路径。
OpenAI 训练了一个模型,通过奖励每一步正确推理(过程监督)而非只奖励最终正确答案(结果监督),在数学问题求解上取得新的 SOTA。除性能提升外,过程监督还带来对齐收益:直接训练模型产出人类认可的思维链。
推荐理由:OpenAI 用过程监督替代结果监督提升数学推理,并给出对对齐的额外收益,可了解训练方法差异。
Hugging Face 与 bitsandbytes 合作,在 transformers 中支持以 4-bit 精度加载和运行模型,覆盖文本、视觉、多模态等大多数 HF 模型,并可在 4bit 模型上训练适配器。
推荐理由:Hugging Face 把 4-bit 量化与 QLoRA 集成进 transformers,读者可据此判断消费级硬件微调大模型的门槛变化。
Hugging Face 探索用指令微调让 Stable Diffusion 按指令处理输入图像,方法基于 InstructPix2Pix 的训练策略并借鉴 FLAN 的指令模板思路。