Hugging Face 把 Llama3 8B 微调到 1.58bit:极低比特量化实践
Hugging Face 团队基于微软 BitNet 架构,成功将 Llama3 8B 微调到 1.58bit,每个参数只用 -1、0、1 三个值表示,模型已发布在 HF1BitLLM 组织下。
推荐理由:Hugging Face 团队公开了把已有 Llama3 8B 微调到 1.58bit 的完整流程与踩坑记录,可迁移到其他模型的极低比特量化。
Hugging Face 团队基于微软 BitNet 架构,成功将 Llama3 8B 微调到 1.58bit,每个参数只用 -1、0、1 三个值表示,模型已发布在 HF1BitLLM 组织下。
推荐理由:Hugging Face 团队公开了把已有 Llama3 8B 微调到 1.58bit 的完整流程与踩坑记录,可迁移到其他模型的极低比特量化。
Hugging Face 在 Hub 的每个数据集页面新增 SQL Console,可直接在浏览器中对数据集运行 SQL 查询。该控制台由 DuckDB WASM 驱动,完全在本地运行,支持完整 DuckDB 语法、结果导出为 parquet,并可通过链接分享公开数据集的查询结果。官方称内存上限约 3GB,DuckDB WASM 尚未支持 hf:// 协议查询数据集。
推荐理由:官方给出浏览器内 SQL 查询数据集的能力与内存限制,读者可据此判断能否替代本地预处理脚本。
HuggingChat 发布 Community Tools,用户可把 Hugging Face 上任意公开 Space 转成模型可直接调用的工具,并借此扩展了图像理解、视频生成和文本转语音等多模态能力。
推荐理由:HuggingChat 把任意 Space 变成可调用工具,读者可据此判断多模态与自定义工具如何接入对话流程。
Hugging Face 发布 Accelerate 1.0.0 首个候选版本,可通过 pip install --pre accelerate 或 Docker 镜像试用。
Hugging Face 的 LeRobot 项目提出 LeRobotDataset 格式,用视频编码存储机器人数据集的视觉模态,平均体积降至原始版本的 14%,最佳情况可达 0.2%,同时保持完整训练能力。解码单帧耗时与压缩图像相当,连续多帧解码仅为压缩图像的 25%-50%,并原生集成 Hub 与可视化工具。
Hugging Face Hub 拥有超 85 万公开模型、每月新增约 5 万个,但 ZeroGPU、多进程 Docker、Gradio API、Webhooks 和 Nomic Atlas 这 5 项工具常被忽视。
Hugging Face 在 Transformers 中推出 DataCollatorWithFlattening,使免 padding 的指令微调打包与 Flash Attention 2 兼容,训练吞吐最高提升 2 倍且收敛质量不变。
Hugging Face 发布教程,介绍如何在 Google Cloud Vertex AI 上用 Text Generation Inference(TGI)和 Hugging Face 深度学习容器(DLC)部署 Meta Llama 3.1 405B。
Hugging Face 发布 ggml 入门指南,介绍这个用 C/C++ 编写、专注 Transformer 推理的开源机器学习库。
阿布扎比 TII 发布 Falcon Mamba 7B,采用纯 Mamba 架构并加入额外 RMS 归一化层以保证大规模训练稳定,模型以 TII Falcon Mamba 7B License 1.0 开放,可在 Hugging Face 生态中使用。
推荐理由:TII 发布首个纯 Mamba 架构的 7B 开源模型,读者可据此了解无注意力架构在长序列上的取舍。
Hugging Face 在 Transformers 中推出统一的工具调用 API,同一套代码可在 Mistral、Cohere、NousResearch 和 Llama 等模型家族间通用,无需或只需极少模型专属改动。
推荐理由:Hugging Face 把工具调用统一进 chat template,读者可据此判断跨模型复用同一套代码的可行边界。
Hugging Face 宣布收购西雅图公司 XetHub,其创始团队此前在 Apple 构建并扩展内部 ML 基础设施,XetHub 的技术可让 Git 扩展到 TB 级仓库。
推荐理由:Hugging Face 收购 XetHub 并计划替换 Hub 的 Git LFS 存储后端,读者可了解大文件版本管理将如何变化。
Hugging Face 与 Albumentations AI 合作推出 TextImage 数据增强流程,可同时修改文档图像及其文本标注,用于视觉语言模型(VLM)微调。该流程支持随机插入、删除、交换和停用词替换等文本增强,并配合图像黑化与修复,保持文本质量。初始版本中的同义词替换因耗时过高已被移除。
Hugging Face 梳理了截至 2024 年 8 月 6 日 Hub 上的安全功能:面向所有用户的细粒度 token、2FA、GPG commit signing、组织访问控制,以及基于 ClamAV、picklescan、trufflehog 的自动化恶意软件、pickle 与密钥扫描。
Google 在 Gemma 2 发布一个月后扩充 Gemma 模型系列,新增 2.6B 参数的 Gemma 2 2B(含 base 与指令微调版)、安全分类器 ShieldGemma 以及稀疏自编码器套件 Gemma Scope。
推荐理由:Gemma 2 新增 2B 小模型、安全分类器和可解释性工具,读者可据此判断端侧部署与安全过滤的可用选项。
Hugging Face 展示如何借助 Diffusers 库中的 Quanto 量化工具降低 Transformer 扩散模型的内存占用。以 PixArt-Sigma、Stable Diffusion 3 和 Aura Flow 为例,将扩散主干与文本编码器量化至 FP8 后,SD3 推理显存从 16.403 GB 降至约 8.2 GB,质量几乎无损、延迟仅小幅上升。
Hugging Face 面向 Enterprise Hub 组织推出 NVIDIA NIM API(无服务器),可在 Hugging Face Hub 上以标准化 API 对 Llama、Mistral 等开源模型运行推理。
Hugging Face 提出 LAVE(LLM-Assisted VQA Evaluation)指标,用 Llama-2-Chat-7b 以 1-3 分制对候选答案打分,在 Docmatix 的 200 张图像子集上评估 MPLUGDocOwl1.5 的零样本表现,LAVE 得分 0.58,而 CIDER 仅 0.1411、BLEU 0.0032、ANLS 0.002。
Mistral AI 发布新一代 Mistral Large 2,拥有 128k 上下文窗口和 123B 参数,可在单节点上以较大吞吐运行,支持包括中文、日文、韩文在内的数十种语言和 80 多种编程语言。
推荐理由:官方给出 Mistral Large 2 的 128k 上下文、123B 参数与多项基准对比,可据此判断其单节点部署的成本位置。
Meta 发布 Llama 3.1,包含 8B、70B、405B 三个尺寸的 base 与 instruct 版本共六个开放权重模型,全部支持 128K token 上下文和 8 种语言,并新增 Llama Guard 3 与 Prompt Guard 两个安全模型。
推荐理由:Hugging Face 官方给出 Llama 3.1 三个尺寸的显存需求、量化方案与工具调用格式,便于评估部署成本。
Hugging Face 发布教程,介绍如何借助 WWDC 24 的新 Core ML 特性在 Mac 上运行 Mistral 7B,并用不到 4GB 内存完成推理。
推荐理由:Hugging Face 团队给出把 Mistral 7B 转成 Core ML 并跑在 Mac 上的完整步骤,可据此复现端侧 LLM 部署流程。
Mistral AI 与 NVIDIA 合作发布 12B 模型 Mistral NeMo,支持最高 128k token 上下文窗口,预训练基座与指令微调 checkpoint 均以 Apache 2.0 许可开源。
推荐理由:Mistral 与 NVIDIA 合作的 12B 模型以 Apache 2.0 开源,128k 上下文和 FP8 推理对部署选型有直接参考。
Hugging Face 为 TGI 推出 Multi-LoRA 服务,只需部署一次基础模型,即可根据请求中的 adapter_id 动态选择对应的 LoRA 适配器,官方称可服务 30 个模型。
推荐理由:原文给出 TGI Multi-LoRA 的部署方式与成本对比,读者可据此判断多微调模型能否合并到一次部署。
Hugging Face 发布 Docmatix,一个包含 240 万张图像、950 万问答对(源自 130 万份 PDF)的文档视觉问答数据集,规模是此前数据集的 240 倍。
Mistral AI 发布专注 STEM 的数学推理模型 Mathstral 7B,基于 Mistral 7B,在 MATH 上得分 56.6%、MMLU 上得分 63.47%,在同规模模型中达到 SOTA。
Mistral AI 发布 Codestral Mamba,这是继 Mixtral 系列之后对 Mamba 架构的又一次探索,采用 Apache 2.0 许可,可自由使用、修改和分发。
推荐理由:Mistral 发布基于 Mamba 架构的代码模型,给出参数规模、256k 检索测试与多种部署方式,可据此判断非 Transformer 架构在代码场景的可用性。
Hugging Face 发布 SmolLM 系列小语言模型,包含 135M、360M 和 1.7B 三个参数规模,并同步开源训练语料 SmolLM-Corpus。
推荐理由:原文公开了三个尺寸小模型的训练数据配比与评测对比,可据此判断端侧小模型的选型与数据策略。
Hugging Face 博客展示了如何用 distilabel 生成合成数据、微调领域专用嵌入模型,并为 Argilla 2.0 构建能理解技术文档的聊天机器人。流程包括将文档按约 256 token 分块、构建向量数据库,并将 Gradio 应用部署到 Hugging Face Space,交互记录存入 Argilla 用于持续评估改进。
Numina 与 Hugging Face 合作的 NuminaMath 7B TIR 赢得首届 AIMO 进步奖,在私有测试集 50 题中解出 29 题。方案基于 DeepSeekMath-Base 7B 做两阶段全量微调,先学自然语言链式推理,再学工具集成推理,配合 SC-TIR 解码生成 N=48、深度 M=4 的候选并多数投票。
推荐理由:获胜方案完整公开了两阶段微调、SC-TIR 解码与内部验证集设计,可迁移到其他推理任务。
Hugging Face 正在 Dataset Hub 上试验一项基于开源 PII 检测工具 Presidio 的新功能,用户可查看数据集 PII 含量的估算报告。Presidio 依靠检测模式和机器学习模型识别 PII,报告可帮助开发者在训练前决定是否进一步过滤数据,也便于数据集所有者验证自身的 PII 过滤流程。
Hugging Face 与 KerasHub 宣布共享模型保存格式,Hugging Face Hub 上 30 万+ Transformers 模型现可直接加载进 KerasHub。首批支持 Gemma 1/2、Llama 3 和 PaliGemma,模型可在 TensorFlow、JAX、PyTorch 后端间一行代码切换。需升级 keras-hub 及 keras>=3.3.3。
Hugging Face 的 TRL 库现已支持视觉语言模型(VLM)的直接偏好优化(DPO),并给出完整训练教程。示例使用 Idefics2-8b 模型和 openbmb/RLAIF-V-Dataset(含超 83,000 条标注数据),TRL 的 DPO 实现同时支持 Llava 1.5 和 PaliGemma。
Hugging Face 用户现可在 Inference Endpoints 和 Spaces 上使用 Google Cloud TPU v5e,提供 v5litepod-1(1 核 16 GB,$1.375/小时)、v5litepod-4(4 核 64 GB,$5.50/小时)和 v5litepod-8(8 核 128 GB,$11.00/小时)三种配置。
Banque des Territoires(CDC 集团)、Polyconseil 与 Hugging Face 合作,为法国校园环保改造项目 EduRénov 构建基于 RAG 的主权数据方案,第一阶段已完成。
Hugging Face 为 Dataset Hub 的数据集搜索新增四项筛选功能:按模态(文本、图像、音频、表格、时间序列、3D、视频、地理空间)、按行数大小、按格式(如 Parquet、WebDataset)以及按兼容库(如 Pandas、Dask、Datasets)搜索。
Intel 与 MILA 将多模态蛋白质设计语言模型 ProtST 重新架构并发布在 Hugging Face Hub,可用 Optimum for Intel Gaudi 库在 Gaudi 2 上运行推理与微调。
Hugging Face 用基于 transformers.agents 构建的 ReactCodeAgent 在 GAIA 基准验证集上取得 44.2%,排名第一,比第二名高 4 个百分点;测试集得分 33.3%,排名第二,并在 Level 3 难题上取得最佳平均分。
推荐理由:Hugging Face 公开了用 Code Agent 登顶 GAIA 的完整实现细节,包括工具设计、安全解释器与规划策略,可迁移到自建智能体系统。
Google 发布开源大模型 Gemma 2,提供 9B 和 27B 两个规模,各有基础版与指令微调版,上下文长度 8K tokens,采用允许商用和再分发的宽松许可。
推荐理由:文章梳理了 Gemma 2 的滑动窗口注意力、软上限与蒸馏等训练改动,并给出与 Llama 3、Qwen 1.5 的基准对比。
XLSCOUT 发布专为专利与知识产权打造的嵌入模型 ParaEmbed 2.0,基于高质量多领域专利数据微调,准确率较 2023 年 10 月发布的 ParaEmbed 1.0 提升 23%。
Hugging Face 发布 Ethics and Society Newsletter #6,探讨高质量数据对 AI 开发的重要性。文章指出好数据应契合具体用途,需具备相关性、全面性、时效性并减少偏见,因为数据质量直接影响模型性能、鲁棒性、效率与公平性。