Hugging Face 重构 Hub 上传与下载架构
Hugging Face 的 Xet 团队正在重新设计 Hub 的上传与下载架构,计划引入内容寻址存储(CAS)并构建自定义传输协议。新方案按字节级分析文件,上传时仅传输必要的新 chunk,并探索压缩 Safetensors 张量文件,有望将上传速度提升 10-25%。读取路径仍由 S3 存储、CloudFront 作为 CDN,CAS 节点将部署在 AWS 少数区域以平衡成本与延迟。
Hugging Face 的 Xet 团队正在重新设计 Hub 的上传与下载架构,计划引入内容寻址存储(CAS)并构建自定义传输协议。新方案按字节级分析文件,上传时仅传输必要的新 chunk,并探索压缩 Safetensors 张量文件,有望将上传速度提升 10-25%。读取路径仍由 S3 存储、CloudFront 作为 CDN,CAS 节点将部署在 AWS 少数区域以平衡成本与延迟。
Hugging Face 发布 SmolVLM,一个 2B 参数的小型视觉语言模型家族,包含 Base、Synthetic 和 Instruct 三个版本,模型权重、数据集、训练配方和工具均以 Apache 2.0 协议开源。
推荐理由:2B 参数 VLM 把显存压到 5GB 并开放全部训练配方,读者可据此判断端侧多模态部署的可行边界。
Hugging Face 博客介绍 LayerSkip 提出的自推测解码,用同一 LLM 的早期层生成 draft token、深层网络负责验证,无需额外小模型即可加速文本生成并降低显存占用。
Hugging Face 的 Xet 团队采用内容定义分块(CDC)将文件拆分为可变大小的块,仅传输和存储修改过的块,从而提升存储与迭代效率。在 CORD-19 数据集基准测试中,Xet 后端将平均下载时间从 51 分钟降至 19 分钟,上传从 47 分钟降至 24 分钟,存储占用从 8.9 GB 降至 3.52 GB。
Hugging Face 与 LLM-jp 联合发布 Open Japanese LLM Leaderboard,用 llm-jp-eval 评测套件覆盖 16 项任务,从自然语言推理、机器翻译到代码生成与数学推理,均以 4-shot 方式测试。数据集由 LLM-jp 评测团队联合语言学家与标注人员构建或翻译,旨在为日语 LLM 提供集中、开放的比较平台。
Hugging Face 博客发布 Judge Arena,一个让用户对两个 LLM 评审模型的评分和理由进行投票对比的平台,结果汇总为按 Elo 分数每小时更新的公开榜单。
Hugging Face Hub 支持托管 TB 级数据集,并提供 Dataset Viewer、全文搜索、SQL Console 及 Pandas、DuckDB 等第三方库的一行代码加载支持。Xet 团队正将单文件上限从 50 GB 提升至 500 GB,同时改进存储与传输效率。数据集可设为公开、私有或门控访问,Nvidia、Google、NASA 等机构已在使用。
Hugging Face 与 PyCharm 完成集成,开发者可在 IDE 内右键选择 "Insert HF Model",按 image-text-to-text 等任务筛选模型并直接插入示例代码,例如 microsoft/Phi-3.5-vision-instruct。
Argilla 2.4 推出无需代码的数据集构建功能,用户可直接在 UI 中从 Hugging Face Hub 导入数据集、定义问题并收集人工反馈。该功能支持公开 Hub 数据集,默认部署启用 Hugging Face OAuth,方便社区或团队协作标注,整个流程不到 5 分钟。Argilla 是 Hugging Face 旗下免费开源的数据中心工具,仍保留 Python SDK 供进一步定制。
Intel Labs 与 Hugging Face 提出 Universal Assisted Generation(UAG),让辅助生成不再要求目标模型与辅助模型共享同一 tokenizer,可跨模型家族配对,对任意 decoder 或 MoE 模型实现 1.5x-2.0x 推理加速。
推荐理由:Intel Labs 与 Hugging Face 提出跨 tokenizer 的辅助生成方法,读者可了解其 2-way tokenizer 翻译思路与实测加速幅度。
CGIAR 与 Digital Green 在 Hugging Face 专家支持下为农业问答机器人 Farmer.chat 搭建了 LLM-as-a-Judge 评测体系,用于衡量 RAG 回答的质量。
Cohere For AI 发布 Aya Expanse 系列多语言模型,包含 8B 和 32B 两个参数规模,并以开放权重形式发布。官方称 Aya Expanse 32B 在成对比较中优于 Gemma 2 27B、Mistral 8x22B 和 Llama 3.1 70B,Aya Expanse 8B 在同参数级别模型中的胜率为 60.4% 至 70.6%。
推荐理由:Cohere For AI 公开了 Aya Expanse 的完整后训练流程,包括数据套利、多语言偏好训练与模型合并的具体做法。
Google DeepMind 与 Hugging Face 在 Transformers v4.46.0 中发布 SynthID Text,可通过 logits processor 为 AI 生成文本加水印,并用分类器检测。
推荐理由:Google DeepMind 与 Hugging Face 把文本水印做成 Transformers 里的生成配置,读者可据此了解其接入方式与检测流程。
Hugging Face 发布 HUGS(Hugging Face Generative AI Services),一套零配置的优化推理微服务,用于在自有基础设施上部署开源模型。
推荐理由:HUGS 把开源模型的推理部署从数周压缩到分钟级,并给出兼容 OpenAI API 的落地路径与定价。
Hugging Face 发布 CinePile 2.0 长视频问答数据集,采用其提出的对抗式数据集精炼方法进行改进。CinePile 初版于 2024 年 5 月推出,包含约 30 万训练样本和 5000 测试样本,人类在该基准上比最好的商业视觉模型高 25%、比开源模型高 65%。CinePile 2.0 与 Hugging Face 合作完成,同时开源了对抗式精炼方法的实现。
dottxt 与 Hugging Face 合作发布 outlines-core 0.1.0,这是 outlines 结构化生成核心算法的 Rust 移植版,Python 绑定已同步上线。
推荐理由:原文给出 Rust 重写带来的索引编译提速与轻量化拆分,读者可据此判断结构化生成如何嵌入现有推理栈。
Hugging Face 的 Speech-to-Speech(S2S)项目通过 VAD、STT、LM、TTS 级联流水线实现语音对话,支持英语、法语、西班牙语、中文、日语和韩语,可用 auto 标志自动检测语言。
Hugging Face 宣布与 Protect AI 合作,将后者的 Guardian 扫描器集成进 Hub 的扫描套件,所有公开模型仓库在推送文件后会自动被扫描。Guardian 可检测 pickle 任意代码执行及 Keras Lambda 层等漏洞,前端也新增了扫描结果展示。目前已有超过 100 万个模型仓库、数亿个文件被扫描。
Hugging Face 发布 Transformers.js v3,新增 WebGPU 支持,官方称比 WASM 快至多 100 倍,并引入 fp32、fp16、q8、q4 等 dtype 量化选项。
推荐理由:官方给出 WebGPU 加速、量化格式与 1200 多个预转换模型,可据此判断浏览器端推理的可用边界。
Stability AI 发布 Stable Diffusion 3.5,包含 8B 的 Large 模型和 8B 的 timestep-distilled 模型,已在 Hugging Face Hub 上线并可通过 Diffusers 使用。
推荐理由:Diffusers 官方给出 SD3.5 Large 的量化推理与 LoRA 训练路径,可据此判断消费级显卡的可用性。
Keras 已支持 Llama 3.2,可直接从 Hugging Face 的 safetensors checkpoint 加载,包括 Llama-3.2-1B-Instruct,无需等待转换,必要时在加载时即时完成。
Hugging Face 修复了 Transformers Trainer 中梯度累积的损失计算错误:此前开启梯度累积时,token 级任务(如 causal LM)的损失按各批次损失取平均,而非按全部非 padding token 总数加权,导致与全批量训练结果不一致。
Hugging Face 委托 Trail of Bits 对 Gradio 5 完成独立安全审计,发现的全部安全风险已在 Gradio 5.0 发布前修复并通过验证。
AMD 发布基于 Zen5 架构的第五代服务器级 EPYC CPU(代号 Turin),最高 192 核 384 线程。
Hugging Face 发布 Gradio 5 稳定版,开发者用几行 Python 即可构建生产级机器学习 Web 应用,可通过 pip install --upgrade gradio 升级。
推荐理由:官方列出 Gradio 5 在 SSR 加载、实时流式与安全审计上的具体改动,便于判断是否值得升级。
Hugging Face 与 Dask 结合,可将 TB 级数据集处理从本地 pandas 扩展到云端多 GPU 并行推理。示例用 FineWeb-Edu 分类器处理 FineWeb 数据集,从本地 100 行扩展到 2.11 亿行、432 GB 的 250 个 Parquet 文件,并支持多节点 GPU 推理。
Intel Labs 与 Hugging Face 提出动态推测解码方法,根据助手模型每次预测的置信度动态调整推测前瞻长度,文本生成最高提速 2.7 倍。该方法自 Transformers 4.45.0 起成为辅助生成的默认模式,在 Llama3.1-8B 搭配 Llama3.2-1B 等测试中均优于启发式方法,后者在 codegen-6B-mono 上甚至出现减速。
Hugging Face 发布 Open FinLLM Leaderboard,专门评测大语言模型在金融任务上的表现,覆盖信息抽取、文本分析、问答、文本生成、风险管理、预测和决策七大类。该榜单采用零样本评测,使用 Accuracy、F1、ROUGE 和 MCC 等指标,数据集聚焦真实金融场景,如信用评分、欺诈检测和股价走势预测。
Hugging Face 发布 BenCzechMark,首个面向捷克语的大语言模型综合评测套件,涵盖 9 大类共 50 项任务,其中 90% 为原生非翻译内容。配套榜单已收录超过 25 个不同规模的开源模型,任务采用 Acc、EM、AUROC、Ppl 等指标,并手工设计至少 5 组提示词以记录最佳表现与方差。
Hugging Face 发布教程,介绍如何将 InstantMesh 等生成式 3D 模型输出的顶点着色网格转换为 UV 贴图纹理网格,并提供 InstantTexture 库实现一键转换。该库通过 xatlas 生成 UV 映射,结合重心坐标插值填充纹理,再用修复、中值滤波、高斯模糊和 LANCZOS 降采样消除空洞与噪点,最终输出 .glb 网格。
Meta 发布 Llama 3.2,共 10 个开放权重模型,包括 5 个多模态模型和 5 个纯文本模型,均已上线 Hugging Face。多模态的 Llama 3.2 Vision 提供 11B 和 90B 两个尺寸,另有可在设备端运行的 1B 和 3B 文本模型,支持 128k 上下文和 8 种语言。
推荐理由:Hugging Face 与 Meta 合作发布 Llama 3.2,给出多模态与端侧小模型的能力、许可限制和上手方式。
Hugging Face 构建了 FineVideo 数据集,包含 4.3 万个视频、共 3.4 千小时,并配有丰富描述、叙事细节、场景切分和 QA 对。该数据集从 YouTube-Commons 的 190 万条英文视频出发,经词密度与视觉动态性过滤,并用 Gemini 1.5 Pro 和 GPT-4o 完成内容标注与结构化输出。
Hugging Face 的 Daily Papers 页面已收录超 3,700 篇论文、订阅者超 12k,作者可一键认领论文并关联到自己的账号。用户还能提交论文、在评论区与作者直接对话,并用 @librarian-bot 获取相似论文推荐。页面支持多语言评论与翻译,并可将论文关联的模型、数据集和 demo 集中展示。
Hugging Face 与 Intel 合作的 Optimum-Intel 支持将 Transformers 模型导出为 OpenVINO IR,并通过 OpenVINO GenAI 的 LLMPipeline 在 C++ 或 Python 中部署。
Hugging Face 团队基于微软 BitNet 架构,成功将 Llama3 8B 微调到 1.58bit,每个参数只用 -1、0、1 三个值表示,模型已发布在 HF1BitLLM 组织下。
推荐理由:Hugging Face 团队公开了把已有 Llama3 8B 微调到 1.58bit 的完整流程与踩坑记录,可迁移到其他模型的极低比特量化。
Hugging Face 在 Hub 的每个数据集页面新增 SQL Console,可直接在浏览器中对数据集运行 SQL 查询。该控制台由 DuckDB WASM 驱动,完全在本地运行,支持完整 DuckDB 语法、结果导出为 parquet,并可通过链接分享公开数据集的查询结果。官方称内存上限约 3GB,DuckDB WASM 尚未支持 hf:// 协议查询数据集。
推荐理由:官方给出浏览器内 SQL 查询数据集的能力与内存限制,读者可据此判断能否替代本地预处理脚本。
HuggingChat 发布 Community Tools,用户可把 Hugging Face 上任意公开 Space 转成模型可直接调用的工具,并借此扩展了图像理解、视频生成和文本转语音等多模态能力。
推荐理由:HuggingChat 把任意 Space 变成可调用工具,读者可据此判断多模态与自定义工具如何接入对话流程。
Hugging Face 发布 Accelerate 1.0.0 首个候选版本,可通过 pip install --pre accelerate 或 Docker 镜像试用。
Hugging Face 的 LeRobot 项目提出 LeRobotDataset 格式,用视频编码存储机器人数据集的视觉模态,平均体积降至原始版本的 14%,最佳情况可达 0.2%,同时保持完整训练能力。解码单帧耗时与压缩图像相当,连续多帧解码仅为压缩图像的 25%-50%,并原生集成 Hub 与可视化工具。
Hugging Face Hub 拥有超 85 万公开模型、每月新增约 5 万个,但 ZeroGPU、多进程 Docker、Gradio API、Webhooks 和 Nomic Atlas 这 5 项工具常被忽视。