Hugging Face 将 Xet 存储上线 Hub,首批仓库迁移 4.5 TB
Hugging Face 宣布 Xet 存储正式上线 Hub,首批 Model 和 Dataset 仓库已从 LFS 迁移至 Xet,迁移总量 4.5 TB,约占 Hub 下载流量的 6%。
推荐理由:Hugging Face 官方复盘 Xet 存储首次迁移的工程细节,可了解大文件去重与传输优化的实际取舍。
把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。
Hugging Face 宣布 Xet 存储正式上线 Hub,首批 Model 和 Dataset 仓库已从 LFS 迁移至 Xet,迁移总量 4.5 TB,约占 Hub 下载流量的 6%。
推荐理由:Hugging Face 官方复盘 Xet 存储首次迁移的工程细节,可了解大文件去重与传输优化的实际取舍。
Mistral AI 发布光学字符识别 API Mistral OCR,可接收图片和 PDF,按顺序交错提取文本与图像,并已作为 Le Chat 文档理解的默认模型。
推荐理由:官方给出 Mistral OCR 的定价、基准对比与自托管选项,可据此判断它在文档解析与 RAG 流程中的位置。
Hugging Face 发布 FastRTC,一个面向 Python 的实时通信库,用于构建实时音频和视频 AI 应用。
推荐理由:FastRTC 把 WebRTC 实时音视频通信封装成 Python 库,读者可据此判断实时语音应用的搭建门槛变化。
Mistral AI 发布首款区域语言模型 Mistral Saba,24B 参数,基于中东和南亚数据集训练,支持阿拉伯语及多种印度语系语言,在泰米尔语等南印度语言上表现突出。官方称其回答比体量大 5 倍以上的模型更准确,速度更快、成本更低,可通过 API 调用,也能在客户本地单 GPU 系统部署,速度超过 150 tokens/s。
推荐理由:Mistral 首款区域语言模型,24B 参数却对标 5 倍体量模型,并支持单卡本地部署,可据此判断区域化模型的落地路径。
Hugging Face 的 Xet 团队将内容定义分块(CDC)投入生产,通过把去重后的数据聚合为最大 64MB 的块、并用分片记录文件与块的映射,把 CAS 条目减少约 1000 倍,上传下载速度在部分场景提升 2-3 倍。
推荐理由:Hugging Face 官方解释 Xet 存储如何用块与分片聚合替代逐块传输,并给出量化模型仓库的实测节省数据。
Mistral AI 发布 Mistral Small 3,一个面向低延迟优化的 24B 参数模型,以 Apache 2.0 许可证开源,同时提供预训练和指令微调两个 checkpoint。
推荐理由:24B 参数在 Apache 2.0 下对标三倍体量模型,并给出单卡本地部署的量化条件,便于判断小模型落点。
Hugging Face 在 Hub 的模型页上线 Inference Providers,首批接入 fal、Replicate、SambaNova、Together AI 四家无服务器推理服务商,并集成到 JS 和 Python 客户端 SDK。
推荐理由:Hugging Face 把四家无服务器推理服务商接入模型页与 SDK,读者可据此了解调用方式与计费差异。
Hugging Face Diffusers 团队发布博客,梳理开源视频生成模型现状,并介绍 Diffusers 对 CogVideoX、Mochi-1、HunyuanVideo、LTX-Video 等模型的支持与优化方案。
推荐理由:梳理开源视频生成模型现状与 Diffusers 的显存优化路径,给出可复用的量化与卸载配置。
Mistral AI 发布 Codestral 25.01,采用更高效的架构和改进的 tokenizer,代码生成与补全速度约为原版 Codestral 的 2 倍,上下文长度提升至 256k。
推荐理由:官方给出 Codestral 25.01 的架构与 tokenizer 变化、256k 上下文和多项基准对比,可据此判断它在 FIM 与低延迟补全场景的位置。
Hugging Face 博客发布教程,介绍用 torch.cuda.memory._record_memory_history 记录并可视化 PyTorch 训练时的 GPU 显存占用。文章以 Qwen2.5-1.5B 为例拆解模型参数、优化器状态、激活值、梯度和优化器中间值各占多少显存,并给出总显存估算公式和激活值随参数量线性变化的启发式。作者还提供了一个显存估算小工具。
推荐理由:原文用可视化快照拆解训练各阶段显存占用,并给出可复用的显存估算公式与启发式。
IBM、Princeton、CMU 和 UIUC 联合发布 Bamba-9B,一个在完全开放数据上训练的混合 Mamba2 模型,训练数据量 2.2T tokens。
推荐理由:Bamba-9B 用完全开放数据训练并给出 vLLM 实测吞吐与延迟数据,可对照同尺寸 Transformer 模型判断混合 Mamba2 架构的取舍。
Intel Labs 与 Hugging Face 提出 Universal Assisted Generation(UAG),让辅助生成不再要求目标模型与辅助模型共享同一 tokenizer,可跨模型家族配对,对任意 decoder 或 MoE 模型实现 1.5x-2.0x 推理加速。
推荐理由:Intel Labs 与 Hugging Face 提出跨 tokenizer 的辅助生成方法,读者可了解其 2-way tokenizer 翻译思路与实测加速幅度。
Hugging Face 发布 HUGS(Hugging Face Generative AI Services),一套零配置的优化推理微服务,用于在自有基础设施上部署开源模型。
推荐理由:HUGS 把开源模型的推理部署从数周压缩到分钟级,并给出兼容 OpenAI API 的落地路径与定价。
dottxt 与 Hugging Face 合作发布 outlines-core 0.1.0,这是 outlines 结构化生成核心算法的 Rust 移植版,Python 绑定已同步上线。
推荐理由:原文给出 Rust 重写带来的索引编译提速与轻量化拆分,读者可据此判断结构化生成如何嵌入现有推理栈。
Hugging Face 发布 Gradio 5 稳定版,开发者用几行 Python 即可构建生产级机器学习 Web 应用,可通过 pip install --upgrade gradio 升级。
推荐理由:官方列出 Gradio 5 在 SSR 加载、实时流式与安全审计上的具体改动,便于判断是否值得升级。
Hugging Face 发布教程,介绍如何借助 WWDC 24 的新 Core ML 特性在 Mac 上运行 Mistral 7B,并用不到 4GB 内存完成推理。
推荐理由:Hugging Face 团队给出把 Mistral 7B 转成 Core ML 并跑在 Mac 上的完整步骤,可据此复现端侧 LLM 部署流程。
Hugging Face 为 TGI 推出 Multi-LoRA 服务,只需部署一次基础模型,即可根据请求中的 adapter_id 动态选择对应的 LoRA 适配器,官方称可服务 30 个模型。
推荐理由:原文给出 TGI Multi-LoRA 的部署方式与成本对比,读者可据此判断多微调模型能否合并到一次部署。
Google 发布开源大模型家族 Gemma,包含 2B 和 7B 两种尺寸,各有基础版和指令微调版,上下文长度 8K tokens。Gemma-7B 在 LLM Leaderboard 上得分 63.75,性能接近 Mistral 7B;Hugging Face 提供了 Transformers、Google Cloud、Inference Endpoints 集成以及基于 TRL 的微调示例。
推荐理由:Google 发布 Gemma 开源模型家族,读者可了解其两种尺寸、性能位次及在 Hugging Face 生态中的部署与微调路径。
Hugging Face 官方博客给出教程,把 ComfyUI 工作流转成 Gradio 应用并部署到 Spaces 的 ZeroGPU 上免费运行。
推荐理由:完整给出从 ComfyUI 工作流导出 Python、包成 Gradio 应用并部署到 ZeroGPU 的步骤,可照着复现。
Hugging Face 博客介绍如何用投机解码将 Whisper 推理速度提升约 2 倍,同时保证输出与单独使用主模型完全一致。
推荐理由:给出 Whisper 投机解码的完整实现与基准数据,读者可据此在现有管线中获得约 2 倍加速且输出不变。