Hugging Face 发布 SmolVLM2:把视频理解带到每台设备
Hugging Face 发布 SmolVLM2 系列视频理解模型,包含 2.2B、500M 和 256M 三种参数规模,官方称 500M 与 256M 是目前最小的视频语言模型。
推荐理由:Hugging Face 官方发布三档小尺寸视频理解模型,并给出 MLX 与 iPhone 本地运行方案,可据此判断端侧视频理解的可行边界。
Hugging Face 发布 SmolVLM2 系列视频理解模型,包含 2.2B、500M 和 256M 三种参数规模,官方称 500M 与 256M 是目前最小的视频语言模型。
推荐理由:Hugging Face 官方发布三档小尺寸视频理解模型,并给出 MLX 与 iPhone 本地运行方案,可据此判断端侧视频理解的可行边界。
Hugging Face Hub 新增 Hyperbolic、Nebius AI Studio 和 Novita 三家无服务器推理提供商,支持 DeepSeek-R1、Flux.1 等模型,并已集成 JS 和 Python 客户端 SDK。用户可在账户设置中配置自有 API key 直连提供商,或通过 HF 路由调用并按标准 API 费率计费,PRO 用户每月获 $2 推理额度。
Hugging Face 宣布 Fireworks.ai 正式成为 HF Hub 支持的推理服务商,可在模型页面及整个 HF 生态中直接调用其无服务器推理。
Hugging Face 用 Math-Verify 替换旧评测器,重新评估了 Open LLM Leaderboard 上提交过的全部 3751 个模型。旧评测器因答案格式、SymPy 解析和比较环节的问题把正确答案判错,新方案平均让模型多解出 61 道题、整体提升 4.66 分,Algebra 与 Prealgebra 子集分别提升 8.27 和 6.93 分。
推荐理由:原文给出旧评测器失效的具体案例和重评后的分数变化,可据此判断数学评测口径对榜单排名的影响。
Hugging Face 博客给出每天 10 亿次分类与嵌入推理的成本测算框架,用 Infinity 部署、k6 压测,在 nvidia-L4($0.8/hr)上跑 10 亿条输入。
Hugging Face 推出面向视频生成模型微调的开源数据集工具链,采用三阶段流水线:用 yt-dlp 下载视频并切分为短片段,再通过 LAION-5B-WatermarkDetection。
Hugging Face 的 Xet 团队将内容定义分块(CDC)投入生产,通过把去重后的数据聚合为最大 64MB 的块、并用分片记录文件与块的映射,把 CAS 条目减少约 1000 倍,上传下载速度在部分场景提升 2-3 倍。
推荐理由:Hugging Face 官方解释 Xet 存储如何用块与分片聚合替代逐块传输,并给出量化模型仓库的实测节省数据。
Open R1 项目发布首个大规模数学推理数据集 OpenR1-Math-220k,在 512 张 H100 上用 vLLM 和 SGLang 本地生成 80 万条 R1 推理轨迹,经 Math Verify 与 Llama3.3-70B-Instruct 过滤后保留 22 万个含正确推理轨迹的问题。
推荐理由:Open R1 项目公开了 220k 数学推理数据集的构建流程与本地生成方案,可了解复现 R1 训练管线的具体做法。
Hugging Face 联合 2A2I、TII 推出 Open Arabic LLM Leaderboard 2,升级阿拉伯语大模型评测榜。首版 OALL 上线不到 7 个月吸引超 46,000 名访客,收到 700 多个模型提交,参数规模从 1B 到 70B 以上,来自 180 多个机构,其中超 70% 为 chat 与微调模型,11% 为预训练模型。
Hugging Face 将 Physical Intelligence 开发的 π0 和 π0-FAST 两个机器人基础模型移植到 LeRobot 仓库,并给出 PyTorch 版本与模型合集。
推荐理由:Physical Intelligence 的 π0 与 π0-FAST 被移植进 LeRobot,读者可据此了解 VLA 与 VLM 在动作表示上的差异。
Adyen 与 Hugging Face 联合发布 DABstep,一个面向多步推理的数据智能体基准,包含 450+ 个源自 Adyen 真实业务的数据分析任务。最强推理型智能体在该基准上仅取得 16% 准确率,凸显当前模型在复杂数据分析上的差距。任务结合结构化与非结构化数据,采用二元事实性评测,仅需代码执行环境即可运行并提交排行榜。
Hugging Face 在 24 小时复现冲刺中开源了 DeepResearch 所需的智能体框架,在 GAIA 验证集上达到 55.15%,高于此前开源框架 Magentic-One 的约 46%。
推荐理由:Hugging Face 用 24 小时复现 OpenAI Deep Research,给出开源框架与 GAIA 实测对比,可看代码智能体相对 JSON 智能体的差距。
Hugging Face 的 Open-R1 项目在启动一周后,复现了 DeepSeek-R1 蒸馏模型在 MATH-500 上的评测分数,例如 DeepSeek-R1-Distill-Qwen-1.5B 得 81.6、7B 得 91.8、32B 得 95.0。
推荐理由:Open-R1 一周内复现了 DeepSeek-R1 蒸馏模型的评测分数,并公开了 GRPO 训练与合成数据生成的具体工程取舍。
Hugging Face 博客发布 Mini-R1 教程,用 GRPO 和 Countdown 游戏在 Qwen2.5-3B-Instruct 上复现 DeepSeek-R1 的 aha moment。
推荐理由:作者用 4 张 H100 复现 DeepSeek-R1 的 aha moment,给出完整脚本与训练观察,可迁移到自己的 RL 实验。
Hugging Face 发布首期《AI 艺术工具通讯》,回顾 2024 年创意 AI 关键进展并预告将推出月度汇总。
Mistral AI 发布 Mistral Small 3,一个面向低延迟优化的 24B 参数模型,以 Apache 2.0 许可证开源,同时提供预训练和指令微调两个 checkpoint。
推荐理由:24B 参数在 Apache 2.0 下对标三倍体量模型,并给出单卡本地部署的量化条件,便于判断小模型落点。
Hugging Face 发布指南,介绍如何在 AWS 上部署和微调 DeepSeek-R1 系列模型。
Hugging Face 发起 Open-R1 项目,计划系统重建 DeepSeek-R1 的数据与训练流程,补上官方未公开的数据集和训练代码。项目分三步:从 DeepSeek-R1 蒸馏高质量推理数据集复现 R1-Distill 模型,复现 R1-Zero 所用的纯强化学习流程并整理数学、推理、代码数据集,以及展示从基座模型经 SFT 到 RL 的多阶段训练。
推荐理由:Hugging Face 公开复现 DeepSeek-R1 的三步计划,读者可了解开源推理模型训练链路的缺口与补全路径。
Hugging Face 在 Hub 的模型页上线 Inference Providers,首批接入 fal、Replicate、SambaNova、Together AI 四家无服务器推理服务商,并集成到 JS 和 Python 客户端 SDK。
推荐理由:Hugging Face 把四家无服务器推理服务商接入模型页与 SDK,读者可据此了解调用方式与计费差异。
Hugging Face Diffusers 团队发布博客,梳理开源视频生成模型现状,并介绍 Diffusers 对 CogVideoX、Mochi-1、HunyuanVideo、LTX-Video 等模型的支持与优化方案。
推荐理由:梳理开源视频生成模型现状与 Diffusers 的显存优化路径,给出可复用的量化与卸载配置。
Hugging Face 为 smolagents 加入视觉支持,可在智能体流程中原生使用视觉语言模型。图片既可在 run 方法中一次性传入并存入 TaskStep 的 task_images,也可通过 step_callbacks 在每步把截图写入 ActionStep 的 observation_images。
推荐理由:官方给出在 smolagents 中接入视觉语言模型的两条路径,读者可据此判断浏览器类智能体的实现方式。
NVIDIA 推出 Python 工具包 KVPress,通过一系列压缩算法降低长上下文 LLM 的 KV Cache 内存占用。以 Llama 3-70B 在 bfloat16 下处理 1M token 为例,KV Cache 需 327.6GB,占约 470GB 总内存的 70%。
Hugging Face 发布 SmolVLM 家族新成员 SmolVLM-256M 和 SmolVLM-500M,共四个 checkpoint,含两个 base 模型和两个指令微调模型,可直接加载到 transformers、MLX 和 ONNX。
推荐理由:SmolVLM 家族新增 256M 与 500M 两个小尺寸视觉语言模型,读者可据此了解小模型在端侧与浏览器推理上的取舍。
Hugging Face 与 FriendliAI 达成合作,将 FriendliAI 的推理基础设施集成进 Hugging Face Hub 的“Deploy this model”按钮,实现一键部署。
Hugging Face 为 Text Generation Inference(TGI)引入多后端架构,通过 Rust 的 Backend 接口把 HTTP 服务与调度层同推理引擎解耦,让用户按模型、硬件和性能需求切换后端。
Hugging Face 发布 TimmWrapper,让任意 timm 视觉模型可直接接入 transformers 生态,支持 pipeline API、Auto 类和 Trainer 微调。该工具可用约 5 行代码通过 BitsAndBytesConfig 完成 8bit 量化,并支持 torch.compile 加速推理与 LoRA 适配器微调,微调后的模型还能回到 timm 使用。
Hugging Face 发布两个静态嵌入模型 static-retrieval-mrl-en-v1(英文检索)和 static-similarity-mrl-multilingual-v1(多语言相似度),在 CPU 上比 all-mpnet-base-v2、multilingual-e5-small 等常见模型快 100 至 400 倍,同时保留至少 85% 的性能。
推荐理由:原文给出静态嵌入模型的训练配方与两个已发布模型,读者可据此评估 CPU 端检索与相似度任务的落地成本。
Hugging Face 发布文章《AI Agents Are Here. What Now?》,指出 AI 智能体基于 LLM 构建,能自主拆解目标并执行子任务,其自主性可按从"模型不影响程序流程"到"模型自行编写并执行代码"分为多个等级。文章认为系统自主性越高、用户让渡的控制权越多,安全、隐私等风险越大,因此建议不要开发完全自主的 AI 智能体,而半自主智能体在风险与收益之间可能更可取。
Hugging Face 推出多语言嵌入模型 vdr-2b-multi-v1,可将文档页面截图编码为单向量,无需 OCR 即可跨语言检索视觉丰富的文档。该模型基于 MrLight/dse-qwen2-2b-mrl-v1,与 LlamaIndex 合作开发,覆盖意大利语、西班牙语、英语、法语和德语,并开源了 50 万样本的 vdr-multilingual-train 数据集。
Hugging Face 在 Open LLM Leaderboard 中引入 CO₂ 排放估算,基于 2024 年 6 月以来对 3000 多个模型的评测数据,分析了 2742 个模型的推理碳排放与性能关系。
Hugging Face 发布 smolagents,一个让语言模型具备智能体能力的轻量库,核心是 CodeAgent,即让智能体用代码而非 JSON 编写动作,并支持通过 E2B 在沙箱中执行。
推荐理由:Hugging Face 官方开源轻量智能体库,用代码而非 JSON 表达动作,并给出可复用的工具构建方式。
Hugging Face 博客发布教程,介绍用 torch.cuda.memory._record_memory_history 记录并可视化 PyTorch 训练时的 GPU 显存占用。文章以 Qwen2.5-1.5B 为例拆解模型参数、优化器状态、激活值、梯度和优化器中间值各占多少显存,并给出总显存估算公式和激活值随参数量线性变化的启发式。作者还提供了一个显存估算小工具。
推荐理由:原文用可视化快照拆解训练各阶段显存占用,并给出可复用的显存估算公式与启发式。
NVIDIA 推出 LogitsProcessorZoo,一组模块化 logits 处理器,可控制序列长度、强制关键短语或引导多选题答案,并与 Hugging Face 的 generate 方法完全兼容。该库通过 pip install logits-processor-zoo 安装,示例基于 meta-llama/Llama-3.2-1B-Instruct 模型演示。
Answer.AI 与 LightOn 发布 ModernBERT,一个仅编码器模型系列,提供 base(149M 参数)和 large(395M 参数)两个版本,支持 8192 token 上下文,可作为 BERT 类模型的直接替代。
推荐理由:ModernBERT 用现代 LLM 技术重做编码器,给出 8k 上下文与速度数据,可据此判断它能否替换现有 BERT 类模型。
IBM、Princeton、CMU 和 UIUC 联合发布 Bamba-9B,一个在完全开放数据上训练的混合 Mamba2 模型,训练数据量 2.2T tokens。
推荐理由:Bamba-9B 用完全开放数据训练并给出 vLLM 实测吞吐与延迟数据,可对照同尺寸 Transformer 模型判断混合 Mamba2 架构的取舍。
阿布扎比 TII 发布 Falcon3 开源模型家族,包含 Falcon3-1B-Base、3B-Base、Mamba-7B-Base、7B-Base 和 10B-Base 五款基础模型。
推荐理由:Falcon3 给出 1B 到 10B 五款开源模型及训练方法,读者可据此判断小模型在数学、代码与推理上的位置。
Hugging Face 在 Google Cloud 的 N2(第三代 Xeon)与 C4(第五代 Xeon)实例上基准测试了文本嵌入和文本生成两类智能体 AI 负载。
Hugging Face 发布 Synthetic Data Generator,一个无代码应用,用户用自然语言描述需求即可生成自定义数据集。工具目前支持文本分类和聊天数据集,背后由 distilabel 和免费的 Hugging Face text-generation API 驱动,文本分类和聊天分别约每分钟生成 50 和 20 个样本。
Hugging Face 与 Entalpic 联合推出开源协作项目 LeMaterial,并首发数据集 LeMat-Bulk,将 Materials Project、Alexandria 和 OQMD 三大材料数据库统一为标准格式,含 6.7M 条数据、7 种材料属性,采用 CC-BY-4.0 许可。
Hugging Face 的 83 个开源模型现已通过 Amazon Bedrock Marketplace 提供给 AWS 客户,底层由 Amazon SageMaker JumpStart 托管端点。