从第一性原理理解 continuous batching
Hugging Face 发布博客,从 attention 机制与 KV caching 出发,通过优化吞吐量推导出 continuous batching。该技术通过并行处理多个对话、完成即换出,最大化高负载场景下的推理性能。文中指出 attention 是 token 间唯一交互之处,其计算量随序列长度呈平方增长。
Hugging Face 发布博客,从 attention 机制与 KV caching 出发,通过优化吞吐量推导出 continuous batching。该技术通过并行处理多个对话、完成即换出,最大化高负载场景下的推理性能。文中指出 attention 是 token 间唯一交互之处,其计算量随序列长度呈平方增长。
Hugging Face Diffusers 官方博客宣布支持 FLUX.2,提供 Flux2Pipeline 与 Flux2Transformer2DModel 的调用示例,文本编码器使用 Mistral3ForConditionalGeneration。
推荐理由:Diffusers 集成 FLUX.2 并给出可直接运行的代码示例,读者可据此了解该模型的调用方式与显存门槛。
OVHcloud 正式加入 Hugging Face Hub 的 Inference Provider 生态,用户可直接在模型页调用 gpt-oss、Qwen3、DeepSeek R1、Llama 等开源权重模型。
Hugging Face TRL 官方集成 RapidFire AI,用户可用 RFSFTConfig、RFDPOConfig、RFGRPOConfig 近乎零代码替换原有 SFT/DPO/GRPO 配置,并发运行多个微调配置。
推荐理由:官方集成给出了并发配置对比的调度机制与实测加速数据,可据此判断微调实验流程能压缩多少时间。
AnyLanguageModel 是一个 Swift 包,作为 Apple Foundation Models 框架的替代方案,让开发者用同一套 API 调用多种模型。
ServiceNow 将 15B 推理模型改造为 Mamba 混合架构,旗舰版 Apriel-H1-15b-Thinker-SFT 实现 2.1x 吞吐,MATH500 从 0.90 升至 0.92、MTBench 从 8.30 升至 8.58,GSM8k、GPQA、AIME24 略有下降,总训练 76.8B token。
Hugging Face 的 kernels 库现已支持构建和共享 ROCm 兼容内核,可运行在 AMD GPU 上并集成进 PyTorch。指南以 RadeonFlow 的 FP8 GEMM 内核为例,该内核针对 AMD Instinct MI300X 优化,曾获 AMD Developer Challenge 2025 大奖。
AMD 联合 Hugging Face 和 Data Monsters 举办 AMD Open Robotics Hackathon,首站 12 月 5-7 日在东京,第二站 12 月 12-14 日在巴黎。
Hugging Face 宣布与 Google Cloud 建立更深层合作,让企业用开放模型构建自有 AI。
Hugging Face 发布博客《On the Shifting Global Compute Landscape》,梳理中国开源权重模型与国产芯片互相牵引的现状:过去几个月,华为昇腾、寒武纪等芯片已开始承载部分高性能开源模型的推理,部分模型开始用国产芯片训练。
推荐理由:梳理中国开源模型与国产芯片互相牵引的路径,帮助读者理解算力受限如何影响模型架构与部署选择。
NVIDIA Isaac for Healthcare v0.4 发布,提供基于 SO-ARM 的端到端入门工作流和"自带手术室"教程,让开发者从仿真、训练到部署自主医疗机器人。
NVIDIA 发布 Isaac for Healthcare v0.4,提供基于 SO-ARM 的端到端入门工作流,覆盖数据采集、训练与真机部署,用于构建自主手术辅助机器人。
推荐理由:原文给出从仿真数据采集到真机部署的完整命令与硬件要求,可据此复现医疗机器人工作流。
IBM 发布 Granite 4.0 家族中最小的 Granite 4.0 Nano,含 4 个 instruct 模型及对应 base 版本:Granite 4.0 H 1B(约 15 亿参数)与 H 350M(约 3.5 亿参数)采用 hybrid-SSM 架构,另有传统 Transformer 版 Granite 4.0 1B 和 350M。
Hugging Face 发布博客提出“语音同意门”(voice consent gate),让模型只有在说话人明确说出同意语句并被 ASR 识别后才启动语音克隆。该方案由三部分组成:生成约 20 词、含同意短语与模型名的独特句子,ASR 识别该句,以及 TTS 语音克隆系统;同一句录音也可直接用作克隆素材。配套示例 Space 与代码已公开,用于探索把同意原则嵌入 AI 系统流程。
Hugging Face 发布 datasets 库流式加载的性能改进,保持 streaming=True 的原有 API 不变,数据文件解析速度提升 10 倍、启动请求最多减少 100 倍、流式速度最多提升 2 倍。
推荐理由:Hugging Face 官方给出流式加载的性能改进细节与配置方式,读者可据此判断大规模训练的数据读取成本。
Hugging Face 发布 huggingface_hub v1.0,这是该库五年来的首个大版本,带来多项破坏性变更。主要变化包括后端从 requests 迁移到 httpx、全新的 hf CLI 取代已弃用的 huggingface-cli、以及 hf_xet 全面替代 hf_transfer 负责文件传输。
推荐理由:官方梳理了 huggingface_hub 五年演进与 v1.0 的破坏性变更,可据此判断升级影响与迁移成本。
LeRobot 发布 v0.4.0,带来 LeRobotDataset v3.0 分块 episode 格式与流式加载,可支持 OXE 级别(>400GB)数据集,并提供 lerobot-edit-dataset CLI 用于删除、拆分、合并数据集。
推荐理由:LeRobot v0.4.0 把数据集、VLA 模型与硬件插件整合进同一开源栈,可据此判断机器人学习工具链的成熟度。
Meta 与 Hugging Face 合作推出 OpenEnv Hub,一个面向智能体环境的开放共享社区 Hub,开发者可构建、分享和探索兼容 OpenEnv 的环境,用于训练和部署。
推荐理由:Meta 与 Hugging Face 联合推出智能体环境共享 Hub,并公开 0.1 规范草案,读者可了解开放智能体生态的协作方式。
Sentence Transformers 从 TU Darmstadt 的 UKP Lab 转由 Hugging Face 维护,Hugging Face 的 Tom Aarsen 自 2023 年底起已负责该项目并将继续领导。
Hugging Face 宣布与威胁情报与恶意软件分析平台 VirusTotal 合作,即日起对 Hub 上 220 万+ 公开模型和数据集仓库进行持续扫描。用户访问仓库或文件页面时,Hub 会自动用文件哈希比对 VirusTotal 威胁情报库,返回干净或恶意状态及检测计数等元数据,不共享原始文件内容。
Hugging Face 发布指南,介绍如何用 Chandra、OlmOCR-2 等开源权重 OCR 模型搭建文档处理流水线,并补充了这些模型的 OlmOCR 评测分数。指南覆盖模型能力对比、微调与开箱使用的取舍、选型要点,以及用多模态检索和文档问答超越传统 OCR。
Hugging Face 为开源工具 AI Sheets 发布重大更新,新增视觉支持,可在表格中查看、分析图像并提取信息,也能从文本生成图像和编辑图像,全部由 Inference Providers 上的开放模型驱动。
推荐理由:官方给出视觉能力在表格工作流中的具体用法与模型对比,可据此判断图像数据整理是否值得迁移。
Hugging Face 发起 AI for Food Allergies 项目,计划打造首个社区驱动的研究实验室,探索 AI 如何推进食物过敏研究。全球约 2.2 亿人患有至少一种食物过敏,美国约占总人口 10%。项目将连接前沿 AI 与生物医学,开发开放协作项目,服务研究者、临床医生和患者。
Intel 与 Hugging Face 联合测试显示,在搭载 Intel Xeon 6 处理器(Granite Rapids)的 Google Cloud C4 虚拟机上运行 OpenAI GPT OSS 模型,总拥有成本(TCO)较上一代 C3 实例提升 1.7 倍,即 70%。
Hugging Face 博客给出在 Intel CPU 上本地运行视觉语言模型(VLM)的三步流程:用 Optimum Intel 与 OpenVINO 将 SmolVLM2-256M-Video-Instruct 转换为 OpenVINO IR,再通过仅权重量化或静态量化压缩模型,最后执行推理。
NVIDIA 发布首个开放合成印度人物画像数据集 Nemotron-Personas-India,基于 NeMo Data Designer 构建,含 2100 万人物画像、77 亿 token,覆盖英语与印地语(天城文及拉丁文),涵盖印度全部 36 个邦和 640 个地区,采用 CC BY 4.0 许可。
BigCode 项目发布 BigCodeArena,这是首个通过实际执行代码来评估代码生成模型的人类参与平台,用户提交编程任务后可对比两个模型的生成结果、运行程序并投票,结果汇总为排行榜。
推荐理由:平台把代码执行结果纳入人类投票,并公开 5 个月社区数据与两个新基准,可据此了解代码模型评测的新做法。
Hugging Face 发布教程,介绍如何将小红书 3B 参数 OCR 模型 dots.ocr 转换到端侧运行,该模型在 OmniDocBench 上超过 Gemini 2.5 Pro。方案用 Core ML 跑 1.2B 的 NaViT 视觉编码器、用 MLX 跑 Qwen2.5-1.5B 语言主干,并称 Neural Engine 能效比 CPU 高 12 倍、比 GPU 高 4 倍。
Hugging Face 发布 Retrieval Embedding Benchmark(RTEB)beta 版,用于评估嵌入模型在真实应用中的检索准确率。RTEB 采用开放与私有数据集混合策略,私有部分由 MTEB 维护者评测,以暴露模型在未见数据上的过拟合。基准覆盖 20 种语言及法律、医疗、代码、金融等领域,默认榜单指标为 NDCG@10,每个数据集至少含 1k 文档和 50 条查询。
Hugging Face 用 OpenVINO.GenAI 在 Intel Core Ultra 上加速 Qwen3-8B,以 Qwen3-0.6B 为草稿模型做投机解码,生成速度提升约 1.3 倍。
Hugging Face 的 Swift 库 swift-transformers 发布 1.0 版本,为 Apple Silicon 平台上的本地模型推理提供 Tokenizers、Hub 和 Core ML 模型封装等组件。
Hugging Face 发布 Smol2Operator,用两阶段训练把无 GUI 定位能力的 SmolVLM2-2.2B-Instruct 变成能理解并操作图形界面的智能体。
Meta 发布 GAIA 的后继智能体基准 Gaia2,并开源配套的 Agents Research Environments(ARE)框架,用于运行、调试和评估智能体。
推荐理由:GAIA 后继基准 Gaia2 转向读写与噪声环境,配套 ARE 框架可自定义场景并导出完整 trace,便于复现与调试。
Hugging Face Hub 新增 Scaleway 为 Inference Provider,用户可直接在模型页调用 gpt-oss、Qwen3、DeepSeek R1、Gemma 3 等开源权重模型。
Cloud Security Alliance 与 Noma Security 主导、Haize Labs 和 Harmonic Security 参与发起 RiskRubric.ai,对 Hugging Face hub 上超 50 万个模型按透明度、可靠性、安全、隐私、防护、声誉六个维度打分,输出 0-100 分及 A-F 等级。
Hugging Face Hub 新增 Public AI 作为 Inference Provider,用户可直接在模型页调用 Swiss AI Initiative、AI Singapore 等机构的公共主权模型。
Hugging Face 发布 LeRobotDataset v3.0,将多个 episode 打包进单个文件,用关系型元数据在 episode 级别检索信息,解决 v2 单文件单 episode 在百万级数据集上的文件系统瓶颈。
Hugging Face 在 Gradio 中推出可见水印功能,只需一条命令即可为 AI 生成的图像、视频和文本添加水印。图像和视频通过 watermark 参数指定水印文件,文本则在 Chatbot 组件中设置 watermark,用户复制 AI 回复时会自动附带署名。水印支持文件名、图像或 numpy 数组,还可使用 QR 水印。
WRITER 发布 Palmyra-mini 系列三款开源模型,参数规模 1.5B 至 1.7B,包括非思考基础版 palmyra-mini 及两个推理变体 palmyra-mini-thinking-a 和 palmyra-mini-thinking-b。
Hugging Face 博客介绍了为支持 OpenAI gpt-oss 系列而在 transformers 中做的一系列升级,包括可从 Hub 下载的零构建 Kernel、MXFP4 量化、张量并行、专家并行、动态滑动窗口缓存、连续批处理与 Paged Attention,以及更快的模型加载。