TNG 如何优化 LLM 并发请求的 Prefill 与 Decode 性能
TNG 在 24 张 H100 GPU 集群上自托管多个大语言模型,支撑 50 个应用、每小时超 5,000 次推理、每天生成超一千万 token。文章拆解了 LLM 生成的两个阶段:prefill 阶段并行处理全部输入 token,decode 阶段只能逐个串行生成输出 token,二者分别对应首 token 延迟和单 token 延迟两个指标。
TNG 在 24 张 H100 GPU 集群上自托管多个大语言模型,支撑 50 个应用、每小时超 5,000 次推理、每天生成超一千万 token。文章拆解了 LLM 生成的两个阶段:prefill 阶段并行处理全部输入 token,decode 阶段只能逐个串行生成输出 token,二者分别对应首 token 延迟和单 token 延迟两个指标。
Hugging Face 发文列举 Gradio 的 17 项特性,说明它不只是 Python UI 库,而是同时提供 UI 与 API 的机器学习应用框架。
Cohere 正式接入 Hugging Face Inference Providers,成为首个直接在 HF Hub 上分享并托管自家模型的模型厂商。
Protect AI 与 Hugging Face 合作半年,截至 2025 年 4 月 1 日已扫描 Hugging Face Hub 上 141 万个仓库中的 447 万个模型版本,在 5.17 万个模型中识别出 35.2 万个不安全或可疑问题。
Hugging Face 宣布收购开源机器人公司 Pollen Robotics,这是其第五次收购,此前曾收购 Gradio 和 XetHub。
推荐理由:Hugging Face 收购 Pollen Robotics 并开卖开源人形机器人,读者可了解其机器人布局与 Reachy 2 的定位。
Language Technologies Lab 发布 Visual Salamandra,将 Salamandra 大语言模型扩展至图像和视频,基于 7B 基础模型,集成 Google SigLIP-So400m 编码器与 2 层 MLP projector,采用四阶段训练和 late-fusion 架构。
Hugging Face 与 Cloudflare 达成合作,让 FastRTC 开发者凭 Hugging Face token 即可接入 Cloudflare 覆盖 335 多个地点的全球 TURN 网络。
Hugging Face 与 MBZUAI 合作上线 Arabic-Leaderboards Space,统一收录阿拉伯语 AI 评测,目前包含 AraGen-03-25 和阿拉伯语指令遵循两个榜单。
Meta 发布 Llama 4 Maverick(约 400B 总参数)和 Llama 4 Scout(约 109B 总参数),两者均为 17B 激活参数的 MoE 模型,原生支持多模态,已在 Hugging Face Hub 上线。
推荐理由:Hugging Face 官方给出 Llama 4 两款 MoE 模型的参数、上下文长度与架构细节,可据此判断部署门槛。
Gradio 月活开发者已超过 100 万,成为 Automatic1111、Text Generation WebUI、Dall-E Mini、LLaMA-Factory 等热门开源项目的界面方案。
Hugging Face 将已有 3 年历史的 NLP Course 更名为 LLM Course,并新增微调 LLM、构建 DeepSeek R1 等推理模型的章节。
TNG Technology Consulting 分享了自托管 LLM 服务中请求排队导致"重度用户"阻塞其他用户的问题,提出在 LLM-Server 层为每个用户和模型建立独立队列并采用轮询调度实现公平分配。由于 vLLM 不支持限制后端队列长度,方案通过抓取 vLLM /metrics 端点的 Prometheus 指标动态调节请求发送速率,将后端队列长度控制在 3 以下以降低新用户延迟。
Hugging Face 将密钥管理从 AWS 单云方案迁移至 Infisical,以应对多云环境下的 secret sprawl、权限管理和手动轮换难题。团队通过 Infisical Kubernetes Operator 自动同步密钥更新,并借助 Okta 集成实现细粒度 RBAC,同时用 CLI 替代本地 .env 文件。
Hugging Face 通过 PR #3091 将 Intel Gaudi 硬件支持原生集成进 TGI 主代码库,不再需要维护独立的 tgi-gaudi 分支。
DeepSeek 本周在 Hugging Face Hub 上线 DeepSeek-V3 0324,这是 R1 推理模型基座 DeepSeek-V3 的更新版本,架构不变但改用 MIT 许可,此前 V3 使用自定义模型许可。
推荐理由:梳理 DeepSeek-V3 0324 的基准提升与 MIT 许可变化,并给出多种本地部署与量化运行方式。
Sentence Transformers 库可微调 reranker(Cross Encoder)模型,使其在自有数据上超越现有方案,也能从零训练新模型。
Gradio 为 gr.Dataframe 组件发布大规模更新,6 周内关闭超 70 个 dataframe 相关问题。新增多单元格选择、行号与列固定(pinned_columns)、复制与全屏按钮、搜索(show_search="search")与筛选("filter")、静态列(static_columns)等功能,并升级键盘导航与 styler 样式参数。
Hugging Face 为 Inference Endpoints 的分析面板推出更新,指标数据改为实时更新,并重构后端以加快高流量端点的数据加载。新面板支持自定义时间范围与自动刷新,还新增副本生命周期视图,可追踪每个副本从初始化到终止的每次状态转换。官方表示仍在持续迭代并欢迎用户反馈。
Hugging Face 发布教程,介绍如何在本地通过 LM Studio 加载 4bit GGUF 量化的 OlympicCoder 7B,并接入 VS Code 的 Continue 扩展实现代码补全、生成、解释、重构和写测试。
Hugging Face 于 3 月 14 日向白宫 OSTP 提交了对白宫 AI 行动计划的回应,主张开源与开放科学是 AI 性能、普及与安全的基础。文中以 7B 参数的 OlympicCoder 在复杂编码任务上超越 Claude 3.7、AI2 全开放 OLMo 2 匹配 o1-mini 为例,并提出承认开源开放科学、优先效率与可靠性、以开放可追溯系统保障 AI 安全三项建议。
NVIDIA 在 GTC 2025 上开源三项物理 AI 成果:世界基础模型 Cosmos Transfer、Physical AI Dataset 以及人形机器人基础模型 NVIDIA Isaac GR00T N1。
推荐理由:NVIDIA 一次性开源世界模型、数据集与人形机器人基础模型,读者可据此了解物理 AI 开发可用的工具链。
Hugging Face 宣布 Xet 存储正式上线 Hub,首批 Model 和 Dataset 仓库已从 LFS 迁移至 Xet,迁移总量 4.5 TB,约占 Hub 下载流量的 6%。
推荐理由:Hugging Face 官方复盘 Xet 存储首次迁移的工程细节,可了解大文件去重与传输优化的实际取舍。
Mistral AI 发布 Mistral Small 3.1,在 Mistral Small 3 基础上提升文本性能与多模态理解,上下文窗口扩展至 128k tokens,推理速度达 150 tokens 每秒,并以 Apache 2.0 许可开源。
推荐理由:Mistral Small 3.1 以 Apache 2.0 开源并给出多模态与长上下文能力,读者可据此判断小模型在端侧与智能体场景的可用性。
Google 发布 Gemma 家族新成员 Gemma 3,提供 1B、4B、12B、27B 四种参数规模,含预训练和指令微调版本。4B、12B、27B 支持图像与文本输入、140 多种语言,上下文窗口从 Gemma 2 的 8k 提升至 128k,1B 版本为纯文本、32k 上下文。
推荐理由:梳理了 Gemma 3 的四种参数规模、多模态与 128k 上下文变化,并给出 transformers 与端侧推理的可用入口。
Hugging Face Open R1 项目发布 OlympicCoder-7B 和 OlympicCoder-32B 两个代码模型,基于 Qwen2.5 Coder Instruct 微调,在 IOI 问题上超过 Claude 3.7 Sonnet 等闭源前沿模型。
推荐理由:Open R1 复现 R1 代码推理配方,给出数据集、IOI 基准与 7B/32B 模型,并附训练经验。
Hugging Face 的 LeRobot 团队与 Yaak 联合发布 L2D,号称全球最大的开源自动驾驶数据集,包含 90+ TB 多模态数据、5000+ 小时驾驶记录,来自德国 30 个城市的 60 辆驾校电动车。
推荐理由:L2D 以 90TB 多模态驾驶数据补齐端到端自动驾驶训练集缺口,并给出 LeRobot 接入方式与分阶段发布计划。
Hugging Face 发布教程,演示如何用 React Native 和 llama.rn(llama.cpp 的绑定)构建可在 Android 与 iOS 上离线运行 LLM 的聊天应用,模型从 Hugging Face hub 下载 GGUF 文件,全程本地推理保证隐私。
Cohere For AI 发布 Aya Vision 系列开源权重视觉语言模型,包含 8B 和 32B 两个版本,覆盖 23 种语言,支持图像描述、视觉问答、文本生成以及文本与图像翻译等任务。
推荐理由:原文给出 8B 与 32B 两个开源权重的多语言视觉语言模型,并公开训练方法与评测基准,便于读者判断小参数模型在多语言多模态上的位置。
Hugging Face 宣布与 JFrog 合作,将 JFrog 扫描器集成到 Hugging Face Hub,用于检测模型权重中的恶意代码。JFrog 扫描器能解析并分析模型权重中的代码,减少误报,覆盖 pickle 和 Keras Lambda 层等多种格式的漏洞利用。所有公开模型仓库在推送文件后将自动被扫描,无需额外操作。
Hugging Face 发布教程,演示如何用 Arize Phoenix 配合 OpenTelemetry 与 OpenInference 追踪和评估基于 smolagents 构建的 Agent。
Hugging Face 与印度科学研究所(IISc)及 ARTPARK 达成合作,旨在提升印度多模态多语言数据集 Vaani 的可访问性与易用性。Vaani 由 IISc/ARTPARK 与 Google 于 2022 年发起,目标采集超 150,000 小时语音和 15,000 小时转写文本,覆盖全印 773 个地区、100 万人。
Hugging Face 发布 FastRTC,一个面向 Python 的实时通信库,用于构建实时音频和视频 AI 应用。
推荐理由:FastRTC 把 WebRTC 实时音视频通信封装成 Python 库,读者可据此判断实时语音应用的搭建门槛变化。
Hugging Face Diffusers 团队实验性推出 Remote VAE,将扩散模型的 VAE 解码过程委托给远程 Inference Endpoints,以缓解高分辨率图像和视频合成中解码器的显存占用问题。
Google 发布 SigLIP 2 系列多语言视觉语言编码器,在 SigLIP 的 sigmoid loss 基础上加入解码器、自蒸馏 Global-Local loss 与 Masked Prediction loss 等训练目标,在零样本分类、图文检索及为 VLM 提取视觉表征等核心能力上全面优于旧版 SigLIP。
推荐理由:梳理 SigLIP 2 相比前代新增的训练目标与 naflex 动态分辨率变体,便于理解视觉编码器的演进方向。
Hugging Face 发布 SmolVLM2 系列视频理解模型,包含 2.2B、500M 和 256M 三种参数规模,官方称 500M 与 256M 是目前最小的视频语言模型。
推荐理由:Hugging Face 官方发布三档小尺寸视频理解模型,并给出 MLX 与 iPhone 本地运行方案,可据此判断端侧视频理解的可行边界。
Hugging Face Hub 新增 Hyperbolic、Nebius AI Studio 和 Novita 三家无服务器推理提供商,支持 DeepSeek-R1、Flux.1 等模型,并已集成 JS 和 Python 客户端 SDK。用户可在账户设置中配置自有 API key 直连提供商,或通过 HF 路由调用并按标准 API 费率计费,PRO 用户每月获 $2 推理额度。
Hugging Face 宣布 Fireworks.ai 正式成为 HF Hub 支持的推理服务商,可在模型页面及整个 HF 生态中直接调用其无服务器推理。
Hugging Face 用 Math-Verify 替换旧评测器,重新评估了 Open LLM Leaderboard 上提交过的全部 3751 个模型。旧评测器因答案格式、SymPy 解析和比较环节的问题把正确答案判错,新方案平均让模型多解出 61 道题、整体提升 4.66 分,Algebra 与 Prealgebra 子集分别提升 8.27 和 6.93 分。
推荐理由:原文给出旧评测器失效的具体案例和重评后的分数变化,可据此判断数学评测口径对榜单排名的影响。
Hugging Face 博客给出每天 10 亿次分类与嵌入推理的成本测算框架,用 Infinity 部署、k6 压测,在 nvidia-L4($0.8/hr)上跑 10 亿条输入。
Hugging Face 推出面向视频生成模型微调的开源数据集工具链,采用三阶段流水线:用 yt-dlp 下载视频并切分为短片段,再通过 LAION-5B-WatermarkDetection。