Intercom 打造可持续 AI 优势的三条经验
Intercom 分享了构建可扩展 AI 平台的三条经验,涵盖评估体系与架构设计,目标是引领客户支持的未来。内容围绕如何将 AI 能力沉淀为可持续的竞争优势展开。
Intercom 分享了构建可扩展 AI 平台的三条经验,涵盖评估体系与架构设计,目标是引领客户支持的未来。内容围绕如何将 AI 能力沉淀为可持续的竞争优势展开。
Hugging Face 发布开源免费的实验追踪 Python 库 Trackio,提供本地 Gradio 仪表盘,并可同步到 Hugging Face Spaces 通过 URL 分享。
PyArrow 和 Pandas 现已支持 Parquet 内容定义分块(CDC),配合 Hugging Face 的 Xet 存储层,可在重新上传、增删列、改列类型、追加行等场景下只传输变更的数据块,大幅降低传输与存储成本。
Hugging Face 将其 CLI 从 huggingface-cli 正式更名为 hf,命令按资源分组为 hf auth、hf cache、hf repo 等,旧命令仍可用但会提示弃用警告。
Hugging Face 发布教程,介绍如何用 Diffusers 和 PEFT 优化 Flux.1-Dev 的 LoRA 推理速度。方案组合 Flash Attention 3、torch.compile 和 FP8 量化,并通过 hotswap 机制避免切换 LoRA 时触发重新编译,在 H100 上相比基线取得 2.23 倍加速。
推荐理由:原文给出 Flux LoRA 推理的完整优化配方与实测数据,读者可据此在 H100 或 4090 上复现加速效果。
Mistral AI 联合 Carbone 4 和法国生态转型署(ADEME)完成首个 AI 模型全生命周期分析,并公开两项指标:Mistral Large 2 截至 2025 年 1 月训练及 18 个月使用产生 20.4 ktCO₂e。
OpenAI 与 Oracle 达成协议,将在美国为 Stargate 开发 4.5 GW 的额外数据中心容量。OpenAI 称这笔投资将创造就业、加速美国再工业化,并推进美国在 AI 领域的领先地位,同时是 Stargate 这一 AI 基础设施平台的重要里程碑。
推荐理由:OpenAI 与 Oracle 就 Stargate 新增 4.5 GW 数据中心容量达成协议,读者可据此了解其美国 AI 基础设施扩张规模。
NVIDIA 宣布通过 NIM 推理微服务在 Hugging Face 上解锁超过 10 万个 LLM 的快速部署。NIM 现在提供单个 Docker 容器,可部署 TensorRT-LLM、vLLM 和 SGLang 支持的多种 LLM,自动识别模型格式、架构与量化方式并选择推理后端,无需手动配置。
推荐理由:NIM 用单个容器自动识别模型格式并选择推理后端,读者可据此判断多模型部署流程能简化到什么程度。
Hugging Face 官方宣布 Hub 存储后端从 Git LFS 迁移到 Xet,已有 50 万个仓库、20 PB 数据完成迁移,超过 100 万用户在用。迁移依靠 Git LFS Bridge 和后台迁移流程实现无硬切换,旧版客户端仍可正常上传下载。从本月起 Xet 将向所有用户开放,现有仓库会自动迁移,新仓库默认启用 Xet。
推荐理由:Hugging Face 官方复盘 Hub 从 Git LFS 迁移到 Xet 的工程细节,可了解大规模存储迁移如何做到对用户零打扰。
Hugging Face 发布博客详解异步机器人推理,将动作预测与动作执行解耦,让机器人在 PolicyServer 计算下一段动作时继续执行当前动作队列,从而消除推理等待。该方案在 SmolVLA 上实现约 2 倍任务完成提速,成功率相当,PolicyServer 与 RobotClient 通过 gRPC 通信,性能约为同类 REST API 的 5 倍。
Hugging Face 发布官方 MCP Server(hf.co/mcp),通过一个 URL 让 AI 助手访问 Hub 及 Spaces 上的数千个 AI 应用,并支持用户动态配置工具。生产环境采用 Streamable HTTP 传输的无状态 Direct Response 模式,开源代码同时支持 STDIO、SSE 和 Streamable HTTP 三种部署方式。
Hugging Face 与 AMD 合作,为 MI300X GPU 编写了三个开源自定义 kernel——融合残差连接/RMS norm/FP8 转换、融合 SwiGLU 激活/FP8 转换以及 Skinny GEMM,用于在 8 卡 MI300X 节点上通过 VLLM 加速 Llama 3.1 405B 的 FP8 推理。
Hugging Face 以 nanoVLM 项目为例,分五个阶段构建高效多模态数据管道,解决 GPU 空转与填充浪费问题。朴素填充阶段约 60% 的 batch 被无用 padding token 占据,随后依次采用受限填充、背包算法打包,并推出支持贪心与 binpack 策略的 ConstantLengthDataset,按 token 与图像数量打包样本。
Hugging Face 基础设施团队公开了支撑其生产环境的三大关键告警机制,包括 NAT 网关吞吐量告警和 Hub 请求日志归档成功率告警。NAT 网关告警在流量超过预设静态阈值时触发,用于发现异常流量峰值并优化成本;日志归档链路则通过 Filebeat、Logstash 与 Elasticsearch 完成日志的采集、加工与存储。
Mistral AI 推出 AI for Citizens 协作计划,帮助各国政府和公共机构战略性地运用 AI 改造公共服务、推动创新。该计划已在法国、卢森堡、新加坡、荷兰、英国、瑞士等国家落地,提供自托管、主权数据中心、SaaS 及 serverless API 等部署选项,确保数据主权并支持本地语言和文化的定制化模型研发。
SGLang 现已支持将 Hugging Face transformers 作为后端,可直接以高性能推理运行任意 transformers 兼容模型,无需原生适配。
Groq 现已作为 Inference Provider 接入 Hugging Face Hub,支持 Llama 4、Qwen QWQ-32B 等开源文本与对话模型,并集成到 JS 和 Python 客户端 SDK。
TNG 在 24 块 H100 上自托管多个大语言模型,每日消耗超 1 亿 token、生成超 1000 万 token,发现 vLLM 默认 chunked-prefill 会顺序调度不同请求的 prefill,单个长提示词请求会阻塞后续请求,导致首 token 等待时间变长。
Featherless AI 现已作为 Inference Provider 接入 Hugging Face Hub,为模型页面提供无服务器推理,并集成 JS 和 Python 客户端 SDK。
Hugging Face 发布 Kernel Hub,让 Python 库和应用通过 kernels 库的 get_kernel 直接从 Hub 加载预编译的优化计算 kernel,无需本地编译。
Mistral AI 发布 Mistral Compute,提供从裸金属服务器到全托管 PaaS 的私有集成 AI 基础设施栈,涵盖 GPU、编排、API、产品与服务。
推荐理由:Mistral 从模型厂商延伸到自有 AI 基础设施,读者可据此判断欧洲算力供给格局的新变量。
Hugging Face 与 NVIDIA 在 GTC Paris 上宣布合作推出 Training Cluster as a Service,让全球研究机构更便捷地获取大型 GPU 集群,按训练运行时长付费。
推荐理由:Hugging Face 与 NVIDIA 联合推出按训练时长付费的 GPU 集群服务,读者可了解其申请方式与整合的组件。
Mistral AI 发布企业级 AI 编码助手 Mistral Code,整合 Codestral、Codestral Embed、Devstral 和 Mistral Medium 四个模型,支持云端、专属容量或气隙本地 GPU 部署,代码留在企业边界内。
推荐理由:官方给出企业级编码助手的模型组合、部署形态与首批客户,可据此判断私有化编码方案的落地路径。
Hugging Face 的 nanoVLM 仓库从零实现了 KV Cache,使自回归生成速度提升 38%。该实现覆盖 Attention 块的缓存更新、语言模型逐层缓存管理,以及区分 prefill 与逐 token 解码的生成循环。相关经验可推广到所有自回归语言模型的生成优化。
Arm 工程师 Michael Gamble 用 Stable Audio Open 模型、PyTorch 和 TorchAudio 打造了一款完全在 Arm CPU 上本地运行的个人音效生成工具,无需 GPU 和云端推理,几秒内即可根据提示词生成 .wav 文件并直接导入 Ableton Live。
Hugging Face 的 TRL 通过 PR #3394 支持 vLLM 的 external launcher,让训练与推理共置在同一批 GPU 上,不再需要单独的 vLLM 服务器进程。
推荐理由:原文给出同卡共置训练与推理的实现方式和多组吞吐对比,读者可据此判断 GRPO 训练的成本变化。
Mistral AI 发布首个面向代码的嵌入模型 Codestral Embed,官方称其在真实代码检索场景中明显优于 Voyage Code 3、Cohere Embed v4.0 和 OpenAI 的大嵌入模型。
推荐理由:官方给出代码嵌入模型与三家竞品的对比,以及维度与精度可调的取舍方式,便于评估检索成本。
Mistral 发布 Agents API,将自家语言模型与代码执行、图像生成、文档库、web search 等内置连接器及 MCP 工具结合,并提供跨对话的持久记忆与智能体编排能力。
推荐理由:官方给出 Agents API 的连接器、记忆与多智能体编排能力,以及带 web search 的 SimpleQA 对比数据,可据此判断企业级智能体平台的落地方式。
Dell 在 Dell Tech World 上发布新版 Dell Enterprise Hub,提供可直接部署的模型与应用目录,支持 Meta Llama 4 Maverick。
OpenAI 宣布推出 Stargate UAE,这是其 AI 基础设施平台 Stargate 的首次国际部署。
推荐理由:OpenAI 首次把 Stargate 基础设施平台部署到美国以外,读者可据此观察其算力布局的国际化节奏。
Hugging Face Diffusers 现已集成 bitsandbytes、GGUF、torchao、Quanto 和原生 FP8 等多种量化后端,并以 Flux-dev 为例展示其效果。
微软在 Build 大会上宣布扩大与 Hugging Face 的合作,Azure AI Foundry 的 Hugging Face Collection 现已提供 10,000+ 个可一键部署的开源模型,覆盖文本、音频和图像任务。
Hugging Face 表示,未来目标是让 Transformers 成为各框架之间的枢纽:只要模型架构被 Transformers 支持,就能在生态其他工具中获得支持。
推荐理由:Hugging Face 说明 Transformers 将作为跨框架模型定义中枢,读者可了解其对训练、推理与本地部署工具链互通的影响。
Kaggle 上线与 Hugging Face 的集成,可直接在 Kaggle 上发现和使用 Hugging Face 模型。
Hugging Face 在 Inference Endpoints 上线新版 OpenAI Whisper 部署方案,基于 vLLM 实现,性能较上一版最高提升 8 倍。
OpenAI 在亚洲推出数据驻留功能,延续其面向全球客户的企业级数据隐私、安全与合规体系。
Mistral AI 发布 Mistral Medium 3,官方称其在多项基准上达到 Claude Sonnet 3.7 的 90% 或以上水平,成本为每百万 token 输入 0.4 美元、输出 2 美元。
推荐理由:官方给出 Mistral Medium 3 的定价、对标模型与部署门槛,读者可据此判断企业选型的成本与落地条件。
Mistral AI 发布 Le Chat Enterprise,一款由全新 Mistral Medium 3 模型驱动的企业级 AI 助手,包含企业搜索、Agent 构建器、自定义数据与工具连接器、文档库、自定义模型和混合部署等功能,全部功能将在未来两周内陆续上线。
Intel 发布权重仅训练后量化方法 AutoRound,通过符号梯度下降联合优化权重舍入与裁剪范围,实现 INT2-INT8 低比特量化。在 INT2 下其相对精度最高达主流基线 2.1 倍,量化 72B 模型在 A100 上仅需 37 分钟。
TNG 在 24 张 H100 GPU 集群上自托管多个大语言模型,支撑 50 个应用、每小时超 5,000 次推理、每天生成超一千万 token。文章拆解了 LLM 生成的两个阶段:prefill 阶段并行处理全部输入 token,decode 阶段只能逐个串行生成输出 token,二者分别对应首 token 延迟和单 token 延迟两个指标。