Falcon-Arabic:阿拉伯语语言模型的突破
阿联酋技术创新研究院(TII)发布 Falcon-Arabic,一款基于 Falcon 3 架构的 7B 参数多语言模型,支持阿拉伯语、英语等多种语言,上下文长度 32,000 tokens。该模型在 OALL v2 基准上超越同尺寸及最多 4 倍大的阿拉伯语 LLM,覆盖阿拉伯语 MMLU、Exams、MadinahQA 等任务。
阿联酋技术创新研究院(TII)发布 Falcon-Arabic,一款基于 Falcon 3 架构的 7B 参数多语言模型,支持阿拉伯语、英语等多种语言,上下文长度 32,000 tokens。该模型在 OALL v2 基准上超越同尺寸及最多 4 倍大的阿拉伯语 LLM,覆盖阿拉伯语 MMLU、Exams、MadinahQA 等任务。
Hugging Face 发布 nanoVLM,一个用纯 PyTorch 训练视觉语言模型(VLM)的轻量工具包,灵感来自 nanoGPT,可在免费 Colab 上启动训练。
Hugging Face Diffusers 现已集成 bitsandbytes、GGUF、torchao、Quanto 和原生 FP8 等多种量化后端,并以 Flux-dev 为例展示其效果。
微软在 Build 大会上宣布扩大与 Hugging Face 的合作,Azure AI Foundry 的 Hugging Face Collection 现已提供 10,000+ 个可一键部署的开源模型,覆盖文本、音频和图像任务。
Hugging Face 表示,未来目标是让 Transformers 成为各框架之间的枢纽:只要模型架构被 Transformers 支持,就能在生态其他工具中获得支持。
推荐理由:Hugging Face 说明 Transformers 将作为跨框架模型定义中枢,读者可了解其对训练、推理与本地部署工具链互通的影响。
Kaggle 上线与 Hugging Face 的集成,可直接在 Kaggle 上发现和使用 Hugging Face 模型。
Hugging Face 在 Inference Endpoints 上线新版 OpenAI Whisper 部署方案,基于 vLLM 实现,性能较上一版最高提升 8 倍。
Hugging Face 发文回顾过去一年视觉语言模型(VLM)的关键变化,涵盖 any-to-any 模型、推理模型、小尺寸模型、MoE 解码器、视觉语言动作模型、多模态 RAG 与智能体、视频语言模型等新趋势。
Hugging Face 发文称 LeRobot 社区贡献数据集正快速增长,目标是把泛化当作数据问题,构建开放多样的“机器人 ImageNet”。目前上传数据集多集中在 So100 和 Koch 机械臂,社区案例还包括抽屉操作、国际象棋对局和动物玩偶交互等。文章同时指出,随着数据采集门槛降低,数据整理与策展将成为下一阶段挑战。
Qwen-3 的 chat template 相比 Qwen-2.5 和 QwQ 有四处关键变化:通过 enable_thinking 标志可开关推理,设为 false 时模板插入空对以跳过逐步思考,而 QwQ 等旧模型强制每轮生成思维链。
Hugging Face 发布教程,介绍如何用 Gradio 在几行 Python 代码内把应用变成 MCP Server,供 LLM 作为工具调用。只需在 launch() 中设置 mcp_server=True,Gradio 就会自动把函数转成 MCP 工具,并用 docstring 生成工具描述和参数,MCP 端点位于 /gradio_api/mcp/sse。
推荐理由:原文给出用 Gradio 把 Python 函数变成 MCP 工具的完整步骤,读者可据此把自有应用接入 LLM 工具调用。
Intel 发布权重仅训练后量化方法 AutoRound,通过符号梯度下降联合优化权重舍入与裁剪范围,实现 INT2-INT8 低比特量化。在 INT2 下其相对精度最高达主流基线 2.1 倍,量化 72B 模型在 A100 上仅需 37 分钟。
Meta 发布 Llama Guard 4,一个从 Llama 4 Scout 剪枝而来的 12B 稠密多模态安全模型,可检测图像与文本输入输出中的不当内容,单张 24GB 显存 GPU 即可运行。
推荐理由:Meta 发布 12B 多模态安全模型与两款提示注入分类器,并给出可直接运行的 transformers 示例。
Hugging Face 发布 Tiny Agents 教程,展示如何用约 50 行 TypeScript 代码在 InferenceClient 之上实现 MCP 客户端和智能体。
推荐理由:作者用 50 行代码演示 MCP 客户端与智能体的最小实现,读者可据此理解工具调用如何接入推理客户端。
Hugging Face 发文列举 Gradio 的 17 项特性,说明它不只是 Python UI 库,而是同时提供 UI 与 API 的机器学习应用框架。
Protect AI 与 Hugging Face 合作半年,截至 2025 年 4 月 1 日已扫描 Hugging Face Hub 上 141 万个仓库中的 447 万个模型版本,在 5.17 万个模型中识别出 35.2 万个不安全或可疑问题。
Hugging Face 宣布收购开源机器人公司 Pollen Robotics,这是其第五次收购,此前曾收购 Gradio 和 XetHub。
推荐理由:Hugging Face 收购 Pollen Robotics 并开卖开源人形机器人,读者可了解其机器人布局与 Reachy 2 的定位。
Meta 发布 Llama 4 Maverick(约 400B 总参数)和 Llama 4 Scout(约 109B 总参数),两者均为 17B 激活参数的 MoE 模型,原生支持多模态,已在 Hugging Face Hub 上线。
推荐理由:Hugging Face 官方给出 Llama 4 两款 MoE 模型的参数、上下文长度与架构细节,可据此判断部署门槛。
Gradio 月活开发者已超过 100 万,成为 Automatic1111、Text Generation WebUI、Dall-E Mini、LLaMA-Factory 等热门开源项目的界面方案。
Hugging Face 将已有 3 年历史的 NLP Course 更名为 LLM Course,并新增微调 LLM、构建 DeepSeek R1 等推理模型的章节。
Hugging Face 将密钥管理从 AWS 单云方案迁移至 Infisical,以应对多云环境下的 secret sprawl、权限管理和手动轮换难题。团队通过 Infisical Kubernetes Operator 自动同步密钥更新,并借助 Okta 集成实现细粒度 RBAC,同时用 CLI 替代本地 .env 文件。
Hugging Face 通过 PR #3091 将 Intel Gaudi 硬件支持原生集成进 TGI 主代码库,不再需要维护独立的 tgi-gaudi 分支。
DeepSeek 本周在 Hugging Face Hub 上线 DeepSeek-V3 0324,这是 R1 推理模型基座 DeepSeek-V3 的更新版本,架构不变但改用 MIT 许可,此前 V3 使用自定义模型许可。
推荐理由:梳理 DeepSeek-V3 0324 的基准提升与 MIT 许可变化,并给出多种本地部署与量化运行方式。
Sentence Transformers 库可微调 reranker(Cross Encoder)模型,使其在自有数据上超越现有方案,也能从零训练新模型。
Hugging Face 发布教程,介绍如何在本地通过 LM Studio 加载 4bit GGUF 量化的 OlympicCoder 7B,并接入 VS Code 的 Continue 扩展实现代码补全、生成、解释、重构和写测试。
Hugging Face 于 3 月 14 日向白宫 OSTP 提交了对白宫 AI 行动计划的回应,主张开源与开放科学是 AI 性能、普及与安全的基础。文中以 7B 参数的 OlympicCoder 在复杂编码任务上超越 Claude 3.7、AI2 全开放 OLMo 2 匹配 o1-mini 为例,并提出承认开源开放科学、优先效率与可靠性、以开放可追溯系统保障 AI 安全三项建议。
Hugging Face 宣布 Xet 存储正式上线 Hub,首批 Model 和 Dataset 仓库已从 LFS 迁移至 Xet,迁移总量 4.5 TB,约占 Hub 下载流量的 6%。
推荐理由:Hugging Face 官方复盘 Xet 存储首次迁移的工程细节,可了解大文件去重与传输优化的实际取舍。
Mistral AI 发布 Mistral Small 3.1,在 Mistral Small 3 基础上提升文本性能与多模态理解,上下文窗口扩展至 128k tokens,推理速度达 150 tokens 每秒,并以 Apache 2.0 许可开源。
推荐理由:Mistral Small 3.1 以 Apache 2.0 开源并给出多模态与长上下文能力,读者可据此判断小模型在端侧与智能体场景的可用性。
Google 发布 Gemma 家族新成员 Gemma 3,提供 1B、4B、12B、27B 四种参数规模,含预训练和指令微调版本。4B、12B、27B 支持图像与文本输入、140 多种语言,上下文窗口从 Gemma 2 的 8k 提升至 128k,1B 版本为纯文本、32k 上下文。
推荐理由:梳理了 Gemma 3 的四种参数规模、多模态与 128k 上下文变化,并给出 transformers 与端侧推理的可用入口。
Hugging Face 的 LeRobot 团队与 Yaak 联合发布 L2D,号称全球最大的开源自动驾驶数据集,包含 90+ TB 多模态数据、5000+ 小时驾驶记录,来自德国 30 个城市的 60 辆驾校电动车。
推荐理由:L2D 以 90TB 多模态驾驶数据补齐端到端自动驾驶训练集缺口,并给出 LeRobot 接入方式与分阶段发布计划。
Cohere For AI 发布 Aya Vision 系列开源权重视觉语言模型,包含 8B 和 32B 两个版本,覆盖 23 种语言,支持图像描述、视觉问答、文本生成以及文本与图像翻译等任务。
推荐理由:原文给出 8B 与 32B 两个开源权重的多语言视觉语言模型,并公开训练方法与评测基准,便于读者判断小参数模型在多语言多模态上的位置。
Hugging Face 宣布与 JFrog 合作,将 JFrog 扫描器集成到 Hugging Face Hub,用于检测模型权重中的恶意代码。JFrog 扫描器能解析并分析模型权重中的代码,减少误报,覆盖 pickle 和 Keras Lambda 层等多种格式的漏洞利用。所有公开模型仓库在推送文件后将自动被扫描,无需额外操作。
Hugging Face 发布教程,演示如何用 Arize Phoenix 配合 OpenTelemetry 与 OpenInference 追踪和评估基于 smolagents 构建的 Agent。
Hugging Face 与印度科学研究所(IISc)及 ARTPARK 达成合作,旨在提升印度多模态多语言数据集 Vaani 的可访问性与易用性。Vaani 由 IISc/ARTPARK 与 Google 于 2022 年发起,目标采集超 150,000 小时语音和 15,000 小时转写文本,覆盖全印 773 个地区、100 万人。
Hugging Face 发布 FastRTC,一个面向 Python 的实时通信库,用于构建实时音频和视频 AI 应用。
推荐理由:FastRTC 把 WebRTC 实时音视频通信封装成 Python 库,读者可据此判断实时语音应用的搭建门槛变化。
Hugging Face Diffusers 团队实验性推出 Remote VAE,将扩散模型的 VAE 解码过程委托给远程 Inference Endpoints,以缓解高分辨率图像和视频合成中解码器的显存占用问题。
Google 发布 SigLIP 2 系列多语言视觉语言编码器,在 SigLIP 的 sigmoid loss 基础上加入解码器、自蒸馏 Global-Local loss 与 Masked Prediction loss 等训练目标,在零样本分类、图文检索及为 VLM 提取视觉表征等核心能力上全面优于旧版 SigLIP。
推荐理由:梳理 SigLIP 2 相比前代新增的训练目标与 naflex 动态分辨率变体,便于理解视觉编码器的演进方向。
Hugging Face 发布 SmolVLM2 系列视频理解模型,包含 2.2B、500M 和 256M 三种参数规模,官方称 500M 与 256M 是目前最小的视频语言模型。
推荐理由:Hugging Face 官方发布三档小尺寸视频理解模型,并给出 MLX 与 iPhone 本地运行方案,可据此判断端侧视频理解的可行边界。
Google 发布 PaliGemma 2 Mix,这是基于 SigLIP 和 Gemma 2 的微调视觉语言模型,覆盖 OCR、长短描述、视觉问答、目标检测与图像分割等任务。模型提供 3B、10B、28B 三种参数规模和 224、448、896 三种分辨率,支持 HF Transformers 与 JAX 框架,并已开放演示。
Hugging Face Hub 新增 Hyperbolic、Nebius AI Studio 和 Novita 三家无服务器推理提供商,支持 DeepSeek-R1、Flux.1 等模型,并已集成 JS 和 Python 客户端 SDK。用户可在账户设置中配置自有 API key 直连提供商,或通过 HF 路由调用并按标准 API 费率计费,PRO 用户每月获 $2 推理额度。