dottxt 与 Hugging Face 发布 Outlines-core 0.1.0:用 Rust 重写结构化生成核心算法
dottxt 与 Hugging Face 合作发布 outlines-core 0.1.0,这是 outlines 结构化生成核心算法的 Rust 移植版,Python 绑定已同步上线。
推荐理由:原文给出 Rust 重写带来的索引编译提速与轻量化拆分,读者可据此判断结构化生成如何嵌入现有推理栈。
开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。
dottxt 与 Hugging Face 合作发布 outlines-core 0.1.0,这是 outlines 结构化生成核心算法的 Rust 移植版,Python 绑定已同步上线。
推荐理由:原文给出 Rust 重写带来的索引编译提速与轻量化拆分,读者可据此判断结构化生成如何嵌入现有推理栈。
Hugging Face 发布 Transformers.js v3,新增 WebGPU 支持,官方称比 WASM 快至多 100 倍,并引入 fp32、fp16、q8、q4 等 dtype 量化选项。
推荐理由:官方给出 WebGPU 加速、量化格式与 1200 多个预转换模型,可据此判断浏览器端推理的可用边界。
Stability AI 发布 Stable Diffusion 3.5,包含 8B 的 Large 模型和 8B 的 timestep-distilled 模型,已在 Hugging Face Hub 上线并可通过 Diffusers 使用。
推荐理由:Diffusers 官方给出 SD3.5 Large 的量化推理与 LoRA 训练路径,可据此判断消费级显卡的可用性。
Hugging Face 发布 Gradio 5 稳定版,开发者用几行 Python 即可构建生产级机器学习 Web 应用,可通过 pip install --upgrade gradio 升级。
推荐理由:官方列出 Gradio 5 在 SSR 加载、实时流式与安全审计上的具体改动,便于判断是否值得升级。
Mistral 宣布 la Plateforme 推出免费额度,并对全线模型降价,其中 Mistral Small 和 Codestral 输入输出价格均下调 80%,Mistral Large 下调 33%。
推荐理由:Mistral 一次性公布免费额度、全线降价和新版小模型,可据此判断其 API 成本与部署选择。
Mistral AI 发布 Pixtral 12B,一个原生多模态模型,采用从零训练的 400M 参数视觉编码器和基于 Mistral Nemo 的 12B 多模态解码器,支持可变图像尺寸与宽高比,128k token 上下文窗口内可处理任意数量图片。
推荐理由:官方给出架构、评测口径与本地部署方式,可据此判断这一 12B 多模态模型在开源阵营中的位置。
阿布扎比 TII 发布 Falcon Mamba 7B,采用纯 Mamba 架构并加入额外 RMS 归一化层以保证大规模训练稳定,模型以 TII Falcon Mamba 7B License 1.0 开放,可在 Hugging Face 生态中使用。
推荐理由:TII 发布首个纯 Mamba 架构的 7B 开源模型,读者可据此了解无注意力架构在长序列上的取舍。
Hugging Face 在 Transformers 中推出统一的工具调用 API,同一套代码可在 Mistral、Cohere、NousResearch 和 Llama 等模型家族间通用,无需或只需极少模型专属改动。
推荐理由:Hugging Face 把工具调用统一进 chat template,读者可据此判断跨模型复用同一套代码的可行边界。
Hugging Face 宣布收购西雅图公司 XetHub,其创始团队此前在 Apple 构建并扩展内部 ML 基础设施,XetHub 的技术可让 Git 扩展到 TB 级仓库。
推荐理由:Hugging Face 收购 XetHub 并计划替换 Hub 的 Git LFS 存储后端,读者可了解大文件版本管理将如何变化。
Google 在 Gemma 2 发布一个月后扩充 Gemma 模型系列,新增 2.6B 参数的 Gemma 2 2B(含 base 与指令微调版)、安全分类器 ShieldGemma 以及稀疏自编码器套件 Gemma Scope。
推荐理由:Gemma 2 新增 2B 小模型、安全分类器和可解释性工具,读者可据此判断端侧部署与安全过滤的可用选项。
Meta 发布 Llama 3.1,包含 8B、70B、405B 三个尺寸的 base 与 instruct 版本共六个开放权重模型,全部支持 128K token 上下文和 8 种语言,并新增 Llama Guard 3 与 Prompt Guard 两个安全模型。
推荐理由:Hugging Face 官方给出 Llama 3.1 三个尺寸的显存需求、量化方案与工具调用格式,便于评估部署成本。
Hugging Face 发布教程,介绍如何借助 WWDC 24 的新 Core ML 特性在 Mac 上运行 Mistral 7B,并用不到 4GB 内存完成推理。
推荐理由:Hugging Face 团队给出把 Mistral 7B 转成 Core ML 并跑在 Mac 上的完整步骤,可据此复现端侧 LLM 部署流程。
Mistral AI 与 NVIDIA 合作发布 12B 模型 Mistral NeMo,支持最高 128k token 上下文窗口,预训练基座与指令微调 checkpoint 均以 Apache 2.0 许可开源。
推荐理由:Mistral 与 NVIDIA 合作的 12B 模型以 Apache 2.0 开源,128k 上下文和 FP8 推理对部署选型有直接参考。
Hugging Face 为 TGI 推出 Multi-LoRA 服务,只需部署一次基础模型,即可根据请求中的 adapter_id 动态选择对应的 LoRA 适配器,官方称可服务 30 个模型。
推荐理由:原文给出 TGI Multi-LoRA 的部署方式与成本对比,读者可据此判断多微调模型能否合并到一次部署。
Mistral AI 发布 Codestral Mamba,这是继 Mixtral 系列之后对 Mamba 架构的又一次探索,采用 Apache 2.0 许可,可自由使用、修改和分发。
推荐理由:Mistral 发布基于 Mamba 架构的代码模型,给出参数规模、256k 检索测试与多种部署方式,可据此判断非 Transformer 架构在代码场景的可用性。
Hugging Face 发布 SmolLM 系列小语言模型,包含 135M、360M 和 1.7B 三个参数规模,并同步开源训练语料 SmolLM-Corpus。
推荐理由:原文公开了三个尺寸小模型的训练数据配比与评测对比,可据此判断端侧小模型的选型与数据策略。
Numina 与 Hugging Face 合作的 NuminaMath 7B TIR 赢得首届 AIMO 进步奖,在私有测试集 50 题中解出 29 题。方案基于 DeepSeekMath-Base 7B 做两阶段全量微调,先学自然语言链式推理,再学工具集成推理,配合 SC-TIR 解码生成 N=48、深度 M=4 的候选并多数投票。
推荐理由:获胜方案完整公开了两阶段微调、SC-TIR 解码与内部验证集设计,可迁移到其他推理任务。
Hugging Face 用基于 transformers.agents 构建的 ReactCodeAgent 在 GAIA 基准验证集上取得 44.2%,排名第一,比第二名高 4 个百分点;测试集得分 33.3%,排名第二,并在 Level 3 难题上取得最佳平均分。
推荐理由:Hugging Face 公开了用 Code Agent 登顶 GAIA 的完整实现细节,包括工具设计、安全解释器与规划策略,可迁移到自建智能体系统。
Google 发布开源大模型 Gemma 2,提供 9B 和 27B 两个规模,各有基础版与指令微调版,上下文长度 8K tokens,采用允许商用和再分发的宽松许可。
推荐理由:文章梳理了 Gemma 2 的滑动窗口注意力、软上限与蒸馏等训练改动,并给出与 Llama 3、Qwen 1.5 的基准对比。
Stability AI 的 Stable Diffusion 3 Medium(2B 参数)已在 Hugging Face Hub 发布并接入 Diffusers。
推荐理由:原文给出 SD3 Medium 的架构变化与 Diffusers 集成细节,读者可据此判断显存占用与推理速度的取舍。