Mistral AI 发布 Codestral 25.01 编码模型
Mistral AI 发布 Codestral 25.01,采用更高效的架构和改进的 tokenizer,代码生成与补全速度约为原版 Codestral 的 2 倍,上下文长度提升至 256k。
推荐理由:官方给出 Codestral 25.01 的架构与 tokenizer 变化、256k 上下文和多项基准对比,可据此判断它在 FIM 与低延迟补全场景的位置。
Mistral AI 发布 Codestral 25.01,采用更高效的架构和改进的 tokenizer,代码生成与补全速度约为原版 Codestral 的 2 倍,上下文长度提升至 256k。
推荐理由:官方给出 Codestral 25.01 的架构与 tokenizer 变化、256k 上下文和多项基准对比,可据此判断它在 FIM 与低延迟补全场景的位置。
Hugging Face 发布 Transformers.js v3,新增 WebGPU 支持,官方称比 WASM 快至多 100 倍,并引入 fp32、fp16、q8、q4 等 dtype 量化选项。
推荐理由:官方给出 WebGPU 加速、量化格式与 1200 多个预转换模型,可据此判断浏览器端推理的可用边界。
Mistral AI 在 Mistral 7B 发布一周年之际推出 Ministral 3B 和 Ministral 8B 两款面向端侧与本地推理的模型,称其在 10B 以下级别刷新了知识、常识、推理、函数调用和效率的表现。
推荐理由:Mistral 在 7B 发布一周年推出两款端侧小模型,给出定价、上下文长度与基准对比,可据此判断本地推理的选型空间。
Google 在 Gemma 2 发布一个月后扩充 Gemma 模型系列,新增 2.6B 参数的 Gemma 2 2B(含 base 与指令微调版)、安全分类器 ShieldGemma 以及稀疏自编码器套件 Gemma Scope。
推荐理由:Gemma 2 新增 2B 小模型、安全分类器和可解释性工具,读者可据此判断端侧部署与安全过滤的可用选项。
Hugging Face 发布教程,介绍如何借助 WWDC 24 的新 Core ML 特性在 Mac 上运行 Mistral 7B,并用不到 4GB 内存完成推理。
推荐理由:Hugging Face 团队给出把 Mistral 7B 转成 Core ML 并跑在 Mac 上的完整步骤,可据此复现端侧 LLM 部署流程。
Hugging Face 发布 SmolLM 系列小语言模型,包含 135M、360M 和 1.7B 三个参数规模,并同步开源训练语料 SmolLM-Corpus。
推荐理由:原文公开了三个尺寸小模型的训练数据配比与评测对比,可据此判断端侧小模型的选型与数据策略。
Hugging Face 与 Intel 合作,通过 Optimum Intel 中的 OpenVINO 集成对微软 Phi-2 模型权重做 4-bit 量化,并在搭载 Core Ultra 7 155H 的中端笔记本上完成本地推理。
Hugging Face 发布 swift-transformers,一个用 Swift 实现类 transformers API 的包,专注文本生成,并同时放出 swift-chat 演示应用、更新版 exporters 与 transformers-to-coreml 转换工具,以及 Llama 2 7B、Falcon 7B 等已转换好的 Core ML 模型。
推荐理由:官方给出在 Apple 设备上跑 Llama 2 等模型的完整工具链与转换路径,可据此评估端侧部署的可行步骤。
Hugging Face 与 Apple 将 Stable Diffusion XL 移植到 Core ML,可在运行 macOS 14 公测版的 Apple Silicon Mac 上本地运行。
推荐理由:原文给出混合位宽调色板量化的完整方法与实测数据,读者可据此判断本地跑 SDXL 的体积与质量取舍。
Hugging Face 博客介绍如何用 Transformers.js 制作完全在浏览器本地运行的实时 ML 网页游戏 Doodle Dash。作者基于 Google Quick, Draw!
推荐理由:完整演示了从微调 MobileViT 到用 Transformers.js 在浏览器内实时推理的端到端流程,可迁移到其他端侧 ML 项目。
Hugging Face 博客介绍如何借助 Core ML 的新压缩与优化能力,在 iPhone、iPad 和 Mac 上更快运行 Stable Diffusion。
推荐理由:文章给出 6-bit palettization 的量化原理与转换命令,读者可据此把 Stable Diffusion 部署到 iPhone 和 Mac 本地运行。
Hugging Face 在 Mac App Store 上线 Diffusers for Mac 1.1,基于 Core ML 转换的 Stable Diffusion 等文生图模型,官方称出图速度最高可达此前两倍。
借助 Apple 工程师提供的转换脚本和推理代码,Stable Diffusion 现在可以通过 Core ML 在 Apple Silicon 上运行,Hugging Face 已将 v1.4、v1.5、v2 base 和 v2.1 base 的官方权重转换并上传到 Hub。
推荐理由:Hugging Face 与 Apple 合作把 Stable Diffusion 转成 Core ML 权重,读者可据此在 Apple Silicon 上本地跑图并了解不同变体的取舍。