跳到正文

#部署/工程

今日 7 条
3月18日周二
3月7日周五
  1. Mistral AI78

    Mistral AI 发布文档理解 API Mistral OCR

    Mistral AI 发布光学字符识别 API Mistral OCR,可接收图片和 PDF,按顺序交错提取文本与图像,并已作为 Le Chat 文档理解的默认模型。

    推荐理由:官方给出 Mistral OCR 的定价、基准对比与自托管选项,可据此判断它在文档解析与 RAG 流程中的位置。

3月6日周四
2月28日周五
2月25日周二
2月24日周一
2月18日周二
  1. Hugging Face Blog35

    Hugging Face Hub 新增 Hyperbolic、Nebius AI Studio 和 Novita 三家无服务器推理提供商

    Hugging Face Hub 新增 Hyperbolic、Nebius AI Studio 和 Novita 三家无服务器推理提供商,支持 DeepSeek-R1、Flux.1 等模型,并已集成 JS 和 Python 客户端 SDK。用户可在账户设置中配置自有 API key 直连提供商,或通过 HF 路由调用并按标准 API 费率计费,PRO 用户每月获 $2 推理额度。

2月17日周一
  1. Mistral AI60

    Mistral 发布区域语言模型 Mistral Saba

    Mistral AI 发布首款区域语言模型 Mistral Saba,24B 参数,基于中东和南亚数据集训练,支持阿拉伯语及多种印度语系语言,在泰米尔语等南印度语言上表现突出。官方称其回答比体量大 5 倍以上的模型更准确,速度更快、成本更低,可通过 API 调用,也能在客户本地单 GPU 系统部署,速度超过 150 tokens/s。

    推荐理由:Mistral 首款区域语言模型,24B 参数却对标 5 倍体量模型,并支持单卡本地部署,可据此判断区域化模型的落地路径。

2月14日周五
2月13日周四
2月12日周三
  1. Hugging Face Blog60

    Hugging Face 用块与分片聚合加速 Hub 上传下载

    Hugging Face 的 Xet 团队将内容定义分块(CDC)投入生产,通过把去重后的数据聚合为最大 64MB 的块、并用分片记录文件与块的映射,把 CAS 条目减少约 1000 倍,上传下载速度在部分场景提升 2-3 倍。

    推荐理由:Hugging Face 官方解释 Xet 存储如何用块与分片聚合替代逐块传输,并给出量化模型仓库的实测节省数据。

2月6日周四
1月30日周四
1月28日周二
  1. Hugging Face Blog60

    Hugging Face 在 Hub 上线 Inference Providers,接入 fal、Replicate、SambaNova、Together AI

    Hugging Face 在 Hub 的模型页上线 Inference Providers,首批接入 fal、Replicate、SambaNova、Together AI 四家无服务器推理服务商,并集成到 JS 和 Python 客户端 SDK。

    推荐理由:Hugging Face 把四家无服务器推理服务商接入模型页与 SDK,读者可据此了解调用方式与计费差异。

1月27日周一
1月23日周四
1月22日周三
1月21日周二
1月16日周四
1月13日周一
  1. Mistral AI62

    Mistral AI 发布 Codestral 25.01 编码模型

    Mistral AI 发布 Codestral 25.01,采用更高效的架构和改进的 tokenizer,代码生成与补全速度约为原版 Codestral 的 2 倍,上下文长度提升至 256k。

    推荐理由:官方给出 Codestral 25.01 的架构与 tokenizer 变化、256k 上下文和多项基准对比,可据此判断它在 FIM 与低延迟补全场景的位置。

12月24日周二
  1. Hugging Face Blog62

    如何在 PyTorch 中可视化并理解 GPU 显存占用

    Hugging Face 博客发布教程,介绍用 torch.cuda.memory._record_memory_history 记录并可视化 PyTorch 训练时的 GPU 显存占用。文章以 Qwen2.5-1.5B 为例拆解模型参数、优化器状态、激活值、梯度和优化器中间值各占多少显存,并给出总显存估算公式和激活值随参数量线性变化的启发式。作者还提供了一个显存估算小工具。

    推荐理由:原文用可视化快照拆解训练各阶段显存占用,并给出可复用的显存估算公式与启发式。

12月23日周一
12月18日周三
  1. Hugging Face Blog60

    IBM 等联合发布混合 Mamba2 模型 Bamba-9B

    IBM、Princeton、CMU 和 UIUC 联合发布 Bamba-9B,一个在完全开放数据上训练的混合 Mamba2 模型,训练数据量 2.2T tokens。

    推荐理由:Bamba-9B 用完全开放数据训练并给出 vLLM 实测吞吐与延迟数据,可对照同尺寸 Transformer 模型判断混合 Mamba2 架构的取舍。

12月17日周二
12月9日周一
12月5日周四
  1. Hugging Face Blog22

    LLM 修复自身错误的能力如何?基于 Keras 和 TPU 的聊天机器人竞技场实验

    Hugging Face 用 Keras、JAX 和 TPU 搭建了一个聊天机器人竞技场,测试 LLM 能否根据用户的自然语言反馈修正自己生成的代码。实验在 TPU v5e 2x4 上同时加载了 5 个约 8B 参数模型和 3 个约 2B 参数模型,共 7 个 LLM,以 bfloat16 格式运行,通过 Gradio 界面并行对话并随时切换模型。

12月3日周二
11月26日周二
  1. Hugging Face Blog34

    Hugging Face 重构 Hub 上传与下载架构

    Hugging Face 的 Xet 团队正在重新设计 Hub 的上传与下载架构,计划引入内容寻址存储(CAS)并构建自定义传输协议。新方案按字节级分析文件,上传时仅传输必要的新 chunk,并探索压缩 Safetensors 张量文件,有望将上传速度提升 10-25%。读取路径仍由 S3 存储、CloudFront 作为 CDN,CAS 节点将部署在 AWS 少数区域以平衡成本与延迟。

11月20日周三
11月7日周四
  1. Mistral AI40

    Mistral AI 推出 Batch API,成本比同步调用低 50%

    Mistral AI 在 La Plateforme 上线 Batch API,处理高并发请求的成本比同步 API 调用低 50%。该 API 面向批量数据处理场景,用户上传批处理文件后下载输出结果,适用于客户反馈与情感分析、文档批量摘要与翻译、向量嵌入建索引和数据标注。目前覆盖 La Plateforme 上全部模型,每个工作区限制 100 万个进行中请求,后续将登陆其云厂商合作伙伴。

  2. Mistral AI57

    Mistral AI 发布内容审核 API

    Mistral AI 发布新的内容审核 API,即 Le Chat 中审核服务所用的同一套接口,现开放给用户按自身应用和安全标准定制。该模型是基于 LLM 的分类器,将文本输入分为 9 个类别,提供原始文本和对话内容两个端点,并针对对话场景分类最后一条消息。模型原生支持多语言,训练语料涵盖阿拉伯语、中文、英语、法语、德语、意大利语、日语、韩语、葡萄牙语、俄语和西班牙语。

11月5日周二
10月29日周二
  1. Hugging Face Blog62

    Intel Labs 与 Hugging Face 提出 Universal Assisted Generation:任意辅助模型加速解码

    Intel Labs 与 Hugging Face 提出 Universal Assisted Generation(UAG),让辅助生成不再要求目标模型与辅助模型共享同一 tokenizer,可跨模型家族配对,对任意 decoder 或 MoE 模型实现 1.5x-2.0x 推理加速。

    推荐理由:Intel Labs 与 Hugging Face 提出跨 tokenizer 的辅助生成方法,读者可了解其 2-way tokenizer 翻译思路与实测加速幅度。

10月23日周三
10月22日周二