跳到正文

#部署/工程

今日 8 条
1月27日周二
  1. Hugging Face Blog28

    中国开源 AI 生态的架构选择:超越 DeepSeek 之后

    中国开源模型已几乎一致转向 MoE 架构,Kimi K2、MiniMax M2、Qwen3 均采用该路线,以在成本约束下兼顾能力与灵活部署。0.5B–30B 小模型成为本地运行与微调主力,Apache 2.0 接近默认许可证。DeepSeek-V3.2-Exp 获华为昇腾与寒武纪 day-zero 支持,蚂蚁 Ling 用国产芯片训练 1 万亿 token 成本降约 20%。

1月22日周四
1月21日周三
1月20日周二
1月15日周四
1月14日周三
1月9日周五
1月8日周四
1月6日周二
12月17日周三
12月11日周四
  1. Hugging Face Blog62

    llama.cpp 新增模型管理功能:router 模式支持动态加载与切换模型

    llama.cpp server 新增 router 模式,可在不重启服务的情况下动态加载、卸载和切换多个模型。该模式采用多进程架构,每个模型独立运行,单个模型崩溃不影响其他模型;支持从 llama.cpp 缓存或 --models-dir 目录自动发现 GGUF 文件,按需加载,并在达到 --models-max(默认 4)时按 LRU 策略卸载最久未用的模型。

    推荐理由:llama.cpp server 新增 router 模式,读者可据此了解本地多模型动态切换与显存管理方式。

12月5日周五
12月1日周一
11月25日周二
  1. Hugging Face Blog22

    从第一性原理理解 continuous batching

    Hugging Face 发布博客,从 attention 机制与 KV caching 出发,通过优化吞吐量推导出 continuous batching。该技术通过并行处理多个对话、完成即换出,最大化高负载场景下的推理性能。文中指出 attention 是 token 间唯一交互之处,其计算量随序列长度呈平方增长。

  2. Hugging Face Blog40

    Tavily 如何打造达到 SOTA 的深度研究智能体

    Tavily 分享了其构建 SOTA 深度研究智能体的经验,曾因第一版架构假设过时被迫推倒重建。其核心思路是简化编排逻辑、拥抱模型自主性,并借助 Tavily Advanced Search 在工具侧完成上下文工程,只返回最相关内容块以降低幻觉与延迟。团队还提出将工具输出蒸馏为反思、仅在生成最终结果时引入原始信息,以模拟人类研究方式。

11月22日周六
  1. Google Research22

    Google 如何用简单线性回归模型预测 EV 充电桩可用性

    Google 推出一款轻量级 EV 充电桩可用性预测模型,用简单线性回归预测某站点在未来若干分钟内是否有空闲充电口。模型以一天中各小时为特征,在 30 至 60 分钟时间跨度、100 个随机站点上评测,性能超过"保持当前状态"这一强基线,主要优势在于识别高占用率变化的关键时刻。

11月20日周四
11月19日周三
  1. Mistral AI38

    Mistral AI 与 SAP、Helsing 达成合作,将在德国开设办公室

    Mistral AI 宣布与 SAP 建立多年合作伙伴关系,为其 AI Foundation 提供完全自主的 AI 技术栈,并联合开发面向欧洲复杂行业与政府机构的行业解决方案。Mistral AI 同时与 Helsing 合作加速面向国防与安全应用的视觉-语言-动作模型研发。该公司还计划在未来数月内于德国开设办公室,并大幅扩充本地团队。

11月17日周一
11月13日周四
11月5日周三
  1. Google Research62

    Google 发布 Project Suncatcher 预印本,探索太空 AI 基础设施设计

    Google 公布研究项目 Project Suncatcher,设想由太阳能卫星星座搭载 TPU 并通过自由空间光链路互联,以在太空扩展 AI 算力。配套预印本论文《Towards a future space-based, highly scalable AI infrastructure system design》讨论了卫星间高带宽通信、轨道动力学和辐射对计算的影响。

    推荐理由:Google 公开了太空 AI 基础设施的预印本,给出卫星互联、轨道与 TPU 抗辐射的早期实测数据。

10月30日周四
  1. Hugging Face Blog38

    MiniMax M2 如何重新思考智能体泛化:对齐基准还是对齐用户?

    MiniMax M2 在智能体后训练中提出"交错思考"(Interleaved Thinking),让模型在任务任意阶段都能思考,以应对工具输出带来的外部扰动。团队发现单纯扩展工具数量无法带来真正泛化,转而构建覆盖工具信息、系统提示词、用户提示词、环境与工具响应全轨迹的数据管线。内部测试中,M2 在陌生"冷启动"框架下工具调用与指令遵循表现均超出预期。

10月29日周三
  1. Hugging Face Blog65

    Hugging Face 博客:全球算力格局正在如何变化

    Hugging Face 发布博客《On the Shifting Global Compute Landscape》,梳理中国开源权重模型与国产芯片互相牵引的现状:过去几个月,华为昇腾、寒武纪等芯片已开始承载部分高性能开源模型的推理,部分模型开始用国产芯片训练。

    推荐理由:梳理中国开源模型与国产芯片互相牵引的路径,帮助读者理解算力受限如何影响模型架构与部署选择。

10月24日周五
  1. Mistral AI62

    Mistral AI 发布 AI Studio 生产平台

    Mistral AI 发布 Mistral AI Studio,一个面向企业团队的生产级 AI 平台,由 Observability、Agent Runtime 和 AI Registry 三大支柱组成。

    推荐理由:Mistral 把自家大规模系统的可观测、执行与治理能力打包成企业平台,读者可据此判断生产级 AI 基础设施的构成。

10月16日周四
10月15日周三
10月11日周六
10月6日周一
10月2日周四
  1. Hugging Face Blog36

    用 Core ML 和 dots.ocr 实现 SOTA OCR

    Hugging Face 发布教程,介绍如何将小红书 3B 参数 OCR 模型 dots.ocr 转换到端侧运行,该模型在 OmniDocBench 上超过 Gemini 2.5 Pro。方案用 Core ML 跑 1.2B 的 NaViT 视觉编码器、用 MLX 跑 Qwen2.5-1.5B 语言主干,并称 Neural Engine 能效比 CPU 高 12 倍、比 GPU 高 4 倍。

10月1日周三
9月29日周一
9月25日周四