跳到正文

#部署/工程

今日 5 条
2月20日周五
2月19日周四
2月18日周三
  1. Hugging Face Blog62

    Gradio 的 gr.HTML 如何一次性生成任意 Web 应用

    Gradio 6 的 gr.HTML 现已支持自定义模板、作用域 CSS 和 JavaScript 交互,可让 Claude 等前沿 LLM 一次性生成前端、后端和状态管理,全部写在一个 Python 文件里,无需构建步骤即可部署到 Hugging Face Spaces。

    推荐理由:原文给出 gr.HTML 的三模板 API 与单文件示例,读者可据此判断如何让 LLM 一次生成可部署的交互组件。

2月13日周五
  1. Hugging Face Blog66

    Hugging Face 发布 CUDA kernel Agent Skill,Claude 与 Codex 可自动生成并基准测试

    Hugging Face 构建了一个 Agent Skill,教编码智能体编写生产级 CUDA kernel,并让 Claude 和 Codex 分别针对 diffusers 的 LTX-Video 和 transformers 的 Qwen3-8B 生成可用 kernel,包含正确的 PyTorch 绑定与基准测试。

    推荐理由:Hugging Face 把 CUDA kernel 开发知识封装成 Agent Skill,并给出两个真实模型的端到端基准数据,可据此判断这类技能包的实际收益。

2月9日周一
  1. Hugging Face Blog67

    Transformers.js v4 发布:WebGPU 运行时用 C++ 重写,BERT 嵌入提速约 4 倍

    Transformers.js v4 已在 NPM 发布,可通过 npm i @huggingface/transformers 安装。最大变化是采用完全用 C++ 重写的 WebGPU 运行时,与 ONNX Runtime 团队在约 200 个模型架构上测试,同一份代码可运行在浏览器、Node、Bun 和 Deno 等环境。

    推荐理由:Transformers.js v4 换用 C++ 重写的 WebGPU 运行时,并给出 BERT 嵌入约 4 倍加速等具体数据,可据此判断浏览器端推理的性能变化。

2月4日周三
  1. Google Research32

    Google Research 提出 Sequential Attention:让 AI 模型更小更快且不牺牲准确率

    Google Research 提出 Sequential Attention,用贪心选择机制在单次模型训练内顺序、自适应地挑选最佳组件(层、块或特征),无需反复重训即可完成特征选择。该方法在多个神经网络基准上取得 SOTA,并实现快速单遍贪心选择,兼顾效率、准确率、可解释性与大规模可扩展性。

1月27日周二
  1. Hugging Face Blog28

    中国开源 AI 生态的架构选择:超越 DeepSeek 之后

    中国开源模型已几乎一致转向 MoE 架构,Kimi K2、MiniMax M2、Qwen3 均采用该路线,以在成本约束下兼顾能力与灵活部署。0.5B–30B 小模型成为本地运行与微调主力,Apache 2.0 接近默认许可证。DeepSeek-V3.2-Exp 获华为昇腾与寒武纪 day-zero 支持,蚂蚁 Ling 用国产芯片训练 1 万亿 token 成本降约 20%。

1月22日周四
1月21日周三
1月20日周二
1月15日周四
1月14日周三
1月9日周五
1月8日周四
1月6日周二
12月17日周三
12月11日周四
  1. Hugging Face Blog62

    llama.cpp 新增模型管理功能:router 模式支持动态加载与切换模型

    llama.cpp server 新增 router 模式,可在不重启服务的情况下动态加载、卸载和切换多个模型。该模式采用多进程架构,每个模型独立运行,单个模型崩溃不影响其他模型;支持从 llama.cpp 缓存或 --models-dir 目录自动发现 GGUF 文件,按需加载,并在达到 --models-max(默认 4)时按 LRU 策略卸载最久未用的模型。

    推荐理由:llama.cpp server 新增 router 模式,读者可据此了解本地多模型动态切换与显存管理方式。

12月5日周五
12月1日周一
11月25日周二
  1. Hugging Face Blog22

    从第一性原理理解 continuous batching

    Hugging Face 发布博客,从 attention 机制与 KV caching 出发,通过优化吞吐量推导出 continuous batching。该技术通过并行处理多个对话、完成即换出,最大化高负载场景下的推理性能。文中指出 attention 是 token 间唯一交互之处,其计算量随序列长度呈平方增长。

  2. Hugging Face Blog40

    Tavily 如何打造达到 SOTA 的深度研究智能体

    Tavily 分享了其构建 SOTA 深度研究智能体的经验,曾因第一版架构假设过时被迫推倒重建。其核心思路是简化编排逻辑、拥抱模型自主性,并借助 Tavily Advanced Search 在工具侧完成上下文工程,只返回最相关内容块以降低幻觉与延迟。团队还提出将工具输出蒸馏为反思、仅在生成最终结果时引入原始信息,以模拟人类研究方式。

11月22日周六
  1. Google Research22

    Google 如何用简单线性回归模型预测 EV 充电桩可用性

    Google 推出一款轻量级 EV 充电桩可用性预测模型,用简单线性回归预测某站点在未来若干分钟内是否有空闲充电口。模型以一天中各小时为特征,在 30 至 60 分钟时间跨度、100 个随机站点上评测,性能超过"保持当前状态"这一强基线,主要优势在于识别高占用率变化的关键时刻。

11月20日周四
11月19日周三
  1. Mistral AI38

    Mistral AI 与 SAP、Helsing 达成合作,将在德国开设办公室

    Mistral AI 宣布与 SAP 建立多年合作伙伴关系,为其 AI Foundation 提供完全自主的 AI 技术栈,并联合开发面向欧洲复杂行业与政府机构的行业解决方案。Mistral AI 同时与 Helsing 合作加速面向国防与安全应用的视觉-语言-动作模型研发。该公司还计划在未来数月内于德国开设办公室,并大幅扩充本地团队。

11月17日周一
11月13日周四
11月5日周三
  1. Google Research62

    Google 发布 Project Suncatcher 预印本,探索太空 AI 基础设施设计

    Google 公布研究项目 Project Suncatcher,设想由太阳能卫星星座搭载 TPU 并通过自由空间光链路互联,以在太空扩展 AI 算力。配套预印本论文《Towards a future space-based, highly scalable AI infrastructure system design》讨论了卫星间高带宽通信、轨道动力学和辐射对计算的影响。

    推荐理由:Google 公开了太空 AI 基础设施的预印本,给出卫星互联、轨道与 TPU 抗辐射的早期实测数据。

10月30日周四
  1. Hugging Face Blog38

    MiniMax M2 如何重新思考智能体泛化:对齐基准还是对齐用户?

    MiniMax M2 在智能体后训练中提出"交错思考"(Interleaved Thinking),让模型在任务任意阶段都能思考,以应对工具输出带来的外部扰动。团队发现单纯扩展工具数量无法带来真正泛化,转而构建覆盖工具信息、系统提示词、用户提示词、环境与工具响应全轨迹的数据管线。内部测试中,M2 在陌生"冷启动"框架下工具调用与指令遵循表现均超出预期。

10月29日周三
  1. Hugging Face Blog65

    Hugging Face 博客:全球算力格局正在如何变化

    Hugging Face 发布博客《On the Shifting Global Compute Landscape》,梳理中国开源权重模型与国产芯片互相牵引的现状:过去几个月,华为昇腾、寒武纪等芯片已开始承载部分高性能开源模型的推理,部分模型开始用国产芯片训练。

    推荐理由:梳理中国开源模型与国产芯片互相牵引的路径,帮助读者理解算力受限如何影响模型架构与部署选择。

10月24日周五
  1. Mistral AI62

    Mistral AI 发布 AI Studio 生产平台

    Mistral AI 发布 Mistral AI Studio,一个面向企业团队的生产级 AI 平台,由 Observability、Agent Runtime 和 AI Registry 三大支柱组成。

    推荐理由:Mistral 把自家大规模系统的可观测、执行与治理能力打包成企业平台,读者可据此判断生产级 AI 基础设施的构成。

10月16日周四
10月15日周三
10月11日周六