跳到正文

#端侧

今日 0 条
9月22日周二
  1. Hugging Face Blog28

    oMLX 作者 Jun Kim 加入 Hugging Face,支持 MLX 社区

    oMLX 作者兼维护者 Jun Kim 加入 Hugging Face,全职投入 MLX 社区建设。oMLX 将从副业转为有资金支持的正式项目,保持 Apache 2.0 开源协议,仍由 Jun 继续领导,目标是提升稳定性并加快开发。Hugging Face 计划让 oMLX 充当新想法的试验场,并推动 transformers 模型定义更快落地为可供不同引擎使用的 MLX 参考实现。

8月12日周三
  1. Google DeepMind72

    Google DeepMind 发布 SL2T 手语转文本模型,率先落地 Pixel 11 的 Gboard 与 Live Transcribe

    Google DeepMind 发布大规模多语言手语转文本模型 SL2T,首次将手语 AI 带入消费级产品,在 Pixel 11 的 Gboard 和 Live Transcribe 中支持美国手语(ASL)转英文听写,后续将扩展更多设备与语言。

    推荐理由:官方披露了 SL2T 的训练规模、隐私设计与基准成绩,可据此判断手语翻译进入消费级产品的可行边界。

7月29日周三
  1. Berkeley AI Research62

    从 CUDA 到 MLX:K-Search 如何把数十年内核经验带到 Apple Silicon

    Berkeley AI Research 与 IBM Research 将 K-Search 进化式内核搜索框架扩展到 MLX,新增结构化 CUDA-to-MLX 翻译层,让 CUDA 内核作为知识库被改写为 Apple Silicon 内核。

    推荐理由:展示了把 CUDA 内核优化经验迁移到 Apple Silicon 的结构化翻译层,读者可了解跨硬件内核迁移的具体做法与实测差距。

7月9日周四
  1. Google Research62

    Google 发布 SensorFM:面向可穿戴健康数据的通用基础模型

    Google Research 发布 SensorFM,一个从无标注可穿戴数据中学习的大型传感器基础模型,预训练语料超过一万亿分钟多模态信号,来自 500 万名同意参与者、100 多个国家和 20 多款 Fitbit 与 Pixel Watch 设备。

    推荐理由:Google 用一万亿分钟可穿戴数据预训练通用生理表征,并给出跨 35 项健康任务的泛化与标签效率证据。

6月27日周六
6月9日周二
  1. Google DeepMind80

    Google DeepMind 发布 Gemma 4 12B:统一无编码器多模态模型

    Google DeepMind 发布 Gemma 4 12B,一款面向笔记本的智能体多模态模型,采用无编码器统一架构,视觉和音频输入直接进入 LLM 主干。该模型在标准基准上性能接近 26B MoE 模型,内存占用不到其一半,可在 16GB VRAM 或统一内存的消费级笔记本上本地运行,并首次在中等规模模型中支持原生音频输入。

    推荐理由:Gemma 4 12B 用无编码器架构把多模态能力压到 16GB 显存,读者可据此判断本地智能体的硬件门槛。

6月5日周五
  1. Google Research66

    Google 研究用手机前摄实现被动心率监测

    Google 在 Nature 发表研究,提出 PHRM 系统,利用手机前摄在面部解锁后拍摄 8 秒视频,通过深度学习在后台估算心率和静息心率。在自由生活研究中,PHRM 心率估算整体 MAPE 为 6.09%,静息心率相对 Fitbit Charge 6 的 MAE 为 4.39 bpm,并在所有肤色组别达到 MAPE 低于 10%。

    推荐理由:Google 用手机前摄在解锁后被动测心率,并公开最大规模手机视频数据集与预训练模型,可看 rPPG 在真实场景的落地边界。

6月2日周二
  1. Hugging Face Blog71

    H Company 发布 Holo3.1 计算机使用智能体模型家族

    H Company 发布 Holo3.1 计算机使用智能体模型家族,基于 Qwen 系列,覆盖 0.8B、4B、9B 和 35B-A3B 四种尺寸,并首次提供 FP8、Q4 GGUF 和 NVFP4 量化权重用于本地推理。

    推荐理由:原文给出 Holo3.1 在移动端、跨框架与量化本地部署上的具体提升,可据此判断计算机使用智能体的落地边界。

5月28日周四
  1. Google Research36

    Google 推出零信任聚合的隐私分析方案,单次消息即可完成安全聚合

    Google 为隐私分析服务提出零信任聚合方案,将新型单次消息密码学聚合协议与 TEE 结合,设备无需多轮在线即可提交数据。该设计使原始数据在任何服务器内存中都不会被暴露或重建,仅在最终阶段处理已聚合匿名的数据,并通过 TEE 远程认证向参与者证明协议按公开代码正确执行。

4月3日周五
4月2日周四
3月25日周三
3月5日周四
  1. Hugging Face Blog36

    Hugging Face 发布嵌入式机器人 AI 指南:数据集录制、VLA 微调与端侧优化

    Hugging Face 发布 NXP 的嵌入式机器人 AI 实践指南,覆盖数据集录制、VLA 策略微调(ACT 与 SmolVLA)及端侧优化。指南以"把茶包放进杯子"任务为例,给出固定相机、夹爪相机、11 个 10×10 cm 起始位置聚类、120 个 episode 等具体做法,并展示 NXP i.MX 95 SoC 优化后的实时性能。

2月9日周一
  1. Hugging Face Blog67

    Transformers.js v4 发布:WebGPU 运行时用 C++ 重写,BERT 嵌入提速约 4 倍

    Transformers.js v4 已在 NPM 发布,可通过 npm i @huggingface/transformers 安装。最大变化是采用完全用 C++ 重写的 WebGPU 运行时,与 ONNX Runtime 团队在约 200 个模型架构上测试,同一份代码可运行在浏览器、Node、Bun 和 Deno 等环境。

    推荐理由:Transformers.js v4 换用 C++ 重写的 WebGPU 运行时,并给出 BERT 嵌入约 4 倍加速等具体数据,可据此判断浏览器端推理的性能变化。

1月23日周五
  1. Google Research32

    Google 研究:用小模型分解式方法实现更优用户意图提取

    Google Research 在 EMNLP 2025 发表的论文提出分解式意图提取方法:先用小型多模态 LLM 逐屏总结用户交互,再从摘要序列中提取意图,在移动端和网页轨迹上均优于 CoT 与端到端微调。该方法用 Gemini 1.5 Flash 8B 即可达到 Gemini 1.5 Pro 相当的效果,成本与速度更优,适用于端侧部署。

1月16日周五
  1. Google Research36

    Google 研究:用 Pixel Watch 智能手表估算步速、步长等步态指标

    Google 提出基于时序卷积网络(TCN)的多头深度学习模型,仅用单只 Pixel Watch 的 50 Hz IMU 信号和用户身高,即可直接估算步速、步长、摆动时间、支撑时间和双脚支撑时间等步态指标。在 246 名参与者、约 7 万个步行片段的大规模验证中,多数指标达到 Pearson r >0.80、ICC >0.80,与 Pixel 6 手机估算结果无显著差异(p >0.05)。

12月3日周三
11月20日周四
11月19日周三
10月30日周四
10月28日周二
10月15日周三
10月11日周六
10月2日周四
  1. Hugging Face Blog36

    用 Core ML 和 dots.ocr 实现 SOTA OCR

    Hugging Face 发布教程,介绍如何将小红书 3B 参数 OCR 模型 dots.ocr 转换到端侧运行,该模型在 OmniDocBench 上超过 Gemini 2.5 Pro。方案用 Core ML 跑 1.2B 的 NaViT 视觉编码器、用 MLX 跑 Qwen2.5-1.5B 语言主干,并称 Neural Engine 能效比 CPU 高 12 倍、比 GPU 高 4 倍。

9月29日周一
9月26日周五
9月4日周四
  1. Hugging Face Blog60

    Google 发布 EmbeddingGemma 多语言嵌入模型

    Google 发布 EmbeddingGemma,一款面向端侧场景的多语言文本嵌入模型,参数量 308M,上下文窗口 2K,支持超过 100 种语言。该模型基于 Gemma3 骨干改为双向注意力,输出 768 维向量并支持 MRL 截断到 512、256 或 128 维,量化后内存占用低于 200MB。

    推荐理由:原文给出 308M 参数、2K 上下文和量化后 200MB 内存等规格,读者可据此判断端侧 RAG 的落地边界。

8月21日周四
8月13日周三
6月26日周四
6月3日周二
5月23日周五
5月21日周三
5月15日周四
  1. Hugging Face Blog62

    Falcon-Edge 发布 1B 与 3B 三值语言模型系列

    Falcon-Edge 系列发布,基于 BitNet 架构的三值(1.58bit)语言模型,提供 1B 和 3B 两种规模,各有 base 与指令微调版本。该系列采用新的预训练范式,单次训练同时产出 bfloat16 非量化版本、原生 BitNet 模型和便于微调的预量化 BitNet 变体,预训练数据约 1.5 Tera Tokens。

    推荐理由:Falcon-Edge 用一次预训练同时产出 bfloat16 与三元量化版本,并给出可直接微调的工具链,读者可据此判断 1.58bit 模型的落地路径。

3月20日周四
3月11日周二
  1. Hugging Face Blog67

    LeRobot 与 Yaak 发布全球最大开源自动驾驶数据集 L2D

    Hugging Face 的 LeRobot 团队与 Yaak 联合发布 L2D,号称全球最大的开源自动驾驶数据集,包含 90+ TB 多模态数据、5000+ 小时驾驶记录,来自德国 30 个城市的 60 辆驾校电动车。

    推荐理由:L2D 以 90TB 多模态驾驶数据补齐端到端自动驾驶训练集缺口,并给出 LeRobot 接入方式与分阶段发布计划。

3月7日周五
2月20日周四
1月30日周四