微软研究院:把物理 AI 推理卸载出机器人可提升任务成功率与续航
微软研究院对移动操作机器人工作负载做了系统性测量,发现把物理 AI 推理从机载 GPU 卸载到边缘或云端 GPU 可提升任务表现。
推荐理由:微软研究院系统测量了机器人端侧推理与卸载到边缘或云端 GPU 的差异,并给出可复用的 Kubernetes 卸载工具链。
微软研究院对移动操作机器人工作负载做了系统性测量,发现把物理 AI 推理从机载 GPU 卸载到边缘或云端 GPU 可提升任务表现。
推荐理由:微软研究院系统测量了机器人端侧推理与卸载到边缘或云端 GPU 的差异,并给出可复用的 Kubernetes 卸载工具链。
NVIDIA 在加拿大多伦多 ROSCon 大会上发布 Isaac ROS 5.0,这是一套基于 ROS 的 GPU 加速软件包集合,新增智能体工作流与平台支持,免费开源。
推荐理由:Isaac ROS 5.0 把智能体工作流引入机器人开发,并给出多家厂商的落地案例,可据此判断开源机器人栈的演进方向。
NVIDIA 发文阐述物理 AI 规模化部署的安全要求,指出安全必须覆盖硬件、软件、AI、运行环境与部署全生命周期,而非部署前的一次性检查。ABI Research 预计到 2035 年 L3-L5 自动驾驶汽车保有量达 4900 万辆,Omdia 估计 2026 至 2035 年间约 6000 万台工业机器人将部署。
AWS 开源 SDK Strands Robots(Apache 2.0)演示了机器人数据闭环:用 Robot("so100") 录制 LeRobotDataset 并同步到 Hugging Face Storage Buckets,再通过 stream_dataset 直接从 Hub 流式读取训练,无需完整下载,最后仅改一个关键字参数即可将 checkpoint 部署回硬件。
Google DeepMind 发布 Gemini Robotics ER 2,定位为机器人的高层大脑,可理解物理世界、规划多步任务,并把动作执行交给底层 VLA 模型,还能原生调用 Google Search 等工具。
推荐理由:官方给出 ER 2 在进度分类、时刻定位与多机器人协作上的具体指标,可据此判断机器人大脑的落地边界。
Google DeepMind 发布 Gemini Robotics 2,作为新一代机器人的智能层,解锁全身控制、灵巧操作和多机器人协作。
推荐理由:官方给出三款模型的职责分工与开放入口,读者可据此判断机器人全身控制与多机协作的落地路径。
NVIDIA 推出 Cosmos-H-Dreams,一个面向手术机器人的实时、动作条件生成式仿真器,通过 FlashDreams 推理库在单张 RTX PRO 6000 GPU 上运行,支持人与策略闭环交互控制。
Hugging Face 发布 Grabette,一套开源低成本的手持夹爪数据采集系统,无需机器人即可录制操作演示并自动转为 LeRobot 格式数据集。Grabette 配备广角鱼眼相机和 RGBD 相机,BOM 成本约 490€,配套的机器人端夹爪 Gripette 成本约 120€。
推荐理由:原文给出了一套无需机器人即可采集操作数据的开源硬件与处理流程,读者可据此判断数据采集门槛的变化。
Mistral AI 发布首个具身导航模型 Robostral Navigate,这是一个 8B 模型,仅用单个普通 RGB 相机、无需 LiDAR 或深度传感器,在 R2R-CE validation unseen 上达到 76.6% 成功率,比最佳单相机方案高 9.7 个百分点,比使用深度或多相机的最佳系统高 4.5 个百分点。
推荐理由:原文给出单目 RGB 相机在 R2R-CE 上的成绩与训练方法,读者可据此判断具身导航的能力边界。
LeRobot v0.6.0 发布,围绕机器人学习闭环引入世界模型策略(VLA-JEPA、FastWAM、LingBot-VA)、新一批 VLA(GR00T N1.7、MolmoAct2、EO-1、EVO1、Multitask DiT)以及统一奖励模型 API(Robometer、TOPReward)。
推荐理由:LeRobot v0.6.0 把世界模型策略、奖励模型与部署 CLI 串成闭环,读者可据此判断开源机器人学习栈的当前能力边界。
AWS 开源 SDK Strands Robots(Apache 2.0)把 LeRobot 栈封装成 AgentTools,用一个 Strands 智能体串起从 Hub 数据集到实体机器人的流程。
推荐理由:AWS 官方给出从 Hub 数据集到实体机器人的完整五步流程,可据此判断仿真与真机数据同格式的实际用法。
Google DeepMind 推出为期 3 个月的机器人加速器项目,从欧洲选出 15 家早期机器人初创公司,本周在伦敦启动,入选团队可使用其 AI 技术栈和 Gemini 机器人模型。项目提供技术指导、产品建议与合作伙伴网络,覆盖物流、制造、医疗、气候和导航等领域,例如挪威 3D-Components 的焊接与金属 3D 打印平台号称比现有做法快 280 倍。
Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其推理优先机器人模型的升级版,强化了空间推理与多视角理解,并新增仪表读数能力,可读取压力表、液位计和数字读数。
推荐理由:官方给出与上一代及 Gemini 3.0 Flash 的对比,并说明仪表读数等新能力如何落地机器人巡检。
Hugging Face 发布 LeRobot v0.5.0,这是该项目迄今最大的一次更新,自 v0.4.0 以来合并超过 200 个 PR、新增 50 多位贡献者。
推荐理由:LeRobot v0.5.0 一次性补齐人形机器人、VLA 策略与仿真环境加载,可据此判断开源机器人栈的当前边界。
Hugging Face 发布 NXP 的嵌入式机器人 AI 实践指南,覆盖数据集录制、VLA 策略微调(ACT 与 SmolVLA)及端侧优化。指南以"把茶包放进杯子"任务为例,给出固定相机、夹爪相机、11 个 10×10 cm 起始位置聚类、120 个 episode 等具体做法,并展示 NXP i.MX 95 SoC 优化后的实时性能。
OpenAI 投资 Merge Labs,支持其开发连接生物智能与人工智能的新型脑机接口,目标是最大化人类能力、自主性与体验。
AMD 联合 Hugging Face 和 Data Monsters 举办 AMD Open Robotics Hackathon,首站 12 月 5-7 日在东京,第二站 12 月 12-14 日在巴黎。
NVIDIA Isaac for Healthcare v0.4 发布,提供基于 SO-ARM 的端到端入门工作流和"自带手术室"教程,让开发者从仿真、训练到部署自主医疗机器人。
NVIDIA 发布 Isaac for Healthcare v0.4,提供基于 SO-ARM 的端到端入门工作流,覆盖数据采集、训练与真机部署,用于构建自主手术辅助机器人。
推荐理由:原文给出从仿真数据采集到真机部署的完整命令与硬件要求,可据此复现医疗机器人工作流。
LeRobot 发布 v0.4.0,带来 LeRobotDataset v3.0 分块 episode 格式与流式加载,可支持 OXE 级别(>400GB)数据集,并提供 lerobot-edit-dataset CLI 用于删除、拆分、合并数据集。
推荐理由:LeRobot v0.4.0 把数据集、VLA 模型与硬件插件整合进同一开源栈,可据此判断机器人学习工具链的成熟度。
Hugging Face 发布 LeRobotDataset v3.0,将多个 episode 打包进单个文件,用关系型元数据在 episode 级别检索信息,解决 v2 单文件单 episode 在百万级数据集上的文件系统瓶颈。
Hugging Face 发布博客详解异步机器人推理,将动作预测与动作执行解耦,让机器人在 PolicyServer 计算下一段动作时继续执行当前动作队列,从而消除推理等待。该方案在 SmolVLA 上实现约 2 倍任务完成提速,成功率相当,PolicyServer 与 RobotClient 通过 gRPC 通信,性能约为同类 REST API 的 5 倍。
Hugging Face 与 Pollen Robotics 发布开源机器人 Reachy Mini,Lite 版 399 美元、带板载计算与无线的 Compute 版 499 美元,均需另付税费和运费,预计约 90 天发货。
推荐理由:开源机器人 Reachy Mini 以 399 美元起售并接入 Hugging Face 模型库,读者可据此判断桌面级机器人实验的门槛与生态玩法。
NVIDIA 发布 Isaac GR00T N1.5,这是 Isaac GR00T N1 的首次重大更新,可通过后训练适配特定本体、任务和环境。
推荐理由:原文给出从数据准备到真机部署的完整命令,读者可据此在低成本 SO-101 机械臂上复现微调流程。
Hugging Face 发布 SmolVLA,一个 450M 参数的开源视觉-语言-动作(VLA)模型,可在消费级硬件甚至 CPU 上运行,仅用 lerobot 标签下的社区共享数据集预训练。
推荐理由:450M 的 VLA 模型仅用社区数据预训练就能在仿真和真机上超过更大模型,读者可据此判断开源机器人模型的成本门槛。
Hugging Face 发文称 LeRobot 社区贡献数据集正快速增长,目标是把泛化当作数据问题,构建开放多样的“机器人 ImageNet”。目前上传数据集多集中在 So100 和 Koch 机械臂,社区案例还包括抽屉操作、国际象棋对局和动物玩偶交互等。文章同时指出,随着数据采集门槛降低,数据整理与策展将成为下一阶段挑战。
Hugging Face 宣布收购开源机器人公司 Pollen Robotics,这是其第五次收购,此前曾收购 Gradio 和 XetHub。
推荐理由:Hugging Face 收购 Pollen Robotics 并开卖开源人形机器人,读者可了解其机器人布局与 Reachy 2 的定位。
NVIDIA 在 GTC 2025 上开源三项物理 AI 成果:世界基础模型 Cosmos Transfer、Physical AI Dataset 以及人形机器人基础模型 NVIDIA Isaac GR00T N1。
推荐理由:NVIDIA 一次性开源世界模型、数据集与人形机器人基础模型,读者可据此了解物理 AI 开发可用的工具链。
Hugging Face 将 Physical Intelligence 开发的 π0 和 π0-FAST 两个机器人基础模型移植到 LeRobot 仓库,并给出 PyTorch 版本与模型合集。
推荐理由:Physical Intelligence 的 π0 与 π0-FAST 被移植进 LeRobot,读者可据此了解 VLA 与 VLM 在动作表示上的差异。
Pollen Robotics 开源 pollen-vision 库,为机器人提供零样本视觉模型的统一接口,首个版本聚焦 3D 物体检测,通过组合 OWL-ViT、Mobile Sam 和 RAM 等模型输出物体的 (x, y, z) 坐标,无需训练即可开箱使用。
OpenAI 训练了一对神经网络,让类人机械手解开魔方。两个网络完全在仿真中训练,使用与 OpenAI Five 相同的强化学习代码,并搭配名为 Automatic Domain Randomization(ADR)的新技术。系统能应对训练中从未见过的情况,例如被毛绒长颈鹿戳碰,说明强化学习不只适用于虚拟任务,也能解决需要高灵巧度的物理世界问题。
推荐理由:OpenAI 用仿真训练加自动域随机化让机械手解魔方,可了解强化学习迁移到物理操作任务的思路。
OpenAI 于 2019 年 4 月 27 日举办了首届 OpenAI Robotics Symposium。
OpenAI 训练出一只类人机械手,能以史无前例的灵巧度操控实体物体。
OpenAI 发布八个模拟机器人环境及 Hindsight Experience Replay 的 Baselines 实现,均为过去一年研究开发,并已用于训练可迁移到实体机器人的模型。同时发布一组机器人研究课题请求。
OpenAI 最新机器人技术让完全在模拟中训练的控制器部署到实体机器人后,能应对环境中的意外变化并完成简单任务。与以往的开环系统不同,这些技术构建的是闭环系统。
OpenAI 展示在模拟机器人摔跤任务中,元学习智能体可快速击败更强的非元学习智能体,并能适应自身物理故障。
OpenAI 发布一套机器人系统,完全在仿真环境中训练后部署到实体机器人上,能够在看过一次示范后学会一项新任务。
推荐理由:OpenAI 早期机器人研究,展示仿真训练后迁移到实体机器人并实现单次示范学习新任务。
OpenAI 发布开源机器人仿真软件 Roboschool,并已集成到 OpenAI Gym 中。
OpenAI 称已打造出全球首个完全在仿真环境中训练、并部署到实体机器人上的垃圾邮件检测 AI。该系统将仿真训练与物理机器人部署结合,用于在物理世界中进行垃圾邮件检测。