Destro AI 用智能体层让机器人与人类工人协同作业,获 800 万美元种子轮
Destro 结束隐身模式并获得 800 万美元种子轮融资,其 AI 智能体层让机器人在物流场景中作业,同时指挥人类工人,而非自研机器人本体。
Destro 结束隐身模式并获得 800 万美元种子轮融资,其 AI 智能体层让机器人在物流场景中作业,同时指挥人类工人,而非自研机器人本体。
AMD 以 82 亿美元收购 World Labs。World Labs 创始人李飞飞在博客中回顾,公司自 2024 年成立以来构建了图像、视频与空间重建的模型训练团队,并通过收购 SceniX 推进机器人仿真能力。
推荐理由:AMD 以 82 亿美元收购 World Labs,可看到空间智能与机器人仿真能力如何被并入芯片厂商版图。
Import AI 474 期关注三项内容:Michael Levin 提出心智是来自 Platonic 空间的模式,身体与机器只是其接口;太空部署 TPU 的设想;智谱(Zhipu)启动外层 RSI 循环。
特斯拉工人对训练 Optimus 人形机器人以替代自身岗位表示抵触。尽管面临阻力,特斯拉仍计划到 2026 年底实现每周生产 1,000 台 Optimus 机器人。
微软研究院对移动操作机器人工作负载做了系统性测量,发现把物理 AI 推理从机载 GPU 卸载到边缘或云端 GPU 可提升任务表现。
推荐理由:微软研究院系统测量了机器人端侧推理与卸载到边缘或云端 GPU 的差异,并给出可复用的 Kubernetes 卸载工具链。
NVIDIA 在加拿大多伦多 ROSCon 大会上发布 Isaac ROS 5.0,这是一套基于 ROS 的 GPU 加速软件包集合,新增智能体工作流与平台支持,免费开源。
推荐理由:Isaac ROS 5.0 把智能体工作流引入机器人开发,并给出多家厂商的落地案例,可据此判断开源机器人栈的演进方向。
NVIDIA 发文阐述物理 AI 规模化部署的安全要求,指出安全必须覆盖硬件、软件、AI、运行环境与部署全生命周期,而非部署前的一次性检查。ABI Research 预计到 2035 年 L3-L5 自动驾驶汽车保有量达 4900 万辆,Omdia 估计 2026 至 2035 年间约 6000 万台工业机器人将部署。
AWS 开源 SDK Strands Robots(Apache 2.0)演示了机器人数据闭环:用 Robot("so100") 录制 LeRobotDataset 并同步到 Hugging Face Storage Buckets,再通过 stream_dataset 直接从 Hub 流式读取训练,无需完整下载,最后仅改一个关键字参数即可将 checkpoint 部署回硬件。
Google DeepMind 发布 Gemini Robotics ER 2,定位为机器人的高层大脑,可理解物理世界、规划多步任务,并把动作执行交给底层 VLA 模型,还能原生调用 Google Search 等工具。
推荐理由:官方给出 ER 2 在进度分类、时刻定位与多机器人协作上的具体指标,可据此判断机器人大脑的落地边界。
Google DeepMind 发布 Gemini Robotics 2,作为新一代机器人的智能层,解锁全身控制、灵巧操作和多机器人协作。
推荐理由:官方给出三款模型的职责分工与开放入口,读者可据此判断机器人全身控制与多机协作的落地路径。
NVIDIA 推出 Cosmos-H-Dreams,一个面向手术机器人的实时、动作条件生成式仿真器,通过 FlashDreams 推理库在单张 RTX PRO 6000 GPU 上运行,支持人与策略闭环交互控制。
Hugging Face 发布 Grabette,一套开源低成本的手持夹爪数据采集系统,无需机器人即可录制操作演示并自动转为 LeRobot 格式数据集。Grabette 配备广角鱼眼相机和 RGBD 相机,BOM 成本约 490€,配套的机器人端夹爪 Gripette 成本约 120€。
推荐理由:原文给出了一套无需机器人即可采集操作数据的开源硬件与处理流程,读者可据此判断数据采集门槛的变化。
Mistral AI 发布首个具身导航模型 Robostral Navigate,这是一个 8B 模型,仅用单个普通 RGB 相机、无需 LiDAR 或深度传感器,在 R2R-CE validation unseen 上达到 76.6% 成功率,比最佳单相机方案高 9.7 个百分点,比使用深度或多相机的最佳系统高 4.5 个百分点。
推荐理由:原文给出单目 RGB 相机在 R2R-CE 上的成绩与训练方法,读者可据此判断具身导航的能力边界。
LeRobot v0.6.0 发布,围绕机器人学习闭环引入世界模型策略(VLA-JEPA、FastWAM、LingBot-VA)、新一批 VLA(GR00T N1.7、MolmoAct2、EO-1、EVO1、Multitask DiT)以及统一奖励模型 API(Robometer、TOPReward)。
推荐理由:LeRobot v0.6.0 把世界模型策略、奖励模型与部署 CLI 串成闭环,读者可据此判断开源机器人学习栈的当前能力边界。
AWS 开源 SDK Strands Robots(Apache 2.0)把 LeRobot 栈封装成 AgentTools,用一个 Strands 智能体串起从 Hub 数据集到实体机器人的流程。
推荐理由:AWS 官方给出从 Hub 数据集到实体机器人的完整五步流程,可据此判断仿真与真机数据同格式的实际用法。
Google DeepMind 推出为期 3 个月的机器人加速器项目,从欧洲选出 15 家早期机器人初创公司,本周在伦敦启动,入选团队可使用其 AI 技术栈和 Gemini 机器人模型。项目提供技术指导、产品建议与合作伙伴网络,覆盖物流、制造、医疗、气候和导航等领域,例如挪威 3D-Components 的焊接与金属 3D 打印平台号称比现有做法快 280 倍。
Hugging Face 发布 LeRobot v0.5.0,这是该项目迄今最大的一次更新,自 v0.4.0 以来合并超过 200 个 PR、新增 50 多位贡献者。
推荐理由:LeRobot v0.5.0 一次性补齐人形机器人、VLA 策略与仿真环境加载,可据此判断开源机器人栈的当前边界。
Hugging Face 发布 NXP 的嵌入式机器人 AI 实践指南,覆盖数据集录制、VLA 策略微调(ACT 与 SmolVLA)及端侧优化。指南以"把茶包放进杯子"任务为例,给出固定相机、夹爪相机、11 个 10×10 cm 起始位置聚类、120 个 episode 等具体做法,并展示 NXP i.MX 95 SoC 优化后的实时性能。
OpenAI 投资 Merge Labs,支持其开发连接生物智能与人工智能的新型脑机接口,目标是最大化人类能力、自主性与体验。
AMD 联合 Hugging Face 和 Data Monsters 举办 AMD Open Robotics Hackathon,首站 12 月 5-7 日在东京,第二站 12 月 12-14 日在巴黎。
NVIDIA Isaac for Healthcare v0.4 发布,提供基于 SO-ARM 的端到端入门工作流和"自带手术室"教程,让开发者从仿真、训练到部署自主医疗机器人。
LeRobot 发布 v0.4.0,带来 LeRobotDataset v3.0 分块 episode 格式与流式加载,可支持 OXE 级别(>400GB)数据集,并提供 lerobot-edit-dataset CLI 用于删除、拆分、合并数据集。
推荐理由:LeRobot v0.4.0 把数据集、VLA 模型与硬件插件整合进同一开源栈,可据此判断机器人学习工具链的成熟度。
Hugging Face 发布 LeRobotDataset v3.0,将多个 episode 打包进单个文件,用关系型元数据在 episode 级别检索信息,解决 v2 单文件单 episode 在百万级数据集上的文件系统瓶颈。
Hugging Face 发布博客详解异步机器人推理,将动作预测与动作执行解耦,让机器人在 PolicyServer 计算下一段动作时继续执行当前动作队列,从而消除推理等待。该方案在 SmolVLA 上实现约 2 倍任务完成提速,成功率相当,PolicyServer 与 RobotClient 通过 gRPC 通信,性能约为同类 REST API 的 5 倍。
Hugging Face 与 Pollen Robotics 发布开源机器人 Reachy Mini,Lite 版 399 美元、带板载计算与无线的 Compute 版 499 美元,均需另付税费和运费,预计约 90 天发货。
推荐理由:开源机器人 Reachy Mini 以 399 美元起售并接入 Hugging Face 模型库,读者可据此判断桌面级机器人实验的门槛与生态玩法。
NVIDIA 发布 Isaac GR00T N1.5,这是 Isaac GR00T N1 的首次重大更新,可通过后训练适配特定本体、任务和环境。
推荐理由:原文给出从数据准备到真机部署的完整命令,读者可据此在低成本 SO-101 机械臂上复现微调流程。
Hugging Face 发布 SmolVLA,一个 450M 参数的开源视觉-语言-动作(VLA)模型,可在消费级硬件甚至 CPU 上运行,仅用 lerobot 标签下的社区共享数据集预训练。
推荐理由:450M 的 VLA 模型仅用社区数据预训练就能在仿真和真机上超过更大模型,读者可据此判断开源机器人模型的成本门槛。
Hugging Face 发文称 LeRobot 社区贡献数据集正快速增长,目标是把泛化当作数据问题,构建开放多样的“机器人 ImageNet”。目前上传数据集多集中在 So100 和 Koch 机械臂,社区案例还包括抽屉操作、国际象棋对局和动物玩偶交互等。文章同时指出,随着数据采集门槛降低,数据整理与策展将成为下一阶段挑战。
Hugging Face 宣布收购开源机器人公司 Pollen Robotics,这是其第五次收购,此前曾收购 Gradio 和 XetHub。
推荐理由:Hugging Face 收购 Pollen Robotics 并开卖开源人形机器人,读者可了解其机器人布局与 Reachy 2 的定位。
NVIDIA 在 GTC 2025 上开源三项物理 AI 成果:世界基础模型 Cosmos Transfer、Physical AI Dataset 以及人形机器人基础模型 NVIDIA Isaac GR00T N1。
推荐理由:NVIDIA 一次性开源世界模型、数据集与人形机器人基础模型,读者可据此了解物理 AI 开发可用的工具链。
Hugging Face 将 Physical Intelligence 开发的 π0 和 π0-FAST 两个机器人基础模型移植到 LeRobot 仓库,并给出 PyTorch 版本与模型合集。
推荐理由:Physical Intelligence 的 π0 与 π0-FAST 被移植进 LeRobot,读者可据此了解 VLA 与 VLM 在动作表示上的差异。
Pollen Robotics 开源 pollen-vision 库,为机器人提供零样本视觉模型的统一接口,首个版本聚焦 3D 物体检测,通过组合 OWL-ViT、Mobile Sam 和 RAM 等模型输出物体的 (x, y, z) 坐标,无需训练即可开箱使用。