跳到正文
原文
Hugging Face Blog·· 2025-06-03精选AI 评分62

Hugging Face 发布 SmolVLA:450M 开源视觉-语言-动作模型

SmolVLA: Efficient Vision-Language-Action Model trained on Lerobot Community Data

AI 导读

Hugging Face 发布 SmolVLA,一个 450M 参数的开源视觉-语言-动作(VLA)模型,可在消费级硬件甚至 CPU 上运行,仅用 lerobot 标签下的社区共享数据集预训练。

推荐理由

450M 的 VLA 模型仅用社区数据预训练就能在仿真和真机上超过更大模型,读者可据此判断开源机器人模型的成本门槛。

来源:Hugging Face Blog · huggingface.co