跳到正文
原文
Hugging Face Blog·· 2025-06-03精选AI 评分65

Hugging Face 发布 SmolVLA:基于社区数据训练的高效开源视觉语言动作模型

SmolVLA: Efficient Vision-Language-Action Model trained on Lerobot Community Data

AI 导读

Hugging Face 推出 SmolVLA-450M,这是一款紧凑的开源视觉语言动作(VLA)模型,专为机器人设计且可在消费级硬件上运行。该模型仅使用 LeRobot 社区共享的数据集进行预训练,在 LIBERO、Meta-World 模拟环境及 SO100/SO101 真实任务中表现优于 ACT 等更强基线。

推荐理由

原文展示了仅用社区数据训练的紧凑视觉语言动作模型,在消费级硬件上实现高效推理并超越更大基线,为机器人研究提供了可复现的低门槛方案。

来源:Hugging Face Blog · huggingface.co