Hugging Face Blog·· 2025-06-03精选AI 评分65
Hugging Face 发布 SmolVLA:基于社区数据训练的高效开源视觉语言动作模型
SmolVLA: Efficient Vision-Language-Action Model trained on Lerobot Community Data
AI 导读
Hugging Face 推出 SmolVLA-450M,这是一款紧凑的开源视觉语言动作(VLA)模型,专为机器人设计且可在消费级硬件上运行。该模型仅使用 LeRobot 社区共享的数据集进行预训练,在 LIBERO、Meta-World 模拟环境及 SO100/SO101 真实任务中表现优于 ACT 等更强基线。
推荐理由
原文展示了仅用社区数据训练的紧凑视觉语言动作模型,在消费级硬件上实现高效推理并超越更大基线,为机器人研究提供了可复现的低门槛方案。
来源:Hugging Face Blog · huggingface.co