跳到正文

#具身智能

今日 0 条
9月28日周一
9月24日周四
9月22日周二
  1. NVIDIA Blog40

    NVIDIA 解析大规模部署 Physical AI 为何需全栈安全体系

    NVIDIA 指出 Physical AI 规模化部署需在硬件、软件及 AI 行为等全层级实现安全,预计 2035 年将有 4900 万辆 L3-5 级自动驾驶汽车和 6000 万台工业机器人落地。其推出的 Halos 系统作为首个全栈安全方案,整合 DRIVE AGX Thor、Alpamayo 模型及 Isaac Lab 仿真工具,为自动驾驶与机器人提供从设计到验证的端到端安全保障。

8月26日周三
8月14日周五
  1. Hugging Face Blog62

    Strands Agents 与 LeRobot 结合 Hugging Face Storage Buckets 实现机器人数据流式循环教程

    AWS Strands Robots SDK 与 Hugging Face LeRobot 及 Storage Buckets 集成,提供了一套完整的机器人数据流式处理工作流。该流程允许通过 Agent 录制演示数据并同步至 Bucket,利用 Xet 字节级去重技术减少传输开销,随后直接从 Hub 流式读取数据进行模型训练,最后将训练好的策略部署回硬件,全程无需本地下载完整数据集。

    推荐理由:原文完整演示了从录制、同步到流式训练和部署的闭环流程,读者可以据此了解如何避免重复下载数据并直接在 Hub 上训练机器人策略。

8月13日周四
  1. Microsoft Research35

    MindTopo 基准揭示 VLMs 拓扑推理与规划能力差距

    Microsoft Research 推出 MindTopo 基准,评估多模态大模型在连续性、分离性、顺序、包围和结等拓扑概念上的理解能力。测试显示当前模型在静态图像识别上表现优于交互式规划任务,且整体性能远低于人类水平。这一发现表明模型难以在动作序列中维持一致的拓扑理解,为机器人及交互环境中的可靠决策提供了改进方向。

7月30日周四
  1. Google DeepMind76

    Google DeepMind 发布 Gemini Robotics ER 2 具身推理模型

    Google DeepMind 发布 Gemini Robotics ER 2,这是一款用于机器人的高级具身推理模型。该模型支持视频理解、任务编排和多机器人协作,在进度分类和时刻查找任务中分别达到 57.4% 和 91.3% 的准确率。开发者可通过 Gemini API 和 Google AI Studio 访问该模型。

    推荐理由:原文给出了视频理解、任务编排和多机器人协作的具体能力指标,读者可以据此判断其在物理世界中的实际表现。

7月28日周二
  1. Google DeepMind80

    Google DeepMind 发布 Gemini Robotics 2 实现机器人全身智能控制

    Google DeepMind 推出 Gemini Robotics 2,通过三个核心模型赋予机器人全身运动控制、精细操作及多机协作能力。该系列包含用于视觉语言动作转换的 VLA 模型、负责高层推理规划的 ER 模型以及支持端侧快速适配新形态的 On-Device 模型。目前 ER 模型已在 Google AI Studio 开放,VLA 和端侧模型向早期合作伙伴提供访问权限。

    推荐理由:原文展示了从上半身到全身控制的跨越,以及多机器人协作能力,为理解通用物理AI的演进路径提供了具体技术参照。

7月27日周一
  1. Hugging Face Blog68

    NVIDIA 发布 Cosmos-H-Dreams:面向手术机器人的实时生成式模拟器

    NVIDIA 推出 Cosmos-H-Dreams,这是一款用于手术机器人的实时动作条件生成式模拟器。该模型通过自强制蒸馏技术将 Cosmos-H-Surgical-Simulator 转化为因果学生模型,并借助 FlashDreams 推理库在单张 NVIDIA RTX PRO 6000 GPU 上实现约 160 fps 的交互式运行。

    推荐理由:原文展示了将手术世界模型蒸馏为实时交互模拟器的技术路径,提供了从离线评估到闭环控制的工程实现细节。

7月21日周二
  1. Hugging Face Blog68

    Hugging Face 发布 Grabette:开源低成本机器人操作数据采集系统

    Hugging Face 联合 Pollen Robotics 发布 Grabette,这是一套基于 UMI 理念的开源手持夹爪系统,旨在让普通用户无需机器人即可录制真实世界操作演示并自动转化为 LeRobot 格式数据集。

    推荐理由:该工具将机器人数据采集门槛降至手持设备,通过浏览器端自动化处理直接生成标准训练数据集,为社区协作构建大规模操作数据提供了低成本且可复用的完整技术路径。

7月8日周三
  1. Mistral AI65

    Mistral AI 发布 Robostral Navigate 8B 具身导航模型

    Mistral AI 推出首个面向具身导航的 8B 模型 Robostral Navigate,该模型仅使用单个 RGB 相机即可让机器人在复杂环境中自主导航。在 R2R-CE 基准测试中,其未见环境成功率达 76.6%,超越了依赖深度传感器或多相机的最佳系统。模型完全基于模拟数据训练,结合指向式导航与在线强化学习技术,支持轮式、足式和飞行机器人等多种形态。

    推荐理由:原文展示了仅用单RGB相机实现复杂环境自主导航的技术路径,为低成本机器人部署提供了新方案。

7月7日周二
  1. Hugging Face Blog70

    LeRobot v0.6.0 发布:引入世界模型策略与部署 CLI 以完善机器人学习闭环

    Hugging Face 发布 LeRobot v0.6.0,旨在闭合机器人学习循环。新版本引入了 VLA-JEPA、FastWAM 等能“想象”未来的世界模型策略,以及 Robometer 等用于判断任务成功的奖励模型 API。

    推荐理由:LeRobot v0.6.0 通过引入世界模型策略、统一奖励模型 API 和部署 CLI,构建了从想象到评估再到改进的完整机器人学习闭环。

7月1日周三
6月17日周三
  1. Hugging Face Blog78

    AWS Strands Robots 集成 LeRobot 实现从 Hub 数据集到物理机器人的全流程指南

    AWS 开源 SDK Strands Robots 集成了 Hugging Face LeRobot 栈,允许开发者通过单个 Agent 循环完成从 Hub 数据集记录、策略训练到物理机器人部署的全流程。

    推荐理由:原文提供了从 Hub 数据集到物理机器人的完整代码示例,展示了如何用单一 Agent 循环统一仿真与硬件部署流程。

6月9日周二
6月3日周三
  1. Hugging Face Blog35

    Reachy Mini 对话应用支持通过 MCP 调用 Hugging Face Spaces 工具

    Reachy Mini 对话应用现可通过 MCP 协议调用托管在 Hugging Face Spaces 的远程工具,如天气查询或网页搜索。用户只需执行 `reachy-mini-conversation-app tool-spaces add` 命令即可安装并启用这些能力,无需修改本地代码。该功能允许开发者发布兼容 Space 供他人使用,实现了工具能力的共享与独立更新。

5月27日周三
5月18日周一
  1. Google DeepMind68

    Google DeepMind Project Genie 新增 Street View 实景锚定功能并向全球 Google AI Ultra 用户开放

    Google DeepMind 宣布其通用世界模型 Project Genie 新增基于 Google Street View 的实景锚定能力,允许用户选择美国境内的真实地点生成互动虚拟环境。

    推荐理由:Project Genie 接入 Street View 真实影像,让 AI 生成的虚拟环境能锚定现实地点,为智能体训练和创意探索提供新路径。

4月20日周一
  1. Berkeley AI Research35

    GRASP:面向长时域世界模型的梯度规划方法

    GRASP 是一种针对学习动力学(世界模型)的梯度规划器,旨在解决长时域规划中的病态优化与局部极小值问题。该方法通过将轨迹提升至虚拟状态实现时间并行优化,在状态迭代中直接引入随机性以增强探索,并重塑梯度信号以规避高维视觉模型中脆弱的“状态-输入”梯度依赖。

4月13日周一
  1. Google DeepMind73

    Google DeepMind 发布 Gemini Robotics-ER 1.6 增强机器人具身推理能力

    Google DeepMind 推出 Gemini Robotics-ER 1.6,这是一款专为机器人设计的高层推理模型,显著提升了空间推理和多视角理解能力。该模型新增了仪表读取功能,能够解读复杂压力表和液位计,并在指向、计数及任务成功检测方面优于前代版本。

    推荐理由:官方详细拆解了空间推理与仪表读取等核心能力,并给出了 API 入口及开发者示例,适合评估其在工业巡检场景的落地潜力。

3月9日周一
  1. Hugging Face Blog68

    LeRobot v0.5.0 发布:支持 Unitree G1 人形机器人与新策略模型

    LeRobot v0.5.0 正式发布,这是该框架迄今最大规模的更新,包含超过 200 个合并 PR 和 50 多位新贡献者。新版本首次全面支持 Unitree G1 人形机器人(含全身控制),引入 Pi0-FAST 自回归 VLA、Real-Time Chunking 等六项新策略,并推出 EnvHub 以直接从 Hugging Face Hub 加载仿真环境。

    推荐理由:该版本新增人形机器人支持与多项策略模型,并优化数据管线与仿真环境加载,为具身智能研发提供更完整的开源工具链。

3月5日周四
1月16日周五
11月13日周四
  1. Google DeepMind65

    Google DeepMind 发布 SIMA 2:具备推理与自我学习能力的虚拟世界智能体

    Google DeepMind 推出新一代通用 AI 智能体 SIMA 2,通过集成 Gemini 模型实现从指令跟随到交互式游戏伙伴的跨越。SIMA 2 具备复杂推理、多模态理解及跨环境泛化能力,能在未训练过的游戏(如 ASKA)和 Genie 3 生成的全新世界中执行任务。该模型还引入了基于试错和反馈的自我改进循环,目前作为有限研究预览向部分学者和游戏开发者开放。

    推荐理由:官方展示了集成 Gemini 推理能力的 SIMA 2 在虚拟世界中的泛化与自我改进机制,为具身智能研究提供了新的技术路径参考。

7月10日周四
7月9日周三
6月12日周四
6月3日周二
  1. Hugging Face Blog65

    Hugging Face 发布 SmolVLA:基于社区数据训练的高效开源视觉语言动作模型

    Hugging Face 推出 SmolVLA-450M,这是一款紧凑的开源视觉语言动作(VLA)模型,专为机器人设计且可在消费级硬件上运行。该模型仅使用 LeRobot 社区共享的数据集进行预训练,在 LIBERO、Meta-World 模拟环境及 SO100/SO101 真实任务中表现优于 ACT 等更强基线。

    推荐理由:原文展示了仅用社区数据训练的紧凑视觉语言动作模型,在消费级硬件上实现高效推理并超越更大基线,为机器人研究提供了可复现的低门槛方案。

5月11日周日
  1. Hugging Face Blog40

    LeRobot 社区数据集:机器人领域的“ImageNet”何时到来?

    LeRobot 正通过简化录制与上传流程,推动 Hugging Face Hub 上社区贡献数据集快速增长,旨在构建机器人领域的“ImageNet”。目前 So100 和 Koch 机械臂数据占主导,涵盖抽屉操作、下棋等多样化任务。该举措致力于解决 VLA 模型泛化能力受限于数据多样性的问题,降低硬件门槛以实现更广泛的数据共享。

4月14日周一
  1. Hugging Face Blog65

    Hugging Face 收购 Pollen Robotics 并推出售价 7 万美元的开源人形机器人 Reachy 2

    Hugging Face 宣布收购拥有 9 年开源机器人研发经验的 Pollen Robotics,这是其第五次收购。双方将共同推进开源机器人战略,目前提供的首款产品是面向研究和教育的开源人形机器人 Reachy 2,支持 VR 遥操作,售价为 70,000 美元。

    推荐理由:原文披露了收购细节及首款开源人形机器人 Reachy 2 的定价与能力,为观察 AI 巨头布局实体硬件提供了具体样本。