Microsoft Research 提出物理 AI 机器人推理卸载方案
Microsoft Research 挑战机器人仅依赖板载 GPU 进行推理的传统假设,提出将计算卸载至边缘或云端。实测显示该方案能提升任务成功率并延长电池寿命,同时支持更大模型运行。团队还推出了基于 Kubernetes 的工具链,帮助开发者在机器人、边缘和云之间部署分布式推理工作负载。
Microsoft Research 挑战机器人仅依赖板载 GPU 进行推理的传统假设,提出将计算卸载至边缘或云端。实测显示该方案能提升任务成功率并延长电池寿命,同时支持更大模型运行。团队还推出了基于 Kubernetes 的工具链,帮助开发者在机器人、边缘和云之间部署分布式推理工作负载。
Google Research 在 CHI 2026 发表研究原型 AgentHands,利用 LLM 推理与 XR 空间感知,使 AI 智能体能生成与语音同步的具身手势。该系统通过环境注册、手势库及实时解析,将抽象指令转化为直观物理演示,显著提升用户在兰花护理等场景中的空间理解能力。
Microsoft Research 推出 MindTopo 基准,评估多模态大模型在连续性、分离性、顺序、包围和结等拓扑概念上的理解能力。测试显示当前模型在静态图像识别上表现优于交互式规划任务,且整体性能远低于人类水平。这一发现表明模型难以在动作序列中维持一致的拓扑理解,为机器人及交互环境中的可靠决策提供了改进方向。
GRASP 是一种针对学习动力学(世界模型)的梯度规划器,旨在解决长时域规划中的病态优化与局部极小值问题。该方法通过将轨迹提升至虚拟状态实现时间并行优化,在状态迭代中直接引入随机性以增强探索,并重塑梯度信号以规避高维视觉模型中脆弱的“状态-输入”梯度依赖。
Google DeepMind 发布 D4RT,一种统一 AI 模型用于动态场景的 4D 重建和追踪。该模型采用基于查询的 Transformer 架构,比先前方法快 18x 至 300x,在单个 TPU 上处理一分钟视频仅需约五秒。
Google DeepMind 推出新一代通用 AI 智能体 SIMA 2,通过集成 Gemini 模型实现从指令跟随到交互式游戏伙伴的跨越。SIMA 2 具备复杂推理、多模态理解及跨环境泛化能力,能在未训练过的游戏(如 ASKA)和 Genie 3 生成的全新世界中执行任务。该模型还引入了基于试错和反馈的自我改进循环,目前作为有限研究预览向部分学者和游戏开发者开放。
推荐理由:官方展示了集成 Gemini 推理能力的 SIMA 2 在虚拟世界中的泛化与自我改进机制,为具身智能研究提供了新的技术路径参考。
Yaak 与 Hugging Face LeRobot 团队联合发布 Learning to Drive (L2D) 数据集,这是目前全球最大的开源多模态自动驾驶数据集。
推荐理由:该数据集提供了大规模多模态驾驶数据及自然语言指令,支持端到端模型训练与社区协作扩展。