跳到正文
原文
OpenAI News·· 2018-07-04AI 评分35

OpenAI 智能体通过单次演示在 Montezuma’s Revenge 中获高分

Learning Montezuma’s Revenge from a single demonstration

AI 导读

OpenAI 训练的智能体仅凭单次人类演示,在 Montezuma’s Revenge 游戏中取得 74,500 分的高分,超越此前所有已发表结果。该算法从演示中精心选择的状态开始游戏序列,并使用 PPO 强化学习算法优化得分以进行学习。

来源:OpenAI News · openai.com