OpenAI News·· 2018-07-04AI 评分35
OpenAI 智能体通过单次演示在 Montezuma’s Revenge 中获高分
Learning Montezuma’s Revenge from a single demonstration
AI 导读
OpenAI 训练的智能体仅凭单次人类演示,在 Montezuma’s Revenge 游戏中取得 74,500 分的高分,超越此前所有已发表结果。该算法从演示中精心选择的状态开始游戏序列,并使用 PPO 强化学习算法优化得分以进行学习。
来源:OpenAI News · openai.com