跳到正文
原文
Hugging Face Blog·· 2022-05-20AI 评分15

Hugging Face 深度强化学习课程:Q-Learning 原理与实现

An Introduction to Q-Learning Part 2/2

AI 导读

Hugging Face 发布深度强化学习课程第二部分,详解 Q-Learning 算法并指导从零构建智能体。该 off-policy 方法利用 TD 更新动作价值函数,通过 Epsilon Greedy 策略平衡探索与利用。学员将在 Frozen Lake v1 和自动驾驶出租车环境中训练首个 RL 智能体,为后续 Deep Q-Learning 奠定基础。

来源:Hugging Face Blog · huggingface.co