Hugging Face Blog·· 2022-05-20AI 评分15
Hugging Face 深度强化学习课程:Q-Learning 原理与实现
An Introduction to Q-Learning Part 2/2
AI 导读
Hugging Face 发布深度强化学习课程第二部分,详解 Q-Learning 算法并指导从零构建智能体。该 off-policy 方法利用 TD 更新动作价值函数,通过 Epsilon Greedy 策略平衡探索与利用。学员将在 Frozen Lake v1 和自动驾驶出租车环境中训练首个 RL 智能体,为后续 Deep Q-Learning 奠定基础。
来源:Hugging Face Blog · huggingface.co