Hugging Face Blog·· 2023-09-29AI 评分45
Hugging Face 介绍如何使用 TRL 库通过 DDPO 微调 Stable Diffusion
Finetune Stable Diffusion Models with DDPO via TRL
AI 导读
Hugging Face 发布指南,演示如何利用 `trl` 库中的 `DDPOTrainer` 对 Stable Diffusion 进行强化学习微调。该方法基于 Denoising Diffusion Policy Optimization (DDPO),将去噪过程建模为多步马尔可夫决策过程以优化人类偏好对齐。
来源:Hugging Face Blog · huggingface.co