跳到正文
原文
Hugging Face Blog·· 2023-09-29AI 评分45

Hugging Face 介绍如何使用 TRL 库通过 DDPO 微调 Stable Diffusion

Finetune Stable Diffusion Models with DDPO via TRL

AI 导读

Hugging Face 发布指南,演示如何利用 `trl` 库中的 `DDPOTrainer` 对 Stable Diffusion 进行强化学习微调。该方法基于 Denoising Diffusion Policy Optimization (DDPO),将去噪过程建模为多步马尔可夫决策过程以优化人类偏好对齐。

来源:Hugging Face Blog · huggingface.co