跳到正文
原文
Hugging Face Daily Papers·· 3 天前AI 评分35

Adaptive Reward Routing:面向音视频联合扩散模型的前向过程 RL 动态多奖励优化

Adaptive Reward Routing: Dynamic Multi-Reward Optimization for Joint Audio-Video Diffusion via Forward-Process RL

AI 导读

针对音视频联合扩散模型的多奖励强化学习,研究者提出 Adaptive Reward Routing,在 DiffusionNFT 前向过程 RL 中同时自适应调整更新位置与奖励组合。

来源:Hugging Face Daily Papers · arxiv.org