Hugging Face Daily Papers·· 3 天前AI 评分35
Adaptive Reward Routing:面向音视频联合扩散模型的前向过程 RL 动态多奖励优化
Adaptive Reward Routing: Dynamic Multi-Reward Optimization for Joint Audio-Video Diffusion via Forward-Process RL
AI 导读
针对音视频联合扩散模型的多奖励强化学习,研究者提出 Adaptive Reward Routing,在 DiffusionNFT 前向过程 RL 中同时自适应调整更新位置与奖励组合。
来源:Hugging Face Daily Papers · arxiv.org