騰訊開源影像模型SRPO:解決AI生圖"油膩感",訓練效率提升75倍

騰訊混元生圖團隊聯合香港中文大學(深圳)、清華大學開發的SRPO(語意相對偏好優化)演算法近日開源,登上Hugging Face趨勢榜首。此技術顯著改善目前開源模型Flux生成影像的"油膩"問題,訓練效率提升75倍,人類評估真實度與美學優秀率提升超300%。
一、核心突破:從"油膩"到真實
問題背景
Flux等主流開源模式生成人像時有皮膚質感差、色調失真問題。
SRPO透過語意相對偏好優化技術,調整獎勵模型偏好,優化生成軌跡。
效果對比
美感優秀率從8.2%提升至38.9%,真實度提升超300%。
訓練效率:32卡僅需10分鐘(5.3GPU卡時),比DanceGRPO快75倍。
二、技術原理:兩大創新設計
Direct-Align採樣策略
傳統瓶頸:多步驟採樣器計算成本高,易梯度爆炸,僅能優化產生後半段。
創新方案:透過雜訊注入與單步驟推理,以"參考錨點"精確重建影像,降低誤差。
語意引導偏好機制
獎勵破解難題:傳統方法依賴預訓練獎勵模型,易過擬合(如偏好紅/紫色調)。
動態控制:透過正/負向提示詞(如"真實感")調節獎勵方向,中和偏差。
第三、應用與開源
開發者支援
支援ComfyUI工作流程,已發布Hugging Face/Github,量化版本下載量1.6萬次。
論文與技術報告公開,社群推出多個量化版本。
限制與展望
低頻風格(如賽博龐克)優化受限,未來將增強可控性與可解釋性。
資源連結
論文:[2509.06942] Directly Aligning the Full Diffusion Trajectory with Fine-Grained Human Preference
GitHub:https://github.com/Tencent-Hunyuan/SRPO
Hugging Face:https://huggingface.co/tencent/SRPO