本サイトの記事や画像は、AIが公的資料や複数の報道を基に事実関係を整理・再構成し制作したものです。[続きを表示]特定の報道内容や表現を再利用・要約することを目的としたものではありません。ただし、誤りや不確定な情報が含まれる可能性がありますので、参考の一助としてご覧いただき、実際の判断は公的資料や各出典元の原文をご確認ください。[私たちの取り組み]
バイトダンス Seedやシンガポール国立大学(NUS)などの研究者は2026年8月25日(UTC、日本時間も同日)、画像生成の拡散モデルを報酬に沿って追加学習する処理を効率化する「DiffusionOPSD」の技術報告とコードを公開した。著者らは比較実験で、最大44.0%の相対改善と最大63%のGPU時間削減を報告した。
完成画像の評価を生成途中の学習目標に変換
従来の報酬誘導型学習では、完成画像への評価だけでは、途中のノイズ除去予測をどう改善すべきかが直接示されない。DiffusionOPSDは、現在の行動方策が生成した途中状態とクリーン出力のアンカーを使い、報酬勾配から正負の学習目標を構築する。
学習後は指数移動平均(EMA)で行動方策を更新し、次の反復で生成軌跡やアンカー、目標を作り直す。完成画像の報酬を生成途中の明示的な教師信号へ変換するオンポリシー自己蒸留方式だ。
20条件中19条件で最高評価
著者らはSD3.5-Mとネイティブ9ステップのZ-Image-Turboで評価し、20条件中19条件で比較手法中最高の最終ホールドアウト評価を得た。最大44.0%の相対改善は、SD3.5-MのVLM-Pairwiseで0.465対0.323となったDiffusionNFTとの比較に基づく。
8GPU構成の計測では、DiffusionNFT比の100更新当たりGPU時間がSD3.5-Mで47.2から28.2へ減り40%削減、Z-Image-Turboで405.8から149.8へ減り63%削減した。初期化、較正、評価の時間は含まない。一方、Z-Image-TurboのピークVRAMはDiffusionOPSDが61.5GB、DiffusionNFTが49.9GBで、GPU時間の短縮がメモリー使用量の削減を意味するわけではない。
コードと3種類のチェックポイントも公開
GitHubでは実装コードと再現用設定を公開し、Hugging Faceでは3種類のLoRAチェックポイントを提供している。いずれもApache-2.0ライセンスで公開されている。
