ページ

2026年2月23日月曜日

デュアリティモデル:驚くほど単純なワンステップ生成パラダイム

#aidexx #news

2026年02月23日




## 要約:
本研究では、既存の確率フローODEを解く際に「1入力1出力」という慣習的なパラダイムからの脱却を目指し、デュアリティモデル(DuMo)を提案します。 DuMoは、単一の入力を基に速度とフローマップを同時に予測し、マルチステップの制約をすべてのサンプルに適用することで、学習の安定性と効率を向上させます。ImageNetでの実験では、従来のモデルを凌駕する優れた結果(FID 1.79)を2ステップで達成しました。

---

## 翻訳:
arXiv:2602.17682v1 Announce Type: new
Abstract: 既存のショートカットやMeanFlowといった整合性に基づいた生成モデルは、確率フローODE(PF-ODE)を解くためのターゲット依存設計により、目覚ましい成果を上げています。通常、これらの方法は、現在の時間$t$にターゲット時間$r$を導入し、ローカルな複数ステップ微分($r = t$)とグローバルな少数ステップ積分($r = 0$)の間で出力を調整します。しかし、従来の「1入力1出力」のパラダイムは、トレーニング予算の分割を強制し、多くの場合、安定性のためにかなりの割合(MeanFlowでは75%など)を複数ステップの目的のみに割り当てます。この分離はトレードオフを強いることになり、複数ステップの目的サンプルに十分な割り当てを行うと、少数ステップの生成が学習不足になり、収束を妨げ、スケーラビリティを制限します。この問題を解決するため、本研究では「1入力、デュアル出力」パラダイムを用いたデュアリティモデル(DuMo)を提案します。共有されたバックボーンとデュアルヘッドを使用することで、DuMoは単一の入力$x_t$から速度$v_t$とフローマップ$u_t$を同時に予測します。これにより、複数ステップの制約をすべてのサンプルに適用し、少数ステップの推定をバウンドさせることができます。トレーニング目的を分離することなく、安定性と効率を大幅に向上させます。ImageNet 256 × 256 では、679Mの拡散トランスフォーマーとSD-VAEを使用して、わずか2ステップで最先端(SOTA)のFID 1.79を達成しました。コードは次の場所で入手できます: https://github.com/LINs-lab/DuMo

[📰 原文はこちら](https://arxiv.org/abs/2602.17682)

---

※本記事はAI(Ollama)による自動翻訳・要約です。

BittensorManがお勧めするメーカーリスト
https://exbridge.jp/xdirect/

AI時代の技術と知識のまとめ(AI生成メディア) - AIDexx
https://exbridge.jp/aidexx/

頑張って働く人に向けて、プロ用仕事アイテムを格安でネット販売しているX-Direct( https://exdirect.net )を、BittensorManは応援しています。

動画の最後にお得な情報がありますので、
最後までご覧ください。

OpenAIとAnthropicのロビー活動とHugging FaceCEOが突きつけるセキュリティへの提言 07-27

本記事はHorizonを使いAI/LLM・バイブコーディング・Web3・スタートアップのニュースを自動収集・要約したものです。 OpenAIとAnthropicのロビー活動とHugging FaceCEOが突きつけるセキュリティへの提言 Hugging Face CEO...