GPDi 無料

-

GPDiT (Generative Pre-trained Autoregressive Diffusion Transformer) は、中国科学技術大学と Step Star が共同提案した自己回帰拡散ビデオ生成モデルです。連続潜在空間でフレームレベルの自己回帰予測を実行し、拡散モデルの高品質な生成機能と自己回帰モデルのタイミング モデリングの利点を統合します。 MSRVTT および UCF-101 ベンチマークでは、当時の最適レベルに達しています。

GPDi 製品インターフェース

GPDiT の完全なレビュー

コアパラメータと統計

GPDiT (Generative Pre-trained Autoregressive Diffusion Transformer) は、中国科学技術大学と Step Star によって共同提案されました。拡散モデルの高品質な生成機能と自己回帰モデルの時間依存モデリング機能を同じフレームワーク内で統合することを目的としています。離散トークン予測ルートとは異なり、GPDiT は連続潜在空間でフレームごとに自己回帰予測を実行し、一度に 1 フレームずつ予測し、拡散損失を通じて最適化することで、モデルがフレーム間の動きのダイナミクスとセマンティックな一貫性を自然にキャプチャできるようにします。

プロジェクト 仕様
フルネーム 生成的な事前トレーニング済み自己回帰拡散トランスフォーマー
出版代理店 中国科学技術大学 (USTC)、StepFun
arXiv ID 2505.07344 (v5、2025-10-08)
主題分野 cs.CV (コンピュータビジョンとパターン認識)、cs.AI (人工知能)
モデルサイズ GPDiT-B (85M パラメータ)、GPDiT-H (2B パラメータ)
技術ロードマップ フレーム単位の自己回帰拡散トランス (フレーム単位の自己回帰拡散)
コアイノベーション 連続潜在空間フレーム予測 + 軽量因果的注意 + パラメーターフリーの回転時間エンコーディング
トレーニング データ UCF-101、MSR-VTT、LAION-Aesthetic、内部ビデオ データ セット
公開フォーム arXiv 論文 (コードとモデルはオープンソースではありません)
オープンソース ライセンス arXiv 非独占的配布ライセンス

モデル仕様の比較: GPDiT-B は DiT-B 構成に従い、12 層のトランスフォーマー、768 の隠れ次元と 12 の注目ヘッド、およびパラメーター量はわずか 85M です。 GPDiT-H は 24 層、2816 隠れ次元、22 個の注目点、および 2B のパラメータ量に拡張されています。このデュアルトラック設計により、研究者は小規模モデルを使用してリソースに制約のあるシナリオでアイデアを検証し、コンピューティング能力が十分な場合には大規模バージョンに切り替えて最適な生成品質を追求できます。

主要なパフォーマンス数値: GPDiT-H-LONG は、MSRVTT ゼロサンプル生成で FVD 64 および FID 7.4 を達成し、同期間で SnapVideo (FVD 110) を約 42% 上回りました。 UCF-101 では、FVD 218 および IS 66.6 を達成し、IS インジケーターは PixelDance (42.1) より約 58% 高くなります。 GPDiT-B (80M パラメータ) は、UCF-101 トレーニングで FVD 214 を達成し、130M パラメータの FAR (FVD 194) との差は 10% 以内であり、軽量アーキテクチャの効率上の利点を示しています。

宣伝性の検証: MSRVTT および UCF-101 に関する論文の定量的な結果を検証でき、同時期の手法と比較した利点が明らかです。ただし、コードとモデルの重みはオープンソースではなく、サードパーティによる独立した複製はまだ登場していません。すべての値は論文による自己申告です。

ユーザーと市場の認識

GPDiT は現在学術論文の段階にあり、市場での認知度は学術的な引用やコミュニティの注目に反映されています。商業化や企業での導入に関するデータはまだありません。

学術コミュニティの注目: この論文は 2025 年 5 月に提出され、10 月に最終バージョンになり、arXiv 上で 5 回のバージョン反復が行われており、著者チームが実験とデモンストレーションを改善し続けていることが示されています。この論文は Hugging Face Daily Papers トレンドに掲載され、コミュニティでの露出をある程度得ています。

機関による支持: 中国科学技術大学 (USTC) は CV と AI の分野で深い蓄積を持っており、StepFun は国内のビデオ生成トラックにおける重要なプレーヤーです (Step-Video シリーズを立ち上げています)。両機関の共同出版により、産学研究統合レベルでの論文の信頼性が高まります。

引用と複製: 現時点では、この論文に関する公開された第三者による複製レポートやコード リポジトリはありません。これは学術論文の通常のペースです。主要な CV カンファレンス論文のほとんどは、出版後 3 ~ 6 か月かかるまでコミュニティで複製されません。公式コードとサードパーティコードが将来的にオープンソース化されるかどうかに注意を払うことをお勧めします。

業界ベンチマークの地位: GPDiT の 2B パラメータ スケールは、SnapVideo (3.9B) や PixelDance (1.5B) と同程度ですが、MSRVTT での FVD 64 のパフォーマンスは当時の第一段階にありました。ただし、デモや API が不足しているため、C サイドでの認識は Runway や Pika などの商用製品よりもはるかに低いです。

コストメリット

GPDiT は現在、完全に論文の形式で存在しており、コスト構造は非常にシンプルです。論文は無料で入手できますが、実験を再現するには多大なコンピューティング能力への投資が必要です。

寸法 広報
論文を読む arXiv は無料で公開されており、PDF / HTML / TeX ソース コードをサポートしています。
コードとモデル オープンソースではないため、ダウンロードして使用することはできません。
APIサービス 提供されていません
GPDiT-B再発費用(控除) 32 個の H100 GPU × 400k 反復 × 約 2 ~ 3 日
GPDiT-H再発費用(控除) マルチステージトレーニング: 200k + 200k + 150k 反復、合計約 1 ~ 2 週間 × 64+ H100
少数サンプルの微調整コスト (控除) 500イテレーション×バッチ4×1枚のカードで完了可能

無料の真実: 論文が無料で読めるのは事実ですが、「使用」にかかる隠れたコストは非常に高額です。 GPDiT-B のトレーニングでは、400k 反復で 32 個の H100 GPU を使用します。クラウド ベンダー H100 に従って計算すると、カード 1 時間あたり約 3 ~ 4 ドルとなり、1 枚の完全な複製のコンピューティング電力コストは 10,000 ~ 20,000 ドルのオーダーになります。 GPDiT-H の多段階トレーニングにはより高いコンピューティング能力が必要ですが、一般の学術研究室にとっては手頃な能力ではありません。

商用 API との暗黙的なコストの比較: 目的が単に「ビデオを生成する」ことである場合、Runway Gen-3 (約 0.05 ~ 0.10 ドル/秒) または Pika (サブスクリプション 10 ~ 50 ドル/月) を直接使用する方が、現段階での GPDiT の自己トレーニングの限界コストよりもはるかに低くなります。 GPDiT の価値は、すぐに使えるコストの利点ではなく、テクノロジーの探求とアーキテクチャの革新にあります。

コンプライアンス リスク: この文書は、学術的な引用と派生研究を許可する arXiv の非独占的配布ライセンスを使用しています。ただし、将来的に論文ソリューションに基づいて商用モデルをトレーニングする場合は、StepFun および USTC が保有する可能性のある特許または知的財産権に注意を払う必要があり、商用利用の前に FTO (実装の自由) 分析を実行する必要があります。

主な機能

GPDiT の機能は、ビデオ生成、ビデオ表現学習、少数サンプル マルチタスク転送の 3 つのレベルに焦点を当てています。

  • フレームレベルの自己回帰ビデオ生成: 連続潜在空間で将来のフレームをフレームごとに予測し、各フレームは以前に生成されたすべてのフレームに基づいて生成されます。この設計は、固定長ビデオ生成の制限を打ち破り、理論的には任意の長さのビデオ シーケンスを生成できます。離散トークンの自己回帰モデルと比較して、連続空間予測では VQ トークナイザーの情報損失の問題が回避されます。

  • 2 つの因果的注意バリアント (OF / OF2): OF (フォーマーのみ) バリアントは、トレーニング中のクリーン フレーム間の注意計算を排除し、ビデオ フレーム間の空間的冗長性を使用して計算量を約 50% 削減します。 OF2 バリアントは、より強力な表現機能と引き換えに、クリーンなフレーム間の相互作用を保持します。どちらも推論中の KV キャッシュ アクセラレーションと当然の互換性があり、長いシーケンスの生成効率は双方向アテンション スキームよりも大幅に高くなります。

  • パラメーターなしの回転時間エンコード: 順拡散プロセスを複素平面上の回転操作として再解釈し、従来の adaLN-Zero モジュールを回転角度 $\theta_t$ に置き換えます。この設計では、DiT モデルのパラメータの約 28% を占める時間条件サブモジュールが削除され、パラメータ効率において明らかな利点があります。

  • 少数サンプルのマルチタスク転送: 事前トレーニングされた GPDiT モデルは、スタイル転送、エッジ検出、深度推定、人物検出、画像のカラー化などのさまざまな下流タスクに転送するために、20 ビデオ サンプル (20 ショット) と 500 回の微調整反復のみを必要とします。この機能は、追加の適応モジュールを必要とせずに、連続自己回帰フレームワークの自然条件スプライシング メカニズムの恩恵を受けます。

  • ビデオ表現学習: GPDiT の中間層機能は、ビデオ理解タスクに直接使用できます。線形検出実験により、GPDiT-H 特徴は UCF-101 分類においてかなりの表現品質を持ち、Video-ChatGPT フレームワークの CLIP ビジュアル エンコーダを置き換えた後、ActivityNet-QA で 28.2% の精度を達成することが示されました。

専門家の視点: GPDiT の機能設計には「隠れた相乗効果」があります。その自己回帰アーキテクチャは、「生成 + 理解」の統合を自然にサポートします。従来のソリューションでは、ビデオ生成モデル (Stable Video Diffusion など) とビデオ理解モデル (VideoMAE など) は 2 つの独立したアーキテクチャです。 GPDiT の生成タスクに関する事前トレーニング済みの重みは、タスクを理解するための特徴抽出器として直接使用でき、生成品質の向上は表現能力の向上と正の相関関係があります (論文の図 5c は、FVD と分類精度の同時向上を検証しています)。これは、同じモデルがビデオ コンテンツ作成シナリオとビデオ分析シナリオの両方に役立つ可能性があることを意味します。

モデルとバージョンの進化

バージョンコンテキスト

GPDiT は arXiv 上で 5 つのバージョンの反復を経て、最初のバージョンから最終バージョンまで約 5 か月かかりました。

バージョン 日付 主要な変更点
v1 2025-05-12 最初の提出では、GPDiT-B (85M) および GPDiT-H (2B) アーキテクチャを提案し、UCF-101 および MSRVTT に関する基本的な結果を報告します。
v2 2025-05-15 実験設定の修正とアブレーション研究の補足
v3 2025-05-19 関連する作業と実験の説明を改善する
v4 2025-05-22 ビデオ表現学習の補足的な線形検出実験とその他のサンプル結果
v5 2025-10-08 最終バージョンでは、GPDiT-H-LONG バリアントを追加し、17 ~ 45 フレームの可変長生成をサポートし、MSRVTT で FVD が 64 に削減されました。

モデルバリエーション

GPDiT システムは、次の 3 つの主要なバリアントで構成されます。

  • GPDiT-B (85M パラメーター): 基本的なベンチマーク モデル。UCF-101 で 400k 反復にわたってゼロからトレーニングされ、リソースに制約のある検証やアブレーション実験に適しています。
  • GPDiT-H (2B パラメーター): 大規模バージョン。最初に LAION-Aesthetic 画像データで 200k 反復をウォームアップし、次に混合画像とビデオ データで 200k 反復をトレーニングし、最後に純粋なビデオ データで 150k 反復を微調整します。
  • GPDiT-H-LONG: GPDiT-H に基づいて、可変長 (17 ~ 45 フレーム) ビデオ データを使用して 150k 反復のトレーニングを継続し、長いシーケンスの生成機能を強化します。

技術的な利点

GPDiT の技術的利点は 3 つのレベルに分類でき、それぞれが特定の効率または品質の向上に直接対応します。

フレームレベルの因果的アテンションは KV キャッシュと互換性があります: 従来の双方向アテンションは、長時間ビデオの生成において 2 つの問題に直面しています。将来のフレーム情報の漏洩により時間的一貫性が損なわれること、および推論中に KV キャッシュを使用できないため、フレームの平方数に応じて計算量が増加することです。 GPDiT はフレームレベルの因果的注意を採用しており、ノイズのある各フレームは、過去に生成されたクリーンなフレームとそれ自体にのみ注意を払います。この設計は推論中に KV キャッシュを自然にサポートし、長いシーケンス生成の計算の複雑さを $\mathcal{O}(F^2)$ から $\mathcal{O}(F)$ に軽減します。実験によると、GPDiT はトレーニング長よりも長いビデオを生成する場合に安定した品質を維持しますが、双方向アテンション スキームでは深刻な品質低下が発生します。

軽量因果的注意: 標準的な因果的注意では、トレーニング中にクリーンなフレームとノイズのあるフレームの 2 セットの表現を同時に維持する必要があり、その結果、ビデオ メモリと計算が 2 倍になります。 GPDiT は、ビデオの隣接するフレーム間の大量の空間的冗長性を観察するため、トレーニング中にクリーンなフレーム間のアテンション計算を直接スキップします。この最適化により、生成品質を犠牲にすることなくアテンションの計算が約 50% 削減されます (GPDiT-B-OF と GPDiT-B-OF2​​ の FVD の差はわずか 2 ポイントです: 216 対 214)。

パラメータのない回転時間コーディング (回転ベースのタイム コンディショニング): DiT などの主流の拡散変換器は、adaLN-Zero を使用してタイム ステップ情報を注入します。このモジュールは、モデルの全パラメーターの約 28% を占めます。 GPDiT は、順拡散過程 $x_t = \sqrt{\bar{\alpha}_t} x_0 + \sqrt{1-\bar{\alpha}_t} \epsilon$ を 2D 複素平面回転として再解釈します。

$$R(\theta_t) = \begin{pmatrix} \cos\theta_t & \sin\theta_t \ -\sin\theta_t & \cos\theta_t \end{pmatrix}$$

$\cos\theta_t = \sqrt{\bar{\alpha}_t}$、$\sin\theta_t = \sqrt{1-\bar{\alpha}_t}$ の場合。このモデルは、逆回転を通じて暗黙的に時間情報を注入し、adaLN-Zero の MLP パラメーターを完全に削除し、同等の生成品質を維持しながらパラメーターの数を大幅に削減します。

連続空間自己回帰と離散トークン自動回帰: 既存の自己回帰ビデオ手法 (VideoPoet、OmniTokenizer など) は、VQ-VAE に依存してビデオ フレームを離散トークンに量子化します。このマッピングには、不可逆的な情報損失が伴います。 GPDiT は連続潜在空間で動作し、フレーム予測にクロスエントロピー損失の代わりに拡散損失を使用して、離散化の精度のボトルネックを回避します。この利点は、数ショットのタスクで特に顕著です。GPDiT は追加のアダプターなしでシーケンスのスプライシングを通じて条件生成を完了できますが、離散トークン メソッドでは通常、特殊なマッピング モジュールのトレーニングが必要です。

使い方

GPDiT は現在、学術論文の形式でのみ公開されており、直接使用できるコード、モデルの重み、オンライン デモはありません。使用パスは次のレベルに分かれています。

使い方 群衆に適しています 現在の実現可能性 リソース要件
論文を読む 研究者、アルゴリズムエンジニア ✅ arXiv 全文公開 なし
リファレンス アーキテクチャ設計 ビデオ生成研究者 ✅ この文書には完全な技術的説明が記載されています。なし
GPDiT-Bを再現 コンピューティング能力を備えた学術研究室 ⚠️ 自分で実装する必要があります。公式コードはありません 32× H100 GPU
GPDiT-Hを再現 大規模な研究チーム ⚠️ 自分で実装する必要があります。公式コードはありません 64+ H100 GPU、マルチステージトレーニング
少数サンプルの微調整実験 事前にトレーニングされた重みを使用したチーム ❌ モデルの重量は公開されていません シングルカード GPU
商用統合 エンタープライズ ユーザー ❌ コード/モデルはオープンソースではありません 該当なし

使用上の提案: この方向に従うことを希望するチームの場合は、最初に論文のアーキテクチャ設計 (§4) とアブレーション実験 (§5) を注意深く読み、軽量の因果的注意の実装の詳細と回転時間エンコーディングの数学的導出に焦点を当てることをお勧めします。チームが再現する意図がある場合は、GPDiT-B から開始し、UCF-101 の基本的な FVD インジケーター (論文レポート 214 ~ 216) を検証してから、GPDiT-H に拡張するかどうかを決定できます。

製品の価格設定

GPDiT は学術研究プロジェクトであり、商用製品の価格設定システムはありません。以下は、さまざまな形式の費用の概要です。

プロジェクト 説明
ペーパーアクセス arXiv は永久に無料で、PDF / HTML / TeX のダウンロードをサポートしています。
コードとモデル オープンソースではないため、価格情報はありません
APIサービス 提供されていません
商用ライセンス 未公開 (著者チームまたは機関の技術移転オフィスに連絡する必要があります)
自己トレーニングのコンピューティング電力コスト (控除) GPDiT-B は約 10,000 ~ 20,000 ドル (32× H100、2 ~ 3 日)。 GPDiT-H は約 50,000 ~ 100,000 ドル以上 (64+ H100、1 ~ 2 週間)

商用ビデオ生成ソリューションとのコスト比較:

計画 一般的な月額費用 該当するシナリオ 生産品質
GPDiT(自己訓練・減点) 10,000 ~ 100,000 ドル (1 回限り) 学術研究、建築探査 自己申告論文 MSRVTT FVD 64
滑走路 Gen-3 0.05 ~ 0.10 ドル/秒 コンテンツ制作、広告制作 商用グレードの画質と一貫性
ピカのサブスクリプション 月額 10 ~ 50 ドル 個人クリエイター、ソーシャルメディアビデオ 迅速な生産、適度な制御
安定したビデオの拡散 (オープンソース) セルフホスト型 GPU のコスト 自己展開シナリオ オープンソース コミュニティによる継続的な最適化

現段階での GPDiT のコストパフォーマンスは、商用ソリューションに比べてはるかに低いです。その価値提案は「既存のビデオ生成ツールを置き換える」ことではなく、次世代アーキテクチャの技術検証と学術的参考資料を提供することです。

アプリケーションのシナリオ

GPDiT の技術的特性により、GPDiT は、すぐに使用できる運用環境よりも、研究およびエンジニアリングの探索シナリオにより適していることがわかります。

  • 自己回帰拡散融合アーキテクチャに関する研究: GPDiT は、研究者が新しい注意バリアント、時間的条件付けメカニズム、またはマルチモーダル拡張を探索できる、完全なフレームレベルの自己回帰拡散フレームワークを提供します。その軽量アーキテクチャはアブレーション実験に特に適しています。85M パラメータ GPDiT-B により、新しいアイデアの迅速な反復検証が可能になります。

  • 長いシーケンスのビデオ生成に関する研究: GPDiT の因果的注意と KV キャッシュのサポートにより、長いシーケンスの生成の計算コストが制御可能になります。この論文では、17 ~ 45 フレーム範囲で GPDiT-H-LONG の安定性を検証しています。数十秒の連続ビデオを必要とする研究タスク (自動運転シーンの予測、モーション シミュレーションなど) に対して、GPDiT のアーキテクチャは、固定長の拡散モデルよりも自然なソリューションを提供します。

  • 統合された生成理解モデルの探索: GPDiT の実験は、生成の品質と表現能力の間に正の相関があることを示しています。これは、「1 つのモデルが生成と理解の両方を行う」というルートが実現可能であることを意味します。視覚的な基盤モデルを構築したいチームのために、GPDiT は生成側からの統一されたトレーニング パラダイム リファレンスを提供します。

  • サンプル数の少ないビデオ タスクのカスタマイズ: 特定の分野 (医療画像変換、産業検査の視覚化など) に対して、GPDiT のサンプル数が少ない移行機能は、非常に少量の注釈付きデータで迅速に適応できることを意味します。 20 ショット + 500 反復というしきい値は、専用モデルを最初からトレーニングするよりもはるかに低いです。

シナリオには適していません:

  • すぐに使えるビデオ コンテンツ制作: コード、モデル、デモはありません。現在、コンテンツ作成者は GPDiT を完全に利用できません。
  • リアルタイム対話型生成: 拡散モデルの反復ノイズ除去プロセスは当然ながらリアルタイム シナリオには適しておらず、論文では GPDiT の推論効率はリアルタイムで評価されていません。
  • 高精度のタイミング制御を必要とする産業グレードのビデオ生成: GPDiT は学術論文レベルのモデルであるため、制御性や一貫性に関してエンジニアリング レベルの保証はありません。

該当する人

  • ビデオ生成分野の研究者: 拡散モデルと自己回帰モデルの相互融合に懸念がある研究者は、拡張または比較のためのベースライン フレームワークとして GPDiT を使用できます。さまざまなタスクにおける OF と OF2 の注意バリアントのパフォーマンスの違いを理解するには、論文のアブレーション実験 (§5.2-5.4) から始めることをお勧めします。

  • コンピューター ビジョン アルゴリズム エンジニア: ビデオ生成の最先端技術を追跡したいエンジニア。軽量の因果的注意の実装パスに焦点を当て、論文 (§4) の技術的ソリューションを集中的に読むのに適しています。この設計の推論効率の向上には、工学的な実装価値があります。

  • マルチモーダル基本モデル チーム: 生成と理解の統合を模索しているチーム。 「生成能力と表現能力には正の相関がある」という GPDiT の発見 (図 5c) はさらなる研究に値します。この現象が他のアーキテクチャでも再現されるかどうかを独自のフレームワークで検証できます。

  • 学術研究室 (修士課程および博士課程の学生を含む): GPDiT-B の 85M パラメータ スケールは、学生研究室にとって比較的使いやすいものです。チームに 4 ~ 8 個の GPU がある場合は、拡散トランスフォーマーの方向に向けた学習プロジェクトとして、UCF-101 でのコア実験の再現を試みることができます。

群衆を思いとどまらせる:

  • コンテンツ クリエイター/セルフメディア オペレーター: 現在、GPDiT には利用可能な入り口がありません。 Runway、Pika、Kling などの商用ツールを利用することをお勧めします。
  • 1 ~ 2 週間以内にビデオ生成機能を提供する必要がある製品チーム: GPDiT の返品期間は月単位です。
  • ディープラーニングの経験のない技術的意思決定者: GPDiT を評価するには、拡散モデルと自己回帰モデルの基礎となる原理を理解する必要があり、調達評価には適していません。

概要と展望

GPDiT は、技術ロードマップに有意義な貢献を行いました。フレームレベルの自己回帰予測と連続潜在空間での拡散生成を統合し、軽量の因果的注意と回転時間エンコーディングの 2 つの実用的な最適化を提案しました。 MSRVTT と UCF-101 では、GPDiT-H は当時の最適または最適に近いレベルに達し、GPDiT-B は 85M パラメータを持つより大きなモデルで競争力のある結果を達成し、アーキテクチャ設計の効率上の利点を証明しました。

論文の考察セクションから、著者チームが現在の研究の限界を認識していることがわかります。実験規模はコンピューティング能力によって制限され、モデルはビデオモダリティに限定され、言語などのマルチモーダル拡張はまだ検討されていません。この論文の VQA 精度は、ActivityNet-QA では 28.2% (Video-ChatGPT では 35.2%) であり、GPDiT の表現学習機能にはまだ改善の余地があることも示しています。

経過観察ポイント:

  1. コード オープン ソース: GPDiT の完全な再現は、公式コード リリースに依存しています。論文が CVPR/ICCV などのトップカンファレンスに採択されれば、コードがオープンソースになる可能性が大幅に高まります。 USTC または StepFun の GitHub アカウントをフォローすることをお勧めします。
  2. 大規模なスケーリング: Paper 2B パラメータの実験規模は、2025 年の大規模モデルのコンテキストでは中程度です。その後 7B ~ 13B パラメータに拡張すると、アーキテクチャ上の利点がより明らかになる可能性があります。
  3. マルチモーダル拡張機能: GPDiT の作成者は、言語などのマルチモーダル入力の統合モデリングを検討する計画を明示しています。これによって「映像生成モデル」から「ビジュアルベーシックモデル」に進化できるかどうかが決まる。
  4. Step-Video シリーズとのコラボレーション: Step Star は Step-Video-T2V と Step-Video-TI2V の両方の発行元であり、GPDiT の技術蓄積は Step-Video の製品ラインに統合される可能性があります。

調達/採用リスク評価: GPDiT は、現段階では調達対象または製品統合の依存関係としては適切ではありません。学術チームは、これを重要な参考資料として研究ベースラインに組み込むことができます。業界チームは、テクノロジーの採用を評価する前に、コードがオープンソース化され、コミュニティで検証されるまで待つことを推奨しています。 GPDiT に基づく商業化計画は、まず FTO 分析を完了して、USTC と StepFun の知的財産の境界を確認する必要があります。チームの目標が「2026 年に高品質のビデオ生成を使用する」ことのみである場合は、商用 API (Runway、Pika、Kling、Sora) または成熟した普及オープン ソース ソリューション (Stable Video Diffusion、VideoCrafter) の評価を優先し、次世代アーキテクチャの技術的予備として GPDiT を使用することをお勧めします。

関連ツール: runway、pika

バージョン情報

  • GPDiT-H-LONG :arXiv v5 アップデートは、GPDiT-H-LONG バリアントを提案し、17 ~ 45 フレームの可変長ビデオ生成をサポートし、MSRVTT では FVD が 64 に削減されます。
  • GPDiT 初版 :arXiv への最初の提出では、自己回帰拡散 Transformer インフラストラクチャと GPDiT-B/GPDiT-H の 2 つの仕様が提案されています。
  • GPDiT-H アップデート :実験データとアブレーション研究を補足して、ビデオ生成と表現学習における GPDiT-H の評価を向上させます。
  • GPDiT-H-LONG :GPDiT-H-LONG バリアントと長時間ビデオ生成の評価を追加し、最終バージョンをリリースしました。公式の正確な日付はまだありません。

ユーザーレビュー

  • レビューを読み込み中...