GPDi Gratuit

-

GPDiT (Generative Pre-trained Autoregressive Diffusion Transformer) est un modèle de génération vidéo de diffusion autorégressive proposé conjointement par l'Université des sciences et technologies de Chine et Step Star. Il effectue une prédiction autorégressive au niveau de l'image dans un espace latent continu et intègre les capacités de génération de haute qualité du modèle de diffusion avec les avantages de modélisation temporelle du modèle autorégressif. Il a atteint le niveau optimal à l’époque sur les benchmarks MSRVTT et UCF-101.

GPDi Interface du produit

Revue complète du #GPDiT

Paramètres et statistiques de base

GPDiT (Generative Pre-trained Autoregressive Diffusion Transformer) a été proposé conjointement par l'Université des sciences et technologies de Chine et Step Star. Il vise à unifier les capacités de génération de haute qualité des modèles de diffusion et les capacités de modélisation de la dépendance temporelle des modèles autorégressifs dans le même cadre. Contrairement aux routes de prédiction de jetons discrets, GPDiT effectue des prédictions autorégressives image par image dans un espace latent continu, prédisant une image à la fois et optimisant par perte de diffusion, permettant au modèle de capturer naturellement la dynamique de mouvement et la cohérence sémantique entre les images.

Projet Spécifications
Nom complet Transformateur de diffusion autorégressif génératif pré-entraîné
Agence d'édition Université des sciences et technologies de Chine (USTC), StepFun
ID arXiv 2505.07344 (v5, 2025-10-08)
Domaine cs.CV (Vision par ordinateur et reconnaissance de formes), cs.AI (Intelligence artificielle)
Taille du modèle GPDiT-B (paramètres 85M), GPDiT-H (paramètres 2B)
Feuille de route technique Transformateur de diffusion autorégressive par trame (diffusion autorégressive par trame)
Innovation de base Prédiction continue de la trame spatiale latente + attention causale légère + codage temporel rotationnel sans paramètre
Données de formation UCF-101, MSR-VTT, LAION-Aesthetic, ensemble de données vidéo internes
Formulaire public Papier arXiv (le code et le modèle ne sont pas open source)
Licence Open Source Licence de distribution non exclusive arXiv

Comparaison des spécifications du modèle : GPDiT-B suit la configuration DiT-B, avec 12 couches de Transformer, 768 dimensions cachées et 12 têtes d'attention, et une quantité de paramètres de seulement 85M ; GPDiT-H est étendu à 24 couches, 2816 dimensions cachées, 22 têtes d'attention et une quantité de paramètres de 2B. Cette conception à double voie permet aux chercheurs d'utiliser de petits modèles pour vérifier des idées dans des scénarios de ressources limitées, et lorsque la puissance de calcul est suffisante, de passer à une version à grande échelle pour rechercher une qualité de génération optimale.

Chiffres clés de performance : GPDiT-H-LONG atteint FVD 64 et FID 7.4 sur la génération d'échantillon zéro MSRVTT, dépassant SnapVideo (FVD 110) d'environ 42 % au cours de la même période ; sur UCF-101, il atteint FVD 218 et IS 66,6, et l'indicateur IS est environ 58 % plus élevé que PixelDance (42,1). GPDiT-B (80 M de paramètres) a atteint le FVD 214 sur la formation UCF-101, et l'écart avec le FAR (FVD 194) de 130 M de paramètres est inférieur à 10 %, ce qui illustre l'avantage d'efficacité de l'architecture légère.

Vérification de la publicité : Les résultats quantitatifs de l'article sur MSRVTT et UCF-101 peuvent être vérifiés, et les avantages par rapport aux méthodes de la même période sont clairs. Cependant, le code et les poids du modèle ne sont pas open source et aucune reproduction indépendante par un tiers n'est encore apparue. Toutes les valeurs sont auto-déclarées par le journal.

Reconnaissance des utilisateurs et du marché

GPDiT est actuellement au stade d'un article académique, et la reconnaissance du marché se reflète dans les citations universitaires et l'attention de la communauté. Il n’existe pas encore de données sur la commercialisation ou l’adoption par les entreprises.

Attention de la communauté universitaire : l'article a été soumis en mai 2025 jusqu'à la version finale en octobre et a connu 5 itérations de version sur arXiv, indiquant que l'équipe d'auteurs continue d'améliorer les expériences et les démonstrations. Le journal apparaît dans la tendance Hugging Face Daily Papers, gagnant ainsi une certaine visibilité auprès de la communauté.

Approbation institutionnelle : L'Université des sciences et technologies de Chine (USTC) a une profonde accumulation dans les domaines du CV et de l'IA, et StepFun est un acteur important dans le domaine de la génération vidéo nationale (elle a lancé la série Step-Video). La publication conjointe des deux institutions confère à l'article une crédibilité au niveau de l'intégration industrie-université-recherche.

Citation et reproduction : à l'heure actuelle, il n'existe aucun rapport public de reproduction tiers ni référentiel de code pour l'article. Il s'agit d'une cadence normale pour un article universitaire - la plupart des articles de conférence CV les plus importants ne sont répliqués par la communauté que 3 à 6 mois après leur publication. Il est recommandé de faire attention à savoir si le code officiel ou tiers sera open source à l'avenir.

Position de référence de l'industrie : l'échelle de paramètres 2B de GPDiT est du même ordre de grandeur que SnapVideo (3,9B) et PixelDance (1,5B), mais ses performances de FVD 64 sur MSRVTT étaient au premier échelon à l'époque. Cependant, en raison du manque de démo et d'API, sa perception du côté C est bien inférieure à celle des produits commerciaux tels que Runway et Pika.

Avantage de coût

GPDiT existe actuellement entièrement sous forme d'articles, avec une structure de coûts très simple : les articles sont disponibles gratuitement, mais un investissement important en puissance de calcul est nécessaire pour reproduire les expériences.

Dimensions Informations publiques
Lecture de papier arXiv est gratuit et ouvert au public, prend en charge le code source PDF/HTML/TeX
Code et modèle Non open source et ne peut pas être téléchargé et utilisé
Service API Non fourni
Coût de récurrence GPDiT-B (déduction) 32 GPU H100 × 400 000 itérations × environ 2-3 jours
Coût de récurrence GPDiT-H (déduction) Formation en plusieurs étapes : 200 000 + 200 000 + 150 000 itérations, environ 1 à 2 semaines au total × 64+ H100
Coût de réglage fin pour quelques échantillons (déduction) 500 itérations × lot 4 × peuvent être complétées avec une seule carte

La vérité gratuite : Il est vrai que la lecture des articles est gratuite, mais les coûts cachés de « l'utilisation » sont extrêmement élevés. La formation de GPDiT-B utilise 32 GPU H100 pour 400 000 itérations. Calculé selon le fournisseur de cloud H100, soit environ 3 à 4 dollars/heure de carte, le coût en puissance de calcul d'une seule reproduction complète est de l'ordre de 10 000 à 20 000 dollars. La formation en plusieurs étapes du GPDiT-H nécessite une puissance de calcul plus élevée, ce qui n'est pas abordable pour les laboratoires universitaires généraux.

Comparaison implicite des coûts avec les API commerciales : si l'objectif est simplement de « générer des vidéos », l'utilisation directe de Runway Gen-3 (~0,05-0,10 $/seconde) ou de Pika (abonnement 10-50 $/mois) est bien inférieure au coût marginal de l'auto-formation GPDiT au stade actuel. La valeur de GPDiT réside dans l’exploration technologique et l’innovation architecturale, plutôt que dans les avantages financiers immédiats.

Risque de conformité : cet article utilise la licence de distribution non exclusive arXiv, qui autorise les citations scientifiques et les recherches dérivées. Cependant, si quelqu'un forme à l'avenir un modèle commercial basé sur la solution de thèse, il doit prêter attention aux brevets ou aux droits de propriété intellectuelle que StepFun et l'USTC peuvent détenir, et une analyse FTO (liberté de mise en œuvre) doit être effectuée avant utilisation commerciale.

Fonctions principales

Les capacités de GPDiT se concentrent sur trois niveaux : génération vidéo, apprentissage de la représentation vidéo et transfert multitâche de quelques échantillons :

  • Génération vidéo autorégressive au niveau de l'image : prédisez les images futures image par image dans un espace latent continu, et chaque image est générée en fonction de toutes les images générées précédemment. Cette conception dépasse les limites de la génération vidéo de longueur fixe et peut théoriquement générer des séquences vidéo de n'importe quelle longueur. Par rapport au modèle autorégressif à jetons discrets, la prédiction spatiale continue évite le problème de perte d'informations du tokenizer VQ.

  • Deux variantes d'attention causale (OF / OF2) : la variante OF (Only Former) élimine les calculs d'attention entre les images propres pendant l'entraînement, en utilisant la redondance spatiale entre les images vidéo pour réduire la quantité de calcul d'environ 50 % ; La variante OF2 conserve l'interaction entre des images propres en échange de capacités de représentation plus fortes. Les deux sont naturellement compatibles avec l’accélération du cache KV lors de l’inférence, et l’efficacité de la génération de séquences longues est nettement supérieure à celle du schéma d’attention bidirectionnel.

  • Encodage du temps de rotation sans paramètre : réinterprètez le processus de diffusion vers l'avant comme une opération de rotation sur le plan complexe, en remplaçant le module adaLN-Zero traditionnel par l'angle de rotation $\theta_t$. Cette conception supprime le sous-module de condition temporelle, qui représente environ 28 % des paramètres du modèle DiT, et présente des avantages évidents en termes d'efficacité des paramètres.

  • Transfert multitâche de quelques échantillons : le modèle GPDiT pré-entraîné n'a besoin que de 20 échantillons vidéo (20 prises de vue) et de 500 itérations de réglage fin pour être transféré vers une variété de tâches en aval telles que le transfert de style, la détection des contours, l'estimation de la profondeur, la détection humaine, la colorisation de l'image, etc. Cette capacité bénéficie du mécanisme d'épissage des conditions naturelles du cadre autorégressif continu sans avoir besoin de modules d'adaptation supplémentaires.

  • Apprentissage de la représentation vidéo : les fonctionnalités de couche intermédiaire de GPDiT peuvent être directement utilisées pour les tâches de compréhension vidéo. Des expériences de détection linéaire montrent que les fonctionnalités GPDiT-H ont une qualité de représentation considérable sur la classification UCF-101 et atteignent une précision de 28,2 % sur ActivityNet-QA après avoir remplacé l'encodeur visuel CLIP dans le framework Video-ChatGPT.

Point de vue d'expert : la conception fonctionnelle de GPDiT a une « synergie cachée » : son architecture autorégressive prend naturellement en charge l'unification de « génération + compréhension ». Dans les solutions traditionnelles, les modèles de génération vidéo (tels que Stable Video Diffusion) et les modèles de compréhension vidéo (tels que VideoMAE) sont deux architectures indépendantes. Les poids pré-entraînés de GPDiT sur la tâche de génération peuvent être directement utilisés comme extracteurs de fonctionnalités pour comprendre les tâches, et l'amélioration de la qualité de la génération est positivement corrélée à l'amélioration des capacités de représentation (la figure 5c de l'article vérifie l'amélioration simultanée du FVD et de la précision de la classification), ce qui signifie que le même modèle peut servir à la fois aux scénarios de création de contenu vidéo et d'analyse vidéo.

Evolution du modèle et de la version

Contexte de la version

GPDiT a connu 5 itérations de version sur arXiv, et il a fallu environ 5 mois entre la première version et la version finale :

Version Dates Changements fondamentaux
v1 2025-05-12 Première soumission, proposant l'architecture GPDiT-B (85M) et GPDiT-H (2B), rapportant les résultats de base sur UCF-101 et MSRVTT
v2 2025-05-15 Paramètres expérimentaux révisés et recherche sur l'ablation complétée
v3 2025-05-19 Améliorer les travaux associés et les descriptions expérimentales
v4 2025-05-22 Expérience de détection linéaire supplémentaire de l'apprentissage de la représentation vidéo et autres résultats d'échantillons
v5 2025-10-08 Version finale, ajoutant la variante GPDiT-H-LONG, prenant en charge la génération de longueur variable de 17 à 45 images, FVD réduit à 64 sur MSRVTT

Variations du modèle

Le système GPDiT se compose de trois variantes principales :

  • GPDiT-B (85 millions de paramètres) : modèle de référence de base, formé à partir de zéro sur UCF-101 pour 400 000 itérations, adapté aux expériences de vérification et d'ablation avec des ressources limitées.
  • GPDiT-H (paramètres 2B) : version à grande échelle, échauffez d'abord 200 000 itérations sur les données d'image LAION-Aesthetic, puis entraînez 200 000 itérations sur des données image-vidéo mixtes, et enfin affinez 150 000 itérations sur des données vidéo pures.
  • GPDiT-H-LONG : basé sur GPDiT-H, utilisez des données vidéo de longueur variable (17 à 45 images) pour continuer l'entraînement pendant 150 000 itérations afin d'améliorer les capacités de génération de séquences longues.

Avantages techniques

Les avantages techniques de GPDiT peuvent être décomposés en trois niveaux, chacun correspondant directement à des gains spécifiques d’efficacité ou de qualité :

L'attention causale au niveau de l'image est compatible avec le cache KV : l'attention bidirectionnelle traditionnelle est confrontée à deux problèmes dans la génération de vidéos longues : la fuite d'informations sur les images futures détruit la cohérence temporelle, et l'incapacité d'utiliser le cache KV pendant l'inférence entraîne une augmentation de la quantité de calcul avec le nombre carré d'images. GPDiT adopte une attention causale au niveau de l'image, et chaque image bruyante ne prête attention qu'aux images propres qui ont été générées dans le passé et à elle-même. Cette conception prend naturellement en charge KV Cache pendant l'inférence, réduisant ainsi la complexité de calcul de la génération de séquences longues de $\mathcal{O}(F^2)$ à $\mathcal{O}(F)$. Les expériences montrent que GPDiT maintient une qualité stable lors de la génération de vidéos plus longues que la durée de l'entraînement, tandis que les schémas d'attention bidirectionnels subissent une grave dégradation.

Attention causale légère : l'attention causale standard doit maintenir deux ensembles de représentations d'images propres et d'images bruyantes en même temps pendant l'entraînement, ce qui entraîne un doublement de la mémoire vidéo et des calculs. GPDiT observe une grande quantité de redondance spatiale entre les images adjacentes de la vidéo et ignore donc directement les calculs d'attention entre les images propres pendant la formation. Cette optimisation réduit le calcul de l'attention d'environ 50 % sans sacrifier la qualité de la génération (la différence FVD entre GPDiT-B-OF et GPDiT-B-OF2 ​​​​n'est que de 2 points : 216 contre 214).

Codage temporel de rotation sans paramètre (conditionnement temporel basé sur la rotation) : les transformateurs de diffusion grand public tels que DiT utilisent adaLN-Zero pour injecter des informations sur le pas de temps. Ce module représente environ 28% du total des paramètres du modèle. GPDiT réinterprète le processus de diffusion vers l'avant $x_t = \sqrt{\bar{\alpha}_t} x_0 + \sqrt{1-\bar{\alpha}_t} \epsilon$ comme une rotation plane complexe 2D :

$$R(\theta_t) = \begin{pmatrix} \cos\theta_t & \sin\theta_t \ -\sin\theta_t & \cos\theta_t \end{pmatrix}$$

Où $\cos\theta_t = \sqrt{\bar{\alpha}_t}$, $\sin\theta_t = \sqrt{1-\bar{\alpha}_t}$. Le modèle injecte implicitement des informations temporelles par rotation inverse, supprimant complètement les paramètres MLP d'adaLN-Zero, réduisant considérablement le nombre de paramètres tout en conservant une qualité de génération comparable.

Autorégression spatiale continue vs autorégression de jetons discrets : les méthodes vidéo autorégressives existantes (telles que VideoPoet, OmniTokenizer) s'appuient sur VQ-VAE pour quantifier les images vidéo en jetons discrets. Cette cartographie implique une perte d’informations irréversible. GPDiT fonctionne dans un espace latent continu et utilise la perte de diffusion au lieu de la perte d'entropie croisée pour la prédiction de trame, évitant ainsi le goulot d'étranglement de précision de la discrétisation. Cet avantage est particulièrement évident sur les tâches en quelques étapes : GPDiT peut réaliser la génération de conditions via l'épissage de séquences sans adaptateurs supplémentaires, tandis que les méthodes de jetons discrets nécessitent généralement la formation de modules de mappage spécialisés.

Comment utiliser

GPDiT n'est actuellement accessible au public que sous la forme d'articles universitaires, sans code, poids de modèle ou démos en ligne directement utilisables. Le chemin d'utilisation est divisé en les niveaux suivants :

Comment utiliser Convient à la foule Faisabilité actuelle Besoins en ressources
Lire des articles Chercheurs, ingénieurs algorithmiques ✅ arXiv texte intégral public Aucun
Conception d'architecture de référence Chercheur en génération vidéo ✅ Le document fournit une description technique complète Aucun
Reproduire GPDiT-B Laboratoire académique doté d'une puissance de calcul ⚠️ Doit être implémenté par vous-même, pas de code officiel GPU 32 × H100
Reproduire GPDiT-H Grande équipe de recherche ⚠️ Doit être implémenté par vous-même, pas de code officiel 64+ GPU H100, formation en plusieurs étapes
Expérience de réglage fin sur quelques échantillons Équipe avec des poids pré-entraînés ❌ Les poids des modèles ne sont pas divulgués GPU à carte unique
Intégration commerciale Utilisateurs d'entreprise ❌ Code/modèle non open source N/A

Suggestions d'utilisation : Pour les équipes qui souhaitent suivre cette direction, il est recommandé de lire d'abord attentivement la conception architecturale (§4) et les expériences d'ablation (§5) de l'article, en se concentrant sur les détails de mise en œuvre de l'attention causale légère et la dérivation mathématique du codage du temps de rotation. Si l'équipe a l'intention de reproduire, elle peut commencer par GPDiT-B, vérifier les indicateurs FVD de base sur UCF-101 (rapport papier 214-216), puis décider d'étendre ou non à GPDiT-H.

Prix des produits

GPDiT est un projet de recherche académique et ne dispose pas de système de tarification des produits commerciaux. Voici un aperçu des coûts des différentes formes :

Projet Descriptif
Accès papier arXiv est gratuit en permanence et prend en charge le téléchargement PDF/HTML/TeX
Codes et modèles Pas open source, aucune information sur les prix
Service API Non fourni
Licence commerciale Non publié (besoin de contacter l'équipe d'auteurs ou le bureau institutionnel de transfert de technologie)
Coût de la puissance de calcul de l'auto-formation (déduction) GPDiT-B coûte environ 10 000 à 20 000 $ (32 × H100, 2-3 jours) ; GPDiT-H coûte environ 50 000 à 100 000 $+ (64+ H100, 1 à 2 semaines)

Comparaison des coûts avec les solutions commerciales de génération de vidéo :

Planifier Coût mensuel typique Scénarios applicables Qualité de fabrication
GPDiT (autoformation, déduction) 10 000 à 100 000 $ (une fois) Recherche académique, exploration architecturale Article autodéclaré MSRVTT FVD 64
Piste Gen-3 0,05-0,10 $/seconde Création de contenu, production publicitaire Qualité et cohérence d'image de qualité commerciale
Abonnement Pika 10-50$/mois Créateur personnel, vidéo sur les réseaux sociaux Production rapide, contrôle modéré
Diffusion vidéo stable (open source) Coût du GPU auto-hébergé Scénario d'auto-déploiement Optimisation continue par la communauté open source

Le rapport coût/performance du GPDiT au stade actuel est bien inférieur à celui des solutions commerciales. Sa proposition de valeur n'est pas de « remplacer les outils de génération vidéo existants », mais de fournir une vérification technique et une référence académique pour l'architecture de nouvelle génération.

Scénarios d'application

Les caractéristiques techniques de GPDiT déterminent qu’il est plus adapté aux scénarios d’exploration de recherche et d’ingénierie qu’aux environnements de production prêts à l’emploi :

  • Recherche sur l'architecture de fusion de diffusion autorégressive : GPDiT fournit un cadre complet de diffusion autorégressive au niveau du cadre, sur lequel les chercheurs peuvent explorer de nouvelles variantes d'attention, des mécanismes de conditionnement temporel ou des extensions multimodales. Son architecture légère est particulièrement adaptée aux expériences d'ablation : le paramètre 85M GPDiT-B permet une vérification itérative rapide de nouvelles idées.

  • Recherche sur la génération de vidéos à séquence longue : l'attention causale de GPDiT et la prise en charge du cache KV rendent le coût de calcul de la génération de séquences longues contrôlable. L'article vérifie la stabilité de GPDiT-H-LONG dans la plage d'images 17-45. Pour les tâches de recherche nécessitant des dizaines de secondes de vidéo continue (telles que la prédiction de scènes de conduite autonome, la simulation de mouvement), l'architecture de GPDiT offre une solution plus naturelle que les modèles de diffusion de longueur fixe.

  • Exploration unifiée du modèle de compréhension de la génération : les expériences de GPDiT montrent qu'il existe une corrélation positive entre la qualité de la génération et la capacité de représentation, ce qui signifie que la voie « un modèle unique effectuant à la fois la génération et la compréhension » est réalisable. Pour les équipes qui souhaitent créer un modèle de base visuel, GPDiT fournit une référence de paradigme de formation unifiée du côté de la génération.

  • Personnalisation des tâches vidéo avec moins d'échantillons : pour des domaines spécifiques (tels que la conversion d'images médicales, la visualisation d'inspection industrielle), la capacité de migration de quelques échantillons de GPDiT signifie qu'il peut être rapidement adapté avec une très petite quantité de données annotées. Le seuil de 20 tirs + 500 itérations est bien inférieur à la formation d'un modèle dédié à partir de zéro.

Ne convient pas aux scénarios :

  • Production de contenus vidéo prêts à l'emploi : Pas de code, pas de modèle, pas de démo, GPDiT est pour l'instant totalement indisponible pour les créateurs de contenus.
  • Génération interactive en temps réel : Le processus de débruitage itératif du modèle de diffusion n'est naturellement pas adapté aux scénarios en temps réel, et l'efficacité d'inférence de GPDiT n'est pas évaluée en temps réel dans l'article.
  • Génération vidéo de qualité industrielle qui nécessite un contrôle temporel de haute précision : en tant que modèle académique au niveau papier, GPDiT n'a pas de garanties de niveau technique en termes de contrôlabilité et de cohérence.

Personnes concernées

  • Chercheurs dans le domaine de la génération vidéo : les chercheurs préoccupés par la fusion croisée des modèles de diffusion et des modèles autorégressifs peuvent utiliser GPDiT comme cadre de base pour l'expansion ou la comparaison. Il est recommandé de commencer par l'expérience d'ablation (§5.2-5.4) de l'article pour comprendre les différences de performances entre les variantes d'attention OF et OF2 sur différentes tâches.

  • Ingénieur d'algorithmes de vision par ordinateur : Ingénieurs qui souhaitent suivre la technologie de pointe de génération vidéo, adaptée à une lecture intensive de la solution technique de l'article (§4), en se concentrant sur le chemin de mise en œuvre de l'attention causale légère - les gains en efficacité de raisonnement de cette conception ont une valeur de mise en œuvre technique.

  • Équipe modèle de base multimodale : une équipe qui explore l'unification de la génération et de la compréhension. La découverte du GPDiT selon laquelle « la capacité de génération et la capacité de représentation sont positivement liées » (Figure 5c) mérite une étude plus approfondie. Vous pouvez vérifier dans votre propre framework si ce phénomène se reproduit dans d'autres architectures.

  • Laboratoires académiques (y compris les étudiants à la maîtrise et au doctorat) : L'échelle de paramètres 85M du GPDiT-B est relativement conviviale pour les laboratoires étudiants. Si l'équipe dispose de 4 à 8 GPU, elle peut essayer de reproduire l'expérience de base sur UCF-101 en tant que projet d'apprentissage dans le sens de la diffusion de Transformer.

Dissuader la foule :

  • Créateur de contenu/Opérateur auto-média : GPDiT n'a actuellement aucune entrée disponible. Il est recommandé de se tourner vers des outils commerciaux comme Runway, Pika ou Kling.
  • Équipes produit qui doivent fournir des fonctionnalités de génération vidéo dans un délai d'une à deux semaines : la période de retour de GPDiT se mesure en mois.
  • Décideurs techniques sans expérience en apprentissage profond : l'évaluation du GPDiT nécessite de comprendre les principes sous-jacents des modèles de diffusion et des modèles autorégressifs, et ne convient pas à l'évaluation des achats.

Résumé et Outlook

GPDiT a apporté une contribution significative à la feuille de route technique en unifiant la prédiction autorégressive au niveau de la trame et la génération de diffusion dans un espace latent continu, et en proposant deux optimisations pratiques de l'attention causale légère et du codage du temps de rotation. Sur MSRVTT et UCF-101, GPDiT-H a atteint le niveau optimal ou presque optimal à l'époque, et GPDiT-B a obtenu des résultats compétitifs avec des modèles plus grands avec 85M de paramètres, prouvant l'avantage d'efficacité de la conception architecturale.

Il ressort de la section de discussion de l'article que l'équipe d'auteurs a réalisé les limites du travail actuel : l'échelle expérimentale est limitée par la puissance de calcul, le modèle est limité à la modalité vidéo et les extensions multimodales telles que le langage doivent encore être explorées. La précision VQA du document de 28,2 % sur ActivityNet-QA (contre 35,2 % sur Video-ChatGPT) montre également qu'il y a encore place à l'amélioration des capacités d'apprentissage des représentations de GPDiT.

Points d'observation de suivi :

  1. Code open source : La reproduction complète de GPDiT repose sur la version officielle du code. Si l'article est accepté par les principales conférences telles que CVPR/ICCV, la probabilité que le code soit open source augmentera considérablement. Il est recommandé de suivre les comptes GitHub de l'USTC ou StepFun.
  2. Échelle plus grande : L'échelle expérimentale des paramètres du papier 2B est moyenne dans le contexte des grands modèles en 2025. S'ils sont ensuite étendus aux paramètres 7B-13B, les avantages architecturaux pourraient devenir plus évidents.
  3. Extensions multimodales : les auteurs de GPDiT déclarent explicitement leur intention d'explorer la modélisation unifiée des entrées multimodales telles que le langage. Cela déterminera s’il peut évoluer d’un « modèle de génération vidéo » à un « modèle visuel de base ».
  4. Collaboration avec la série Step-Video : Step Star est l'éditeur de Step-Video-T2V et Step-Video-TI2V, et l'accumulation technologique de GPDiT peut être intégrée dans la gamme de produits Step-Video.

Évaluation des risques d'approvisionnement/d'adoption : GPDiT ne convient pas comme cible d'approvisionnement ou comme dépendance d'intégration de produit à ce stade. Les équipes universitaires peuvent l’intégrer dans la base de recherche en tant que référence importante ; Les équipes industrielles recommandent d'attendre que le code soit open source et vérifié par la communauté avant d'évaluer l'adoption de la technologie. Tout plan de commercialisation basé sur GPDiT doit d'abord effectuer une analyse FTO pour confirmer les limites de propriété intellectuelle de l'USTC et de StepFun. Si l'objectif de l'équipe est uniquement « d'utiliser la génération vidéo de haute qualité en 2026 », il est recommandé de prioriser l'évaluation des API commerciales (Runway, Pika, Kling, Sora) ou des solutions open source de diffusion matures (Stable Video Diffusion, VideoCrafter), et d'utiliser GPDiT comme réserve technique pour l'architecture de nouvelle génération.

Outils associés : runway, pika

Informations de version

  • GPDiT-H-LONG :La mise à jour arXiv v5 propose la variante GPDiT-H-LONG, prend en charge la génération vidéo de longueur variable de 17 à 45 images et le FVD est réduit à 64 sur MSRVTT.
  • GPDiT Première édition :La première soumission à arXiv propose deux spécifications : l'infrastructure Transformer à diffusion autorégressive et GPDiT-B/GPDiT-H.
  • Mise à jour GPDiT-H :Complétez les données expérimentales et les études d’ablation pour améliorer l’évaluation du GPDiT-H dans la génération vidéo et l’apprentissage de la représentation.
  • GPDiT-H-LONG :Ajout de la variante GPDiT-H-LONG et de l'évaluation de la génération vidéo longue, version finale publiée. Il n’y a pas encore de date officielle précise.

Avis des utilisateurs

  • Chargement des avis...