GPDiT
免费
GPDiT(Generative Pre-trained Autoregressive Diffusion Transformer)是中国科学技术大学与阶跃星辰联合提出的自回归扩散视频生成模型,在连续潜在空间中进行帧级自回归预测,融合扩散模型的高质量生成能力与自回归模型的时序建模优势,在 MSRVTT 和 UCF-101 基准上达到当时最优水平。
GPDiT 的完整评测
核心参数与统计
GPDiT(Generative Pre-trained Autoregressive Diffusion Transformer)由中国科学技术大学与阶跃星辰联合提出,旨在将扩散模型的高质量生成能力与自回归模型的时序依赖建模能力统一在同一框架内。与离散 token 预测路线不同,GPDiT 在连续潜在空间中逐帧进行自回归预测,每次预测一帧并通过扩散损失优化,使模型能自然捕获帧间运动动态与语义一致性。
| 项目 | 规格 |
|---|---|
| 全称 | Generative Pre-trained Autoregressive Diffusion Transformer |
| 发布机构 | 中国科学技术大学(USTC)、阶跃星辰(StepFun) |
| arXiv ID | 2505.07344(v5,2025-10-08) |
| 学科领域 | cs.CV(计算机视觉与模式识别)、cs.AI(人工智能) |
| 模型规模 | GPDiT-B(85M 参数)、GPDiT-H(2B 参数) |
| 技术路线 | 帧级自回归扩散 Transformer(Frame-wise Autoregressive Diffusion) |
| 核心创新 | 连续潜在空间帧预测 + 轻量因果注意力 + 无参数旋转时间编码 |
| 训练数据 | UCF-101、MSR-VTT、LAION-Aesthetic、内部视频数据集 |
| 公开形态 | arXiv 论文(代码与模型未开源) |
| 开源许可 | arXiv 非独占分发许可 |
模型规格对比:GPDiT-B 遵循 DiT-B 配置,12 层 Transformer、768 隐藏维度12 头注意力,参数量仅 85M;GPDiT-H 则扩展至 24 层2816 隐藏维度22 头注意力,参数量达 2B。这种双轨设计允许研究者在资源受限场景下使用小模型验证思路,在算力充足时切换到大规模版本追求最优生成质量。
关键性能数字:GPDiT-H-LONG 在 MSRVTT 零样本生成上达到 FVD 64、FID 7.4,超越同期 SnapVideo(FVD 110)约 42%;在 UCF-101 上 FVD 218、IS 66.6,IS 指标高于 PixelDance(42.1)约 58%。GPDiT-B(80M 参数)在 UCF-101 训练上取得 FVD 214,与 130M 参数的 FAR(FVD 194)差距在 10% 以内,说明轻量架构的效率优势。
宣传核验:论文在 MSRVTT 与 UCF-101 上的量化结果可核验,与同期方法对比优势明确。但代码与模型权重未开源,第三方独立复现尚未出现,所有数值均为论文自报。
用户与市场认可
GPDiT 当前处于学术论文阶段,市场认可体现在学术引用与社区关注层面,尚无商业化落地或企业采用数据。
学术社区关注:论文自 2025 年 5 月提交至 10 月最终版,在 arXiv 上历经 5 个版本迭代,说明作者团队在持续完善实验与论证。论文出现在 Hugging Face Daily Papers 趋势中,获得一定社区曝光。
机构背书:中国科学技术大学(USTC)在 CV 与 AI 领域有深厚积累,阶跃星辰(StepFun)是国内视频生成赛道的重要玩家(曾推出 Step-Video 系列)。双机构联合发布让论文在产学研结合层面具备可信度。
引用与复现:截至当前时间点,论文尚无公开的第三方复现报告或代码仓库。这对于一篇学术论文而言属于正常节奏——大多数 CV 顶会论文在发表后 3-6 个月内才会出现社区复现。建议关注后续是否有官方或第三方代码开源。
行业对标位置:GPDiT 的 2B 参数规模与 SnapVideo(3.9B)、PixelDance(1.5B)处于同一量级,但在 MSRVTT 上 FVD 64 的表现属于当时的第一梯队。不过由于无 Demo 和 API,它在 C 端感知度上远低于 Runway、Pika 等商用产品。
成本优势
GPDiT 当前完全以论文形式存在,成本结构非常简单——论文免费获取,但若想复现实验则需要显著的算力投入。
| 维度 | 公开信息 |
|---|---|
| 论文阅读 | arXiv 免费公开,支持 PDF / HTML / TeX 源码 |
| 代码与模型 | 未开源,无法下载使用 |
| API 服务 | 不提供 |
| GPDiT-B 复现成本(推演) | 32 张 H100 GPU × 400k 迭代 × 约 2-3 天 |
| GPDiT-H 复现成本(推演) | 多阶段训练:200k + 200k + 150k 迭代,总计约 1-2 周 × 64+ H100 |
| 少样本微调成本(推演) | 500 迭代 × batch 4 × 单卡即可完成 |
免费的真相:论文免费阅读是真的,但"使用"的隐性成本极高。GPDiT-B 的训练使用了 32 张 H100 GPU 进行 400k 次迭代,按云厂商 H100 约 $3-4/卡时计算,单次完整复现的算力成本在 $10,000-20,000 量级。GPDiT-H 的多阶段训练所需算力更高,非一般学术实验室可负担。
与商用 API 的隐性成本对比:如果目标只是"生成视频",直接使用 Runway Gen-3(约 $0.05-0.10/秒)或 Pika(订阅 $10-50/月)在当前阶段远低于自训练 GPDiT 的边际成本。GPDiT 的价值在于技术探索与架构创新,而非即用型成本优势。
合规风险:论文使用 arXiv 非独占分发许可,允许学术引用与衍生研究。但若未来有人基于论文方案训练商用模型,需注意 StepFun 与 USTC 可能持有的专利或知识产权,商业使用前应进行 FTO(自由实施)分析。
主要功能
GPDiT 的能力集中在视频生成、视频表示学习与少样本多任务迁移三个层面:
-
帧级自回归视频生成:在连续潜在空间中逐帧预测未来帧,每帧生成时以之前所有已生成帧为条件。这一设计突破了固定长度视频生成的限制,理论上可生成任意长度的视频序列。与离散 token 自回归模型相比,连续空间预测避免了 VQ 分词器的信息丢失问题。
-
两种因果注意力变体(OF / OF2):OF(Only Former)变体在训练时消除干净帧之间的注意力计算,利用视频帧之间空间冗余降低计算量约 50%;OF2 变体则保留干净帧间的交互以换取更强的表示能力。推理时两者均天然兼容 KV Cache 加速,长序列生成效率显著高于双向注意力方案。
-
无参数旋转时间编码:将扩散前向过程重解释为复平面上的旋转操作,用旋转角度 $\theta_t$ 替代传统 adaLN-Zero 模块。这一设计移除了约占 DiT 模型 28% 参数量的时间条件子模块,在参数效率上具有明显优势。
-
少样本多任务迁移:预训练后的 GPDiT 模型仅需 20 个视频样本(20 shots)和 500 次微调迭代,即可迁移到风格迁移、边缘检测、深度估计、人体检测、图像着色等多种下游任务。这种能力受益于连续自回归框架的自然条件拼接机制,无需额外适配模块。
-
视频表示学习:GPDiT 的中间层特征可直接用于视频理解任务。线性探测实验表明,GPDiT-H 特征在 UCF-101 分类上具备可观的表示质量,且在 Video-ChatGPT 框架中替换 CLIP 视觉编码器后,在 ActivityNet-QA 上达到 28.2% 准确率。
专家视点:GPDiT 的功能设计有一个"隐藏协同"——它的自回归架构天然支持"生成 + 理解"统一。传统方案中,视频生成模型(如 Stable Video Diffusion)和视频理解模型(如 VideoMAE)是两套独立架构。GPDiT 在生成任务上的预训练权重可直接作为理解任务的特征提取器,且生成质量的提升与表示能力的提升呈正相关(论文 Figure 5c 验证了 FVD 与分类精度的同步改善),这意味着同一个模型可能同时服务于视频内容创作和视频分析两个场景。
模型与版本演进
版本脉络
GPDiT 在 arXiv 上经历了 5 个版本迭代,从初版到最终版历时约 5 个月:
| 版本 | 日期 | 核心变化 |
|---|---|---|
| v1 | 2025-05-12 | 首次提交,提出 GPDiT-B(85M)与 GPDiT-H(2B)架构,在 UCF-101 与 MSRVTT 上报告基础结果 |
| v2 | 2025-05-15 | 修正实验设置,补充消融研究 |
| v3 | 2025-05-19 | 完善相关工作和实验描述 |
| v4 | 2025-05-22 | 补充视频表示学习的线性探测实验与更多少样本结果 |
| v5 | 2025-10-08 | 最终版本,加入 GPDiT-H-LONG 变体,支持 17-45 帧可变长度生成,在 MSRVTT 上 FVD 降至 64 |
模型变体
GPDiT 体系包含三个主要变体:
- GPDiT-B(85M 参数):基础基准模型,在 UCF-101 上从头训练 400k 迭代,适用于资源受限的验证与消融实验。
- GPDiT-H(2B 参数):大规模版本,先在 LAION-Aesthetic 图像数据上预热 200k 迭代,再在混合图像-视频数据上训练 200k 迭代,最后在纯视频数据上微调 150k 迭代。
- GPDiT-H-LONG:在 GPDiT-H 基础上使用可变长度(17-45 帧)视频数据继续训练 150k 迭代,增强长序列生成能力。
技术优势
GPDiT 的技术优势可拆解为三个层面,每一个都直接对应具体的效率或质量收益:
帧级因果注意力与 KV Cache 兼容:传统双向注意力在长视频生成中面临两个问题——未来帧信息泄露破坏时序一致性,以及推理时无法使用 KV Cache 导致计算量随帧数平方增长。GPDiT 采用帧级因果注意力,每个噪声帧仅关注过去已生成的干净帧和自身。这一设计在推理时天然支持 KV Cache,使长序列生成的计算复杂度从 $\mathcal{O}(F^2)$ 降至 $\mathcal{O}(F)$。实验表明,GPDiT 在生成长度超过训练长度的视频时仍能保持质量稳定,而双向注意力方案会出现严重退化。
轻量因果注意力(Lightweight Causal Attention):标准因果注意力在训练时需要同时维护干净帧和噪声帧两套表示,导致显存与计算翻倍。GPDiT 观察到视频相邻帧之间存在大量空间冗余,因此在训练时直接跳过干净帧之间的注意力计算。这一优化约减少 50% 的注意力计算量,且不牺牲生成质量(GPDiT-B-OF 与 GPDiT-B-OF2 的 FVD 仅差 2 个点:216 vs 214)。
无参数旋转时间编码(Rotation-based Time Conditioning):DiT 等主流扩散 Transformer 使用 adaLN-Zero 注入时间步信息,该模块占模型总参数的约 28%。GPDiT 将扩散前向过程 $x_t = \sqrt{\bar{\alpha}_t} x_0 + \sqrt{1-\bar{\alpha}_t} \epsilon$ 重解释为 2D 复平面旋转:
$$R(\theta_t) = \begin{pmatrix} \cos\theta_t & \sin\theta_t \ -\sin\theta_t & \cos\theta_t \end{pmatrix}$$
其中 $\cos\theta_t = \sqrt{\bar{\alpha}_t}$, $\sin\theta_t = \sqrt{1-\bar{\alpha}_t}$。模型通过反向旋转隐式注入时间信息,完全移除了 adaLN-Zero 的 MLP 参数,在保持相当生成质量的前提下显著降低了参数量。
连续空间自回归 vs 离散 token 自回归:现有自回归视频方法(如 VideoPoet、OmniTokenizer)依赖 VQ-VAE 将视频帧量化为离散 token,这一映射存在不可逆的信息损失。GPDiT 在连续潜在空间操作,使用扩散损失代替交叉熵损失进行帧预测,避免了离散化的精度瓶颈。这在少样本任务上的优势尤为明显——GPDiT 无需额外的适配器即可通过序列拼接完成条件生成,而离散 token 方法通常需要训练专门的映射模块。
如何使用
GPDiT 目前仅以学术论文形式公开,没有可直接使用的代码、模型权重或在线 Demo。使用路径分为以下层次:
| 使用方式 | 适合人群 | 当前可行性 | 资源需求 |
|---|---|---|---|
| 阅读论文 | 研究者、算法工程师 | ✅ arXiv 全文公开 | 无 |
| 参考架构设计 | 视频生成研究者 | ✅ 论文提供完整技术描述 | 无 |
| 复现 GPDiT-B | 有算力的学术实验室 | ⚠️ 需自行实现,无官方代码 | 32× H100 GPU |
| 复现 GPDiT-H | 大型研究团队 | ⚠️ 需自行实现,无官方代码 | 64+ H100 GPU,多阶段训练 |
| 少样本微调实验 | 有预训练权重的团队 | ❌ 模型权重未公开 | 单卡 GPU |
| 商用集成 | 企业用户 | ❌ 代码/模型未开源 | N/A |
使用建议:对于希望跟进该方向的团队,建议先精读论文的架构设计(§4)与消融实验(§5),重点关注轻量因果注意力的实现细节和旋转时间编码的数学推导。如果团队有复现意向,可以从 GPDiT-B 开始,在 UCF-101 上验证基础 FVD 指标(论文报告 214-216),再决定是否扩展到 GPDiT-H。
产品定价
GPDiT 作为学术研究项目,无商业产品定价体系。以下是各类形态的成本概况:
| 项目 | 说明 |
|---|---|
| 论文访问 | arXiv 永久免费,支持 PDF / HTML / TeX 下载 |
| 代码与模型 | 未开源,无定价信息 |
| API 服务 | 不提供 |
| 商业授权 | 未公开(需联系作者团队或机构技术转移办公室) |
| 自训练算力成本(推演) | GPDiT-B 约 $10K-20K(32× H100,2-3 天);GPDiT-H 约 $50K-100K+(64+ H100,1-2 周) |
与商用视频生成方案的成本对比:
| 方案 | 典型月度成本 | 适用场景 | 生成质量 |
|---|---|---|---|
| GPDiT(自训练,推演) | $10K-100K(一次性) | 学术研究、架构探索 | 论文自报 MSRVTT FVD 64 |
| Runway Gen-3 | $0.05-0.10/秒 | 内容创作、广告制作 | 商用级画质与一致性 |
| Pika 订阅 | $10-50/月 | 个人创作者、社媒视频 | 快速出片,控制力适中 |
| Stable Video Diffusion(开源) | 自托管 GPU 成本 | 自部署场景 | 开源社区持续优化 |
GPDiT 在当前阶段的性价比远低于商用方案。其价值定位不是"替代现有视频生成工具",而是为下一代架构提供技术验证和学术参考。
应用场景
GPDiT 的技术特性决定了它更适合研究与工程探索场景,而非即时可用的生产有境:
-
自回归扩散融合架构研究:GPDiT 提供了一个完整的帧级自回归扩散框架,研究者可以在此基础上探索新的注意力变体、时间条件机制或多模态扩展。其轻量架构特别适合消融实验——85M 参数的 GPDiT-B 可以快速迭代验证新想法。
-
长序列视频生成研究:GPDiT 的因果注意力与 KV Cache 支持使长序列生成的计算成本可控。论文在 17-45 帧范围验证了 GPDiT-H-LONG 的稳定性。对于需要数十秒连续视频的研究任务(如自动驾驶场景预测、运动模拟),GPDiT 的架构提供了比固定长度扩散模型更自然的解决方案。
-
统一生成-理解模型探索:GPDiT 的实验显示生成质量与表示能力存在正相关,这意味着"一个模型同时做生成和理解"的路线是可行的。对于希望构建视觉基础模型(Visual Foundation Model)的团队,GPDiT 提供了从生成侧出发的统一训练范式参考。
-
少样本视频任务定制:对于特定领域(如医学影像转换、工业检测可视化),GPDiT 的少样本迁移能力意味着可以用极少量的标注数据快速适配。20 shots + 500 迭代的门槛远低于从头训练一个专用模型。
不适配场景:
- 即用型视频内容生产:无代码无模型无 Demo,GPDiT 当前对内容创作者是完全不可用状态。
- 实时交互式生成:扩散模型的迭代去噪过程天然不适合实时场景,GPDiT 的推理效率在论文中未作实时性评估。
- 需要高精度时序控制的工业级视频生成:作为学术论文级别的模型,GPDiT 在可控性、一致性保障上没有工程级保证。
适用人群
-
视频生成方向的研究者:关注扩散模型与自回归模型交叉融合的研究人员,可以将 GPDiT 作为基线框架进行扩展或对比。建议从论文的消融实验(§5.2-5.4)入手,理解 OF 与 OF2 注意力变体在不同任务上的表现差异。
-
计算机视觉算法工程师:希望跟踪视频生成前沿技术的工程师,适合精读论文的技术方案(§4),重点关注轻量因果注意力的实现路径——这一设计在推理效率上的收益具有工程落地价值。
-
多模态基础模型团队:正在探索统一生成与理解的团队,GPDiT 的"生成能力与表示能力正相关"这一发现(Figure 5c)值得深入研究。可以在自身框架中验证这一现象是否在其他架构下复现。
-
学术实验室(含硕博研究生):GPDiT-B 的 85M 参数规模对学生实验室相对友好,如果团队有 4-8 张 GPU,可以尝试在 UCF-101 上复现核心实验,作为扩散 Transformer 方向的学习项目。
劝退人群:
- 内容创作者 / 自媒体运营:GPDiT 当前无可用入口,建议转向 Runway、Pika 或 Kling 等商用工具。
- 需要在 1-2 周内交付视频生成功能的产品团队:GPDiT 的复现周期以月为单位计算。
- 非深度学习背景的技术决策者:评估 GPDiT 需要理解扩散模型与自回归模型的底层原理,不适合作为采购评估对象。
总结与展望
GPDiT 在技术路线上做出了一个有意义的贡献——在连续潜在空间中将帧级自回归预测与扩散生成统一起来,并提出了轻量因果注意力与旋转时间编码两项实用优化。在 MSRVTT 和 UCF-101 上,GPDiT-H 达到了当时的最优或接近最优水平,且 GPDiT-B 以 85M 参数取得了与更大模型竞争的结果,证明了架构设计的效率优势。
从论文的讨论部分可以看出,作者团队已经意识到当前工作的局限性:实验规模受算力约束、模型仅限于视频模态、语言等多模态扩展尚待探索。论文在 ActivityNet-QA 上 28.2% 的 VQA 准确率(vs Video-ChatGPT 的 35.2%)也表明,GPDiT 的表示学习能力仍有提升空间。
后续观察点:
- 代码开源:GPDiT 的完整复现依赖于官方代码发布。如果论文被 CVPR/ICCV 等顶会接收,代码开源的概率会显著增加。建议关注 USTC 或 StepFun 的 GitHub 账号。
- 更大规模扩展:论文 2B 参数的实验规模在 2025 年的大模型语境下属于中等。如果后续扩展到 7B-13B 参数,架构优势可能会更加明显。
- 多模态扩展:GPDiT 的作者明确指出计划探索语言等多模态输入的统一建模。这将决定它是否能从"视频生成模型"进化到"视觉基础模型"。
- 与 Step-Video 系列的协同:阶跃星辰同时是 Step-Video-T2V 和 Step-Video-TI2V 的发布方,GPDiT 的技术积累可能被整合到 Step-Video 的产品线中。
采购/采用风险评估:GPDiT 在当前阶段不适合作为采购对象或产品集成依赖。学术界团队可以将其作为重要参考文献纳入研究基线;工业界团队建议等待代码开源和社区验证后再评估技术采用。任何基于 GPDiT 的商业化计划都必须先完成 FTO 分析,确认 USTC 和 StepFun 的知识产权边界。如果团队的目标只是"在 2026 年用上高质量视频生成",建议优先评估商用 API(Runway、Pika、Kling、Sora)或成熟的扩散开源方案(Stable Video Diffusion、VideoCrafter),将 GPDiT 作为下一代架构的技术储备。
限制与不适配场景
该工具在以下场景中存在使用限制:
场景适配边界 需要高度行业专业知识的任务、对输出格式有严格规范的场景、需要零错误的自动化流程可能效果不达预期。AI 输出应作为初稿或辅助参考,最终结果需人工核验。
技术限制 上下文长度有限、复杂推理准确性可能不足、免费版有使用额度。建议在正式采用前通过试用验证核心场景的可用性。
版本信息
- GPDiT-H-LONG :arXiv v5 更新,提出 GPDiT-H-LONG 变体,支持 17-45 帧可变长度视频生成,在 MSRVTT 上 FVD 降至 64。
- GPDiT-H-LONG :加入 GPDiT-H-LONG 变体与长视频生成评估,发布最终版本。暂无官方精确日期。
- GPDiT-H 更新 :补充实验数据与消融研究,完善 GPDiT-H 在视频生成与表示学习上的评估。
- GPDiT 初版 :arXiv 首次提交,提出自回归扩散 Transformer 基础架构与 GPDiT-B/GPDiT-H 两个规格。
用户评价