Sand AI
免费
Sand AI 是一家 AI 研究公司,致力于推动通用人工智能的发展。
Sand AI
核心参数与统计
Sand AI 是一家以视频生成模型为核心技术方向的 AI 研究公司,而非面向终端消费者的聊天产品。其主推产品 Magi-1 系列是开源的自回归视频生成模型,定位为"世界模型"(world model),在视频物理规律预测方面表现出色。
| 项目 | 公开信息 |
|---|---|
| 官方定位 | AI research company |
| 核心技术产品 | Magi-1 / Magi-1.1 自回归视频生成模型 |
| 开源许可 | Apache 2.0 |
| GitHub Stars | ~3,700(MAGI-1 仓库) |
| GitHub Forks | ~239 |
| 模型规模 | 24B / 4.5B(Magi-1),蒸馏 + 量化版本 |
| 模型架构 | Diffusion Transformer + Block-Causal Attention |
| 硬件要求 | 24B: H100/H800×8;4.5B: RTX 4090×1 |
| API 平台 | 提供 platform.sand.ai |
| 归属 | US |
一句话简评:Sand AI 不是聊天机器人公司,而是以开源视频生成模型 Magi-1 为核心技术资产的研究驱动型组织,其产品形态是 API 和开源模型权重,而非消费级应用。
用户与市场认可
Sand AI 的市场认可主要来自开源社区和学术圈,而非商业客户数——后者未公开。
开源影响力:MAGI-1 在 GitHub 上获得约 3,700 颗星239 个 Fork,14 位贡献者参与开发。这一规模在视频生成模型类开源项目中属于中上水平,说明其技术路线受到开发者社区的关注。
学术认可:MAGI-1 的论文(arXiv:2505.13211)在人机评估中宣称达到开源模型最优水平(超过 Wan-2.1、HunyuanVideo),在指令遵循和运动质量上甚至可与 Kling 等闭源商业模型竞争。Physical-IQ 基准测试中,Magi-24B 在视频延续预测任务上大幅领先所有已有模型(56.02 vs. VideoPoet 29.50)。
生态整合:Magi-1 已适配 ComfyUI 工作流和 Dify 提示词增强管线,降低了在已有 AI 创作工具链中的集成门槛。
成本优势
Sand AI 的成本结构分为开源自部署和商业化 API 两条路径:
C端/个人:Magi-1 开源模型(4.5B 版本)可在单张 RTX 4090(24GB VRAM)上运行,蒸馏量化版本甚至支持 12GB 显存显卡,个人研究者可用自有硬件零成本部署。产品平台 magi.sand.ai 提供在线 demo,具体额度与计费以官方实时页面为准。
API/开发者:platform.sand.ai 提供云端 API,但定价细节未公开。研究者可通过 Docker 有境快速本地部署(docker pull sandai/magi:latest),不需要授权费用。
企业/私有化:Apache 2.0 许可下企业可自由商用,无授权费。但 24B 模型需要 H100/H800×8 集群,私有化部署的硬件成本显著。
隐性成本:开源虽免授权费,但 24B 模型的推理硬件要求(8×H100)限制了中小团队的本地部署可能性。蒸馏 + 量化版本(fp8_quant)虽将硬件需求降到 RTX 4090×8 或 4×H100,但推理质量会有一定折损。
主要功能
Sand AI 的核心能力围绕 Magi-1 系列视频生成模型构建,而非一个多功能的 AI 平台:
- 自回归视频生成(Magi-1):以 chunk 为单位逐段生成视频(每 chunk 24 帧),支持流式输出,可同时并发处理最多 4 个 chunk。
- 图像生成视频(I2V):基于输入图像和文本指令生成视频,支持场景过渡控制。
- 视频延续(V2V):给定前缀视频,预测并生成后续内容,在物理规律预测上有突出表现。
- 文本生成视频(T2V):纯文本到视频的生成,支持分辨率、帧率CFG 参数控制。
- 蒸馏推理加速:通过 shortcut distillation 让一个模型支持 64/32/16/8 步可变推理预算,最小质量折损换取速度。
【专家视点】:Magi-1 的自回归架构不同于主流的扩散全序列生成——它逐段生成视频,这带来的核心优势是:① 支持流式输出(不需要等待完整视频生成完毕);② 在视频延续任务中物理规律预测精度远高于扩散模型(Physical-IQ 成绩证明)。这意味着它在"视频续写"和"长时间视频生成"这两个场景下有天然的架构优势,但在一次性完整视频生成的质量上限上未必超过大规模扩散模型。
模型与版本演进
相关信息未公开,以官方实时页面为准。
技术优势
Sand AI 的技术核心是 Magi-1 的自回归扩散架构,与主流一次性扩散模型形成差异:
自回归 denoising 算法:视频被切分为固定长度的 chunk(24 帧),每个 chunk 完成 denoising 后立即开始下一 chunk 的生成,支持最多 4 个 chunk 的并发处理。机制上在时间维度引入了因果建模,效果上实现了流式生成和物理动作预测的精度优势。适用场景为视频续写、长视频生成和物理仿真。
MoE Scaling:采用混合专家架构扩展视频扩散模型,通过稀疏激活降低训练和推理的 FLOPs,使 24B 模型在 8×H100 上可部署。此路线可参考其博客"Scaling Video Diffusion Models with MoE"。
Distillation + Quantization:通过 shortcut distillation 实现单模型多步数推理支持(64/32/16/8 步),结合 fp8 量化,让 24B 模型可部署在 4×H100 或 8×RTX 4090 上。机制上通过 self-consistency constraint 让大步和小步的推理轨迹一致,效果上在有限推理预算下维持了较高的保真度。
性能与吞吐(TTFT/TPM/RPM):未公开,以官方实时页面或 API 文档为准。
适配边界:Magi-1 擅长物理规律预测和视频延续任务(V2V),在 Physical-IQ 基准上大幅领先所有竞品;不太擅长的场景是"一次性高质量完整视频生成"相比 Kling、Sora 等大规模训练的纯扩散模型可能仍有差距。
如何使用
Sand AI 提供三种使用路径:
| 方式 | 入口 | 适合人群 | 硬件要求 |
|---|---|---|---|
| 在线产品 | magi.sand.ai | 想快速尝试视频生成的用户 | 无需硬件 |
| API 平台 | platform.sand.ai | 开发者集成 | 按 API 调用计费 |
| 开源部署 | GitHub + Docker | 研究与自部署 | 4.5B: RTX 4090×1;24B: H100×8 |
开源快速部署(以 4.5B 为例):
docker pull sandai/magi:latest
docker run -it --gpus all --shm-size=32g sandai/magi:latest /bin/bash
bash example/4.5B/run.sh
以上配置以 GitHub 仓库 README 为准。
产品定价
Sand AI 的定价模式因使用路径而异:
- 开源自部署:Apache 2.0 许可,零授权费。硬件成本由用户自行承担(4.5B 约 $3,000-5,000 单张 RTX 4090;24B 约 $100,000+ 八卡 H100 集群)。
- API 平台:platform.sand.ai 提供云端调用,具体单价未公开,以官方实时页面为准。
- 在线产品:magi.sand.ai 提供免费体验额度,超出部分计费方式未公开。
应用场景
Sand AI 的技术特性决定了其在三类场景中更有优势:
- 视频内容创作:基于图像或文本描述生成短视频,适合社交媒体内容制作、广告创意概念验证。核验重点:生成视频的分辨率、时长控制和多轮迭代的一致性。
- 物理仿真与延续预测:给定一段真实视频的前缀,预测后续物理运动(如物体坠落、液体流动),适合影视特效预览和科学研究可视化。核验重点:物理行为的真实感与连续性。
- AI 研究与开发:作为开源视频生成基线用于学术研究,或通过 API 集成到已有创作工具链。核验重点:模型权重的可用许可证(Apache 2.0 商用友好)与社区维护活跃度。
适用人群
- AI 研究者:将 Magi-1 作为视频生成的研究基线,利用开源权重和推理代码进行学术研究。
- 视频创作者:使用在线产品或 API 生成短视频内容,降低视频制作门槛。
- 开发者与集成商:通过 API 或 Docker 部署将视频生成能力集成到自有产品中。
不适配边界:不适配需要实时交互式对话的场景(Sand AI 不是聊天 AI);也不适配对一次性视频质量要求极高(对标 Sora/Kling 顶级输出)的商业制作场景——Magi-1 的强项在延续预测而非一次性质量。
总结与展望
Sand AI 以 Magi-1 系列证明了自回归架构在视频生成领域的潜力,尤其在物理规律预测这一维度上展示了可量化的领先优势。开源策略(Apache 2.0)和生态适配(ComfyUI、Dify)使其在开发者社区获得了一定的采用基础。
当前限制:产品化的 API 定价未公开,商业可用性尚不透明;24B 模型的硬件门槛对中小团队不友好;在一次性视频质量上与 Kling、Sora 等头部商业产品的差距未量化。
采购/采用风险评估:研究团队建议直接使用开源 4.5B 版本地部署验证效果;需要更高视频质量的商业用户应在评估 Magi-1.1 的蒸馏量化版本后再决定是否投入硬件采购;API 集成前需确认 platform.sand.ai 的 SLA、延迟和计费模式。
Sand AI 的版本演进
模型里程碑
- Magi-1 4.5B(2025-04-30):首个开源版本,4.5B 参数,单卡 RTX 4090 可运行。
- Magi-1 24B(2025-04-21 论文/权重发布):完整 24B 版本,24B 参数,8×H100 部署。
- Magi-1 蒸馏+量化版(2025-05-26):4.5B-distill 和 4.5B-distill+fp8_quant,降低推理硬件需求。
- ComfyUI 适配(2025-05-30):增加 ComfyUI 自定义节点,融入已有创作管线。
- Magi-1.1 24B(2026-06-17):下一代版本,开源权重发布,同样支持蒸馏+量化。
从版本节奏看,Sand AI 在过去一年保持了每季度一次有效技术更新的频率,从模型发布到蒸馏优化再到生态适配,路线清晰。
版本信息
- current :当前版本。
- launch :产品上线。
用户评价