DeepInfra
DeepInfra 是一款 AI推理云 平台,提供 OpenAI 兼容的 API 接口,托管 100+ 开源模型(LLM、视觉、语音、图像生成、嵌入等),同时支持私有模型部署与 GPU 集群租赁。平台自建数据中心,SOC 2 / ISO 27001 认证,零数据留存策略。2026 年完成 1.07 亿美元 Series B 融资。
DeepInfra
核心参数与统计
DeepInfra 定位为 AI 推理云基础设施,面向开发者和企业提供 OpenAI 兼容的推理 API。它不是单一模型,而是一个模型托管与推理服务平台,覆盖文本生成、视觉理解、图像生成、语音识别、嵌入与重排序等多种能力。
| 项目 | 公开信息 |
|---|---|
| 官方定位 | AI inference cloud — OpenAI-compatible API, 100s of open-source models |
| 平台形态 | 推理 API、私有模型部署GPU 集群租赁 |
| 模型规模 | 100+ 开源模型(LLM、多模态、图像、语音、嵌入) |
| API 兼容 | OpenAI SDK 兼容(base_url 替换即用) |
| 服务层级 | Standard (1x)、Priority (1.5x)、Flex (0.8x) |
| 并发上限 | 默认 200 并发请求/账户(可申请提升) |
| 首 Token 延迟(TTFT) | 未公开通用数据;Priority 层级显著低于 Standard,具体因模型与负载而异,以实际测试为准 |
| Token 吞吐(TPM/RPM) | 未公开通用频控数值;平台按 token 计费无硬性速率上限,但 200 并发限制间接约束吞吐量 |
| 合规认证 | SOC 2、ISO 27001 |
| 数据中心 | 美国 8 个自建数据中心 |
| 数据策略 | 零数据留存(zero retention) |
| 公司成立 | 2022 年 9 月 |
| 累计融资 | 1.07 亿美元 Series B(2026-05) |
| 支持平台 | Web Dashboard、REST API |
服务层级机制:DeepInfra 的三种服务层级按请求调度优先级区分。Standard 为默认调度,Priority 将请求排在标准流量之前以获得更快的首 Token 延迟(价格 1.5 倍),Flex 以较低价格换取慢响应和偶发不可用(价格 0.8 倍),适合非生产或异步场景。
覆盖模型类别:平台同时托管文本生成、视觉/OCR、嵌入/重排序、图像生成(FLUX 系列)、语音识别(Whisper/Voxtral)、视频生成等多类模型,一个 API Key 即可调用全部。
用户与市场认可
DeepInfra 的市场认可主要体现在开发者生态、企业客户和资本市场三个层面:
开发者采用:DeepInfra 是 OpenRouter 上托管模型数量最多的推理提供商。平台提供 OpenAI 兼容 API,开发者只需将 base_url 指向 https://api.deepinfra.com/v1/openai 即可迁移,零代码改动。GitHub 组织拥有 47 个仓库,包括官方 TypeScript/Node SDK、Python SDK(社区维护)、LangChain 集成CLI 工具 deepctl 以及丰富的 cookbook 示例库。
企业客户:官网公开显示知名用户包括 OpenRouter、Quora、Vercel、Adobe、Ubisoft、Meta、ByteDance、LinkedIn、Microsoft、Deloitte、Salesforce、Hugging Face、Rakuten 等,覆盖科技、咨询、金融、游戏等领域。这些客户使用 DeepInfra 支撑其 AI 产品的生产推理负载。
资本市场:2026 年 5 月完成 1.07 亿美元 Series B 融资,由 500 Global 和 Georges Harik(imo.im 联合创始人)共同领投,NVIDIA、Samsung Next、Supermicro、Felicis、Crescent Cove、A.Capital Ventures、Peak6、Upper90 等跟投。自 Series A 以来 Token 处理量增长 25 倍。
行业认可:与 NVIDIA 建立早期基础设施合作,支持 Nemotron 模型NemoClaw Agent 框架和 NVIDIA Dynamo 推理软件,并率先部署 Blackwell GPU。
成本优势
DeepInfra 的成本结构围绕"只为你实际使用的计算付费"设计,不设最低消费或长期合约。
C 端/个人:DeepInfra 不提供直接面向 C 端的聊天产品(其独立产品 DeepGPT 可能面向此需求),个人开发者通过 API 使用,按 Token 或执行时间计费,无月费门槛。嵌入模型最低至 $0.005/百万 Token。
API/开发者:LLM 按输入/输出 Token 分别计费,支持缓存命中优惠(如 DeepSeek V4-Pro 缓存输入仅 $0.10/百万 Token,远低于标准输入 $1.30)。图像模型按生成分辨率与迭代次数计费(如 FLUX-2-dev $0.01 × (w/1024) × (h/1024) × (iters/28))。语音模型按执行时长计费。以 DeepSeek V4-Flash 为例,输入 $0.09/百万 Token,输出 $0.18/百万 Token,在开源模型推理市场中处于极具竞争力的价位。
| 模型示例 | 上下文 | 输入价格 ($/M Token) | 输出价格 ($/M Token) |
|---|---|---|---|
| DeepSeek-V4-Flash | 1024k | $0.09(缓存 $0.018) | $0.18 |
| DeepSeek-V4-Pro | 1024k | $1.30(缓存 $0.10) | $2.60 |
| Qwen3.6-35B-A3B | 256k | $0.15 | $0.95 |
| Llama-4-Maverick-17B-128E | 1024k | $0.20 | $0.80 |
| gemma-4-26B-A4B-it | 256k | $0.07 | $0.34 |
| Mistral-Small-3.2-24B | 125k | $0.075 | $0.20 |
企业/私有化:支持两种私有化模式。一是自定义 LLM 部署(Custom LLMs),在专用 GPU 上运行自有模型,按 GPU 小时计费:A100 $0.89/h、H100 $2.20/h、H200 $2.69/h、B200 $3.69/h、B300 $4.89/h,分钟级计费,按周出账。二是 DeepCluster 专属集群,5 年期的 B300 集群仅 $1.98/GPU-h(对比公有云 $6.50/GPU-h),优惠幅度约 70%,256–5000 GPU 可选,包含 Tier 3 数据中心与 99.982% 可用性 SLA。
隐性成本:API 模式的隐性成本主要包括高频调用时的并发限制(默认 200 并发)、超出后需联系商务提升配额的沟通成本,以及 Priority 层级 1.5 倍的加价。企业私有化部署还需评估机房空间、电力与网络带宽的配套投入。
主要功能
DeepInfra 的能力围绕"一个 API 调用所有模型"设计,核心功能包括:
-
OpenAI 兼容推理 API:支持 100+ 开源模型的文本生成、多模态理解、嵌入、重排序。使用 OpenAI SDK 或任何兼容客户端,仅需修改
base_url和api_key即可调用。支持流式输出JSON 模式、工具调用/Function Calling、上下文缓存等特性。 -
多模态与视觉理解:支持 Gemma 4、Qwen-VL、Kimi K2.6 等多模态模型的图像理解OCR 文本提取、文档分析。通过标准的 Chat Completions API 传入图像 URL 或 Base64 即可。
-
图像与视频生成:托管 FLUX 全系列(FLUX-2-dev、FLUX-2-pro、FLUX-2-max 等)、Stable Diffusion 等图像生成模型,以及文本转视频模型。计费基于分辨率与迭代次数,灵活性高。
-
嵌入与重排序:提供 bge、e5、gte、multilingual-e5 等主流嵌入模型,以及重排序(Rerank)能力,适用于 RAG、语义搜索、信息检索场景。最低仅 $0.005/百万 Token。
-
语音识别与合成:支持 OpenAI Whisper 系列模型和 Voxtral 系列语音模型,覆盖语音转文字和文字转语音场景。
-
私有模型部署(Custom LLMs):在 DeepInfra 的 A100/H100/H200/B200/B300 GPU 上部署自己的微调模型,自动扩缩容,私有端点隔离。适合数据主权要求高或需要定制推理逻辑的团队。
-
GPU 集群租赁(DeepCluster):以 5 年长期合约形式提供 B300 专属集群,SSH 直连,适用于训练、微调或其他需要持续 GPU 算力的场景。
功能协同效应:DeepInfra 真正的产品力不在于单个功能,而在于"单一 API 入口 + 多模型类型 + 服务层级灵活切换"的组合。开发团队无需为图像生成、文本推理、嵌入检索分别对接不同供应商,一次集成即可覆盖多种 AI 负载。Private 模型和 GPU 集群的叠加,使企业可以在同一平台上完成从实验到生产、从推理到训练的完整 AI 工作负载闭有。
模型与版本演进
相关信息未公开,以官方实时页面为准。
技术优势
DeepInfra 的技术竞争力来自"垂直整合 + 推理优化"的系统级工程能力,每条能力都围绕"为什么更快/更省/更稳"的因果链展开:
自有基础设施 -> 消除中间层加价与资源争抢:与在公有云(AWS/GCP/Azure)之上搭建推理层的竞品不同,DeepInfra 自购并运营美国 8 个数据中心的 GPU 硬件,从芯片到 API 全栈自控。这种架构在三个层面产生结构性优势——成本上消除了云厂商的 markup 层(以 DeepCluster B300 为例,$1.98/GPU-hr 对比公有云 $6.50/GPU-hr);延迟上避免了物理机超售引起的波动;容量上在新模型发布后能快速完成规模化部署而不受云厂商配额限制。适用场景:高吞吐、持续运行的 Agent 推理和生产级 LLM 服务。
推理优化软件栈 -> 更高 GPU 利用率与更低每 Token 成本:团队深度参与 NVIDIA TensorRT-LLM 和 vLLM 的工程开发(GitHub 均有官方 fork),同时与 NVIDIA Dynamo 分布式推理框架有联合优化。这意味着 DeepInfra 在算子层面(FlashAttention、PagedAttention、Continuous Batching)和调度层面(KV cache 管理、动态批处理)都能做到比通用云平台更高的 GPU 利用率。利用率越高,每百万 Token 的固定成本摊销越低,最终体现为终端价格优势。适用场景:对 Token 单价敏感的规模化推理场景。
NVIDIA 生态深度协作 -> 最早获取新一代硬件红利:作为 NVIDIA 开放 AI 生态的早期基础设施合作伙伴,DeepInfra 率先部署 Blackwell B200/B300 GPU,并规划在 Vera Rubin 架构上通过 Dynamo 实现推理成本效率 20 倍的提升。这一合作关系不仅意味着硬件选型上的优先权,更重要的是 DeepInfra 能在 NVIDIA 下一代推理软件栈(如 Dynamo、NemoClaw)尚在开发阶段就进行适配优化,而非等 GA 后才被动跟进。适用场景:需要利用最新 GPU 架构红利进行长期成本优化的企业。
自动扩缩容 -> 闲置零成本:平台内置的自动扩缩容机制根据请求负载动态调整模型副本数量。流量高峰时自动增加副本保证响应速度,低谷时释放副本避免空闲 GPU 计费。结合 Custom LLM 的分钟级计费粒度,用户仅为实际使用的 GPU 时长付费。适用场景:流量模式波动大的 AI 应用,如电商大促、社交裂变等。
服务层级调度 -> 差异化资源分配不影响总体成本:Standard/Priority/Flex 三级调度不是简单的速率限制,而是通过请求队列优先级管理实现差异化资源分配。Priority 1.5x 的价格溢价来源于将请求排在队列前端,而非增加硬件总量。Flex 0.8x 的价格折扣则通过将请求安排在低负载时段或使用空闲容量实现。这种设计在不大幅增加平台总成本的前提下为用户提供了成本-延迟的自主选择权。适用场景:多负载混合场景(生产流量用 Priority、后台批处理用 Flex)。
适配边界:DeepInfra 的架构强项在推理而非训练——它不提供模型预训练平台,也不直接提供一键微调服务(需用户自行准备权重后通过 Custom LLM 部署)。对于需要"训练+推理"一站式服务的团队,可能需要搭配外部训练框架。此外,当前数据中心仅限美国 8 个节点,对亚太和欧洲客户而言,网络延迟可能成为瓶颈,建议在实际部署前进行跨区域延迟测试。
如何使用
DeepInfra 的核心使用路径是 API 调用,同时提供网页 Dashboard 进行模型浏览API Key 管理和用量监控。
快速开始
- 访问 deepinfra.com 注册账号。
- 在 Dashboard 中生成 API Key(
https://deepinfra.com/dash/api_keys)。 - 使用 OpenAI SDK 或直接发起 HTTP 请求调用模型。
API 调用示例
使用 Python OpenAI SDK 调用 DeepSeek-V4-Flash:
from openai import OpenAI
client = OpenAI(
api_key="<YOUR_DEEPINFRA_API_KEY>",
base_url="https://api.deepinfra.com/v1/openai",
)
response = client.chat.completions.create(
model="deepseek-ai/DeepSeek-V4-Flash",
messages=[{"role": "user", "content": "Hello! what is deepinfra、"}],
temperature=0.7,
max_tokens=1024,
stream=True,
)
for chunk in response:
print(chunk.choices[0].delta.content or "", end="")
Curl 调用示例:
curl -s https://api.deepinfra.com/v1/openai/chat/completions \
-H "Authorization: Bearer <YOUR_DEEPINFRA_API_KEY>" \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-ai/DeepSeek-V4-Flash",
"messages": [{"role": "user", "content": "Hello!"}],
"temperature": 0.7,
"max_tokens": 1024,
"stream": true
}'
服务层级设置
在 API 请求中通过 service_tier 参数指定调度优先级:
{
"model": "deepseek-ai/DeepSeek-V4-Flash",
"messages": [{"role": "user", "content": "Hello!"}],
"service_tier": "priority"
}
可选值:"standard"(默认,1x 价格)、"priority"(1.5x 价格)、"flex"(0.8x 价格,非生产场景)。
| 使用方式 | 适合人群 | 特点 |
|---|---|---|
| REST API (OpenAI 兼容) | 开发者/集成商 | 替换 base_url 即可迁移,SDK 支持 Python、Node.js、LangChain |
| Web Dashboard | 评测/实验 | 浏览模型、生成 API Key、查看用量与账单 |
| deepctl CLI | DevOps/SRE | 命令行管理推理任务与集群 |
| Custom LLMs | 企业/模型所有者 | 部署私有微调模型,自动扩缩容 |
| DeepCluster | 高性能计算团队 | B300 专属集群,SSH 直连,5 年合约 |
产品定价
DeepInfra 的定价按模型类型和服务层级分为三类计费模式:
LLM 文本生成:按每百万 Token 计费,输入和输出分别计价。支持上下文缓存折扣(cache hit 价格远低于标准输入)。三档服务层级(Standard/Priority/Flex)在基础价格上乘以对应系数。定价页公开所有模型价格,以官方实时页面为准。
图像/音频模型:按执行时间或生成参数计费。FLUX 图像模型计费公式为 价格 × (宽度/1024) × (高度/1024) × (迭代次数/基准值)。语音模型按执行时长计费。
嵌入模型:统一按每百万 Token 计费,价格区间 $0.005–$0.01/百万 Token。
私有部署与集群:Custom LLMs 按 GPU 小时计费,分钟级粒度,按周出账。DeepCluster 按 GPU 小时计费,5 年合约锁定 $1.98/GPU-h(B300),需联系商务确认。
使用层级与出账:根据累计消费自动升级使用层级,每个层级有对应的开票阈值(Tier 1: $20,Tier 5: $10,000)。需预先绑定信用卡或预充值。可设置消费上限避免超支。
- C 端/个人:无直接 C 端产品,开发者通过 API 按量付费,无月费。
- 开发者/API:按 Token 付费,无最低消费。200 并发限制内免费扩容,超出需联系商务。
- 企业/私有化:Custom LLMs GPU 小时计费或 DeepCluster 长期合约,均需商务确认具体条款与 SLA。
应用场景
DeepInfra 的典型落地场景覆盖从个人实验到企业生产的全频谱:
-
生产级 LLM 推理:企业将 DeepSeek、Qwen、Llama 等开源模型接入客服系统、内容生成、代码辅助等生产流程。OpenAI 兼容的 API 使得迁移成本近乎为零,收益体现在从闭源 API 切换到开源模型后的成本下降和模型自主权提升。
-
RAG 与知识检索:结合 DeepInfra 的嵌入模型(bge、e5 系列)和重排序能力构建检索增强生成系统。同一 API Key 调用嵌入和生成模型,简化技术栈。需关注不同嵌入模型的最大 Token 限制(512 或 8K)与多语言适配性。
-
图像与视频生成:利用 FLUX 系列模型进行电商产品图、广告创意、概念设计的批量生成。计费按分辨率和迭代次数,适合需要高频出图的团队。FLUX-2-klein 系列为轻量模型,生成速度更快、成本更低。
-
多模态文档理解:使用 Gemma 4、Qwen-VL 等模型进行发票识别、合同信息提取、表格 OCR。通过视觉 API 直接传入文档截图,无需预处理管线。
-
Agent 与工具调用:DeepSeek V4-Pro、Claude Fable 5 等模型支持 Function Calling 和工具调用,可用于构建 AI Agent 应用。Priority 服务层级可确保 Agent 多步推理的低延迟。
-
模型微调与私有部署:在 DeepInfra GPU 上部署自有微调模型,结合自动扩缩容服务生产流量。适合有数据主权要求或需要定制模型行为的企业。
适用人群
DeepInfra 的多层服务形态覆盖以下四类角色:
-
AI 应用开发者:需要快速集成推理能力,关注 API 兼容性、模型丰富度和价格。DeepInfra 的 OpenAI 兼容 API 使其几乎无需修改代码即可从 OpenAI 迁移,适合做模型选型验证和生产部署。
-
DevOps 与基础设施团队:负责 GPU 集群管理和推理成本优化。DeepInfra 的 deepctl CLI、私有部署和 DeepCluster 选项为其提供了从托管 API 到裸金属 GPU 的完整控制梯度。
-
AI 研究与实验人员:需要频繁切换不同模型进行对比评测。DeepInfra 的 100+ 模型库和统一 API 降低了多模型评估的工程开销。
-
企业 AI 平台负责人:评估推理供应商的合规、安全和成本。DeepInfra 的 SOC 2 / ISO 27001 认证、零数据留存策略和美国自建数据中心是其区别于公有云 API 的关键差异点。
不适配边界:DeepInfra 不适合需要深度绑定单一模型厂商生态的场景(如需要 Azure OpenAI 的企业合同)、对全球多区域部署有即时需求(目前以美国数据中心为主)、或仅需极低推理量且对延迟不敏感的个人实验场景(此时免费或廉价替代方案更合适)。
总结与展望
DeepInfra 的核心竞争力在于"开源模型生态 + OpenAI 兼容 API + 自建推理基础设施"的垂直整合。它不是最便宜的推理 API(部分模型 Flex 层级可以做到很低的成本),也不是功能最丰富的(不提供模型训练服务),但对于需要在生产有境中规模化使用开源模型的开发团队和企业,它在兼容性、模型广度和基础设施可控性之间提供了当前市场上少见的平衡。
当前限制:数据中心目前集中在美国,全球覆盖有限;默认 200 并发限制对高流量场景需要额外商务沟通;平台本身不提供模型训练或微调服务,仅聚焦推理层。
采购/采用风险评估:对创业团队和中小型开发者,建议先用 Standard 层级 + 按量付费跑通原型,验证 API 兼容性和模型效果后,再根据实际用量评估是否需要 Priority 层级或私有部署。企业采购前需重点确认:并发配额提升流程、数据留存策略的具体条款(尤其是输入输出是否用于服务改进)、DeepCluster 合约的提前终止条件,以及未来对非美国数据中心的覆盖计划。对于已使用 OpenAI API 的团队,DeepInfra 是一个低迁移成本的开源模型替代方案,但不应视为闭源模型的完全替代——某些场景(如超长上下文角色扮演、特定领域闭源模型)仍需要保留多家供应商。
DeepInfra 的平台版本演进
DeepInfra 作为 SaaS 平台,没有传统意义上的软件版本号,其演进体现在模型支持扩展、硬件升级和融资里程碑上。
平台初始阶段(2022–2024)
- 2022 年 9 月:公司成立,由前 imo 团队创立。
- 2023–2024 年:推出推理 API 初始版本,逐步增加开源模型支持,建立美国数据中心基础设施。
高速扩展阶段(2025)
- 模型库扩展至 100+:覆盖主流开源 LLM、多模态、图像生成和语音模型。
- 硬件升级:引入 H200 和 B200 GPU 支持,提升推理吞吐和能效。
- 合规认证:获得 SOC 2 和 ISO 27001 认证,零数据留存策略落地。
Series B 里程碑(2026-05)
- 2026 年 5 月 4 日:宣布 1.07 亿美元 Series B 融资,Token 处理量较 Series A 增长 25 倍。
- DeepCluster 发布:推出 B300 专属 GPU 集群租赁服务,5 年合约 $1.98/GPU-h。
- 新模型持续接入:Anthropic Claude Fable 5、Claude Sonnet 5、GLM-5.2、Kimi K2.7-Code、Qwen3.6 等最新模型均在发布后快速上线。
限制与不适配场景
该工具在以下场景中存在使用限制:
场景适配边界 需要高度行业专业知识的任务、对输出格式有严格规范的场景、需要零错误的自动化流程可能效果不达预期。AI 输出应作为初稿或辅助参考,最终结果需人工核验。
技术限制 上下文长度有限、复杂推理准确性可能不足、免费版有使用额度。建议在正式采用前通过试用验证核心场景的可用性。
版本信息
- DeepInfra Series B 版本 :B 轮融资 1.07 亿美元;Token 处理量较 A 轮增长 25 倍;推出 DeepCluster B300 集群;新增 Claude Fable 5/Sonnet 5、GLM-5.2、Kimi K2.7-Code 等模型;8 个美国数据中心运营。
- 平台初始版本 :DeepInfra 公司成立,推出 AI 推理 API 初始版本,从零构建推理优化基础设施。
- DeepStart 创业计划 :推出面向初创企业的 10 亿免费 tokens 计划,要求融资 25 万-1000 万美元且成立不超过 2 年。暂无官方精确日期。
- Series A 里程碑 :完成 A 轮融资;此后 Token 处理量增长 25 倍;扩展模型库至 100+;获得 SOC 2/ISO 27001 认证。暂无官方精确日期与金额。
用户评价