FreeLLMAPI
免费
FreeLLMAPI 是开源的 OpenAI 兼容代理服务,聚合 Google Gemini、Groq、Cerebras、Mistral 等 28+ 家 AI 服务商的免费额度,每月总计约 40 亿 tokens 免费推理容量,支持智能路由、自动故障转移AES-256-GCM 密钥加密和可视化仪表盘。
FreeLLMAPI:开源 LLM 免费额度聚合代理网关深度解析
核心参数与统计
| 项目 | 规格 |
|---|---|
| 项目名称 | FreeLLMAPI |
| 分类 | AI 编程 / API 代理 |
| 开源许可 | MIT |
| GitHub Stars | 16.4k |
| 编程语言 | TypeScript (主要) |
| 交付形态 | 自托管 / Docker / 桌面应用 |
| 目标用户 | 开发者 / 个人 / 小团队 |
| 核心赞助方 | 社区驱动,无商业赞助 |
FreeLLMAPI 的核心价值主张清晰且直接:将 28+ 家 AI 服务商的免费额度聚合为一个统一的 OpenAI 兼容 API 端点,月均聚合约 40 亿 tokens 的免费推理容量。它不是又一个"LLM 聚合平台",而是定位于个人开发者在本地实验中"零成本调用多模型"的工程化解决方案。MIT 许可意味着商用和二次分发均无法律障碍。GitHub 16.4k Stars 在 API 代理类项目中属于头部水平,反映了社区对"聚合免费额度"这一需求的强烈程度——有趣的是,Stars 数本身也是项目持续更新的动力之一。
用户与市场认可
FreeLLMAPI 的市场认可度可以从三个维度拆解:社区指标、使用场景覆盖和竞争定位。
社区指标:GitHub 16.4k Stars、2.4k Forks,47 位贡献者(截至 2026 年 7 月)。Stars 增长曲线在 v0.5.0 发布后出现明显加速(新增 9 家提供商 + Anthropic 兼容 API + MCP 服务器支持),说明每次功能大版本更新都会触达新一波用户。Release 频率约每月一个 minor 版本,0.3.0(2026-06-10)→ 0.4.1(2026-06)→ 0.5.0(2026-07-18),迭代节奏健康。
使用场景的扩散路径:项目早期用户主要是需要零成本调用多个 LLM 做原型验证的个人开发者。随着 v0.5.0 加入 MCP 服务器、图像生成和 TTS 支持,用户群开始向以下方向扩展:(1) 需要 RAG 原型搭建的 AI 应用开发者;(2) 需要低成本多模型评测的数据科学家;(3) 需要在本地搭建 AI 服务网关的小团队。
竞争定位:与 OpenRouter(月处理 100 万亿 tokens 的商业网关)不同,FreeLLMAPI 走的是"自托管 + 免费额度聚合"路线。OpenRouter 的卖点是 400+ 模型选择和零运维,FreeLLMAPI 的卖点是零费用和数据不离开本地。两者在用户群上存在重叠——开发者可能在原型阶段用 FreeLLMAPI,到生产阶段切换 OpenRouter 或直接使用 API Key。这种"Up-selling"式自然分流对社区项目来说反而是一种生态定位证明。
成本优势
| 成本维度 | 说明 |
|---|---|
| 软件许可 | $0(MIT 许可,商用和二次分发均允许) |
| 基础设施 | 自备服务器/云资源(推荐 1 vCPU + 2GB RAM,单机部署) |
| 部署运维 | 需基础 Docker 或 Node.js 运维能力 |
| API 调用费 | $0(聚合第三方免费额度) |
| 商业支持 | 仅社区支持(GitHub Issues / Discussions) |
TCO 推演(12 个月,个人开发者场景):
- FreeLLMAPI 自部署:云服务器约 ¥50/月 × 12 = ¥600 + 运维人力约 2 小时初始部署 + 1 小时/月维护 ≈ ¥600-900/年
- 商业 API 直连(同等调用量):假设日均调用 28 家提供商各 10 次,直接通过官方 API 调用,无免费额度利用 ⇒ 月费约 $50-200(视调用量) ≈ ¥4,000-16,000/年
- 商业 API 网关(如 OpenRouter):同上调用量,约 $10-50/月 ≈ ¥800-4,000/年
关键结论:FreeLLMAPI 的零软件许可费 + 零 API 调用费使其在"多提供商、中等调用量"场景下的成本优势极为显著。但需注意,第三方免费额度的可用性和速率限制变化不受项目控制——某家服务商若调整免费策略,聚合总容量就会缩水。
架构与核心能力
- 架构总览:FreeLLMAPI 采用前后端分离架构。后端核心是一个 TypeScript 实现的 API 代理服务,接收 OpenAI 兼容格式的请求,通过内置的路由器将请求分发到 28+ 家的底层 API 端点。前端提供可视化仪表盘(桌面应用内置),用于查看各提供商的调用量、剩余免费额度和延迟统计。数据流为:用户 → OpenAI 兼容请求 → FreeLLMAPI 路由器 → 目标提供商 API → 响应聚合 → 用户。
- 核心引擎(智能路由器):路由器的核心功能包括:(1) 模型到提供商的映射——维护一个动态模型目录,将"模型名称 + 请求参数"映射到可用的免费提供商端点;(2) 自动故障转移——如果首选提供商返回 429(限流)或 5xx(服务端错误),路由器自动切换到备选提供商;(3) 成本感知调度——优先使用剩余免费额度最多的提供商,平衡各提供商的调用配额。v0.5.0 引入的签名模型目录使路由器可以自动同步最新的提供商模型列表,无需手动配置。
- 扩展机制:通过结构化提供商适配系统(Structured Provider Adapter System),新增提供商只需要实现标准化接口。社区贡献了大多数提供商的适配器,这降低了单一维护者的负担。此外,v0.5.0 增加了 MCP(Model Context Protocol)服务器支持,使 FreeLLMAPI 可以作为 MCP 客户端与其他 MCP 服务器交互——这是一个重要的生态扩展点,使 FreeLLMAPI 从"API 代理"升级为"AI 服务网关"。
- 安全设计:API Key 以 AES-256-GCM 加密存储在本地,密钥派生使用 PBKDF2。响应缓存机制减少了重复请求对免费额度的消耗。但需要注意:加密仅用于静态存储,运行时的 API Key 仍以明文形式存在于内存中,这是所有 API 代理项目的共通局限。
模型与版本演进
| 版本 | 日期 | 关键变化 |
|---|---|---|
| v0.5.0(最新) | 2026-07-18 | 新增 9 家提供商、Anthropic 兼容 API、图像生成/TTS、MCP 服务器、结构化输出、响应缓存、安全加固 |
| v0.4.1 | ~2026-06 | 修复与稳定性更新,桌面版安装程序命名修复 |
| v0.3.0 | 2026-06-10 | Premium 实时模型目录上线,路由器自动同步签名模型目录,结构化提供商适配系统 |
版本节奏从 v0.3.0 到 v0.5.0 约 6 周,属于快速迭代期。v0.5.0 的更新量最大——新增 9 家提供商使聚合容量显著提升,Anthropic 兼容 API 和 MCP 服务器的加入大幅扩展了适用范围。项目的版本号策略是"功能导向"而非"稳定性导向":minor 版本增量的主要信号是新功能上线,而非接口稳定性承诺。这意味着生产环境中使用固定版本(而不是 latest tag)是更稳妥的策略。
技术优势
- 架构设计:模块化适配器架构使新增提供商成本极低——社区贡献者通常可以在 2-4 小时内完成一个新提供商的适配器编写。路由器的智能故障转移机制将单点故障的影响范围限制在单个提供商级别,不会导致整个服务的请求失败。前后端分离的设计使前端仪表盘和后端路由可以独立迭代。
- 性能表现:FreeLLMAPI 本身的代理延迟极低(毫秒级),总请求延迟主要取决于目标提供商 API 的响应速度。通过响应缓存机制,对相同请求的二次调用可以直接返回缓存结果,避免重复消耗免费额度。基准测试显示,在 1 vCPU + 2GB RAM 的配置下,FreeLLMAPI 可处理约 500 RPM(请求/分钟),足以覆盖个人和小团队的使用场景。
- 安全设计:(1) API Key 静态加密(AES-256-GCM + PBKDF2);(2) 请求日志可配置脱敏级别;(3) 响应缓存支持 TTL 策略。安全设计的核心局限在于 API Key 在运行时以明文存在于内存中——这在单用户本地部署场景中风险可控,但在多用户共享部署场景中需要额外的隔离措施。
- 可观测性:桌面应用内置可视化仪表盘,显示各提供商的调用量、剩余额度和延迟分布。日志支持结构化输出(JSON),可接入 ELK/Loki 等日志平台。指标通过 Prometheus 格式暴露,可被 Grafana 等监控系统采集。
部署踩坑指南
基于社区部署经验,以下常见问题:
1. 提供商 API Key 配置与管理:用户需要为每个想调用的提供商注册账号并获取 API Key,然后通过 FreeLLMAPI 的加密存储功能保存。常见坑点:不同提供商的 API Key 格式和权限管理差异很大——某些提供商(如 Google Gemini)需要项目级授权,而其他(如 Groq)只需要简单的 API Key。解决方案:按官方文档的"Provider Setup"部分逐家配置,先用单提供商验证通过后再逐步添加。
2. 免费额度速率限制(Rate Limit):聚合免费额度的代价是各提供商的速率限制各不相同且通常较严格。问题链:单提供商速率低 → 路由器自动故障转移 → 多提供商并行使用 → 部分提供商的"免费滥用检测"机制可能因为来自同一 IP 的请求模式而被触发。解决方案:配置请求队列和指数退避重试(Exponential Backoff),并在仪表盘中监控各提供商的调用频率,避免短时间聚集请求。
3. Docker 部署的内存资源规划:FreeLLMAPI 的 Node.js 进程默认内存使用约 200-400MB,在高并发下可达 1GB+。常见问题:在 512MB 的小规格云实例上部署后,进程因 OOM 被系统杀掉。解决方案:生产环境推荐 1 vCPU + 2GB RAM 的最小配置,并使用 --memory 和 --memory-swap 限制容器的资源上限。
4. 桌面应用与系统代理冲突:桌面版内置的仪表盘和配置工具在某些企业网络环境中与系统代理设置冲突,导致无法连接外部 API。解决方案:在桌面版设置中手动配置代理穿透规则,或在终端中使用 Docker 部署而非桌面版。
如何使用
| 入口 | 安装/使用方式 |
|---|---|
| GitHub 源码 | git clone https://github.com/tashfeenahmed/freellmapi.git → npm install → 配置 .env → npm start |
| Docker | docker pull ghcr.io/freellmapi/freellmapi:latest → docker run -p 3000:3000 -v ./config:/app/config freellmapi |
| 桌面应用 | GitHub Releases 下载对应系统安装包 → 安装 → 图形化界面配置 |
| 一键脚本 | curl -fsSL https://get.freellmapi.dev \| bash(社区维护,以官方 README 为准) |
快速上手步骤:
- 使用 Docker 部署:
docker run -d -p 3000:3000 --name freellmapi ghcr.io/freellmapi/freellmapi:latest - 访问 http://localhost:3000 ,通过仪表盘添加至少一个提供商的 API Key(如 Groq 或 Gemini)。
- 验证调用:
curl http://localhost:3000/v1/chat/completions -H "Authorization: Bearer local" -d '{"model":"gpt-3.5-turbo","messages":[{"role":"user","content":"Hello"}]}' - 将 OpenAI SDK 的 base_url 指向
http://localhost:3000/v1,即可使用标准 OpenAI 兼容 SDK 调用聚合的免费模型。
API 调用示例(Python):
from openai import OpenAI
client = OpenAI(
base_url="http://localhost:3000/v1", # FreeLLMAPI 端点
api_key="local" # 默认本地密钥
)
response = client.chat.completions.create(
model="gpt-3.5-turbo", # FreeLLMAPI 自动映射到有免费额度的模型
messages=[{"role": "user", "content": "写一段关于 AI 网关的简介"}]
)
print(response.choices[0].message.content)
产品定价(开源项目通常免费)
| 层级 | 价格 | 包含内容 |
|---|---|---|
| 开源核心 | $0 | 全部核心功能(MIT 许可) |
| 云托管版 | 暂无 | 目前仅提供自部署和桌面应用 |
| 企业版 | 暂无 | 社区驱动,无商业版本 |
FreeLLMAPI 当前完全开源免费。但如果你的团队计划在生产环境中大规模使用,以下隐性成本需要计入:部署运维人力(初始 setup 约 2-4 小时,日常维护约 1-2 小时/月)+ 基础设施费用(云服务器 ¥50-200/月)+ 第三方 API 免费额度的"管理成本"(监控各提供商的额度余量和策略变更)。
应用场景
- 场景一:多模型原型验证 —— 在开发 AI 应用的原型阶段,需要快速尝试不同模型的输出效果(如 GPT-4o vs Gemini vs Claude 的代码生成质量对比)。传统做法需要逐家注册 API Key、管理不同厂商的 SDK、分别调用后手动汇总。FreeLLMAPI 将这一过程简化为:配置一次 API Key → 通过统一端点调用 → 仪表盘中查看各模型结果。ROI 推演:原型阶段的 API 调用量通常在数百万 tokens 级别,使用 FreeLLMAPI 聚合免费额度可直接将这一阶段的调用成本降至零。
- 场景二:本地 AI 服务网关 —— 在本地网络中搭建一个 AI 服务网关,团队内的多个应用共享同一个网关实例。FreeLLMAPI 的路由器和缓存机制可以避免团队内重复调用同一模型,提高免费额度的利用效率。核验方法:仪錶盘中的调用统计可直接反映各提供商的额度消耗速度。
- 场景三:数据隐私优先的批量推理 —— 对于包含敏感数据的批量推理任务(如内部文档分析),用户可以通过 FreeLLMAPI 将请求路由到提供免费额度的服务商,但数据不经过第三方网关,降低了数据泄露的风险面。局限:数据最终仍会到达目标提供商的服务端,如果目标提供商有数据留存政策,这一风险仍然存在——只能通过选择数据留存政策透明的提供商来部分缓解。
适用人群
- 个人开发者:需要零成本调用多 LLM 进行原型验证、功能测试或学习实验的独立开发者。对 Docker/Node.js 有基础了解即可上手。
- 数据科学家/ML 工程师:需要在不同模型上做基准测试和效果对比。FreeLLMAPI 的统一调用接口使模型切换成本降到最低。
- 小团队/AI 应用 Startup:在预算有限的前提下为团队提供多模型调用能力。自部署模式确保 API Key 不离开本地网络。
- 不适配边界:(1) 需要 SLA 保障的生产级 API 网关(建议使用 OpenRouter、Anthropic/OpenAI 直接 API);(2) 无技术团队的组织(建议使用云托管服务);(3) 对 API 响应延迟有严格要求的实时场景(FreeLLMAPI 的代理层引入毫秒级额外延迟,且免费额度的速率限制可能导致更高延迟)。
竞品对比
| 对比维度 | FreeLLMAPI | OpenRouter | One API | LiteLLM |
|---|---|---|---|---|
| 开源/闭源 | 开源(MIT) | 闭源(SaaS) | 开源(MIT) | 开源(MIT) |
| 核心定位 | 聚合免费额度 | 400+ 模型商业网关 | 自建 API 网关 | LLM 代理库 |
| 部署方式 | 自托管 / Docker / 桌面 | SaaS | 自托管 / Docker | Python 库 |
| 提供商数量 | 28+(聚焦免费额度) | 400+(含付费和免费) | 按自定义配置 | 200+ |
| 免费额度利用 | 核心功能(路由器自动调度) | 有限(按提供商本身) | 需手动配置 | 需手动配置 |
| 故障转移 | 自动(智能路由器) | 自动 | 手动配置 | 手动配置 |
| 加密存储 | AES-256-GCM | 服务端(商业级) | 无内置 | 无内置 |
| 社区活跃度 | 16.4k Stars, 47 贡献者 | N/A(闭源) | 5.2k Stars | 12.6k Stars |
| 适用场景 | 个人/小团队免费多模型 | 生产级多模型网关 | 企业内 API 管理 | Python 应用集成 |
总结与展望
FreeLLMAPI 在开源 API 代理领域提供了一个高度聚焦的解决方案——"聚合免费额度"。它没有试图成为又一个通用的 API 网关(如 One API 或 LiteLLM),而是通过智能路由器、自动故障转移和加密存储这三大能力,将"免费调用 28+ 家模型"这一任务的工程复杂度降到最低。
当前优势:(1) 零 API 调用费 + 开源 MIT 许可,经济性优势在原型验证和实验场景中极为显著;(2) 智能路由器和自动故障转移将多提供商管理的复杂度对用户隐藏;(3) 响应缓存和加密存储等工程化设计超出了大多数同类开源项目。
已知局限与风险:(1) 免费额度的不可控性——第三方提供商的免费策略变化不在项目控制范围内。假设某日 Groq 或 Gemini 调整免费额度上限,聚合容量会直接缩水。这一风险无法通过软件升级解决,只能通过多提供商"冗余"来部分对冲。(2) 社区项目的可持续性——47 位贡献者和单一主要维护者的结构意味着项目活力高度依赖核心维护者的时间投入。(3) 生产级能力的缺失——无 SLA、无商业支持、无企业级权限管理,意味着 FreeLLMAPI 更适合"搭建原型和实验环境"而非"承载生产流量"。
后续关注方向:(1) 提供商网络的地域扩展——亚洲和南美提供商的覆盖范围;MCP 服务器生态的成长速度——这可能成为 FreeLLMAPI 走向"AI 服务网关"的差异化路线;社区版 vs 企业版的商业化路径是否会出现——这关系到项目的长期可持续性。
建议在原型验证和本地实验场景中优先使用 FreeLLMAPI,然后将生产流量迁移到 OpenRouter 或直接 API Key。这既能利用免费额度降低实验成本,又能避免社区项目的可持续性风险对生产环境产生影响。
限制与不适配场景
该工具在以下场景中存在使用限制:
场景适配边界 需要高度行业专业知识的任务、对输出格式有严格规范的场景、需要零错误的自动化流程可能效果不达预期。AI 输出应作为初稿或辅助参考,最终结果需人工核验。
技术限制 上下文长度有限、复杂推理准确性可能不足、免费版有使用额度。建议在正式采用前通过试用验证核心场景的可用性。
版本信息
- v0.5.0 :新增 9 家提供商Anthropic 兼容 API、图像生成/TTS、MCP 服务器、结构化输出、响应缓存、安全加固等。
- v0.3.0 :Premium 实时模型目录上线,路由器自动同步签名模型目录,新增结构化提供商适配系统。
- v0.4.1 :修复与稳定性更新,桌面版安装程序命名修复。暂无官方精确日期。
用户评价