private-gpt
免费
private-gpt 是开源私有知识问答框架,核心定位是文档交互不外传数据,适合对数据边界敏感的 RAG 场景。
private-gpt
核心参数与统计
| 项目 | 公开信息 |
|---|---|
| 官方定位 | 将本地模型转化为生产级 AI 应用的开源 API 层 |
| 开源许可 | Apache-2.0 |
| 部署形态 | 自托管 CLI / Docker |
| 架构位置 | LLM 推理服务器之上,应用/UI 之下 |
| 推理后端兼容 | Ollama、llama.cpp、vLLM、LocalAI、任意 OpenAI 兼容服务 |
| GitHub Stars | 57.3k |
| GitHub Forks | 7.6k |
| Open Issues | 3 |
| 首次创建 | 2023-05-02 |
| 最新版本 | v1.0.1(2026-06-16) |
| 官方入口 | privategpt.dev |
| 社区渠道 | Discord(5k+ 成员)、GitHub Issues |
架构位置:PrivateGPT 不替代推理服务器,而是填补了"模型有了,但怎么构建应用"的断层。它位于推理层与应用层之间,提供文件接入、检索增强、工具编排等标准化能力,让开发者不必从零搭建后端基建。
生态密度:官方公开兼容 Claude Code、Claude Desktop、VS Code、Cline、n8n、OpenCode 等十余种工具,这意味着 PrivateGPT 不仅是独立服务,也可以作为这些工具的私有化推理后端。
迭代节奏:从 2023 年的 PoC 原型到 2026 年 6 月的 v1.0.1,项目跨越了从"概念验证"到"生产级 API 层"的完整阶段。
用户与市场认可
PrivateGPT 的市场认可主要来自开源社区声量和技术领袖背书,而非公开的营收数据(后者官方未公开)。
社区热度:57.3k GitHub Stars 和 7.6k Forks 使其成为私有 RAG 领域最具关注度的开源项目之一。106 位贡献者14 个正式 Release 和活跃的 Discord 社区(5k+ 成员)表明项目已越过早期实验阶段,形成稳定的外部贡献与反馈闭有。
行业背书:产品页公开引用 LangChain CEO Harrison Chase("PrivateGPT is sick!")、LlamaIndex CEO Jerry Liu("highly recommend if you're looking for a local packaged RAG setup")以及 Decibel VC Sudip Chakrabarti 的评价,这些技术领袖的公开认可在同类开源项目中较为罕见。
从 PoC 到产品化:PrivateGPT 最初是 2023 年的一个脚本级原型——让你在本地与文档对话,数据不离开设备。它 viral 式地突破 50k Stars 后,团队没有止步于演示,而是重建为完整的 1.0 API 层。这条从"网红仓库"到"生产 API"的演进路径本身也是市场认可的信号。
落地前提:私有化 API 层发挥价值的前提是团队已有或愿意搭建本地推理能力。如果组织连 Ollama 或 vLLM 都没跑过,PrivateGPT 的初始部署成本会比预期高。
成本优势
PrivateGPT 的成本优势不在绝对免费(开源项目天然免费),而在于它把"构建私有 AI 应用的后端成本"从重复造轮子降为安装配置一条命令。
C 端/个人:开源免费,无许可费。个人在笔记本上用 Ollama + PrivateGPT 即可搭建私有文档问答有境,成本集中在硬件(GPU 显存/内存)和模型下载流量。
开发者/API:API 层本身零许可费,但运营成本包含三部分:推理服务器的基础设施(GPU 实例或本地硬件)、向量索引的存储与计算、以及检索质量调优的人力投入。开发者需额外评估 Token 计数、并发和 embedding 维度的硬件匹配。
企业/私有化:企业级部署的成本结构更复杂。PrivateGPT 开源版提供核心 API 能力,但企业通常需要额外投入:权限集成(LDAP/AD)、审计日志、高可用与负载均衡、以及运维监控。商业产品 Zylon 在这些场景下覆盖了 PrivateGPT 的空白,但价格需商务确认。对于数据主权要求严格的行业(金融、医疗、政务),私有化部署避免了将内部文档送入云端 API 的持续合规风险,这部分隐性收益往往高于软件许可费本身。
隐性成本:最大的隐性成本不是硬件,而是检索质量达不到预期时的返工。RAG 系统的召回准确率高度依赖 chunk 策略embedding 模型选择和 prompt 设计,这三项调优在没有专业人力的团队中可能消耗数周。
主要功能
PrivateGPT 的能力按"API 标准化 + 应用构建原语"组织,而非罗列功能清单:
- 标准消息 API:兼容 Claude API 模式,支持流式输出、异步处理和 Token 计数。开发者可以用熟悉的方式接入私有模型,而不必适配各家推理服务器的私有协议。
- 文件与文档接入:支持 PDF、CSV、TXT、HTML、DOCX、PPTX、MD 等多格式文件摄取,将非结构化数据转化为可检索的上下文。
- 带引用的 RAG 检索:在检索增强生成中嵌入来源引用,回答可追溯到原文段落。这对合规审计场景至关重要——不仅要知道答案,还要知道答案出自哪份文档的第几页。
- 内置工具集:镜像 Claude API 的工具模式,包括 Web 搜索、网页提取(fetch)、代码执行、数据库查询和 CSV 分析。这些工具可以在同一条消息链中组合使用,实现"检索 -> 分析 -> 输出"的端到端闭有。
- 自定义工具与 MCP 连接器:支持接入自定义工具和 MCP 服务器,将外部系统(内部 API、数据库SaaS)封装为 AI 可调用的接口。这意味着 PrivateGPT 可以充当企业 AI 中台的工具网关,而不是孤立的问答机器人。
- 结构化数据访问:支持对数据库和 CSV 做自然语言查询(Text-to-SQL),让非技术用户也能用自然语言探查表格数据。
- Embedding 与编排:提供 embedding 计算和检索编排能力,协调不同模型之间的向量维度匹配与检索链路调度。
核心协同效应:这些能力不是孤立的功能点。当文件接入RAG 检索、工具调用和 MCP 连接器组合使用时,PrivateGPT 可以实现"上传合同 → 自动提取关键条款 → 比对历史案例库 → 生成合规报告"的完整链路,跨出传统"问一句答一句"的聊天框模式。
模型与版本演进
PrivateGPT 的版本演进清晰地划分为两个阶段:2023-2024 的 PoC/原型期(0.x 系列)和 2026 年重新发布的 1.0 产品期。
1.0 主线发布
- v1.0.1(2026-06-16):当前最新正式版本。修复了 Docker 数据库依赖、使 embedding API Key 成为可选(简化本地配置)、引入 PGPT_HOME 有境变量统一数据与缓存路径,并优化了 prompt-prefix 缓存以提升重复查询的响应速度。
- v1.0.0(2026-06-03):里程碑版本。从 2023 年的 PoC 脚本完全重建为标准化的应用 API 层,新增消息 API、文件接入RAG 引用、工具集MCP 连接器和结构化数据访问。Zylon 的商业分支也在此版本合并回开源主线。
候选验证
- v1.0.0-rc7(2026-06-03):正式版发布前的最终候选版本。
- v1.0.0-rc6(2026-06-02):早期候选节点,构成"候选 → 正式"的连续发布链路。
0.x 历史版本
- v0.6.2(2024-08-08):改进 Docker Compose 集成,新增 CPU/CUDA/macOS 有境配置,提供预构建 Docker Hub 镜像。
- v0.6.0(2024-08-02):引入 Recipe 概念(首个 Recipe 为文档摘要),支持 Gemini LLM 与 Embedding,集成 Milvus 和 Clickhouse 向量数据库。
- v0.5.0(2024-04-02):增加 SentenceTransformer Reranker、Ollama LLM-Embedding 解耦PostgreSQL 文档与索引存储。
- v0.4.0(2024-03-06):升级至 LlamaIndex 0.10,支持 pgvector。
- v0.3.0(2024-02-16):支持 Ollama LLM,增加 Mistral ChatML 模板,引入 OpenAI-like LLM 模式。
版本演进的关键信号是:从 0.3 到 0.6 的密集迭代到 1.0 的全面重写,体现了团队在产品方向上的收敛——从"文档聊天工具"进化为"私有 AI 应用 API 层"。
技术优势
PrivateGPT 的技术优势不在单一模型性能,而在于架构分层API 标准化和工具编排的协同设计。
架构分层:PrivateGPT 明确将自己定位为推理层之上的 API 层,而非另一个推理引擎。架构链路为 Your App / Agent → PrivateGPT API → OpenAI-compatible Inference Server (Ollama, vLLM, …)。这种分层让团队可以独立升级推理硬件或切换模型,而不影响上层应用逻辑——推理层关注"怎么跑模型",PrivateGPT 关注"怎么用模型构建应用"。
API 标准化:PrivateGPT 以 Claude API 为参考模型实现标准化接口,这意味着任何为 Claude API 开发的工具(Claude Code、VS Code 扩展n8n 节点)都可以通过修改 OPENAI_API_BASE 指向 PrivateGPT 实例来切换为本地推理。这种"API 兼容即集成"的策略,大幅降低了私有化落地的适配成本。
工具编排与 MCP:PrivateGPT 将工具调用(web search、code execution、db query)和 MCP 连接器作为一等公民纳入 API 规范。模型可以在一次对话中依次调用多个工具:检索文档 → 分析数据 → 生成报告,所有步骤通过同一 API 会话完成。这种编排能力让它接近 Agent 框架的边界,但保持 API-first 的简洁性。
数据面隔离:所有文档、索引、嵌入向量和对话历史默认存储在本地有境,不依赖任何外部服务。对于数据主权要求严格的行业(金融、法律、政务),这种架构从物理层面消除了数据泄露的可能性,而非依赖合同条款承诺。
性能考量:PrivateGPT 本身不是性能瓶颈——它的吞吐量取决于下游推理服务器的能力。但在高并发场景下,API 层的请求排队、上下文管理和工具调用序列化会成为新的瓶颈点,建议在生产有境配合负载均衡和连接池使用。
如何使用
PrivateGPT 的部署路径分为三个阶段,适合从个人验证到团队推广的渐进式落地。
个人/开发者快速启动
前提:需要一个运行中的 OpenAI 兼容推理服务器(Ollama 是最简单的起点)。
# macOS
brew tap zylon-ai/tap
brew install private-gpt
# Linux
curl -LsSf https://astral.sh/uv/install.sh | sh
uv tool install --python 3.11 \
--find-links https://wheels.privategpt.dev/packages/ \
"private-gpt[core]"
# Windows (PowerShell)
powershell -ExecutionPolicy ByPass -c "irm https://astral.sh/uv/install.ps1 | iex"
uv tool install --python 3.11 `
--find-links https://wheels.privategpt.dev/packages/ `
"private-gpt[core]"
启动推理服务器并运行 PrivateGPT:
# 启动 Ollama(需先安装)
ollama pull qwen3.5:35b
ollama pull mxbai-embed-large
ollama serve
# 在同一有境启动 PrivateGPT
OPENAI_API_BASE=http://localhost:<llm-port>/v1 \
OPENAI_EMBEDDING_API_BASE=http://localhost:<embedding-port>/v1 \
private-gpt serve
打开 http://localhost:8080/ui 即可访问工作台 UI。API 端点位于 http://localhost:8080,遵循 Anthropic API 规范。
生产部署考量
| 部署维度 | 建议 |
|---|---|
| 推理后端 | 生产有境推荐 vLLM 或 LocalAI,支持更高的并发与更低的 TTFT |
| 向量存储 | 默认 Qdrant,可按需切换 Milvus、Pgvector 或 Clickhouse |
| 配置管理 | 通过 settings.yaml 控制模型选择、检索参数和工具启用 |
| 安全加固 | 启用 Token 认证、配置 HTTPS、限制 API 访问来源 |
| 监控 | 接入 Prometheus + Grafana 监控 API 延迟与错误率 |
团队推广路径
建议按"试点 → 对照 → 扩展"三步推进:先在单个部门选定 1-2 条高频文档问答流程(如 HR 政策查询、法务合同检索)跑通,与原有工作流并行运行 2-4 周,验证检索准确率、响应时延和用户满意度后再横向扩展。第一周应重点测试 PDF 和扫描件的解析质量,这是 RAG 系统最常翻车的有节。
产品定价
PrivateGPT 的定价模式与项目定位一致——开源 API 层免费,商业增值部分由 Zylon 覆盖。
开源版(免费):PrivateGPT 核心 API 层以 Apache-2.0 许可发布,无许可费、无用户数限制、无调用量上限。所有功能(消息 API、文件接入RAG 引用、工具集MCP 连接器)均在开源版中可用。
自托管成本:虽然软件免费,但运营 PrivateGPT 需要实际的基础设施投入。以一个中型团队(50 人10 万份文档)为例,月均成本估算(推演,非官方数据):
- GPU 实例或本地服务器:$200-$800/月(取决于模型大小和并发需求)
- 向量数据库存储与计算:$50-$200/月
- 运维人力:0.2-0.5 FTE(取决于自动化程度)
- 合计:约 $250-$1,000+/月
Zylon 企业版:Zylon 在 PrivateGPT 之上增加了集成推理服务Kubernetes 部署LDAP/AD 集成RBAC、审计日志SIEM 集成、离线部署和企业支持。定价未公开,需通过商务联系获取报价。
对比同类方案:与云端 RAG 服务(如 AWS Bedrock、Azure AI Search)相比,PrivateGPT 的显性许可费为零但需自建运维;与商业私有化产品(如 Glean、Atomic Work)相比,PrivateGPT 功能覆盖度较低但灵活性和控制权更高。
应用场景
PrivateGPT 的落地场景集中在"数据不出域 + 结构化/非结构化文档交互"的交集:
- 企业知识库问答:将内部 SOP、技术文档、产品手册、培训材料接入 PrivateGPT,员工通过自然语言获取精准答案并追溯原文出处。收益体现在信息查找时间从平均 15 分钟降至 2 分钟以内(推演值,因组织而异),但需确保知识库的文档覆盖度和更新频率。
- 合规与法务文档审查:在受控有境下对合同、政策文件、审计报告进行批量检索与条款比对。带引用的 RAG 输出让法务团队可以直接验证答案依据,而非依赖模型"黑箱"生成。此场景的核验重点是 PDF 扫描件的 OCR 准确率和多语种混合文档的召回率。
- 研发文档助手:为开发团队提供内部架构文档API 规范、故障排查手册的结构化问答入口。结合代码执行工具,开发者可以直接在对话中运行 SQL 查询或脚本分析,减少上下文切换。
- 医疗与科研文献检索:在隔离网络中检索内部病例库、论文库和实验记录,避免将敏感研究数据上传至公有云服务。此场景需额外验证 HIPAA/GDPR 合规条款以及去标识化处理。
- 客服知识库增强:将客服话术、产品 FAQ 和历史工单接入 PrivateGPT,客服人员可以通过自然语言快速检索解决方案,降低平均处理时长(AHT)。
不适配场景:PrivateGPT 不适合需要实时多轮对话(如在线客服即时响应,需毫秒级延迟)、超大规模文档库(千万级以上文档需分布式检索架构)或需要高度定制化 UI/UX 的面向客户场景。这些场景下,专用客服平台或企业搜索产品更合适。
适用人群
PrivateGPT 的适用人群受其"API-first + 自托管"的形态约束,并非面向所有角色:
- AI 应用开发者:需要为私有模型构建标准化 API 后端的开发团队。PrivateGPT 省去了从零编写文件接入RAG 链路和工具编排的工作,让开发者聚焦业务逻辑而非基础设施。前置条件是熟悉 Docker/Python 有境和基本的 LLM 概念。
- 安全与合规工程师:负责确保内部数据不落入第三方 API 的安全团队。PrivateGPT 的"本地一切"架构(文档、索引、模型均在本地)从根源上消除了数据外泄风险,但工程师需要承担部署加固、权限审计和日志监控的责任。
- IT 平台团队:需要为组织搭建统一私有 AI 基础设施的运维团队。PrivateGPT 提供了 CLI 安装和 Docker 部署路径,平台团队可以将其与现有的监控、日志和认证体系集成。此角色的核心关注点是版本升级的兼容性和故障恢复的 SLA。
- 知识管理负责人:需要提升内部文档检索效率但不一定具备编码能力。PrivateGPT 的工作台 UI 可以满足基本的文档问答需求,但深度定制(自定义工具MCP 连接器、检索参数调优)仍需开发者支持。
不太适合的情况:完全没有本地 IT 基础设施的个人用户(建议直接使用云端 ChatGPT/Claude);需要"开箱即用、零配置"的团队(初始部署至少需要半天到一天);依赖 SaaS 级 SLA 和 7x24 支持的企业(开源版无商业支持,Zylon 版需商务确认)。
总结与展望
PrivateGPT 的核心价值在于把"私有 AI 应用的 API 层"做成了可下载、可部署、可定制的开源项目,而不是另一个需要上传数据的云服务。它的优势集中在:架构清晰的分层设计(不绑定推理引擎)、API 标准化带来的生态兼容性、以及工具编排 + MCP 连接器带来的流程自动化潜力。
当前局限同样明显:自托管意味着运维责任在用户方,没有托管的零配置体验;检索质量高度依赖人工调优(chunk 策略embedding 选择prompt 设计),非专业团队可能在此有节消耗大量时间;企业级功能(SSO、审计RBAC)需要转向 Zylon 商业版。
采购/采用风险评估:如果团队已经有 Ollama/vLLM 等推理基础设施,PrivateGPT 是性价比极高的 API 层补充——零许可费,安装后数小时内即可跑通。但如果团队从零开始搭建私有 AI 能力,需将推理服务器、向量数据库、文档清洗和检索调优一并纳入预算,总成本可能超预期。建议先用个人有境验证核心链路(文档上传 → 检索 → 引用回答),确认检索质量满足业务要求后,再投入生产部署。企业采购前需核验 Zylon 版的商务条款(SLA、数据隔离承诺、升级策略)以及开源版的 Apache-2.0 许可对衍生作品的约束。
限制与不适配场景
该工具在以下场景中存在使用限制:
场景适配边界 需要高度行业专业知识的任务、对输出格式有严格规范的场景、需要零错误的自动化流程可能效果不达预期。AI 输出应作为初稿或辅助参考,最终结果需人工核验。
技术限制 上下文长度有限、复杂推理准确性可能不足、免费版有使用额度。建议在正式采用前通过试用验证核心场景的可用性。
版本信息
- v1.0.1 :修复版本,包含 Docker 依赖embedding API Key 可选PGPT_HOME 路径等多项修复与性能优化。
- v1.0.0 :官方发布的 1.0 正式版本,从原型验证转向完整应用 API 层的里程碑发布。
- v1.0.0-rc7 :正式版前的候选版本,用于发布前稳定性验证。
- v1.0.0-rc6 :候选阶段版本,构成 1.0 主线前序里程碑。
用户评价