Poolside AI
免费
Poolside AI 专注于企业级软件工程场景,自研代码大模型,提供代码生成、审查、测试与部署全流程 AI 辅助。
Poolside AI
Poolside AI 的核心参数与统计
Poolside AI 走的是"自研代码大模型 + 智能体平台"的整合路线——从模型层到 Agent 层再到企业部署层全部自建,不做任何通用 LLM 的套壳封装。其 Laguna 系列模型在 SWE-bench 系列基准上已进入第一梯队,同时 pool 智能体工具和 Poolside Platform 企业平台构成了完整的交付体系。
| 参数项 | 公开信息 |
|---|---|
| 产品定位 | 企业级 AI 软件工程平台(自研模型 + 智能体 + 部署基础设施) |
| 核心模型 | Laguna M.1(225B-A23B MoE)/ Laguna XS 2.1(33B-A3B MoE) |
| 上下文窗口 | 256K tokens(全系列) |
| 覆盖阶段 | 编码、审查、测试CI/CD、架构评审、项目管理 |
| 目标客户 | 中大型企业、政府/国防、金融/合规行业 |
| 部署方式 | 公有云 API / 私有云(AWS/Azure/GCP VPC)/ 裸金属 / 气隙部署(Dell 托管) |
| 模型许可 | Apache 2.0(M.1 & XS.2)/ OpenMDW-1.1(XS 2.1) |
| 智能体工具 | pool CLI(开源,ACP 协议,支持 MCP 扩展) |
| 公开融资 | 2024 年 10 月宣布 5 亿美元融资,训练集群扩展至 10,000 GPU |
| 创始团队 | co-CEO Jason Warner(前 GitHub CTO)& Eiso Kant(前 source{d} 创始人) |
与市面上多数"通用模型套壳做 IDE 插件"的竞品不同,Poolside 从模型训练到 Agent 运行时到企业管控台全部自研。其核心差异在于:模型以"代码执行反馈"(RLCEF)而非"下一个 token 预测"为训练信号,Agent 以"完成工程任务"而非"生成代码片段"为评估标准。
Poolside AI 的用户与市场认可
采用数据(官方披露):截至 2026 年 5 月,Laguna XS.2 和 M.1 发布 4 周内处理超过 1 万亿 tokens,XS.2 权重在 Hugging Face 上下载超 50,000 次。官方博客显示早期客户集中于政府/公共部门和大型企业,典型客户包括 Hunted Labs(软件供应链安全公司)等。
市场信号:Poolside 在 2024 年 10 月完成 5 亿美元融资(投资方未公开),资金用于将训练集群从 6,144 张 H200 GPU 扩展至 10,000 GPU 规模。团队规模约 60 人 Applied Research 团队(截至 2026 年 4 月)。
行业对标定位:Poolside 在 SWE-bench 系列基准上与同参数级模型处于同一梯队。以 33B-A3B 的 XS 2.1 对比:
- SWE-bench Verified:68.2%(vs Qwen3.6-35B-A3B 的 73.4%,vs Claude Haiku 4.5 的 73.3%)
- SWE-bench Multilingual:63.1%(vs Qwen3.6-35B-A3B 的 67.2%)
- SWE-Bench Pro:44.5%(vs Claude Haiku 4.5 的 52.4%)
- Terminal-Bench 2.0:30.1%(vs Qwen3.6-35B-A3B 的 51.5%)
以 225B-A23B 的 M.1 对比:
- SWE-Bench Pro:46.9%(vs DeepSeek-V4-Flash-284B-A13B 的 50.9%,vs Claude Sonnet 4.6 的 52.6%)
- Terminal-Bench 2.0:40.7%(vs DeepSeek-V4-Flash 的 52.5%,vs Claude Sonnet 4.6 的 56.9%)
结论:Poolside 的 MoE 架构在同等激活参数下效率突出(3B/23B 激活参数 vs 竞品 13B-17B),但在绝对分数上仍与头部闭源模型存在差距。最大的差异化在于"模型 + 智能体 + 企业部署"三位一体的交付模式,而非单一基准分数。
Poolside AI 的成本优势
Poolside 的定价结构覆盖开发者 API、企业订阅和自托管三个层级,透明度在各层级间差异较大。
C 端/个人开发者成本:
- 免费层:Laguna M.1 和 XS 2.1 均在有限时间内提供免费 API 使用(通过 platform.poolside.ai 和 OpenRouter)。免费层可能使用用户输入/输出来改进模型(以 OpenRouter 免费端点条款为准)。
- 按量付费(API):
- Laguna XS 2.1:$0.10/百万输入 tokens,$0.20/百万输出 tokens,$0.05/百万缓存读取 tokens
- Laguna M.1(OpenRouter):$0.20/百万输入 tokens,$0.40/百万输出 tokens
- Laguna XS 2.1 付费定价与 XS.2 保持一致
- 本地运行:XS 2.1 权重开源(OpenMDW-1.1),可在个人硬件上免费运行。模型压缩至 FP8/INT4/NVFP4 量化版本,配合 DFlash 推测解码,本地推理 tok/s 可翻倍。
API/开发者成本:
- 开发者可通过 OpenRouter 直接用现有 OpenAI SDK 调用,无需额外基础设施。
- 自建推理需考虑硬件成本:XS 2.1(33B-A3B,FP8)可在消费级 GPU 上运行;M.1(225B-A23B)需要数据中心级 GPU 集群。
- 无公开 API 速率限制(Rate Limit)数据,以官方实时页面为准。
企业/私有化成本:
- Poolside Platform 订阅制:以年度合同计价,包含模型权重Platform 管控台、容器化沙箱、审计追踪和 MCP 集成。
- 部署模式影响成本:
- 公有云 VPC 部署(AWS/Azure/GCP):按计算资源 + 订阅费计价
- 裸金属/气隙部署(Dell 托管):需一次性硬件采购 + 年度软件订阅
- 显性成本项:模型权重授权Platform 许可Forward Deployed 工程师驻场服务(FDRE)
- 隐性成本:初期 POC 验证周期(建议 4-8 周)、内部安全合规审查流程FDRE 人力成本
- 具体企业定价未公开,需商务洽谈。相比 API 按量付费模式,企业订阅更适合 token 消耗量大的团队。
成本对比总结:
| 层级 | 模式 | 价格区间 | 适用场景 |
|---|---|---|---|
| 个人/研究 | 免费 API + 开源权重 | $0(有限时限制) | 评估、实验、学术 |
| 开发者 | API 按量 / OpenRouter | XS 2.1: $0.10-0.20/M tokens | 个人项目、小团队集成 |
| 企业 | Platform 订阅 | 未公开(按合同) | 中大型工程团队、合规行业 |
Poolside AI 的主要功能
Poolside 的能力栈分为三层:模型能力层Agent 工具层、企业平台层。
模型层能力:
- 代码生成与补全:基于自然语言描述或上下文,生成完整函数、模块或重构方案。Laguna 系列在 256K 上下文中可处理大型代码库级别的理解与修改。
- 代码审查与缺陷检测:在 PR 流程中自动检查变更代码,发现潜在缺陷、安全漏洞和风格偏离。与传统 linter 不同,Poolside 模型能理解代码语义而非仅做模式匹配。
- 自动化测试生成:根据代码逻辑自动生成单元测试与集成测试用例,覆盖正常路径和异常边界。模型基于代码执行反馈训练,对"什么值得测"有更好的判断力。
- 架构分析与重构建议:分析代码结构变更的影响范围,给出架构层评估——适合大型重构、模块拆分或框架迁移场景的决策支持。
- 多语言覆盖:SWE-bench Multilingual 基准涵盖多种编程语言,验证了模型跨语言工程能力。
Agent 工具层(pool CLI):
- 交互式智能体:在终端中运行
/斜杠命令、@模糊文件搜索、!shell 模式等。 - 四种操作模式:
Always ask(默认):每次工具调用前请求批准Accept edits:自动批准文件读写Allow all:自动批准所有工具调用Plan:仅规划不修改代码
- ACP 协议支持:作为 ACP Server 嵌入 VS Code、Zed、JetBrains 等编辑器;也可作为 ACP Client 驱动其他智能体(Claude Agent、Codex 等)。
- MCP 集成:通过
pool mcp add连接外部 MCP Server,扩展工具能力(文件系统、数据库API 等)。 - 非交互模式:
pool exec支持 CI/CD 流水线中的单次任务执行,输出 JSON 格式结果。
企业平台层(Poolside Platform):
- 容器化沙箱执行:每个 Agent Session 在隔离容器中运行,内置密钥管理和网络策略控制。每个 Agent 动作(工具调用、文件编辑、推理步骤)都被记录为可搜索的轨迹(trajectory),支持审计回溯。
- 企业工具集成:通过集中管理的 MCP Server 连接 Slack、Jira、GitHub、Workday、Salesforce 等企业系统。
- 四层部署选项:裸金属、气隙托管(Dell 合作)、AWS/Azure/GCP VPC 部署。
- FDRE 服务:Forward Deployed Research Engineers 驻场协助团队识别高价值 Agent 工作流,首批自动化流程在数周内交付。
- 管理控制台:管理员集中定义安全边界、审批策略和数据访问规则;凭据加密存储、运行时注入、自动从输出中红action。
Poolside AI 的模型与版本演进
Poolside 在 2023 年 4 月成立后,经历了约两年的模型训练基础设施建设,于 2026 年开始密集发布模型和产品。以下为关键版本节点:
主线发布
| 版本 | 日期 | 核心变化 | 模型规格 |
|---|---|---|---|
| Laguna M.1 | 2026-04-28 | 首个旗舰模型发布,225B-A23B MoE,Apache 2.0 | 225B 总参/23B 激活,30T tokens 训练,6,144 H200 |
| Laguna XS.2 | 2026-04-28 | 首个开源权重模型发布,33B-A3B MoE,Apache 2.0 | 33B 总参/3B 激活,30T tokens 训练 |
| 256K 上下文升级 | 2026-05-26 | M.1 和 XS.2 上下文窗口从 128K 扩展至 256K | — |
| Laguna XS 2.1 | 2026-07-02 | XS.2 升级版,SWE-bench Multilingual +5.4 分 | 33B-A3B,OpenMDW-1.1 许可 |
| M.1 服务结束预告 | 2026-07-28 | M.1 将从 API 下线(OpenRouter 标注) | — |
候选验证
- Laguna XS.2(2026-04,Apache 2.0):首款开源模型,在 33B-A3B 参数量级达到 SWE-Bench Pro 44.5%。权重可在 Hugging Face 下载,支持 vLLM、SGLang、TRT-LLM、Ollama 等推理框架。
- Laguna XS 2.1(2026-07,OpenMDW-1.1):架构与 XS.2 相同,但在 SWE-bench Multilingual(+5.4 分)和 Terminal-Bench 2.0(+1.0 分)上有显著提升。新增 DFlash 推测解码支持,本地推理 tok/s 翻倍。同时发布 FP8/INT4/NVFP4 量化版本。
- Laguna M.1(2026-04,Apache 2.0旗舰):225B-A23B 的 MoE 模型,SWE-Bench Pro 46.9%、Terminal-Bench 2.0 40.7%。重点面向复杂多步工程任务。免费服务至 2026 年 7 月 28 日后下线 API,但开源权重仍可通过 Hugging Face 获取。
版本脉络说明
Poolside 的版本发布节奏显示:M.1 作为探路者验证了大规模 MoE 在代码场景的有效性,XS.2 将能力浓缩到可本地运行的规模并开源,XS 2.1 则在社区反馈基础上做了针对性改进。全部模型均使用"Model Factory"内部平台训练,该平台支持自动化评估RLCEF(基于代码执行反馈的强化学习)和 AutoMixer 数据配比优化。
Poolside AI 的技术优势
Poolside 的技术壁垒不在单一算法突破,而在"模型训练 → 智能体执行 → 企业部署"全链路的系统性整合。
RLCEF(Reinforcement Learning from Code Execution Feedback):这是 Poolside 最核心的技术差异。模型不是在"预测下一个 token"上优化,而是在"生成的代码能否通过测试执行"上做强化学习。模型在训练中探索数百万个任务、覆盖 130,000+ 真实代码库,每次尝试都获得代码执行反馈。这使得模型对"什么代码能跑"的理解远超纯语言模型。RLCEF 的异步 rollout 设计使用 GPUDirect RDMA 在数秒内完成数百 GB 权重传输,实现训练和推理的无缝衔接。
Model Factory 训练平台:Poolside 自建的端到端模型训练编排平台,将原本需要数周调度的人工流程压缩到 1 小时内。核心组件包括:
- Muon 优化器:相比 AdamW,在达到相同训练 loss 时节省约 15% 的步数,且学习率可跨模型规模迁移。分布式实现将正交化计算分散到各 rank,训练 M.1 时优化器开销不到步时间的 1%。
- AutoMixer 数据配比优化:训练约 60 个代理模型,每个模型使用不同数据配比,拟合性能预测回归器,自动搜索最优数据混合比例。代码能力由合成数据驱动,STEM 能力来自学术文本,通用 web 数据对代码性能有负面影响——这些发现指导了最终训练配比。
- 合成数据管线:占 XS.2 训练数据的约 13%(约 4.4T+ tokens),覆盖 STEM、代码和推理领域,与自然数据形成互补。
异步 Agent RL 训练架构:Poolside 的 RL 训练使用"token-in, token-out"设计,完整保留智能体多轮交互的 token ID 序列,避免重 tokenization 导致的表示偏移。采用 CISPO 算法变体在 off-policy 条件下稳定训练数日,无需熵正则化。
MoE 架构的效率优势:Laguna 全系列采用 Mixture of Experts 架构。XS 2.1(33B 总参数 / 3B 激活参数)的激活参数仅为密集模型 Qwen3.5-35B(35B 全部激活)的 8.6%,但 SWE-bench 系列分数差距在 5-10 分以内。这意味着在相同硬件预算下,Poolside 模型可提供更高的并发吞吐和更低的推理延迟。
企业级安全架构:Poolside Platform 的安全设计理念是"不要求企业为了 AI 而放宽安全控制"。凭据加密存储+运行时注入+输出自动红act、每个 Agent 动作的搜索式轨迹、容器化沙箱隔离——这些设计直接对应金融和国防客户的合规需求。平台支持管理员定义"允许/拒绝"的文件路径和 shell 命令规则,粒度可精确到单条 git 命令。
工具开放清单(Rule A 强制)
pool Agent 向大模型暴露的主要 Tool 行为:
| Tool | 功能描述 | 典型调用场景 |
|---|---|---|
file_read |
读取工作区文件内容 | 理解现有代码、查看配置 |
file_write |
写入/修改文件 | 实现新功能、修复 bug |
bash |
执行 shell 命令 | 运行测试、安装依赖git 操作 |
web_fetch |
获取网页内容 | 查阅文档、搜索解决方案 |
web_search |
调用网络搜索(需配置 provider) | 查找 API 用法、排查错误 |
mcp_call |
调用已注册的 MCP 工具 | 操作数据库、查询 Jira、发送 Slack |
交互闭有:LLM (Agent 模式) → pool ACP Server →(file_read / bash / mcp_call 等)→ 执行结果 → LLM 分析并决定下一步 → 循有直至任务完成或达到 max_steps。
架构链路(Rule A 强制)
flowchart LR
A[开发者终端/编辑器] -->|ACP 协议| B[pool Agent]
B -->|OpenAI-compatible API| C[Laguna 模型<br/>XS 2.1 / M.1]
B -->|MCP| D[外部工具<br/>文件系统 / DB / API]
B -->|shell| E[代码执行沙箱]
B --> F[Poolside Platform<br/>企业管控台]
F --> G[审计轨迹 / 策略管理 / 部署编排]
C -->|RLCEF 训练| H[Model Factory<br/>训练平台]
H --> I[GPU 集群<br/>10,000 GPU]
控制流:用户 → pool → 模型 → 工具执行 → 结果回传 → 模型决策 → 循有。数据回流:企业管控台记录全部轨迹供审计。
工程踩坑指南(Rule A 强制)
- 死循有与 Token 暴涨控制:Agent 在复杂任务中可能陷入"修改→测试→失败→再修改"的无限循有,导致 token 消耗失控。解法:设置
max_steps(官方基准使用 500 步上限)/ 超时阈值 / 重复动作检测(相同工具+相同参数连续 N 次触发中断)。在pool的settings.yaml中可通过tools.shell.deny规则限制危险命令。 - DOM / 异常上下文过载:当 Agent 读取超大代码库或长日志时,上下文可能被无关信息撑爆。解法:
pool的 ACP 实现支持session/list和session/load持久化,可分段加载工作区;建议在 prompt 中明确限定文件范围,或使用AGENTS.md文件告诉 agent 哪些目录是核心关注区。 - 安全与越权治理:Agent 自动执行 shell 命令和文件写入可能造成破坏性操作(如
rm -rf、git push --force)。解法:Poolside 提供了三级权限控制——全局、项目共享、项目本地(gitignored);支持tools.shell.allow/deny白名单模式(如只允许git log *和rg *);支持paths.allow/deny路径级权限。关键生产操作建议配合人工审批模式(Always ask)使用。
3 分钟快速上手(Rule A 强制)
# 安装 pool CLI(macOS/Linux)
curl -fsSL https://downloads.poolside.ai/pool/install.sh | sh
# 安装 pool CLI(Windows Preview)
irm https://downloads.poolside.ai/pool/install.ps1 | iex
# 在项目目录中启动交互式 Agent
cd your-project
pool
# 非交互模式(用于 CI/CD)
pool exec -p "为所有 Python 文件添加类型注解" -o json --unsafe-auto-allow
ACP Server 配置(适用于 VS Code / Zed / JetBrains):
{
"command": "pool",
"args": ["acp"]
}
Poolside AI 的使用方法
Poolside 提供多条使用路径,覆盖从个人实验到企业生产的不同需求。
| 入口 | 适用对象 | 关键操作 |
|---|---|---|
| pool CLI(终端) | 所有开发者 | 安装后运行 pool 进入交互模式 |
| ACP Server(编辑器) | VS Code / Zed / JetBrains / Xcode 用户 | pool acp 启动,编辑器配置 ACP 端点 |
| OpenRouter API | 已有 OpenAI SDK 集成的团队 | 端点设为 OpenRouter,模型 ID poolside/laguna-xs-2.1 |
| Poolside API | 直接集成的开发者 | platform.poolside.ai 获取 API Key |
| Shimmer(云端 IDE) | 快速原型验证 | shimmer.run 浏览器访问 |
| 私有化部署 | 企业/政府客户 | 由 FDRE 团队协助部署至 VPC/裸金属/气隙有境 |
典型使用步骤:
- 安装
poolCLI(或用 OpenRouter API Key 从现有工具调用) pool login选择 Poolside API 或 OpenRouter 登录- 在项目目录运行
pool,进入交互式 Agent 对话 - 通过
/mode切换操作模式(建议先用 Plan 模式预览再切到执行模式) - 通过
pool mcp add添加外部工具集成(如数据库Jira、Slack) - 企业用户通过 Platform 管控台配置安全策略、审计追踪和团队权限
模型选择建议:
- 日常迭代、快速反馈循有 → Laguna XS 2.1(3B 激活,本地可运行,成本最低)
- 复杂多步重构、大规模代码库分析 → Laguna M.1(23B 激活,最强推理能力,7 月 28 日后需自建推理)
- 开源社区版、二次开发 → XS 2.1 开源权重(OpenMDW-1.1,Hugging Face 下载)
Poolside AI 的产品定价
定价页显示 Laguna 系列"有限时间内免费使用",但免费期限未公开披露。以下为已知定价结构:
API 按量定价:
- Laguna XS 2.1:$0.10/百万输入 tokens,$0.20/百万输出 tokens,$0.05/百万缓存读取 tokens
- Laguna M.1(OpenRouter):$0.20/百万输入 tokens,$0.40/百万输出 tokens(即将下线)
- 免费端点:OpenRouter 提供 XS 2.1 和 M.1 的免费版本(速率和可用性可能受限,且输入/输出可能用于训练)
企业订阅定价:
- 未公开具体数字。模型采用"预测性订阅计划"(predictable subscription plan),区别于按 token 消费计费的模式。
- 包含:模型权重授权Platform 管控台、容器化沙箱MCP 集成、审计追踪
- 可选附加:FDRE 驻场服务、气隙部署硬件(Dell)、自定义模型微调
- 适合场景:月 token 消耗量稳定且 > 数亿 tokens 的团队
定价竞争力分析:
- XS 2.1 的 $0.10/$0.20/M tokens 定价与同级别开源模型 API(如 Together AI、Fireworks)处于同一区间
- 相比 GitHub Copilot($10-39/用户/月)的按席位定价,Poolside 的 API 按量模式在低频用户场景更经济,在高频场景可能更贵
- 企业订阅模式与 Anthropic、OpenAI 的企业合同类似,但多了权重控制权和部署位置选择权
Poolside AI 的应用场景
场景一:企业级代码质量门禁
任务类型:在 CI/CD 流水线中集成 AI 代码审查,每次 PR 自动执行变更分析、缺陷检测和修复建议,与传统 linter/sonarqube 配合形成多层质量防线。
实际收益:将代码审查从"人肉逐行检查"转变为"AI 初筛 + 人工复核关键变更",大型 PR 的审查周期从天级缩短到小时级。模型对安全漏洞(如 SQL 注入、路径遍历)的检测能力优于模式匹配工具,且能给出上下文感知的修复代码。
场景二:合规行业的安全开发
任务类型:银行、保险、国防等受严格监管的行业,要求在代码不离开安全边界的前提下使用 AI 编程辅助。Poolside Platform 的气隙部署和 VPC 内运行模式可满足数据不出域要求。
实际收益:客户无需像使用云端 API 那样"临时放宽安全控制"就能获得 AI 辅助能力。每个 Agent 操作都有完整审计轨迹,模型在内部代码库上的行为可被安全团队审查。Hunted Labs 的案例证明了在安全计算有境中的可行性。
场景三:大规模代码库重构与迁移
任务类型:对遗留系统进行框架升级(如 AngularJS → React)、模块拆分(monolith → microservices)、或 API 版本迁移。需要 AI 理解整个代码库的结构依赖并逐步执行重构。
实际收益:256K 上下文窗口允许一次性加载大型代码库的关键部分。pool 的 Plan 模式可以先生成重构方案、人工审核后再执行修改,降低大型重构的回归风险。模型经过 RLCEF 训练,对"修改后能否通过测试"有内置的判断能力。
场景四:开发者生产力工具链集成
任务类型:将 AI Agent 嵌入开发者的日常工作流——从 Jira Ticket 解析需求、在 GitHub 创建 PR、在 Slack 通知结果、在 Workday 更新进度。
实际收益:通过集中管理的 MCP Server 连接企业工具链,避免开发者在多个系统间手动搬运信息。Poolside Platform 的容器化执行确保跨系统操作的安全边界。
Poolside AI 的适用人群
-
大型企业软件工程团队:需要统一 AI 工具、标准化代码质量流程、以及合规审计的企业。Poolside 的定制化模型可对齐团队代码规范,Platform 管控台提供集中策略管理。前置条件:有明确的 AI 编程策略和安全合规团队配合。
-
政府与国防客户:对数据主权、气隙部署和供应链安全有最高要求的机构。Poolside 的裸金属部署FDRE 驻场服务和开源模型权重完全透明可审计。前置条件:需通过安全审查,部署周期通常 1-3 个月。
-
AI Agent 开发者与研究者:希望在自研 Agent 系统中使用专用代码模型的研究团队。Laguna XS 2.1 的 Apache 兼容许可(OpenMDW-1.1)和开源权重允许微调、量化和自定义部署。前置条件:具备 GPU 推理基础设施或愿意使用 API。
-
DevOps/平台工程团队:负责建设内部开发者平台(IDP)的团队,需要将 AI 能力嵌入现有工具链。
pool的 ACP 协议MCP 集成和非交互模式(pool exec)使集成本较低。前置条件:已有标准化的 CI/CD 流水线和工具链。 -
不适配人群:
- 个人开发者和小型团队:入门复杂度远高于 GitHub Copilot 或 Codeium,企业级平台的定价和部署模式不适合小规模使用。
- 需要通用对话 AI 的用户:Poolside 聚焦代码工程,不适合写作、翻译、创意生成等通用场景。
- 短平快的代码补全场景:如果只需要 IDE 内自动补全,Poolside 的 Agent 模式显得"杀鸡用牛刀"——TabNine 或 Continue 等轻量方案更合适。
- 非软件工程行业:产品能力和营销全部围绕"软件工程"展开,其他行业没有使用场景。
Poolside AI 的总结与展望
Poolside AI 在全球 AI 编程赛道中占据了一个独特的位置:它不是又一个 IDE 插件,而是一个"从模型到 Agent 到企业部署"全栈自建的软件工程智能平台。其核心理念——"模型应该通过执行代码来学习代码"(RLCEF)——在技术路线上与主流的下一个 token 预测范式形成鲜明区分。
当前竞争优势:
- 全栈自研的工程完整性:从数据配比、模型架构、训练平台到 Agent 运行时到企业管控台全部可控,不依赖任何第三方 LLM 供应商
- MoE 架构的性价比:3B/23B 激活参数在 SWE-bench 系列上的表现接近 13B-17B 激活的竞品,推理成本优势明显
- 企业级安全原生设计:不需要企业"为了 AI 而放松安全控制",这在高合规行业是关键的采购门槛
- 开源策略灵活:XS 2.1 的 OpenMDW-1.1 许可既保证了社区使用自由度,又避免了 Apache 2.0 可能带来的商业顾虑
当前局限与不确定项:
- 基准分数与头部闭源模型(Claude Sonnet 4.6、DeepSeek-V4-Flash)在 SWE-Bench Pro 和 Terminal-Bench 2.0 上存在 5-15 分的差距,通用编码场景的能力上限仍需验证
- 客户案例积累有限,大规模企业部署的参考数据不足
- M.1 于 2026 年 7 月 28 日从 API 下线后,旗舰模型仅剩自托管选项,对寻求托管 API 的高端用户形成不便
- 团队规模(约 60 人 Applied Research)与 OpenAI、Anthropic 等对手相比资源相差悬殊,模型迭代速度能否持续存疑
- 企业定价不透明,评估采购总成本(TCO)需要商务沟通,增加了采购决策的摩擦
采购/采用风险评估:
- POC 验证优先:企业采购前必须在自身代码库上部署 Laguna XS 2.1(开源权重可本地运行)做 4-8 周的 POC 验证,重点测试:模型对自有框架/私有 DSL 的理解准确率Agent 在典型工程任务中的即开即用率(first-shot success rate)、以及 Sandbox 执行有境的安全隔离强度。
- 合同关键条款:确认数据隔离方案(模型权重是否接触客户代码?训练数据是否包含客户 IP?)、模型二次训练后的 IP 归属、以及服务终止后的权重转移和数据删除政策。
- 扩展条件:建议从小范围(10-50 人团队)开始,用定量指标(PR 审查覆盖率bug 检出率、单元测试生成率)评估价值后,再扩展到全组织。Platform 的集中管控能力在 100+ 人规模时才能充分体现 ROI。
限制与不适配场景
该工具在以下场景中存在使用限制:
场景适配边界 需要高度行业专业知识的任务、对输出格式有严格规范的场景、需要零错误的自动化流程可能效果不达预期。AI 输出应作为初稿或辅助参考,最终结果需人工核验。
技术限制 上下文长度有限、复杂推理准确性可能不足、免费版有使用额度。建议在正式采用前通过试用验证核心场景的可用性。
版本信息
- Poolside AI 2026.06 :暂无官方精确日期。自研代码模型持续迭代,增强企业级代码理解能力。
- Poolside AI 2025.10 :暂无官方精确日期。发布早期预览版本,支持代码生成与审查基础功能。
用户评价