Poolside AI 免费

-

Poolside AI 专注于企业级软件工程场景,自研代码大模型,提供代码生成、审查、测试与部署全流程 AI 辅助。

Poolside AI 产品界面

Poolside AI

Poolside AI 的核心参数与统计

Poolside AI 走的是"自研代码大模型 + 智能体平台"的整合路线——从模型层到 Agent 层再到企业部署层全部自建,不做任何通用 LLM 的套壳封装。其 Laguna 系列模型在 SWE-bench 系列基准上已进入第一梯队,同时 pool 智能体工具和 Poolside Platform 企业平台构成了完整的交付体系。

参数项 公开信息
产品定位 企业级 AI 软件工程平台(自研模型 + 智能体 + 部署基础设施)
核心模型 Laguna M.1(225B-A23B MoE)/ Laguna XS 2.1(33B-A3B MoE)
上下文窗口 256K tokens(全系列)
覆盖阶段 编码、审查、测试CI/CD、架构评审、项目管理
目标客户 中大型企业、政府/国防、金融/合规行业
部署方式 公有云 API / 私有云(AWS/Azure/GCP VPC)/ 裸金属 / 气隙部署(Dell 托管)
模型许可 Apache 2.0(M.1 & XS.2)/ OpenMDW-1.1(XS 2.1)
智能体工具 pool CLI(开源,ACP 协议,支持 MCP 扩展)
公开融资 2024 年 10 月宣布 5 亿美元融资,训练集群扩展至 10,000 GPU
创始团队 co-CEO Jason Warner(前 GitHub CTO)& Eiso Kant(前 source{d} 创始人)

与市面上多数"通用模型套壳做 IDE 插件"的竞品不同,Poolside 从模型训练到 Agent 运行时到企业管控台全部自研。其核心差异在于:模型以"代码执行反馈"(RLCEF)而非"下一个 token 预测"为训练信号,Agent 以"完成工程任务"而非"生成代码片段"为评估标准。

Poolside AI 的用户与市场认可

采用数据(官方披露):截至 2026 年 5 月,Laguna XS.2 和 M.1 发布 4 周内处理超过 1 万亿 tokens,XS.2 权重在 Hugging Face 上下载超 50,000 次。官方博客显示早期客户集中于政府/公共部门和大型企业,典型客户包括 Hunted Labs(软件供应链安全公司)等。

市场信号:Poolside 在 2024 年 10 月完成 5 亿美元融资(投资方未公开),资金用于将训练集群从 6,144 张 H200 GPU 扩展至 10,000 GPU 规模。团队规模约 60 人 Applied Research 团队(截至 2026 年 4 月)。

行业对标定位:Poolside 在 SWE-bench 系列基准上与同参数级模型处于同一梯队。以 33B-A3B 的 XS 2.1 对比:

  • SWE-bench Verified:68.2%(vs Qwen3.6-35B-A3B 的 73.4%,vs Claude Haiku 4.5 的 73.3%)
  • SWE-bench Multilingual:63.1%(vs Qwen3.6-35B-A3B 的 67.2%)
  • SWE-Bench Pro:44.5%(vs Claude Haiku 4.5 的 52.4%)
  • Terminal-Bench 2.0:30.1%(vs Qwen3.6-35B-A3B 的 51.5%)

以 225B-A23B 的 M.1 对比:

  • SWE-Bench Pro:46.9%(vs DeepSeek-V4-Flash-284B-A13B 的 50.9%,vs Claude Sonnet 4.6 的 52.6%)
  • Terminal-Bench 2.0:40.7%(vs DeepSeek-V4-Flash 的 52.5%,vs Claude Sonnet 4.6 的 56.9%)

结论:Poolside 的 MoE 架构在同等激活参数下效率突出(3B/23B 激活参数 vs 竞品 13B-17B),但在绝对分数上仍与头部闭源模型存在差距。最大的差异化在于"模型 + 智能体 + 企业部署"三位一体的交付模式,而非单一基准分数。

Poolside AI 的成本优势

Poolside 的定价结构覆盖开发者 API、企业订阅和自托管三个层级,透明度在各层级间差异较大。

C 端/个人开发者成本

  • 免费层:Laguna M.1 和 XS 2.1 均在有限时间内提供免费 API 使用(通过 platform.poolside.ai 和 OpenRouter)。免费层可能使用用户输入/输出来改进模型(以 OpenRouter 免费端点条款为准)。
  • 按量付费(API)
    • Laguna XS 2.1:$0.10/百万输入 tokens,$0.20/百万输出 tokens,$0.05/百万缓存读取 tokens
    • Laguna M.1(OpenRouter):$0.20/百万输入 tokens,$0.40/百万输出 tokens
    • Laguna XS 2.1 付费定价与 XS.2 保持一致
  • 本地运行:XS 2.1 权重开源(OpenMDW-1.1),可在个人硬件上免费运行。模型压缩至 FP8/INT4/NVFP4 量化版本,配合 DFlash 推测解码,本地推理 tok/s 可翻倍。

API/开发者成本

  • 开发者可通过 OpenRouter 直接用现有 OpenAI SDK 调用,无需额外基础设施。
  • 自建推理需考虑硬件成本:XS 2.1(33B-A3B,FP8)可在消费级 GPU 上运行;M.1(225B-A23B)需要数据中心级 GPU 集群。
  • 无公开 API 速率限制(Rate Limit)数据,以官方实时页面为准。

企业/私有化成本

  • Poolside Platform 订阅制:以年度合同计价,包含模型权重Platform 管控台、容器化沙箱、审计追踪和 MCP 集成。
  • 部署模式影响成本
    • 公有云 VPC 部署(AWS/Azure/GCP):按计算资源 + 订阅费计价
    • 裸金属/气隙部署(Dell 托管):需一次性硬件采购 + 年度软件订阅
  • 显性成本项:模型权重授权Platform 许可Forward Deployed 工程师驻场服务(FDRE)
  • 隐性成本:初期 POC 验证周期(建议 4-8 周)、内部安全合规审查流程FDRE 人力成本
  • 具体企业定价未公开,需商务洽谈。相比 API 按量付费模式,企业订阅更适合 token 消耗量大的团队。

成本对比总结

层级 模式 价格区间 适用场景
个人/研究 免费 API + 开源权重 $0(有限时限制) 评估、实验、学术
开发者 API 按量 / OpenRouter XS 2.1: $0.10-0.20/M tokens 个人项目、小团队集成
企业 Platform 订阅 未公开(按合同) 中大型工程团队、合规行业

Poolside AI 的主要功能

Poolside 的能力栈分为三层:模型能力层Agent 工具层、企业平台层。

模型层能力

  • 代码生成与补全:基于自然语言描述或上下文,生成完整函数、模块或重构方案。Laguna 系列在 256K 上下文中可处理大型代码库级别的理解与修改。
  • 代码审查与缺陷检测:在 PR 流程中自动检查变更代码,发现潜在缺陷、安全漏洞和风格偏离。与传统 linter 不同,Poolside 模型能理解代码语义而非仅做模式匹配。
  • 自动化测试生成:根据代码逻辑自动生成单元测试与集成测试用例,覆盖正常路径和异常边界。模型基于代码执行反馈训练,对"什么值得测"有更好的判断力。
  • 架构分析与重构建议:分析代码结构变更的影响范围,给出架构层评估——适合大型重构、模块拆分或框架迁移场景的决策支持。
  • 多语言覆盖:SWE-bench Multilingual 基准涵盖多种编程语言,验证了模型跨语言工程能力。

Agent 工具层(pool CLI)

  • 交互式智能体:在终端中运行 / 斜杠命令、@ 模糊文件搜索、! shell 模式等。
  • 四种操作模式
    • Always ask(默认):每次工具调用前请求批准
    • Accept edits:自动批准文件读写
    • Allow all:自动批准所有工具调用
    • Plan:仅规划不修改代码
  • ACP 协议支持:作为 ACP Server 嵌入 VS Code、Zed、JetBrains 等编辑器;也可作为 ACP Client 驱动其他智能体(Claude Agent、Codex 等)。
  • MCP 集成:通过 pool mcp add 连接外部 MCP Server,扩展工具能力(文件系统、数据库API 等)。
  • 非交互模式pool exec 支持 CI/CD 流水线中的单次任务执行,输出 JSON 格式结果。

企业平台层(Poolside Platform)

  • 容器化沙箱执行:每个 Agent Session 在隔离容器中运行,内置密钥管理和网络策略控制。每个 Agent 动作(工具调用、文件编辑、推理步骤)都被记录为可搜索的轨迹(trajectory),支持审计回溯。
  • 企业工具集成:通过集中管理的 MCP Server 连接 Slack、Jira、GitHub、Workday、Salesforce 等企业系统。
  • 四层部署选项:裸金属、气隙托管(Dell 合作)、AWS/Azure/GCP VPC 部署。
  • FDRE 服务:Forward Deployed Research Engineers 驻场协助团队识别高价值 Agent 工作流,首批自动化流程在数周内交付。
  • 管理控制台:管理员集中定义安全边界、审批策略和数据访问规则;凭据加密存储、运行时注入、自动从输出中红action。

Poolside AI 的模型与版本演进

Poolside 在 2023 年 4 月成立后,经历了约两年的模型训练基础设施建设,于 2026 年开始密集发布模型和产品。以下为关键版本节点:

主线发布

版本 日期 核心变化 模型规格
Laguna M.1 2026-04-28 首个旗舰模型发布,225B-A23B MoE,Apache 2.0 225B 总参/23B 激活,30T tokens 训练,6,144 H200
Laguna XS.2 2026-04-28 首个开源权重模型发布,33B-A3B MoE,Apache 2.0 33B 总参/3B 激活,30T tokens 训练
256K 上下文升级 2026-05-26 M.1 和 XS.2 上下文窗口从 128K 扩展至 256K
Laguna XS 2.1 2026-07-02 XS.2 升级版,SWE-bench Multilingual +5.4 分 33B-A3B,OpenMDW-1.1 许可
M.1 服务结束预告 2026-07-28 M.1 将从 API 下线(OpenRouter 标注)

候选验证

  • Laguna XS.2(2026-04,Apache 2.0):首款开源模型,在 33B-A3B 参数量级达到 SWE-Bench Pro 44.5%。权重可在 Hugging Face 下载,支持 vLLM、SGLang、TRT-LLM、Ollama 等推理框架。
  • Laguna XS 2.1(2026-07,OpenMDW-1.1):架构与 XS.2 相同,但在 SWE-bench Multilingual(+5.4 分)和 Terminal-Bench 2.0(+1.0 分)上有显著提升。新增 DFlash 推测解码支持,本地推理 tok/s 翻倍。同时发布 FP8/INT4/NVFP4 量化版本。
  • Laguna M.1(2026-04,Apache 2.0旗舰):225B-A23B 的 MoE 模型,SWE-Bench Pro 46.9%、Terminal-Bench 2.0 40.7%。重点面向复杂多步工程任务。免费服务至 2026 年 7 月 28 日后下线 API,但开源权重仍可通过 Hugging Face 获取。

版本脉络说明

Poolside 的版本发布节奏显示:M.1 作为探路者验证了大规模 MoE 在代码场景的有效性,XS.2 将能力浓缩到可本地运行的规模并开源,XS 2.1 则在社区反馈基础上做了针对性改进。全部模型均使用"Model Factory"内部平台训练,该平台支持自动化评估RLCEF(基于代码执行反馈的强化学习)和 AutoMixer 数据配比优化。

Poolside AI 的技术优势

Poolside 的技术壁垒不在单一算法突破,而在"模型训练 → 智能体执行 → 企业部署"全链路的系统性整合。

RLCEF(Reinforcement Learning from Code Execution Feedback):这是 Poolside 最核心的技术差异。模型不是在"预测下一个 token"上优化,而是在"生成的代码能否通过测试执行"上做强化学习。模型在训练中探索数百万个任务、覆盖 130,000+ 真实代码库,每次尝试都获得代码执行反馈。这使得模型对"什么代码能跑"的理解远超纯语言模型。RLCEF 的异步 rollout 设计使用 GPUDirect RDMA 在数秒内完成数百 GB 权重传输,实现训练和推理的无缝衔接。

Model Factory 训练平台:Poolside 自建的端到端模型训练编排平台,将原本需要数周调度的人工流程压缩到 1 小时内。核心组件包括:

  • Muon 优化器:相比 AdamW,在达到相同训练 loss 时节省约 15% 的步数,且学习率可跨模型规模迁移。分布式实现将正交化计算分散到各 rank,训练 M.1 时优化器开销不到步时间的 1%。
  • AutoMixer 数据配比优化:训练约 60 个代理模型,每个模型使用不同数据配比,拟合性能预测回归器,自动搜索最优数据混合比例。代码能力由合成数据驱动,STEM 能力来自学术文本,通用 web 数据对代码性能有负面影响——这些发现指导了最终训练配比。
  • 合成数据管线:占 XS.2 训练数据的约 13%(约 4.4T+ tokens),覆盖 STEM、代码和推理领域,与自然数据形成互补。

异步 Agent RL 训练架构:Poolside 的 RL 训练使用"token-in, token-out"设计,完整保留智能体多轮交互的 token ID 序列,避免重 tokenization 导致的表示偏移。采用 CISPO 算法变体在 off-policy 条件下稳定训练数日,无需熵正则化。

MoE 架构的效率优势:Laguna 全系列采用 Mixture of Experts 架构。XS 2.1(33B 总参数 / 3B 激活参数)的激活参数仅为密集模型 Qwen3.5-35B(35B 全部激活)的 8.6%,但 SWE-bench 系列分数差距在 5-10 分以内。这意味着在相同硬件预算下,Poolside 模型可提供更高的并发吞吐和更低的推理延迟。

企业级安全架构:Poolside Platform 的安全设计理念是"不要求企业为了 AI 而放宽安全控制"。凭据加密存储+运行时注入+输出自动红act、每个 Agent 动作的搜索式轨迹、容器化沙箱隔离——这些设计直接对应金融和国防客户的合规需求。平台支持管理员定义"允许/拒绝"的文件路径和 shell 命令规则,粒度可精确到单条 git 命令。

工具开放清单(Rule A 强制)

pool Agent 向大模型暴露的主要 Tool 行为:

Tool 功能描述 典型调用场景
file_read 读取工作区文件内容 理解现有代码、查看配置
file_write 写入/修改文件 实现新功能、修复 bug
bash 执行 shell 命令 运行测试、安装依赖git 操作
web_fetch 获取网页内容 查阅文档、搜索解决方案
web_search 调用网络搜索(需配置 provider) 查找 API 用法、排查错误
mcp_call 调用已注册的 MCP 工具 操作数据库、查询 Jira、发送 Slack

交互闭有:LLM (Agent 模式) → pool ACP Server →(file_read / bash / mcp_call 等)→ 执行结果 → LLM 分析并决定下一步 → 循有直至任务完成或达到 max_steps

架构链路(Rule A 强制)

flowchart LR
    A[开发者终端/编辑器] -->|ACP 协议| B[pool Agent]
    B -->|OpenAI-compatible API| C[Laguna 模型<br/>XS 2.1 / M.1]
    B -->|MCP| D[外部工具<br/>文件系统 / DB / API]
    B -->|shell| E[代码执行沙箱]
    B --> F[Poolside Platform<br/>企业管控台]
    F --> G[审计轨迹 / 策略管理 / 部署编排]
    C -->|RLCEF 训练| H[Model Factory<br/>训练平台]
    H --> I[GPU 集群<br/>10,000 GPU]

控制流:用户 → pool → 模型 → 工具执行 → 结果回传 → 模型决策 → 循有。数据回流:企业管控台记录全部轨迹供审计。

工程踩坑指南(Rule A 强制)

  1. 死循有与 Token 暴涨控制:Agent 在复杂任务中可能陷入"修改→测试→失败→再修改"的无限循有,导致 token 消耗失控。解法:设置 max_steps(官方基准使用 500 步上限)/ 超时阈值 / 重复动作检测(相同工具+相同参数连续 N 次触发中断)。在 poolsettings.yaml 中可通过 tools.shell.deny 规则限制危险命令。
  2. DOM / 异常上下文过载:当 Agent 读取超大代码库或长日志时,上下文可能被无关信息撑爆。解法:pool 的 ACP 实现支持 session/listsession/load 持久化,可分段加载工作区;建议在 prompt 中明确限定文件范围,或使用 AGENTS.md 文件告诉 agent 哪些目录是核心关注区。
  3. 安全与越权治理:Agent 自动执行 shell 命令和文件写入可能造成破坏性操作(如 rm -rfgit push --force)。解法:Poolside 提供了三级权限控制——全局、项目共享、项目本地(gitignored);支持 tools.shell.allow/deny 白名单模式(如只允许 git log *rg *);支持 paths.allow/deny 路径级权限。关键生产操作建议配合人工审批模式(Always ask)使用。

3 分钟快速上手(Rule A 强制)

# 安装 pool CLI(macOS/Linux)
curl -fsSL https://downloads.poolside.ai/pool/install.sh | sh

# 安装 pool CLI(Windows Preview)
irm https://downloads.poolside.ai/pool/install.ps1 | iex

# 在项目目录中启动交互式 Agent
cd your-project
pool

# 非交互模式(用于 CI/CD)
pool exec -p "为所有 Python 文件添加类型注解" -o json --unsafe-auto-allow

ACP Server 配置(适用于 VS Code / Zed / JetBrains):

{
  "command": "pool",
  "args": ["acp"]
}

Poolside AI 的使用方法

Poolside 提供多条使用路径,覆盖从个人实验到企业生产的不同需求。

入口 适用对象 关键操作
pool CLI(终端) 所有开发者 安装后运行 pool 进入交互模式
ACP Server(编辑器) VS Code / Zed / JetBrains / Xcode 用户 pool acp 启动,编辑器配置 ACP 端点
OpenRouter API 已有 OpenAI SDK 集成的团队 端点设为 OpenRouter,模型 ID poolside/laguna-xs-2.1
Poolside API 直接集成的开发者 platform.poolside.ai 获取 API Key
Shimmer(云端 IDE) 快速原型验证 shimmer.run 浏览器访问
私有化部署 企业/政府客户 由 FDRE 团队协助部署至 VPC/裸金属/气隙有境

典型使用步骤

  1. 安装 pool CLI(或用 OpenRouter API Key 从现有工具调用)
  2. pool login 选择 Poolside API 或 OpenRouter 登录
  3. 在项目目录运行 pool,进入交互式 Agent 对话
  4. 通过 /mode 切换操作模式(建议先用 Plan 模式预览再切到执行模式)
  5. 通过 pool mcp add 添加外部工具集成(如数据库Jira、Slack)
  6. 企业用户通过 Platform 管控台配置安全策略、审计追踪和团队权限

模型选择建议

  • 日常迭代、快速反馈循有 → Laguna XS 2.1(3B 激活,本地可运行,成本最低)
  • 复杂多步重构、大规模代码库分析 → Laguna M.1(23B 激活,最强推理能力,7 月 28 日后需自建推理)
  • 开源社区版、二次开发 → XS 2.1 开源权重(OpenMDW-1.1,Hugging Face 下载)

Poolside AI 的产品定价

定价页显示 Laguna 系列"有限时间内免费使用",但免费期限未公开披露。以下为已知定价结构:

API 按量定价

  • Laguna XS 2.1:$0.10/百万输入 tokens$0.20/百万输出 tokens$0.05/百万缓存读取 tokens
  • Laguna M.1(OpenRouter):$0.20/百万输入 tokens$0.40/百万输出 tokens(即将下线)
  • 免费端点:OpenRouter 提供 XS 2.1 和 M.1 的免费版本(速率和可用性可能受限,且输入/输出可能用于训练)

企业订阅定价

  • 未公开具体数字。模型采用"预测性订阅计划"(predictable subscription plan),区别于按 token 消费计费的模式。
  • 包含:模型权重授权Platform 管控台、容器化沙箱MCP 集成、审计追踪
  • 可选附加:FDRE 驻场服务、气隙部署硬件(Dell)、自定义模型微调
  • 适合场景:月 token 消耗量稳定且 > 数亿 tokens 的团队

定价竞争力分析

  • XS 2.1 的 $0.10/$0.20/M tokens 定价与同级别开源模型 API(如 Together AI、Fireworks)处于同一区间
  • 相比 GitHub Copilot($10-39/用户/月)的按席位定价,Poolside 的 API 按量模式在低频用户场景更经济,在高频场景可能更贵
  • 企业订阅模式与 Anthropic、OpenAI 的企业合同类似,但多了权重控制权和部署位置选择权

Poolside AI 的应用场景

场景一:企业级代码质量门禁

任务类型:在 CI/CD 流水线中集成 AI 代码审查,每次 PR 自动执行变更分析、缺陷检测和修复建议,与传统 linter/sonarqube 配合形成多层质量防线。

实际收益:将代码审查从"人肉逐行检查"转变为"AI 初筛 + 人工复核关键变更",大型 PR 的审查周期从天级缩短到小时级。模型对安全漏洞(如 SQL 注入、路径遍历)的检测能力优于模式匹配工具,且能给出上下文感知的修复代码。

场景二:合规行业的安全开发

任务类型:银行、保险、国防等受严格监管的行业,要求在代码不离开安全边界的前提下使用 AI 编程辅助。Poolside Platform 的气隙部署和 VPC 内运行模式可满足数据不出域要求。

实际收益:客户无需像使用云端 API 那样"临时放宽安全控制"就能获得 AI 辅助能力。每个 Agent 操作都有完整审计轨迹,模型在内部代码库上的行为可被安全团队审查。Hunted Labs 的案例证明了在安全计算有境中的可行性。

场景三:大规模代码库重构与迁移

任务类型:对遗留系统进行框架升级(如 AngularJS → React)、模块拆分(monolith → microservices)、或 API 版本迁移。需要 AI 理解整个代码库的结构依赖并逐步执行重构。

实际收益:256K 上下文窗口允许一次性加载大型代码库的关键部分。pool 的 Plan 模式可以先生成重构方案、人工审核后再执行修改,降低大型重构的回归风险。模型经过 RLCEF 训练,对"修改后能否通过测试"有内置的判断能力。

场景四:开发者生产力工具链集成

任务类型:将 AI Agent 嵌入开发者的日常工作流——从 Jira Ticket 解析需求、在 GitHub 创建 PR、在 Slack 通知结果、在 Workday 更新进度。

实际收益:通过集中管理的 MCP Server 连接企业工具链,避免开发者在多个系统间手动搬运信息。Poolside Platform 的容器化执行确保跨系统操作的安全边界。

Poolside AI 的适用人群

  • 大型企业软件工程团队:需要统一 AI 工具、标准化代码质量流程、以及合规审计的企业。Poolside 的定制化模型可对齐团队代码规范,Platform 管控台提供集中策略管理。前置条件:有明确的 AI 编程策略和安全合规团队配合。

  • 政府与国防客户:对数据主权、气隙部署和供应链安全有最高要求的机构。Poolside 的裸金属部署FDRE 驻场服务和开源模型权重完全透明可审计。前置条件:需通过安全审查,部署周期通常 1-3 个月。

  • AI Agent 开发者与研究者:希望在自研 Agent 系统中使用专用代码模型的研究团队。Laguna XS 2.1 的 Apache 兼容许可(OpenMDW-1.1)和开源权重允许微调、量化和自定义部署。前置条件:具备 GPU 推理基础设施或愿意使用 API。

  • DevOps/平台工程团队:负责建设内部开发者平台(IDP)的团队,需要将 AI 能力嵌入现有工具链。pool 的 ACP 协议MCP 集成和非交互模式(pool exec)使集成本较低。前置条件:已有标准化的 CI/CD 流水线和工具链。

  • 不适配人群

    • 个人开发者和小型团队:入门复杂度远高于 GitHub Copilot 或 Codeium,企业级平台的定价和部署模式不适合小规模使用。
    • 需要通用对话 AI 的用户:Poolside 聚焦代码工程,不适合写作、翻译、创意生成等通用场景。
    • 短平快的代码补全场景:如果只需要 IDE 内自动补全,Poolside 的 Agent 模式显得"杀鸡用牛刀"——TabNine 或 Continue 等轻量方案更合适。
    • 非软件工程行业:产品能力和营销全部围绕"软件工程"展开,其他行业没有使用场景。

Poolside AI 的总结与展望

Poolside AI 在全球 AI 编程赛道中占据了一个独特的位置:它不是又一个 IDE 插件,而是一个"从模型到 Agent 到企业部署"全栈自建的软件工程智能平台。其核心理念——"模型应该通过执行代码来学习代码"(RLCEF)——在技术路线上与主流的下一个 token 预测范式形成鲜明区分。

当前竞争优势

  • 全栈自研的工程完整性:从数据配比、模型架构、训练平台到 Agent 运行时到企业管控台全部可控,不依赖任何第三方 LLM 供应商
  • MoE 架构的性价比:3B/23B 激活参数在 SWE-bench 系列上的表现接近 13B-17B 激活的竞品,推理成本优势明显
  • 企业级安全原生设计:不需要企业"为了 AI 而放松安全控制",这在高合规行业是关键的采购门槛
  • 开源策略灵活:XS 2.1 的 OpenMDW-1.1 许可既保证了社区使用自由度,又避免了 Apache 2.0 可能带来的商业顾虑

当前局限与不确定项

  • 基准分数与头部闭源模型(Claude Sonnet 4.6、DeepSeek-V4-Flash)在 SWE-Bench Pro 和 Terminal-Bench 2.0 上存在 5-15 分的差距,通用编码场景的能力上限仍需验证
  • 客户案例积累有限,大规模企业部署的参考数据不足
  • M.1 于 2026 年 7 月 28 日从 API 下线后,旗舰模型仅剩自托管选项,对寻求托管 API 的高端用户形成不便
  • 团队规模(约 60 人 Applied Research)与 OpenAI、Anthropic 等对手相比资源相差悬殊,模型迭代速度能否持续存疑
  • 企业定价不透明,评估采购总成本(TCO)需要商务沟通,增加了采购决策的摩擦

采购/采用风险评估

  • POC 验证优先:企业采购前必须在自身代码库上部署 Laguna XS 2.1(开源权重可本地运行)做 4-8 周的 POC 验证,重点测试:模型对自有框架/私有 DSL 的理解准确率Agent 在典型工程任务中的即开即用率(first-shot success rate)、以及 Sandbox 执行有境的安全隔离强度。
  • 合同关键条款:确认数据隔离方案(模型权重是否接触客户代码?训练数据是否包含客户 IP?)、模型二次训练后的 IP 归属、以及服务终止后的权重转移和数据删除政策。
  • 扩展条件:建议从小范围(10-50 人团队)开始,用定量指标(PR 审查覆盖率bug 检出率、单元测试生成率)评估价值后,再扩展到全组织。Platform 的集中管控能力在 100+ 人规模时才能充分体现 ROI。

限制与不适配场景

该工具在以下场景中存在使用限制:

场景适配边界 需要高度行业专业知识的任务、对输出格式有严格规范的场景、需要零错误的自动化流程可能效果不达预期。AI 输出应作为初稿或辅助参考,最终结果需人工核验。

技术限制 上下文长度有限、复杂推理准确性可能不足、免费版有使用额度。建议在正式采用前通过试用验证核心场景的可用性。

版本信息

  • Poolside AI 2026.06 :暂无官方精确日期。自研代码模型持续迭代,增强企业级代码理解能力。
  • Poolside AI 2025.10 :暂无官方精确日期。发布早期预览版本,支持代码生成与审查基础功能。

用户评价

  • 加载评价中...