Bytebot 免费

-

Bytebot 是开源自托管的桌面 AI Agent(Apache 2.0),给 AI 分配一台容器化 Linux 桌面,通过计算机视觉和大语言模型理解屏幕内容,像人类一样执行鼠标键盘操作。覆盖跨应用工作流、数据录入、文档处理等场景,支持 Anthropic Claude / OpenAI GPT / Google Gemini。

Bytebot 产品界面

Bytebot

Bytebot 的核心参数与统计

Bytebot 是一款开源的桌面 AI Agent,官方定位为 "Desktop agents that use computers like a human — at cloud scale"。它给 AI 分配一台独立的容器化 Linux 桌面,AI 通过"看屏幕→移动鼠标→敲键盘"来完成复杂跨应用工作流,而不是通过 API 或脚本。它与传统 RPA(UiPath、Blue Prism)形成错位竞争——传统 RPA 依赖固定选择器和预定义流程图,Bytebot 依靠视觉理解动态适应界面变化。

项目 公开信息
官方定位 Desktop agents that use computers like a human — at cloud scale
产品形态 开源自托管桌面 AI Agent
核心技术路线 计算机视觉(屏幕截图分析)+ 大语言模型(意图理解与任务规划)
开源许可 Apache 2.0
社区规模 11.1k GitHub stars、1.5k forks、77 watching
开发语言 TypeScript(92.1%)、Dockerfile、CSS 等
贡献者 11 人
最新版本 2026-01(仓库已于 2026-03-07 归档为只读)
支持平台 Desktop(Docker 容器化部署)
支持模型 Anthropic Claude(推荐)、OpenAI GPT、Google Gemini、LiteLLM 代理
开发者 Tantl Labs, Inc.

一句话简评:Bytebot 不是一个传统 RPA 工具,而是一个给 AI 分配"专属电脑"的容器化桌面 Agent 框架。它解决的核心痛点是——传统自动化脚本在界面变化后立即失效,而 Bytebot 靠视觉理解来适应变化,同时通过完整桌面有境打破了浏览器 Agent 的应用边界。

部署形态:Bytebot 完全自托管,运行在 Docker 容器中,数据不出企业网络。它不是一个 SaaS 平台,而是一个你自建、自管、自带 AI 模型密钥的基础设施组件。

项目状态说明:Bytebot 的 GitHub 仓库已在 2026 年 3 月 7 日由所有者归档为只读。这意味着项目暂停了主线开发,但现有代码和文档仍可正常使用,社区可 fork 继续演进。

Bytebot 的用户与市场认可

Bytebot 的市场认可主要来自开源社区和企业自动化领域的关注,而非公开的营收数据(后者官方未公开)。

社区热度:GitHub 仓库在归档前积累了 11.1k stars 和 1.5k forks,说明它在桌面 Agent 细分赛道上获得了开发者社群的广泛关注。77 个 watching 也表明有相当数量的用户持续跟踪项目更新。

错位竞争定位:Bytebot 自称不是 UiPath 的替代品,而是填补了"传统 RPA 过于僵化、浏览器 Agent 能力受限"之间的空白。市场对"给 AI 一台完整电脑"这个思路的正面反馈,反映在从 Y Combinator 启动到 GitHub 万星的速度上。

博客影响力:Bytebot 团队在官网发表的《The Age of the Desktop Agent Is Here》(2025-04-17)等系列博客,被多个 AI 新闻聚合站转载,推动了"桌面 Agent"这个概念在开发者中的认知。

落地前提:Bytebot 的价值在以下条件下才能充分发挥——团队已有可用的 AI 模型 API 密钥(Anthropic/OpenAI/Google)、具备 Docker 运维能力、并且要自动化的任务场景涉及跨多个桌面应用而非单一网页。

Bytebot 的成本优势

Bytebot 的成本结构与传统 RPA 和 SaaS Agent 有根本区别:软件本身免费(Apache 2.0),你只为底层资源付费。

C 端/个人开发者

  • 显性成本:零软件许可费。唯一支出是 AI 模型 API 调用费(通常每任务几分到几毛美元)和运行 Docker 的基础设施(一台普通服务器甚至本地开发机即可)。
  • 隐性成本:需自行配置 AI API 密钥Docker 有境和网络;Agent 执行速度受 AI 模型响应时间和屏幕截图处理延迟影响;复杂任务可能消耗较多 Token。
  • 对比:相比 Zapier 等 SaaS 自动化工具(月费 20-100 美元起),Bytebot 的初始成本更低,但需要更多技术投入。

开发者/API 集成

  • 显性成本:零许可费 + AI API 按量付费 + 服务器成本。Bytebot 提供 REST API(端口 9991/9990),可编程创建任务和控制桌面。
  • 隐性成本:Agent 执行的不确定性意味着需要设计重试和人工确认机制;API 调用失败处理逻辑需自行实现。
  • 采购动作:无采购门槛,git clone + docker-compose up 即可开始。

企业/私有化部署

  • 显性成本:零许可费,AI API 按量付费,基础设施(服务器/ Kubernetes 集群)成本。支持 Helm 图表部署到 K8s。
  • 隐性成本:桌面 Agent 的视觉决策不确定性要求关键操作设置人工复核有节;对 GPU/TPU 无硬性需求,但 AI 调用延迟会影响整体吞吐;需评估 AI 提供商的隐私政策是否与企业合规要求匹配。
  • 企业级功能:支持密码管理器(1Password、Bitwarden)集成实现自动 2FA 认证;有境持久化,一次配置多次复用。

总结:Bytebot 的 TCO(总拥有成本)的核心变量不是软件许可费,而是(AI Token 消耗量 × 单价)+ 运维人力 + 人工复核成本。对于高频、简单任务,Bytebot 可能比传统 RPA 更贵;对于界面变化频繁、跨应用的中长尾场景,Bytebot 的成本效率优势明显。

Bytebot 的主要功能

Bytebot 的能力围绕"给 AI 一个完整的桌面有境来执行任务"设计,可归纳为以下核心功能簇:

  • 屏幕视觉理解与操作:AI 通过截图"看"屏幕,识别 UI 元素(按钮、输入框、菜单、弹窗),然后通过模拟鼠标点击、键盘输入、滚动等操作与界面交互。核心差异:不依赖 DOM 结构CSS 选择器或固定坐标,界面改版后仍然可用。适用于任何 Linux 桌面应用——包括 Electron 应用Terminal、VS Code 等非网页工具。
  • 自然语言任务驱动:用户用自然语言描述任务,AI 自动分解为子步骤并依次执行。隐藏联动:Agent 内部级联了"看屏幕→决策→操作→验证→下一步"的循有,用户无需指定每一步怎么做。例如"下载近一周的供应商发票并归档",AI 会自动打开浏览器、导航到门户网站、处理 2FA 登录、下载文件到桌面文件系统、创建文件夹归档。
  • 跨应用端到端工作流:串联多个不相关的桌面应用——浏览器、终端、文件管理器VS Code、办公软件——完成一个完整业务流程。隐藏联动:浏览器中下载的 PDF 可以直接用系统 PDF 阅读器打开分析,提取的数据可以直接写入本地表格,形成闭有。
  • 文件上传与文档处理:用户可以直接将文件(PDF、电子表格等)上传到 Bytebot 桌面,AI 能读取整个 PDF 内容到上下文,执行提取关键信息、交叉比对、生成摘要等操作。核心差异:与浏览器 Agent 不同,Bytebot 能处理 API 无法访问的本地文档格式。
  • 密码管理器与 2FA 认证:内置对 1Password、Bitwarden 等密码管理器的支持,AI 可以自动填充凭证并处理两步验证。隐藏联动:一次配置后,AI 可在多个站点的登录场景中复用已保存的凭据,无需人工每次介入。
  • 实时桌面直播与接管模式:用户可以在 Web UI 上实时观看 Agent 的操作过程,并在必要时"接管"鼠标键盘直接操作。隐藏联动:接管后 Agent 暂停,恢复后继续执行——适合配置有境、处理 AI 无法通过的复杂验证等场景。
  • 程序化 API 控制:REST API 暴露了任务创建(POST /tasks)、桌面截图(POST /computer-use)、鼠标点击(click_mouse)等细粒度控制端点。隐藏联动:API 层使得 Bytebot 可以作为更大自动化流程中的一个"执行单元"被编排工具调用。

Bytebot 的模型与版本演进

Bytebot 的版本脉络呈现"从概念验证到社区爆发再到归档停顿"的典型开源项目生命周期。

主线发布

版本节点 日期 说明
Bytebot beta ~2025-06 早期版本上线,完成基础"视觉识别+点击"能力闭有
Bytebot current ~2026-01 当前可核验的最新版本,支持多 AI 提供商、密码管理器Helm 部署、实时桌面视图
仓库归档 2026-03-07 所有者将仓库设为只读,项目停止主线开发

版本解读

Bytebot 的 GitHub Releases 页面显示"没有已发布的版本"——项目主要依赖 Git 提交和 Docker 镜像标签来分发。三个 Docker 镜像(bytebot-agentbytebot-desktopbytebot-ui)在 GitHub Container Registry 上可获取,分别对应 Agent 控制服务、桌面有境和前端 UI。

项目的最后一次提交在 2026 年 3 月 7 日前约 10 个月(即约 2025 年 5 月),由主要维护者 atupem 完成。之后到归档之间无新提交,说明项目在归档前已处于维护停滞状态。

迭代节奏:从 11 位贡献者和 92.1% TypeScript 代码占比看,Bytebot 是一个以 JavaScript 全栈开发者为主的社区项目。其演进方向是从"能跑通一个任务"到"可规模化部署的产品化框架"。

Bytebot 的技术优势

主类型判断:Agent / MCP / 自动化工具。以下按规则 A 执行深度分析。

工具开放清单(Tool Open List)

Bytebot 通过其 Agent 服务向大模型暴露以下原子操作能力,模型通过这些工具的串联完成一次交互闭有:

Tool 名称 功能说明 闭有角色
screenshot 截取当前桌面屏幕图像 感知(视觉输入)
click_mouse 在指定坐标执行鼠标点击 操作(输出动作)
move_mouse 移动鼠标到指定坐标 操作(输出动作)
type_keyboard 模拟键盘输入文本 操作(输出动作)
scroll 在屏幕上执行滚动操作 操作(输出动作)
press_key 按下特殊按键(Enter、Tab、Esc 等) 操作(输出动作)
drag 拖拽操作 操作(输出动作)
wait 等待指定时间或条件 流程控制
task_complete 标记任务完成并输出结果 闭有终止

交互闭有流程:用户输入自然语言任务 → LLM 解析意图并规划步骤 → 执行 screenshot 获取当前屏幕状态 → LLM 分析屏幕内容 → 调用 move_mouse + click_mouse/type_keyboard 执行操作 → 再次 screenshot 验证结果 → 循有直到 task_complete

架构链路

  用户(Web UI / REST API)
       │
       ▼
┌─────────────────────────────┐
│   Bytebot UI (Next.js)      │  Port 9992 — Web 管理界面
│   Bytebot API (NestJS)      │  Port 9991 — 任务管理 API
└──────────┬──────────────────┘
           │
           ▼
┌─────────────────────────────┐
│   Bytebot Agent Service     │  AI 决策引擎 — 协调 LLM 与桌面操作
│   (NestJS + LLM SDK)        │
└──────────┬──────────────────┘
           │  computer-use API (Port 9990)
           ▼
┌─────────────────────────────┐
│   Bytebot Desktop           │  Ubuntu 22.04 + XFCE
│   (Docker Container)        │  预装: Firefox, VS Code, Thunderbird
│                              │  可安装: Chrome, Slack, 任意 Linux 应用
└─────────────────────────────┘
           │
           ▼
┌─────────────────────────────┐
│    AI Provider API          │  Anthropic Claude / OpenAI GPT /
│    (外部)                    │  Google Gemini / LiteLLM
└─────────────────────────────┘

控制流:用户 → Bytebot UI/API → Agent Service → LLM → 解析意图 → Desktop (截图+操作) → 反馈截图给 LLM → 循有 → 输出结果

数据回流:所有操作前后截图自动保存,形成可审计的操作日志。

工程踩坑指南

基于 Bytebot 的架构特性,在实际部署和使用中需要注意以下工程问题:

  1. 死循有与 Token 暴涨控制:Agent 在执行复杂任务时可能陷入"截图→误判→操作→再截图→再误判"的死循有,导致 Token 消耗急剧增加。解法:在 Agent 配置中设置 max_steps(最大执行步数)和单任务超时时间;在任务描述中明确"如果遇到 X 情况则放弃并报告";利用接管模式在发现循有时人工中断。Bytebot 的 Age of Desktop Agent 博客也承认"current desktop agents struggle with anything more than medium-complexity tasks and cannot yet run unsupervised"。

  2. DOM / 桌面上下文过载:当桌面打开多个窗口、标签页或复杂界面时,全屏截图的分辨率过高可能导致 LLM 上下文被视觉 Token 占满。解法:Bytebot 实际通过指定坐标区域截图来缩小范围,而非每次都截全屏;用户应尽量在任务描述中限定"只操作 X 窗口"以降低上下文负载。对于高分辨率显示器,考虑调整桌面分辨率到 1440x900 以内。

  3. 安全与越权治理:AI 持有完整桌面控制权后,可能执行不可逆操作——删除文件、提交支付、发布内容、修改系统配置。解法:Bytebot 的设计通过"自托管+容器化"天然隔离了 Agent 与宿主系统;关键操作路径上建议保留人工确认点(如"支付确认前暂停并通知用户");利用 Bytebot 的接管模式在 Agent 执行不可逆操作前人工介入。企业部署时应限制 Agent 可访问的网络范围和文件系统路径。

  4. AI 模型选择与成本优化:不同模型在桌面 Agent 场景下的表现差异明显。解法:官方推荐 Anthropic Claude(computer-use 能力最成熟),但 Claude 的 Token 单价较高;OpenAI GPT 速度快但复杂屏幕理解略逊;Gemini 性价比高但在中文界面识别上可能有偏差。建议先用 Claude 跑通关键流程,再根据 Token 消耗数据决定是否切换到更经济的模型。通过 LiteLLM 集成可使用 Azure OpenAI、AWS Bedrock 或本地 Ollama 模型来优化成本。

3 分钟快速上手

Bytebot 提供多种部署方式,最快捷的是 Docker Compose 或 Railway 一键部署。

Docker Compose 部署

# 克隆仓库
git clone https://github.com/bytebot-ai/bytebot.git
cd bytebot

# 配置 AI 提供商密钥(三选一)
echo "ANTHROPIC_API_KEY=sk-ant-<YOUR_API_KEY>" > docker/.env
# 或: echo "OPENAI_API_KEY=sk-<YOUR_API_KEY>" > docker/.env
# 或: echo "GEMINI_API_KEY=<YOUR_API_KEY>" > docker/.env

# 启动
docker-compose -f docker/docker-compose.yml up -d

# 打开 Web UI
# http://localhost:9992

Railway 一键部署:点击 Deploy on Railway 按钮,填入 AI API 密钥即可。

程序化创建任务

import requests

# 简单任务
response = requests.post('http://localhost:9991/tasks', json={
    'description': '下载最新的销售报告并生成摘要'
})

# 带文件上传的任务
files = {'files': open('contract.pdf', 'rb')}
response = requests.post('http://localhost:9991/tasks',
    data={'description': '审查这些合同中的重要日期'},
    files=files
)

Bytebot 的使用方式

Bytebot 的使用路径分为"部署 → 配置桌面 → 分配任务 → 监控与干预"四个阶段。

部署方式对比

方式 适合场景 前置条件 运维成本
Docker Compose 个人开发、小团队验证 Docker 有境AI API 密钥
Railway 一键部署 快速体验、无需运维 Railway 账号AI API 密钥 最低
Kubernetes (Helm) 企业规模化部署 K8s 集群Helm 3 中-高
本地开发运行 二次开发、定制化 Node.js、Docker

典型使用路径

  1. 部署 Bytebot:选择上述任一方式部署,访问 http://localhost:9992 打开 Web UI。
  2. 配置桌面有境:在 Desktop 标签页中安装额外软件(Chrome、Slack、企业应用),配置密码管理器扩展(1Password/Bitwarden),登录目标网站并保持会话。
  3. 创建任务:在 Web UI 中用自然语言描述任务,或通过 REST API 程序化创建。支持附加文件作为任务输入。
  4. 实时监控:在 Live Desktop View 中观看 Agent 的操作过程,Agent 执行每一步前后会自动截图供审查。
  5. 接管与恢复:当 Agent 遇到无法处理的场景(复杂验证码、需要人为判断的决策),用户可以接管鼠标键盘,处理完成后让 Agent 继续执行。
  6. 审计与日志:所有操作记录(含前后截图)保存在任务历史中,可用于事后审计和流程优化。

进阶配置

  • 多 AI 提供商切换:通过 LiteLLM 集成,可使用 Azure OpenAI、AWS Bedrock、Ollama 本地模型等 100+ 提供商。
  • 规模化部署:通过 Helm Chart 部署到 Kubernetes,支持横向扩展运行多个 Agent 容器并行执行任务。
  • 密码管理器集成:安装 Bitwarden 或 1Password 浏览器扩展,AI 可自动完成含 2FA 的登录流程。

Bytebot 的产品定价

Bytebot 的产品定价极为简单,因为它本身是完全开源免费的。以下是三层成本结构:

C 端/个人用户

  • 软件费用:零(Apache 2.0 开源许可,无任何许可费、订阅费或使用量限制)
  • 必需支出:AI API 按量付费(通常每任务 $0.01-$0.10,取决于模型和复杂度)
  • 基础设施:可在本地开发机运行,无需额外云资源
  • 典型月成本:$5-$30(轻度使用,取决于 AI 模型选择)

开发者/API 集成

  • 软件费用:零
  • AI API 成本:随任务量线性增长。高频场景建议使用 OpenAI GPT 或 Gemini 以降低单次 Token 成本
  • 服务器成本:一台 4 核 8G 云服务器约 $30-$60/月,可支持单容器运行
  • 隐性成本:API 集成开发与维护、异常处理逻辑、人工复核机制

企业/私有化部署

  • 软件费用:零
  • AI API 成本:按量计费,大规模使用可考虑通过 LiteLLM 接入 Azure OpenAI(有企业合规背书)
  • 基础设施:Kubernetes 集群 + 存储,视规模 $200-$2000/月
  • 企业特有隐性成本:安全审计、权限治理Agent 行为监控、合规文档编制
  • 需注意:Bytebot 本身不提供企业级支持 SLA,企业需自建或通过社区获取支持

关键提示:Bytebot 项目已于 2026 年 3 月归档,这意味着后续 AI API 的兼容性变化(如 Anthropic/OpenAI 的 computer-use API 升级)不会有官方适配。企业在评估长期使用时,需考虑 fork 维护或寻找替代方案的风险。

Bytebot 的应用场景

Bytebot 的"完整桌面 + 视觉理解"能力使它特别适合以下场景:

  • 财务对账与发票处理:登录多个银行门户(含 2FA)、下载交易文件、提取发票数据、跨系统对账。传统做法需要人工操作多个系统,Bytebot 可以端到端自动化,但需要为 AI 操作配置好各系统的密码管理器凭证。 核验重点:银行门户界面变化频率2FA 的超时处理、金额交叉验证的准确性。
  • 客户入职与跨系统数据同步:在 CRM、银行系统、验证平台之间导航,提取和录入客户信息。Bytebot 的优势在于这些系统通常没有公开 API,传统集成本极高。 核验重点:数据录入的完整性与一致性校验AI 误填后的回滚机制。
  • 开发工作流自动化:自动 scaffold 新项目、安装依赖、启动开发服务器、在 VS Code 中修改文件、在浏览器中验证变更。这是浏览器 Agent 做不到的——因为它需要操作 VS Code 和终端。 核验重点:AI 对 IDE 操作的准确性、代码修改后的自动测试验证。
  • 技术研究与报告生成:自主联网搜索、下载 PDF 文档、阅读分析、提取关键信息、生成结构化摘要。适合信息调研类的重复性工作,但需要人工核验 AI 筛选信息的准确性和偏见。 核验重点:信息来源的权威性判断、总结中的事实性错误率。
  • UI 测试与视觉回归:自动执行界面操作流程、截图比对、报告 UI bug。Bytebot 相比 Playwright 等传统自动化测试工具的优势是无需维护选择器,但执行速度和确定性不如脚本方案。 核验重点:测试覆盖率的完整性、误报率、截图比对的一致性。

Bytebot 的适用人群

Bytebot 的多形态部署策略吸引三类核心角色,但它也有明确的不适配边界:

  • 自动化工程师与 RPA 开发者:需要处理界面频繁变化的自动化场景,希望摆脱"改一次界面修一次脚本"的维护负担。Bytebot 提供 Docker/K8s 部署和 REST API 集成,适合嵌入现有自动化体系。
  • DevOps 与基础设施团队:负责企业自动化平台的选型与运维,看重自托管的数据安全性和容器化部署的弹性。Bytebot 的 Helm Chart 和 Railway 部署降低了上手门槛。
  • 效率型个人开发者:希望自动化日常重复操作(数据录入、文件整理、信息采集)但不想为 Zapier 等 SaaS 工具付费。Bytebot 的零许可费和自托管特性使其成为高性价比选择。
  • 技术研究与数据分析人员:需要批量处理 PDF/电子表格、跨网站收集信息、生成结构化报告。前置条件:需要能描述清楚任务逻辑,并接受 AI 执行的不确定性。

不适配人群与场景

  • 对 100% 成功率有刚性需求的关键生产场景(如金融交易执行、医疗数据录入):Bytebot 的视觉识别存在固有波动性,不适合无人监管的关键任务。
  • 对执行速度有极致要求的批量场景(如每秒处理数千条记录):Bytebot 的"截图→思考→操作→验证"循有比传统脚本慢 10-100 倍。
  • 无 Docker 运维能力的业务用户:Bytebot 需要自行部署和维护,不是开箱即用的 SaaS 产品。
  • 需要官方 SLA 和合规认证的企业:项目已归档,无官方支持渠道。
  • 仅需网页自动化的场景:如果任务全在浏览器内完成,浏览器 Agent(如 Operator、Browser Use)的部署和成本更低。

总结与展望

Bytebot 是桌面 Agent 赛道的代表性开源项目,它以"给 AI 一台完整电脑"的思路,解决了传统 RPA 脚本在界面变化后失效、以及浏览器 Agent 无法操作桌面应用的双重痛点。项目在约 12 个月的活跃开发期内积累了 11k+ stars,验证了市场对"视觉驱动的桌面自动化"的需求。

技术价值:Bytebot 证明了"LLM + 计算机视觉 + 容器化桌面"的技术组合可以完成中等复杂度的跨应用自动化任务。其"截图理解→坐标操作→验证循有"的架构成为了后续同类项目的参考范式。

当前限制

  • 项目已归档,无主线演进,新 AI 模型和 API 的兼容性需要社区 fork 维护。
  • Agent 在中等复杂度以上的任务中仍需人工监督,官方博客也承认"cannot yet run unsupervised"。
  • 视觉识别精度与屏幕分辨率UI 复杂度强相关,在非标准界面(老旧系统、专业软件定制 UI)上表现不稳定。
  • 无内置的权限治理和操作审计系统,企业落地需自建安全层。
  • Token 消耗和 AI 调用延迟是主要的规模化瓶颈。

采购/采用风险评估

  • 短期(<6 个月):Bytebot 仍可作为桌面 Agent 技术的参考实现和原型验证工具。对于有 Docker 运维能力的团队,从 1-2 条低风险数据录入流程开始试点是合理的。
  • 中期(6-18 个月):随着项目归档时间的推移,兼容性风险会逐渐上升。建议关注社区 fork 的活跃度,或评估商业化替代方案(如 Anthropic 的 computer-use 直接集成UI Path 的 AI Agent 能力)。
  • 长期(>18 个月):如果桌面 Agent 市场的商业化产品成熟,Bytebot 更可能作为"技术理念验证"而非生产工具存在。企业在做 18 个月以上的技术规划时,应将其视为"设计参考"而非"依赖组件"。
  • 关键条款核验:由于项目是 Apache 2.0 许可,fork 和商业使用无法律障碍。但企业需自行承担后续维护、安全更新和 AI 提供商兼容性适配的所有成本。

相关工具:CrewAILangChain

版本信息

  • Bytebot archived :GitHub 仓库由所有者归档为只读,项目停止主线开发。
  • Bytebot launch :Y Combinator 公开发布,《The Age of the Desktop Agent Is Here》博客发表。
  • Bytebot current :项目归档前的最终版本,完整支持多 AI 提供商、密码管理器K8s 部署。暂无官方精确日期。
  • Bytebot beta :早期版本上线,完成基础视觉识别与操作闭有。暂无官方精确日期。

用户评价

  • 加载评价中...