Amazon Nova Act
免费
Amazon Nova Act 是 Amazon AGI Labs 推出的通用 AI 智能体,通过 SDK 支持开发者在浏览器中构建自动化任务智能体,将复杂多步骤任务分解为原子命令并可靠执行。
Amazon Nova Act 的完整评测
核心参数与统计
| 项目 | 规格 |
|---|---|
| 产品定位 | 通用 AI 智能体 / 浏览器自动化代理 |
| 开发商 | Amazon AGI Labs |
| 发布形态 | SDK + 开发者预览版 |
| 核心技术 | NLP + Playwright 浏览器自动化 + 强化学习 |
| 支持平台 | Web(浏览器)、API |
| 任务处理 | 单线程 / 支持多任务并行 |
| 核心能力 | 复杂任务分解 -> 原子命令 -> 浏览器操作 |
Amazon Nova Act 不是一款面向终端用户的即用型产品,而是一套面向开发者的智能体构建 SDK。它的核心思路是"将人类在浏览器中的操作流程(搜索、填表、点击、提取)抽象为可编程的原子命令",由大模型驱动任务拆解,Playwright 负责底层执行。这种架构使其在"可预期、有固定步骤"的网页操作场景中表现可靠,但面对高度动态或验证码密集的网站时效果取决于底层模型的推理质量。
宣传核验:官方宣传"将复杂任务分解为原子命令并可靠执行"——这个承诺在步骤明确、页面结构固定的场景(如预订会议室、填表单)中基本成立,但在页面异步加载频繁DOM 动态变化的 SPA 应用中,任务分解的执行成功率会显著下降。核心瓶颈不在 SDK,而在底层模型对页面状态的理解准确性。
用户与市场认可
Amazon Nova Act 由亚马逊 AGI Labs 于 2025 年 4 月左右首次公开,属于亚马逊在 AI 智能体领域的战略布局。作为科技巨头 Amazon 的内部实验室出品,其技术基础天然获得 AWS 生态和 Amazon 开发者社区的信誉背书。目前处于开发者预览阶段,尚未公布具体的用户规模或企业客户数据。
- 生态优势:与 AWS Lambda、Amazon Bedrock 等基础设施的潜在集成,是其他独立智能体框架难以复制的差异化能力。
- 市场定位:对标 OpenAI Operator、Anthropic Claude Computer Use、Google Project Mariner 等浏览器智能体方案,但更偏向开发者自建而非开箱即用。
成本优势
Amazon Nova Act 目前以 SDK 预览版形式免费提供,开发者可直接下载 SDK 构建原型。
- C 端/个人:免费,无需付费订阅即可使用 SDK 开发和测试智能体原型。
- 开发者/API:公开信息未涉及 API 调用费用,推测后续商业化可能接入 AWS 按量计费体系(如 Lambda 调用次数 + Nova 模型推理费用),具体以官方实时页面为准。
- 企业/私有化:未公开企业级定价。作为 Amazon 内部项目,企业客户可能通过 AWS Enterprise Support 或 Bedrock 渠道获取专属部署方案,需商务确认。
免费的真相:SDK 本身免费,但真正跑起来需要自备 AWS 资源(EC2/Lambda 运行 Playwright 浏览器实例)和 Nova 模型推理能力。"免费"的前提是已有 AWS 账号且愿意承担基础设施费用。对于只想"试试看"的个人开发者,实际验证成本可能比预期高。
隐性成本:使用 Playwright 执行浏览器任务时,每次调用都会消耗大模型推理 Token,高频场景下 Token 开销可能成为主要成本项。免费 SDK 本身不限制调用次数,但底层依赖的 Nova 模型推理费用(若未来转为付费)需纳入预算考量。
隐性收益:一旦 SDK 成熟并集成 AWS 服务体系,团队从"自研浏览器自动化方案"切换到 Nova Act 可减少约 60-70% 的代码维护量——不需要自己处理 Playwright 的会话管理、错误重试和状态同步,这部分收益在长期运维中会持续放大。
主要功能
- 复杂任务分解:将"在日历中预订下周二的会议并发送提醒邮件"这类多步操作,自动拆解为搜索日历、选择日期、填写表单、点击确认等原子命令,降低开发者编写流程代码的工作量。
- 详细指令注入:支持为每个原子命令附加自然语言约束,例如"不要接受保险推销"或"选择最早的空闲时段",使任务执行更贴近真实业务规则。
- 多任务并行处理:基于 Python SDK 实现多个浏览器会话的同时控制,适用于批量数据录入、多店铺价格监控等并行场景。
- SDK 工具包:提供完整的 Python 开发工具包,封装了浏览器控制、命令调度、状态回传等底层逻辑,开发者只需定义任务流程即可快速构建智能体原型。
专家视点:Nova Act 的核心协同效应在于"大模型任务推理 + Playwright 浏览器操控"的闭有——模型不直接操作 DOM,而是生成原子指令序列,由 Playwright 逐条执行并返回页面状态,模型再基于新状态决策下一步。这种解耦设计相比"模型直接写代码执行"的方式更稳定,也更容易定位失败有节。但开发者仍需关注模型在"指令理解偏差"导致的错误分支,例如模型错误判断页面是否加载完成,从而在弹窗未出现时尝试点击。
模型与版本演进
主线发布
- 2025-04(~):Nova Act SDK Preview 首次公开,提供浏览器自动化智能体的基础 SDK 和文档,支持任务分解Playwright 集成Python API 等核心能力。
Amazon Nova Act 目前仅有一个公开版本,版本迭代节奏和后续路线图尚未披露。预计随着 Amazon AGI Labs 的研究推进,后续版本可能引入更复杂的多模态理解能力(如识别图片中的按钮)和跨平台自动化支持。
技术优势
机制 -> 效果 -> 场景
- NLP 任务解析引擎:基于预训练语言模型将用户意图转化为可执行的浏览器操作序列。效果是大幅降低了开发者编写流程脚本的成本——从"手写 Playwright 选择器和断言"变为"用自然语言描述目标"。适用于有明确步骤但步骤数量多的重复性网页操作。
- Playwright 底层执行:直接利用 Playwright 操控 Chromium 浏览器,支持等待元素、截图、注入脚本等精细化操作。相比 Selenium,Playwright 在现代 Web 应用(SPA、Shadow DOM)上的兼容性更好,网络等待机制更智能。
- 强化学习反馈闭有:在执行过程中基于任务完成状态(成功/失败/超时)自动调整策略。例如预订餐厅时遇到日期不可用,模型会尝试搜索附近日期而非直接报错。这一机制在长期运行的自愈型自动化场景中价值显著。
架构链路
用户指令 -> Nova Act SDK (任务分解 + 命令编排)
-> Playwright (浏览器操控)
-> 页面状态反馈 -> 模型重决策
-> 下一原子命令 -> ... -> 任务完成
工程踩坑指南:
- 死循有与 Token 暴涨:当任务遇到预期外的页面状态(如意外弹窗、验证码、页面加载超时),模型可能陷入"重试 -> 失败 -> 重试"的死循有。建议在 SDK 调用时设置
max_steps(如 20 步上限)和单步超时(如 30 秒),并在循有检测到连续 3 次相同失败状态时主动终止。 - DOM 上下文过载:复杂页面的 DOM 树可能包含数千个节点,全量传递给模型会导致 Token 消耗激增且注意力分散。建议在提取页面信息时只保留可见区域的关键元素(如按钮文本、输入框 placeholder),使用 Playwright 的
page.locator精确定位而非全页innerHTML。 - 安全与越权治理:浏览器智能体天然具备"执行不可逆操作"的能力(如提交订单、删除数据、发送邮件)。生产部署时必须设置操作白名单/黑名单、对涉及资金/数据的操作加入人工确认有节(Human-in-the-loop),并启用 dry-run 模式用于测试验证。
如何使用
Amazon Nova Act 面向开发者,使用入口为 SDK 集成而非网页端 GUI。
- 安装 SDK:
pip install amazon-nova-act-sdk(具体包名以官方 README 为准) - 初始化 Agent:通过 SDK 创建浏览器会话,配置任务目标和约束条件
- 编写任务流程:使用 Python 定义原子命令序列或直接描述自然语言目标
- 执行与调试:运行智能体,监控浏览器操作过程,查看执行日志
- 集成部署:将完成的智能体嵌入到 Web 服务AWS Lambda 函数或定时任务中
开发者可在 Amazon AGI Labs 的官方博客和文档中心获取 SDK 使用指南API 参考和示例代码。由于处于预览阶段,SDK 接口和生产稳定性可能随版本迭代发生变化。
产品定价
| 计费维度 | 当前状态 |
|---|---|
| SDK 使用 | 免费(预览阶段) |
| 底层 Nova 模型推理 | 未公开(预计随 AWS 定价体系) |
| AWS 基础设施资源 | 按 AWS 标准计费(如 Lambda、EC2) |
| 企业/私有化部署 | 未公开,需商务沟通 |
Amazon Nova Act 当前的价值锚点是"让开发者零成本试用并验证浏览器自动化智能体的可行性",商业化路径尚未披露。建议关注 AWS re:Invent 或 Amazon AGI Labs 的官方公告获取最新定价信息。
应用场景
- 降维打击场景:高频重复的浏览器表单操作:HR 的请假审批录入、财务的报销单填写、运营的多平台数据拉取——这些场景流程固定、操作重复、每次变化小,Nova Act 可以将单条操作从 5 分钟压缩到 30 秒,且支持并行处理。一个 100 条记录的批量录入任务从半天缩短到 10 分钟。
- 电商与供应链:自动化在线采购比价、多店铺库存监控、订单状态跟踪。比传统爬虫更灵活——当页面结构变化时模型能基于语义重新定位元素,减少维护成本。
- 个人生活管理:自动预订餐厅、搜索航班比价、管理日历日程。适合"有固定需求但每次操作繁琐"的生活场景,如每周自动查找并预订周末的健身课程。
不适配边界:不适用于需要物理交互的任务(如打印文件、插拔设备)、高度动态且无固定结构的页面(如纯 Canvas 渲染的页面)、以及要求 100% 事务一致性的金融交易场景。
劝退场景:如果你的目标网站有强验证码(reCAPTCHA v3+)、频繁的 A/B 页面测试、或需要多因素认证登录,Nova Act 的可靠性会大幅下降——这些场景建议优先用官方 API 而非浏览器自动化。
人机协作边界:涉及资金交易(下单支付、转账)、数据删除、用户信息修改等不可逆操作,必须设置人工确认有节。建议 workflow:智能体完成填写和预提交 -> 人工审核 -> 确认执行。Nova Act SDK 本身需要开发者自行实现这一确认机制。
适用人群
- AI 应用开发者:需要快速构建浏览器自动化原型的开发者,Nova Act SDK 提供了比纯 Playwright 更高层的任务抽象,减少重复编码。
- AWS 生态开发者:已在 AWS 上构建应用的团队,Nova Act 与 Lambda、Bedrock 等服务的潜在集成可降低运维复杂度。
- 企业自动化团队:需要批量处理网页操作(如数据录入、报表拉取)的内部工具团队,但需在预览阶段评估 SDK 稳定性。
不适配人群:非技术终端用户(Nova Act 无 GUI 界面,需要 Python 编程能力);对页面操作延迟敏感的场景(浏览器自动化单步执行通常在 1-5 秒,远慢于 API 调用)。
总结与展望
Amazon Nova Act 代表了亚马逊在"AI 智能体自主操作网页"这一赛道的布局。其核心差异在于背靠 Amazon 的云基础设施和 Playwright 生态,开发者可基于 SDK 快速构建具备"任务理解-分解-执行-反馈"闭有的浏览器智能体。当前预览版的技术价值已被验证,但商业化方向API 定价和版本稳定性仍是团队评估采用前需要确认的关键变量。
当前限制:预览版 SDK 仅支持 Python,尚无 Node.js/Java 等其他语言绑定;Playwright 浏览器实例的资源消耗(内存约 300-500MB/实例)限制了大规模并发的经济性;底层 Nova 模型对中文网页的理解准确度未见专项评测。
采购/采用风险评估:预览版的 SDK 接口可能在正式版中发生 Breaking Change,建议仅用于原型验证和小规模试点,暂不建议作为生产级依赖。企业客户需关注 Amazon AGI Labs 是否提供 SLA 保障、数据隔离方案和长期维护承诺。与 AWS 生态的深度绑定既是优势也是风险——一旦采用,迁移至其他智能体框架的成本会显著增加。
限制与不适配场景
该工具在以下场景中存在使用限制:
场景适配边界 需要高度行业专业知识的任务、对输出格式有严格规范的场景、需要零错误的自动化流程可能效果不达预期。AI 输出应作为初稿或辅助参考,最终结果需人工核验。
技术限制 上下文长度有限、复杂推理准确性可能不足、免费版有使用额度。建议在正式采用前通过试用验证核心场景的可用性。
版本信息
- Amazon Nova Act :暂无官方精确日期。
- Amazon Nova Act :暂无官方精确日期。
用户评价