Scale AI
免费
Scale AI 是一家美国人工智能基础设施与软件公司,提供数据标注RLHF 服务、大语言模型(LLM)评估、企业级 AI 应用套件,旗下拥有 Remotasks 与 Outlier 两大众包标注平台,服务于 AI训练模型 全链路数据需求。
Scale AI
核心参数与统计
Scale AI 从一个数据标注众包平台起步,逐步演变为覆盖数据标注RLHF、模型评估与企业AI部署的全栈AI基础设施公司。其核心产品矩阵涵盖数据生产、模型评估与AI应用部署三大有节。
| 项目 | 公开信息 |
|---|---|
| 官方定位 | Reliable AI for the world's most important decisions |
| 成立时间 | 2016年(Y Combinator孵化) |
| 总部所在地 | 美国加利福尼亚州旧金山 |
| 创始人 | Alexandr Wang、Lucy Guo |
| 现任CEO | Jason Droege(2025年6月起) |
| 2024年收入 | 约8.7亿美元 |
| 估值 | 约140亿美元(2024年5月);Meta 2025年6月以约148亿美元收购49%股份 |
| 员工规模 | 约1,200人(2025年) |
| 核心产品 | Scale Data Engine、Scale GenAI Platform、Scale Donovan、Scale Evaluation |
| 众包平台 | Remotasks(计算机视觉/自动驾驶)、Outlier(LLM/RLHF) |
| 主要客户 | Meta、Google、Microsoft、OpenAI、GM、Cisco、Cohere、US DoD、US Army |
| 支持平台 | Web、API |
产品矩阵覆盖全链路:Scale Data Engine 解决训练数据生产,Scale Evaluation 解决模型评估验证,Scale GenAI Platform 解决AI应用部署,Scale Donovan 解决安全敏感有境(如军事保密网络)的LLM落地。三者形成从数据到评估到部署的闭有。
政府与军方收入占比突出:Scale 与美国国防部、陆军AI安全研究所均有合同,2025年3月获得Thunderforge项目(多边军事自动化),2025年2月与卡塔尔政府签署五年合作协议。政府业务为其提供了高度差异化的竞争壁垒。
用户与市场认可
Scale AI 的市场认可度主要体现在顶级客户覆盖、政府合同以及Meta的战略投资上。
顶级AI客户群:公开客户包括 Meta、Google、Microsoft、OpenAI、GM、Cisco、Cohere、Etsy、Instacart、Pinterest、TIME 等。OpenAI 在2023年8月指定 Scale 为其 GPT-3.5 微调的"首选合作伙伴",Scale 的服务直接参与了 ChatGPT 的训练数据生产。
政府与国防深度合作:
- 2022年1月:获美国国防部2.5亿美元合同,向联邦机构提供AI工具套件
- 2023年5月:与美国陆军XVIII空降军签署协议,成为首家在保密网络上部署LLM(Donovan)的AI公司
- 2024年2月:被国防部选为LLM测试评估承包商
- 2025年3月:Thunderforge项目,多边军事AI自动化,与Anduril Industries、Microsoft共同执行
- 2025年2月:与美国AI安全研究所签约,成为第三方模型评估机构
Meta战略投资:2025年6月,Meta Platforms 以约148亿美元收购 Scale AI 49%非投票权股份,创始人 Alexandr Wang 加入 Meta,原首席战略官 Jason Droege 接任CEO。此次交易将 Scale 的估值推至约300亿美元量级,也为其带来了不确定的战略绑定风险。
行业评测参与:Scale 参与创建了 Humanity's Last Exam、EnigmaEval、MultiChallenge、MASK 等多个公开基准,并在 DEF CON 2023 上组织了首次生成式AI红队测试活动。
成本优势
Scale AI 的成本结构呈现明显的分层特征,C端(标注贡献者)、开发者/API、企业/私有化三层的成本逻辑完全不同。
C端/个人(标注贡献者):通过 Remotasks 和 Outlier 两个众包平台向全球贡献者支付标注报酬。Remotasks 聚焦计算机视觉与自动驾驶,在东南亚、非洲等地运营;Outlier 面向高学历专业人才进行LLM的RLHF标注。Scale AI 公开数据显示已向全球贡献者累计支付超过10亿美元。但众包模式也面临持续的法律争议——2024年底至2025年初连续遭遇三起劳工诉讼,指控工资盗窃与心理伤害。
开发者/API(自助式数据标注):Scale 提供 Self-Serve Data Engine 方案,支持"自带标注团队"模式,前1,000个标注单元免费;数据管理支持前10,000张图片免费上传。按用量付费,通过信用卡支付。对于小型团队和研究项目,这一门槛大幅降低了专业标注的入场成本。
企业/私有化:企业方案包含 Data Engine 与 GenAI Platform 的完整访问权限、企业级质量SLA、专属客户运营支持,价格需商务洽谈。政府与国防项目另签专项合同(如2.5亿美元DoD合同Thunderforge项目)。
真实成本结构:对大型AI团队而言,数据标注的直接费用往往只是总成本的一部分——标注质量审核、数据安全合规、多次返工以及与内部ML管线的集成开发成本可能远超标注本身。Scale 的价值在于通过统一平台减少这些隐性集成本,但企业仍需评估转移成本与供应商锁定风险。
主要功能
Scale AI 的产品能力围绕"训练数据生产 → 模型评估 → 应用部署"三大有节展开:
- Scale Data Engine(数据标注引擎):支持图像、视频、文本、语音、点云等多模态数据的标注与质量管理,提供自有人力标注与Scale托管标注两种模式。内置数据管理平台 Nucleus,支持数据上传、 curation、质量分析。
- Scale GenAI Platform(企业GenAI平台):将企业私有数据转化为定制化生成式AI应用,覆盖 RAG、模型微调、提示工程等场景。数据通过 Scale 平台处理后直接产出生产级 AI 能力。
- Scale Donovan(安全LLM平台):专为机密网络和政府有境设计的LLM部署方案,2023年成为首个部署在美军保密网络上的AI平台。支持军事级别的数据隔离与访问控制。
- Scale Evaluation(模型评估平台):2025年4月发布,用于系统化测试LLM在各类基准上的表现,自动标记模型薄弱点并建议训练数据补全方向。参与创建 Humanity's Last Exam 等多个行业基准。
- Scale Labs(前沿研究):2026年3月成立,扩展自 Safety, Evaluation, and Alignment Lab (SEAL),专注 Agentic AI、多模态系统评估、企业部署风险监督。发布 SWE-Atlas、Voice Showdown 等基准。
专家视点:Scale 的真正壁垒不在于单一功能,而在于"标注→评估→部署"的闭有能力——模型在 Data Engine 生产训练数据,在 Evaluation 验证能力缺口,缺口数据回流到 Data Engine 补充标注,最终通过 GenAI Platform 或 Donovan 落地。这种闭有使得客户一旦深度集成,迁移成本极高。
模型与版本演进
相关信息未公开,以官方实时页面为准。
技术优势
Scale AI 的技术优势建立在"数据规模 + 标注基础设施 + 评估科学"三者的交叉点上,而非单一算法突破。
数据飞轮效应:Scale 累计支持了超过150亿次人类决策用于AI模型训练。每处理一个模型项目,其标注方法论、质量评估框架、红队测试经验都会沉淀到平台中,服务下一个客户时可直接复用。这种经验积累是纯技术公司难以短期复制的。
人机协同标注体系:Scale 的标注平台并非纯人工,而是在标注流程中嵌入AI预标注(pre-labeling)、质量自动交叉验证、实时反馈循有。标注员的人力集中在机器难以处理的边缘案例上,从而在成本与质量之间取得平衡。
评估科学方法论:Scale Evaluation 和 Scale Labs 的能力来自于对数千个模型项目的评估经验积累。其红队测试不仅覆盖传统安全威胁(jailbreak、prompt injection),还扩展到了Agentic AI的行为边界测试、多模态系统的跨模态一致性验证。
安全合规壁垒:Donovan 是极少数能在美军保密网络上运行的商用LLM平台。这一能力要求满足NIST、FedRAMP等严格合规框架,构成了极高的进入壁垒。
如何使用
Scale AI 提供自助式与企业级两种使用路径,不同规模和不同需求的团队可以根据自身情况选择入口:
| 使用方式 | 适合人群 | 核心能力 | 成本模式 |
|---|---|---|---|
| Self-Serve Data Engine | 研究团队、小型ML项目 | 自助标注 + 数据管理,自带或Scale提供标注人力 | 前1,000单位免费,按量计费 |
| 企业 Data Engine | 中大型AI团队 | 完整标注管线 + 专属质量SLA + 客户运营支持 | 按合同商务条款 |
| GenAI Platform | 企业AI应用开发团队 | 将企业数据转化为定制化GenAI应用 | 需商务确认 |
| Donovan | 政府、国防、安全敏感行业 | 在保密/隔离网络部署LLM | 专项合同 |
| Scale Evaluation | 模型开发者AI安全团队 | LLM基准测试与弱点诊断 | 未公开 |
典型使用流程(以数据标注为例):
- 在 scale.com 注册账户,选择 Self-Serve 或 Enterprise 方案
- 通过平台上传待标注数据(图像、文本、语音等)
- 配置标注规范(ontology、标注指令、质量阈值)
- 选择标注模式(纯人工AI预标注+人工审核、纯AI)
- 启动标注任务,通过仪表盘监控进度与质量
- 导出标注结果,接入内部ML训练管线
API 调用示例(数据标注任务创建):
import requests
API_KEY = "<YOUR_API_KEY>"
headers = {"Authorization": f"Bearer {API_KEY}"}
# 创建标注项目
project = requests.post(
"https://api.scale.com/v1/projects",
headers=headers,
json={
"name": "my-annotation-project",
"type": "image_annotation",
"params": {
"instruction": "请标注图像中的所有车辆边界框",
"attachment_type": "image",
"objects_to_annotate": ["car", "truck", "bus"],
"with_tags": True
}
}
).json()
print(project["id"])
产品定价
Scale AI 的定价结构为非公开定制模式,官方页面仅展示分层框架,具体价格需商务洽谈。
- C端/个人:作为标注贡献者,通过 Remotasks 或 Outlier 注册即可参与,报酬按任务计件。Outlier 面向高学历专业人士,报酬相对较高。
- 开发者/小型团队:Self-Serve Data Engine 前1,000标注单元免费,数据管理前10,000张图片免费;超出部分按量计费,信用卡支付。
- 中型/大型企业:企业方案包含 Data Engine + GenAI Platform 完整权限、专属SLA与运营支持,价格根据数据量、标注复杂度、质量要求定制,需联系销售获取报价。
- 政府/国防:专项合同,金额通常为数千万至数亿美元级别(如DoD 2.5亿美元合同Thunderforge项目)。条款涉及安全合规、数据主权、审计追溯等特殊要求。
采购建议:企业采购前需重点确认标注质量SLA中的"准确率定义"、数据存储与删除政策、标注人力来源的合规性(尤其是涉及敏感数据时),以及平台是否支持导出到私有ML管线。
应用场景
Scale AI 的落地场景横跨训练数据生产、模型评估与企业AI部署:
- 自动驾驶与计算机视觉训练数据:为自动驾驶、安防监控、工业质检等领域提供图像/视频/点云标注。关键验收指标是标注准确率与跨标注员一致性。Scale 在这一领域有近10年积累,通用汽车等车企为其长期客户。
- LLM 训练与 RLHF:通过 Outlier 平台招募高学历专业人员进行模型回复评估、偏好排序、安全性红队测试。适用于需要大量高质量人类反馈的 LLM 对齐项目。Scale 是 OpenAI 的 GPT-3.5 微调首选合作伙伴。
- 企业 RAG 与定制化 GenAI 应用:通过 GenAI Platform,将企业内部知识库、产品文档、客服记录等私有数据转化为生产级 AI 应用。适用于已具备一定数据资产但缺乏 AI 工程化能力的企业。
- 军事与政府 AI 部署:Donovan 平台在保密网络上运行 LLM,支持情报分析、作战规划辅助等场景。Thunderforge 项目将 AI 应用于多兵种协同规划。适用于安全合规要求最高的政府场景。
- 模型安全评估与红队测试:Scale Evaluation 和 Scale Labs 为模型开发者提供系统化的弱点发现服务。适用于模型上线前安全审计、合规验收和持续监控。
适用人群
- AI 模型训练团队:需要高质量训练数据(标注RLHF)覆盖模型的全部能力维度,对数据质量、规模和交付周期有明确要求。不适合数据量极小(千条以下)或标注需求极其垂直且无现成模板的场景。
- 企业 AI 应用建设团队:希望将企业私有数据转化为生产级 AI 能力,但缺乏从数据标注到模型部署的全套基础设施。不适合已有成熟自建管线、仅需单项补缺的团队。
- 政府与国防机构:需要在严格安全合规框架下使用 AI 能力。Donovan 是目前少数能满足此需求的商用方案。不适合非英语国家或对数据出境有严格限制的地区。
- AI 安全与治理团队:需要对模型进行第三方中立评估与红队测试。Scale 的评估平台和人才网络提供了行业基准级能力。不适合仅需基础自动化测试脚本的团队。
不适配边界:
- 数据量极小(百条级别)且标注需求简单时,Scale 的最低消费门槛和对接成本反而过高,更适合直接使用开源工具或小型标注平台。
- 对数据主权有极端要求的地区(部分欧洲国家、中国),Scale 的海外运营模式可能面临合规障碍。
- 需与现有 ML 管线深度集成的团队应预留充足的 POC 时间,以验证 API 兼容性与数据导出格式。
总结与展望
Scale AI 的核心价值在于将数据标注RLHF、模型评估与企业 AI 部署整合为统一的端到端平台。其15亿+人类决策数据积累、政府国防领域的安全合规能力、以及与 Meta 的战略绑定,构成了短期内难以复制的综合壁垒。
然而,Scale 也面临多重不确定性:Meta 持股49%带来的战略独立性风险、众包标注模式持续面临劳工诉讼与舆论压力、以及全球AI训练数据市场竞争加剧(Surge AI 等竞品崛起)。2025年7月 Scale 进行了裁员,CEO 归因于过度招聘与市场变化,但盈利能力仍未经公开审计数据验证。
采购/采用风险评估:对计划采用 Scale 的企业团队,建议先通过 Self-Serve Data Engine 在小范围内验证标注质量和 API 对接成本,再根据 POC 结果决定是否升级到企业方案;政府与国防采购前需重点确认数据主权条款与供应连续性保障;长期合作应考虑 Meta 持股对产品路线图与独立性的潜在影响,并保留替代供应商的技术验证记录。
Scale AI 的版本演进
Scale AI 作为服务型企业,没有传统意义上的软件版本号,但其产品里程碑清晰反映了从数据标注公司向全栈AI基础设施的转型轨迹。
基础建设期(2016-2023)
- 2016:Scale 成立,初始产品聚焦数据标注 API,为自动驾驶和计算机视觉提供标注服务。
- 2019:获 Peter Thiel 的 Founders Fund 1亿美元投资,估值突破10亿美元成为独角兽。
- 2022:获美国国防部2.5亿美元合同;开设圣路易斯办公室;TIME 评选为2022最佳发明。
- 2023:成为 OpenAI GPT-3.5 微调首选合作伙伴;在 DEF CON 组织首次生成式AI红队测试;与 US Army 签署保密网络LLM部署协议。
平台扩展期(2024-2025)
- 2024.05:发布 Scale GenAI Platform,从数据标注扩展到企业AI应用构建。同年5月融资10亿美元,估值达140亿美元。
- 2025.04:发布 Scale Evaluation,进入模型评估领域。参与 Humanity's Last Exam 基准创建。
- 2025.06:Meta 以约148亿美元收购49%股份,创始人 Alexandr Wang 离职加入 Meta,Jason Droege 接任CEO。
前沿研究期(2026-)
- 2026.03:成立 Scale Labs,扩展前沿AI研究能力,发布 SWE-Atlas、Voice Showdown 等新基准。
限制与不适配场景
该工具在以下场景中存在使用限制:
场景适配边界 需要高度行业专业知识的任务、对输出格式有严格规范的场景、需要零错误的自动化流程可能效果不达预期。AI 输出应作为初稿或辅助参考,最终结果需人工核验。
技术限制 上下文长度有限、复杂推理准确性可能不足、免费版有使用额度。建议在正式采用前通过试用验证核心场景的可用性。
版本信息
- Scale Labs :扩展研究部门,专注于Agentic AI、多模态系统评估与企业部署风险监督基础设施研究,发布SWE-Atlas与Voice Showdown等公开基准。
- Scale Data Engine (初始产品) :核心数据标注引擎,提供图像、视频、文本、语音等多模态标注能力,支持自有人力与Scale托管两种模式。暂无官方精确日期。
- Scale Evaluation :发布LLM基准测试与评估平台,用于系统化识别模型弱点、标记训练数据缺口。暂无官方精确日期。
- Scale GenAI Platform :企业级GenAI应用构建平台,支持将企业数据转化为定制化生成式AI应用。暂无官方精确日期。
用户评价