Appen 是一家 AI 训练数据公司,向构建 AI 系统的团队出售由人工生产和人工验证的数据、数据标注与模型评估服务。它于 1996 年在悉尼创立,最初专注于为早期 NLP 系统提供语音和语言数据。如今它在澳大利亚证券交易所上市,股票代码为 APX。Appen 将自身职责描述为交付经专家验证、用于训练前沿模型的数据,让 AI 系统能够大规模理解细微差别、语境与复杂性。
公司在同一市场的两端开展业务:
Appen 称拥有超过 100 万名经审核的贡献者,覆盖 170 多个国家,支持 235 种以上语言。2018 年,即在澳交所上市的当年,Appen 收购了 Figure Eight 以扩展平台能力。
Appen 将定制数据业务分为六条产品线,每条对应现代模型开发的一个环节:
对于领域专家 RLHF,Appen 称偏好排序和比较反馈来自医学、法律、科学和金融领域经验证的博士、医学博士和法学博士,并认为标准众包标注无法判断临床诊断或法律论证是否正确。其监管审计依据欧盟《人工智能法》、NIST AI RMF 和组织伦理框架评估模型输出。
另一条编程产品线提供仓库级数据集,用于训练和评估 LLM 与编程智能体,包含 60 多个环境、50 多种语言和 500 个可验证的 RL 任务。这些环境被描述为私有且不进入公开代码索引,因此评估可以在没有已知训练重叠的情况下进行。
ADAP 是 Appen 的数据标注平台,Appen 称它融合了自动化与人工监督,可为广泛的模态和 AI 用例交付数据。Appen 列出的主要能力如下:
Appen 的目录收录 596 个数据集,分属八个类别,从 RL 任务与验证器到语音、代码和企业数据。每个数据集都附有规格说明表,记录来源、同意情况、标注方法、已知局限和许可条款。Appen 这样界定两者的选择:现成数据集以标准条件覆盖常见类别,数天内即可交付;当项目需要特定人群构成、受控声学环境或专业领域覆盖时,则采用定制采集。
Appen 还运营一个供给侧项目:企业把自身已在运行的工作流程和运营经验授权给正在构建新模型的 AI 实验室,由 Appen 负责抽取、匿名化以及与实验室的沟通。该项目界定了三类运营数据:运营文档、决策与升级处理记录,以及记录系统。
Appen 公开的案例研究展示了其承接工作的范围;以下数字均为公司自己提供。
Appen 适合:
不太适合:
移动端任务以拍摄物品照片、录制视频或录制音频为主;在应用内开始工作之前,Appen 建议用电脑完成部分注册和项目选择步骤。
Appen 未向买方公开价格。在本次评测核查的官方页面(包括完整站点地图)中,没有价目表、套餐对比表或自助结账,AI 数据团队的联系表单也标明仅受理商务和销售咨询。
标准目录许可为永久、非独占许可,含商业训练权利,许可类型列在每个数据集的规格说明表上。企业数据方面,每项合作单独报价,条款在任何抽取开始前以书面形式约定,并在验收时付款。Appen 承担抽取、匿名化、准备和传输工作,没有预付费用、没有设置费,也不从支付给合作方的款项中扣减。价值随运营知识的稀缺程度、源系统之间的互联程度,以及数据量和时间跨度而提高。
CrowdGen 宣传的最高时薪为 $100+/小时,脚注说明费率取决于所在地区和技能。医疗临床人员和法律专家的领域上限最高,分别为最高 $450/小时和最高 $400/小时;软件工程师最高 $150/小时,语言学家最高 $95/小时。金融类上限从投资经理的最高 $150/小时到 FP&A 分析师的最高 $180/小时不等,医疗行政人员则最高 $90/小时。这些是上限,不是典型收入。CrowdGen 称会在工作开始前明确说明费率。Appen 还表示,绝不会要求贡献者为加入其项目支付任何费用。
与 Appen 业务重叠的服务,以下按各自的定位概述:
Appen 自身的组合还多了可授权的数据集目录、企业运营数据授权项目,以及在专用设施中端到端采集、同步和标注的物理 AI 数据。
是的。CrowdGen 自称是 Appen 的贡献者平台,Appen 的防诈骗提示页面也将 crowdgen.com 和 app.crowdgen.com 列为其官方网站。
Appen 称,它绝不会要求人们为申请或开始一份工作而汇款,从不预先寄送支票,官方邮件只从 @appen.com 地址发出。
大多数收入以美元计价、以当地货币支付,可通过银行转账、PayPal、Payoneer、Airtm 等方式提现。