Пользовались этим инструментом? Оцените его
Пользовались этим инструментом? Оцените его
Appen поставляет данные для обучения ИИ: компания продаёт созданные и проверенные людьми данные, разметку данных и оценку моделей командам, разрабатывающим ИИ-системы. Она основана в Сиднее в 1996 году и поначалу занималась речевыми и языковыми данными для ранних NLP-систем. Сегодня её акции торгуются на Австралийской фондовой бирже под тикером APX. Appen описывает свою задачу как поставку проверенных экспертами данных, на которых обучаются передовые модели, чтобы ИИ-системы понимали нюансы, контекст и сложность в масштабе.
Компания работает на обеих сторонах одного рынка:
Appen сообщает о более чем 1 млн проверенных исполнителей, представительстве более 170 стран и поддержке более 235 языков. В 2018 году, в год выхода на ASX, Appen приобрела Figure Eight для расширения возможностей платформы.
Appen делит работу с данными под заказ на шесть продуктовых линеек, каждая — для своего этапа современной разработки моделей:
Для экспертного RLHF Appen утверждает, что ранжирование предпочтений и сравнительную обратную связь дают проверенные обладатели степеней PhD, MD и JD в медицине, праве, науке и финансах, и доказывает, что обычная краудсорсинговая разметка не может судить, верен ли клинический диагноз или юридический аргумент. Её регуляторные аудиты оценивают выходные данные моделей на соответствие Закону ЕС об ИИ, NIST AI RMF и этическим рамкам организаций.
Отдельная линейка для программирования предлагает датасеты уровня репозиториев для обучения и оценки LLM и агентов-программистов: более 60 сред, более 50 языков и 500 проверяемых RL-задач. Эти среды описываются как закрытые и исключённые из публичных индексов кода, поэтому оценку можно проводить без известного пересечения с обучающими данными.
ADAP — платформа разметки данных Appen; по словам Appen, она сочетает автоматизацию и человеческий контроль для поставки данных по широкому спектру модальностей и сценариев применения ИИ. Основные возможности по списку Appen:
Каталог Appen насчитывает 596 датасетов в восьми категориях — от RL-задач и верификаторов до речи, кода и корпоративных данных. К каждому датасету прилагается спецификация с источником, согласием, методом разметки, известными ограничениями и условиями лицензии. Appen формулирует выбор так: готовые наборы охватывают распространённые категории на стандартных условиях и поставляются за несколько дней, а сбор под заказ нужен, когда проекту требуются определённые демографические группы, контролируемая акустическая среда или охват узкоспециальной области.
Appen также ведёт программу со стороны предложения: компании лицензируют рабочие процессы и операционное ноу-хау, на которых они уже работают, ИИ-лабораториям, создающим новые модели, а Appen берёт на себя извлечение, анонимизацию и переговоры с лабораториями. Она охватывает три категории операционных данных: операционную документацию, записи о решениях и эскалациях, а также учётные системы.
Опубликованные кейсы Appen показывают диапазон задач, за которые берётся компания; цифры ниже — данные самой компании.
Appen подходит:
Хуже подходит:
Мобильные задания в основном сводятся к фотографированию предметов, записи видео или аудио, и Appen рекомендует компьютер для некоторых шагов регистрации и выбора проекта до работы в приложении.
Цены Appen для покупателей не публикуются. На официальных страницах, проверенных для этого обзора, включая полную карту сайта, нет прайс-листа, таблицы тарифов или самостоятельного оформления заказа, а контактная форма команды по ИИ-данным помечена как только для деловых запросов и запросов по продажам.
Стандартная лицензия каталога бессрочная и неисключительная, с правами на коммерческое обучение; тип лицензии указан в спецификации каждого датасета. Для корпоративных данных каждое партнёрство оценивается индивидуально, условия согласуются письменно до любого извлечения, а оплата производится при приёмке. Appen берёт на себя извлечение, анонимизацию, подготовку и передачу — без авансовых платежей, без платы за настройку и без удержаний из сумм, выплачиваемых партнёрам. Ценность растёт с редкостью операционных знаний, степенью связанности исходных систем, объёмом данных и глубиной их истории.
CrowdGen рекламирует $100+ в час как максимальную почасовую ставку со сноской о том, что ставка зависит от местоположения и навыков. Самые высокие отраслевые потолки — у практикующих медиков и юристов: до $450 и до $400 в час; у разработчиков ПО — до $150 в час, у лингвистов — до $95 в час. В финансах потолки варьируются: до $150 в час у управляющих инвестициями и до $180 в час у аналитиков FP&A, а у администраторов в здравоохранении — до $90 в час. Это потолки, а не типичный заработок. CrowdGen утверждает, что ставки чётко указываются до начала работы. Appen также заявляет, что никогда не попросит исполнителей платить что-либо за участие в своих проектах.
Сервисы, пересекающиеся с Appen, кратко — по их собственному позиционированию:
Собственный набор Appen добавляет лицензируемый каталог датасетов, программу лицензирования корпоративных операционных данных и данные для физического ИИ, которые собираются, синхронизируются и размечаются от начала до конца на специально построенных площадках.
Да. CrowdGen называет себя платформой исполнителей Appen, а на странице Appen о мошенничестве crowdgen.com и app.crowdgen.com перечислены среди её официальных сайтов.
Appen заявляет, что никогда не попросит присылать деньги за подачу заявки или начало работы, никогда не отправляет чеки заранее и рассылает официальные письма только с адресов @appen.com.
Большая часть заработка указывается в долларах США и выплачивается в местной валюте; вывести средства можно банковским переводом, через PayPal, Payoneer, Airtm и другими способами.