Replicate позволяет запускать модели ИИ через облачный API, не разбираясь в машинном обучении и не поддерживая свою инфраструктуру. Один HTTP-запрос отправляет вход в модель изображений, видео, звука или языка и возвращает результат: не нужно арендовать GPU и собирать контейнер. По сути это API моделей ИИ.
За этим интерфейсом стоят три задачи: запустить модель, опубликованную кем-то другим, дообучить её на своих данных и развернуть код, который вы упаковали сами. Каждая из них достигается одной строкой кода.
Оператор — Replicate, LLC., адрес 101 Townsend Street, Сан-Франциско. 17 ноября 2025 года сменился владелец: «ведущая платформа для запуска моделей ИИ» объявила о переходе в Cloudflare. Продуктовая поверхность была из этого изменения явно исключена — поставщик заявляет, что API не меняется и используемые сегодня модели продолжат работать, а покупатель дал то же обещание: API и рабочие процессы существующих пользователей продолжат работать без перерыва. Разработка тоже не остановилась: свежая запись в журнале изменений добавляет набор Markdown-инструкций, дающих ассистентам для кода экспертные знания о работе с моделями ИИ на этой платформе.
Размер каталога — цифра поставщика: в объявлении о сделке говорится о более чем 50 000 моделей с открытым исходным кодом и дообученных моделей, а независимого подсчёта в проверенных каналах не нашлось.
За одним API стоят четыре сущности, которые ведут себя по-разному и по задержке, и по стоимости:
«Модель на платформе» поэтому не единый профиль производительности: официальные модели всегда прогреты и готовы отвечать на запросы, поэтому их можно запускать, не думая о холодном старте, тогда как редко используемая модель сообщества сначала загружается с нуля.
Ёмкость двигается в обе стороны без настройки: при наплыве трафика платформа масштабируется вверх, а без трафика опускается до нуля. Если такое поведение слишком свободное, функция развёртывания (deployment) позволяет, среди прочего, управлять оборудованием и параметрами масштабирования любой модели. Для команд организации (organization) дают общий доступ к моделям, API-токенам, счетам и панелям.
Стандартный фильтр безопасности охватывает более узкий круг, чем можно подумать: для веб-предсказаний проверка безопасности включается только на базовой модели SDXL, базовой модели Flux и всех производных дообучениях обеих. Есть и запасной выход — при запуске модели через API проверку безопасности можно отключить, — из-за чего на пути через API гарантированного фильтра нет.
Первая интеграция короткая, но два шага из неё дёшевы сейчас и дороги потом.
Документированные возможности ложатся на узкий набор задач.
Те же факты очерчивают границу: гарантированное время ответа, запуск дольше тридцати минут или результаты, остающиеся на платформе для последующей выгрузки, выходят за документированные рамки стандартного аккаунта.
Он подходит командам, которым нужен бессерверный GPU-инференс без владения всем стеком машинного обучения и которым проще принять плавающий счёт, чем эксплуатировать кластеры. Подходит он и авторам моделей: публикация и дообучение здесь операции первого класса.
Четыре ситуации подходят плохо, и каждая восходит к опубликованному условию:
Всё доступно по HTTP. Собственные клиенты покрывают Node.js, Python, Swift и Go, к ним добавлен размещённый MCP-клиент; другие экосистемы, например Elixir, поддерживаются участниками сообщества, а не поставщиком, и это меняет уровень поддержки, на который можно рассчитывать.
Есть и путь через браузер — самый быстрый способ посмотреть поля ввода модели до написания кода.
Цены Replicate не имеют тарифных ступеней. Вы платите только за потреблённое: часть моделей тарифицируется по оборудованию и времени, часть — по входу и выходу. Какой счётчик применяется, зависит от модели, а не от вашего аккаунта. На временном счётчике ставка следует за оборудованием:
| Оборудование | За секунду | За час |
|---|---|---|
| Nvidia T4 | $0.000225 | $0.81 |
| Nvidia L40S | $0.000975 | $3.51 |
| Nvidia A100 (80 ГБ) | $0.001400 | $5.04 |
| Nvidia H100 | $0.001525 | $5.49 |
Это цены за секунду работы, а не за запрос: большинство моделей тарифицируется по времени, которое уходит на выполнение, и цена за секунду зависит от используемого оборудования, поэтому один и тот же запрос на более тяжёлой модели стоит дороже. Счётчик выхода работает наоборот: официальные модели тарифицируются по предсказуемым метрикам вроде числа созданных изображений, секунд видео или входных и выходных токенов, а опубликованные примеры идут от $0.04 за созданное изображение до $3.75 за миллион входных токенов. Бюджет на один запрос заранее считается только на этой стороне, а самые высокие уровни вообще не относятся к самообслуживанию: дополнительная мультипроцессорная ёмкость H100 доступна по договорам с обязательством по расходам.
Холодный старт на общей ёмкости — это проблема задержки, а на выделенной — проблема оплаты. На общей стороне при использовании публичной модели вы платите только за время, когда она активно обрабатывает ваши запросы; время запуска и время простоя модели бесплатны. Ожидание при этом вполне реально: в отдельных случаях процесс занимает несколько минут. И оно не полностью в вашей власти, поскольку по умолчанию вы делите пул оборудования с другими клиентами, а ваши запросы попадают в общую очередь.
Убрать ожидание — значит сменить счётчик. На выделенной ёмкости вы платите за всё время, пока экземпляры модели находятся онлайн: за время запуска, за время простоя в ожидании запросов и за время активной обработки. Исключение — быстро стартующие дообученные модели: они тарифицируются только по активному времени обработки, независимо от того, публичные они или приватные.
Бесплатный доступ существует, но он ограничен и не описан цифрами. Часть моделей запускается бесплатно, но через некоторое время вас попросят настроить оплату — без указания суммы, списка моделей или срока. Непополненные аккаунты вдобавок ограничиваются по скорости: если кредит выдан, а способ оплаты не привязан, действует лимит 1 запрос в секунду и не более 6 запросов в минуту.
Платный доступ предоплатный и имеет срок. Купленный кредит действует 1 год с даты покупки и не возвращается, кроме случаев, требуемых законом; договор повторяет правило истечения: каждый платёж, пополнивший предоплаченный баланс, сгорает в конце двенадцатого месяца после даты платежа, если не израсходован полностью. У автопополнения есть нижние границы — минимальный порог $5 и минимальная сумма пополнения $15, — а как только баланс достигает нуля, новые задачи блокируются, а работающая инфраструктура выключается.
Корпоративные условия обсуждаются, а не публикуются: выделенный менеджер, приоритетная поддержка, более высокие лимиты GPU и SLA по производительности, а объёмные скидки привязаны к обязательству по расходам.
Большую часть сравнения делают два факта. Первый — широта: корпоративные пользователи получают доступ к более чем 50 000 моделей через один API и один договор, и это не то же предложение, что сервис, заточенный под одну модальность. Второй — самая дешёвая конфигурация и есть общая, а в ней время от времени встречаются холодный старт или лимиты масштабирования в зависимости от того, как эту модель используют другие клиенты.
Независимые источники называют состав поля, а не расставляют места. Подписанный технический материал к выходу компании из тени в феврале 2023 года описывал переполненный рынок: стартап конкурирует с Hugging Face и OctoML, а отчасти и с Runway ML, которые в сумме привлекли сотни миллионов долларов. Публичное обсуждение среди разработчиков позже дало более длинный практический список — сколько вообще игроков в этой нише? Replicate, RunPod, Modal, Northflank, FAL.
На практике их разделяют три вопроса: публикует ли провайдер посекундную ставку за оборудование или только цену за выход; берёт ли он плату за простой, когда экземпляры закреплены; и сохраняет ли он ваши результаты или удаляет их по таймеру. Ни один независимый бенчмарк в этом круге не прошёл порог по источнику: найденные сравнительные страницы принадлежали либо конкурирующим платформам, либо агрегаторам, живущим на реферальных ссылках.
Документация и договор говорят разное о неудачной работе. Документация по оплате утверждает, что неудавшийся запуск не тарифицируется ни на одной модели, тогда как отмена запуска официальной модели всё же может быть выставлена к оплате. Условия говорят обратное: частичные запуски и неудачные попытки подлежат оплате в зависимости от точной точки отказа, зафиксированной в логах поставщика. Третье правило касается цепочек вызовов: если модель падает, вам выставляют длительность запуска плюс стоимость нижестоящих моделей, вызванных до отказа. Эти страницы между собой несогласованны, а именно эти логи служат записью при разборе споров по счетам, поэтому нагрузке с высокой долей отказов нужно письменно зафиксировать применимое правило.
В тарифах самообслуживания договором не закреплено ничего. Поставщик оставляет за собой право по собственному усмотрению в любой момент вносить изменения в сервис, в том числе ограничивая или прекращая отдельные функции, временно или постоянно и без уведомления. Обещания по доступности моделей тоже нет, поэтому модель, от которой зависит ваш продукт, может исчезнуть без предупреждения — фиксируйте версии и держите запасной путь. Разрешение споров тоже ограничено: применяется право штата Калифорния, а коллективные арбитражные процедуры не допускаются.
Единообразный интерфейс скрывает неединообразные лицензии: нельзя использовать модели машинного обучения в нарушение ограничений открытой лицензии их владельца. Разрешительные лицензии, использование только для исследований и проприетарные условия стоят за одним и тем же вызовом.
Хранение асимметрично. Предсказания через API стираются по часовому таймеру, а данные предсказаний, созданных через веб-интерфейс, хранятся бессрочно, так что историю накапливает именно браузерный путь. Мониторинг прописан прямо: поставщик оставляет за собой право отслеживать использование сервиса на предмет соблюдения политики, включая автоматические и ручные проверки содержимого и действий. Политика конфиденциальности отдельно предупреждает, что загруженные обучающие данные могут содержать любые сведения, часть которых по различным законам о приватности может считаться «чувствительной».
Права на результат широки, но обусловлены. Поставщик передаёт вам все возможные права, титул и интересы в отношении выхода, включая коммерческое использование вроде продажи или публикации, с оговоркой о применимых условиях третьих сторон — этой оговоркой и является лицензия той модели, что создала результат. Взамен вы предоставляете на свои входные данные лицензию в объёме, необходимом для выдачи результата, обучения и создания производных клиентских моделей, оказания услуг по условиям, а также формирования и компиляции Resultant Data. На вопрос, обучают ли эти входные данные собственные модели поставщика, опубликованные политики не отвечают ни утвердительно, ни отрицательно.
Платформа заявляет, что не «продаёт» и не «передаёт» персональные данные в значении законов штатов США о приватности, а политика указывает, что персональные данные детей младше 16 лет намеренно не собираются.
Есть ограниченный бесплатный лимит, а не бесплатный тариф: часть моделей работает бесплатно до момента, когда вас попросят настроить оплату, при этом ни объём, ни срок, ни список моделей не опубликованы. Пока способ оплаты не привязан, пропускная способность ограничена одним запросом в секунду.
На публичных моделях нет: там время запуска и простоя бесплатно. Всё меняется, как только вы закрепляете ёмкость: выделенные экземпляры и развёртывания тарифицируют и запуск, и простой.
Да. Кредит действует год с даты покупки, а договор указывает, что каждый платёж сгорает в конце двенадцатого месяца после оплаты, если не израсходован полностью. Предоплаченные балансы не возвращаются, кроме случаев, предусмотренных законом или прямо оговорённых в договоре.
Через API по умолчанию нет: входы, выходы, файлы и логи удаляются через час, поэтому всё нужное придётся скопировать самостоятельно. Остаются только предсказания, созданные в браузере, — до тех пор, пока вы их не удалите.