Пользовались этим инструментом? Оцените его
Пользовались этим инструментом? Оцените его
Modal — бессерверное облако, запускающее Python-код на GPU и CPU с посекундной оплатой; компания описывает его как облачную инфраструктуру для команд, разрабатывающих, обучающих и обслуживающих ИИ-приложения в больших масштабах.
Modal помещает ваш код в контейнер, выполняет его в облаке и автоматически добавляет контейнеры при росте трафика, объединяя мощности крупных облаков и выбирая, где запускать каждую задачу. Образы контейнеров и запросы GPU задаются кодом на Python, поэтому у приложения Modal нет YAML-файлов развёртывания.
Сайтом modal.com управляет Modal Labs. По данным независимых технологических СМИ, Modal основали в 2021 году CEO Эрик Бернхардссон и CTO Акшат Бубна; по словам компании, она привлекла более 466 млн долларов от инвесторов, включая General Catalyst и Redpoint Ventures. 28 сентября 2026 года в технологической новостной статье со ссылкой на неназванный источник сообщалось, что Modal Labs, которую статья назвала поставщиком инфраструктуры ИИ-инференса, близка к привлечению раунда на 750 млн долларов под руководством Accel при оценке в 15,75 млрд долларов; в Modal Labs от комментариев отказались.
Modal охватывает инференс с холодным стартом, который компания называет субсекундным, параллельные пакетные задачи, обучение и дообучение, изолированные песочницы для сгенерированного ИИ кода и совместные Notebooks с GPU.
Аргумент gpu принимает T4, L4, A10, L40S, A100 (общий вариант, 40 ГБ или 80 ГБ), RTX PRO 6000, H100 (или H100!), H200, B200 (или B200+) и B300. B300, B200, H200, H100, A100, L4, T4 и L40S допускают до 8 GPU на контейнер (до 2 304 ГБ памяти GPU); A10 ограничен 4 GPU и 96 ГБ.
Для бенчмарков важны два автоматических апгрейда: запрос H100 может выполниться на H200, а запрос A100 — на A100 с 80 ГБ, по исходной цене; запрос H100! отключает апгрейд до H200. Функция также может перечислить типы GPU в порядке предпочтения, и Modal откатывается вниз по списку.
Modal Sandboxes — защищённые контейнеры, определяемые во время выполнения, для запуска недоверенного кода пользователей или агентов. По словам Modal, миллионы песочниц можно программно создать менее чем за минуту, а снимки и восстановление ускоряют запуск.
Размещённые блокноты Jupyter с бессерверной оплатой, автоматическим отключением при простое, GPU от Modal и совместным редактированием в реальном времени.
1 октября 2026 года Modal объявила, что Modal Clusters общедоступны через декоратор @modal.clustered: многоузловые группы GPU с RDMA, планируемые совместно из общего пула мощностей с посекундной оплатой.
pip install modal, затем modal setup для аутентификации (или python -m modal setup, если первый вариант не сработает).@app.function(...), указав образ контейнера и GPU, и запустите файл командой modal run path/to/file.py.Modal утверждает, что контейнеры загружаются примерно за секунду, но прогретыми они становятся лишь после импортов и прочей инициализации в глобальной области видимости, поэтому готовность может занять от секунд до минут. Три настройки балансируют задержку и расходы на простой:
scaledown_window: держит простаивающие контейнеры активными от 2 секунд до 20 минут; чем длиннее окно, тем меньше холодных стартов, но простаивающие ресурсы оплачиваются.min_containers и buffer_containers: первый держит минимум прогретых контейнеров, чтобы функция никогда не сокращалась до нуля, второй добавляет запасные контейнеры, пока она активна.us, даёт больший пул ресурсов, чем узкий, что улучшает время холодного старта и доступность.Modal может развернуть любое контейнеризуемое приложение на Python и ориентирован на ресурсоёмкие задачи с горизонтальным масштабированием: масштабный ML-инференс, обучение и дообучение моделей, конвейеры данных, научные вычисления и очереди задач.
Эти три цитаты клиентов — отзывы с главной страницы, а не независимые кейсы.
Независимых сигналов от отзывов в этом раунде мало: на платформе отзывов при сообществе запусков продуктов у Modal на 5 октября 2026 года была оценка 5,0 по 61 отзыву, а ИИ-сводка платформы говорит, что авторы в основном основатели и критики почти нет.
routing_region также принимает us-west (Орегон), eu-west (Дублин) и ap-south (Мумбаи).Modal сочетает месячный план с посекундной тарификацией GPU и учётом CPU и памяти по факту использования; прейскурантные цены ниже зафиксированы 5 октября 2026 года.
| План | Плата за платформу | Включённые вычисления | Места | Контейнеры / параллельность GPU | Хранение логов | Включённый исходящий трафик |
|---|---|---|---|---|---|---|
| Starter | $0 + вычисления / месяц | $30 / месяц | 3 | 100 / 10 | 1 день | 1 ТиБ / месяц |
| Team | $250 + вычисления / месяц | $100 / месяц | Без ограничений | 5 000 / 50 | 30 дней | 10 ТиБ / месяц |
| Enterprise | Индивидуально | Индивидуально | Без ограничений | Повышенная параллельность GPU | Индивидуально | 100 ТиБ / месяц |
Enterprise добавляет скидки за объём, встроенные услуги ML-инженеров, приватную поддержку в Slack, журналы аудита, Okta SSO и HIPAA. Starter допускает 200 развёрнутых приложений и 5 развёрнутых cron-задач и не включает собственные домены, откаты развёртываний, бюджеты на уровне окружений, прокси со статическим IP и RBAC; Team хранит 3 версии для отката.
| Ресурс | Цена за секунду |
|---|---|
| Nvidia B300 | $0.001972 |
| Nvidia B200 | $0.001736 |
| Nvidia H200 SXM | $0.001261 |
| Nvidia H100 SXM5 | $0.001097 |
| Nvidia RTX PRO 6000 | $0.000842 |
| Nvidia A100, 80 ГБ | $0.000694 |
| Nvidia A100, 40 ГБ | $0.000583 |
| Nvidia L40S | $0.000542 |
| Nvidia A10 | $0.000306 |
| Nvidia L4 | $0.000222 |
| Nvidia T4 | $0.000164 |
| CPU, за физическое ядро (2 vCPU) | $0.0000131 |
| Память, за ГиБ | $0.00000222 |
Минимум CPU — 0,125 ядра на контейнер. Для песочниц и Notebooks действуют повышенные тарифы на CPU и память: $0.00003942 за ядро и $0.00000667 за ГиБ в секунду, GPU — по стандартным ценам. Volumes стоят $0.09 за ГиБ в месяц сверх бесплатного 1 ТиБ, а исходящий трафик сверх лимита плана — $0.04 за ГиБ. В расчётном примере Modal Stable Diffusion на A10G обходится примерно в $0.491 за 1 000 изображений.
nonpreemptible=True утраивает прейскурантные цены на CPU и память и недоступно для GPU-функций.Каждая бессерверная GPU-платформа ниже отличается от Modal главным образом тем, как оплачивается простой и насколько широк выбор GPU.
| Вариант | Выбор GPU | Сокращение до нуля | Правило оплаты простоя |
|---|---|---|---|
| Google Cloud Run (GPU) | RTX PRO 6000 Blackwell (96 ГБ) или L4 (24 ГБ) | Да | Оплата по экземплярам; минимальные экземпляры оплачиваются полностью даже в простое |
| RunPod Serverless | Здесь не рассматривается | Гибкие воркеры — да; активные воркеры работают круглосуточно | Посекундная оплата от запуска воркера до полной остановки с округлением вверх |
| Replicate | Здесь не рассматривается | Публичные модели — да | Большинство приватных моделей работают на выделенном оборудовании с оплатой времени настройки, простоя и активной работы |
Деление на гибкие и активные воркеры у RunPod соответствует выбору min_containers в Modal. Replicate тарифицирует большинство публичных моделей по времени выполнения, а некоторые — по входным и выходным данным. Отличия Modal — инфраструктура, заданная на Python, и песочницы в том же аккаунте, а также более длинный список GPU, чем у Cloud Run.
routing_region можно задать только при первом развёртывании функции, а входные и выходные данные больше 2 МиБ по-прежнему проходят через объектное хранилище в us-east.Соглашение Modal запрещает майнинг криптовалют или связанную с ним блокчейн-активность, DoS-атаки, пиринговый обмен файлами, а также универсальные платформы файлового хостинга или раздачи медиа.
У Starter нет платы за платформу и есть $30 вычислений в месяц, но руководство по биллингу требует привязать способ оплаты, а токены общих эндпоинтов оплачиваются с первого запроса.
Нет, если оно уже сократилось до нуля. Поддержание активности по умолчанию в 60 секунд и простой внутри более длинного scaledown_window оплачиваются, а min_containers не даёт функции опуститься до нуля.
Функции и песочницы можно закрепить за регионами ЕС с множителем 1,15 или 1,75 и маршрутизацией через eu-west, но логи приложений остаются в США, крупные входные и выходные данные проходят через us-east, а общие эндпоинты закрепить нельзя.