Пользовались этим инструментом? Оцените его
Пользовались этим инструментом? Оцените его
Fireworks (в документации — Fireworks AI) — облачная платформа для запуска и обучения открытых ИИ-моделей. Разработчики вызывают размещённые модели через API инференса LLM, арендуют выделенные GPU для собственных развёртываний или дообучают открытые модели на своих данных и обслуживают результат на той же инфраструктуре.
Компания позиционирует платформу как «фундаментальную инфраструктуру для специализированного интеллекта» — принадлежащий клиенту цикл обучения, который превращает ведущие модели с открытым исходным кодом и данные клиента в преимущество, усиливающееся с каждой итерацией. Fireworks не создаёт базовые модели с нуля: сооснователь и генеральный директор Линь Цяо описывала бизнес как помощь компаниям в дообучении существующих моделей под их конкретные задачи. Ранее Цяо руководила командой разработки ИИ-платформы в Meta.
О масштабе: в сентябре 2026 года независимые технологические СМИ сообщили, что в июле Fireworks объявила, что её выручка в годовом исчислении достигла 1 млрд долларов — впятеро больше, чем годом ранее.
Эти возможности превращают дообучение открытых моделей в конвейер, ведущий к обслуживанию, а не в отдельный продукт: на главной странице сказано, что каждый чекпоинт развёртывается в продакшен за секунды.
Типичный первый проект проходит путь от тестов в бессерверном режиме до контроля затрат:
firectl quota list, чтобы проверить текущие лимиты запросов, квоты GPU, лимиты расходов и использование аккаунта.Цитаты клиентов на главной странице Fireworks — отзывы, отобранные вендором, а не независимые кейсы, но они показывают целевые нагрузки платформы:
В двух случаях платформа подходит хуже. Командам, которым нужна фиксированная версия модели, бессерверный режим даёт меньше: такими моделями управляет команда Fireworks, и они могут обновляться или выводиться из употребления с выходом новых моделей. Условия запрещают использование несовершеннолетними без надзора родителя или законного опекуна.
Оплата предварительная: автопополнение может само пополнять баланс, а месячный лимит расходов ограничивает использование. Клиенты с контрактом могут получить возможность перейти на постоплату.
Цены указаны в долларах США за 1 млн токенов в формате вход / кешированный вход / выход, по данным на 5 октября 2026 года.
| Модель | Standard | Priority |
|---|---|---|
| Kimi K3 | $3.00 / $0.30 / $15.00 | $3.75 / $0.375 / $18.75 |
| DeepSeek V4.1 Flash | $0.30 / $0.006 / $1.20 | $0.375 / $0.0075 / $1.50 |
| GLM 5.3 | $1.40 / $0.26 / $4.40 | $1.75 / $0.325 / $5.50 |
| OpenAI GPT OSS 120B | $0.15 / $0.015 / $0.60 | $0.18 / $0.018 / $0.72 |
Текстовые модели и модели зрения, не указанные отдельно, тарифицируются по размеру: менее 4B параметров — $0.10, от 4B до 16B — $0.20, более 16B — $0.90 за 1M токенов, без отдельной цены для кеша. Пакетный инференс тарифицируется по 50 % от бессерверных цен и на входе, и на выходе. С 1 сентября 2026 года запущенные модели только для США стоят в 1,5 раза дороже бессерверных цен базовой модели.
Развёртывания по требованию тарифицируются посекундно за GPU, без дополнительной платы за время запуска.
| GPU | За минуту | За час |
|---|---|---|
| H100 80 ГБ | $0.134 | $8.00 |
| H200 141 ГБ | $0.134 | $8.00 |
| B200 180 ГБ | $0.217 | $13.00 |
| B300 288 ГБ | $0.250 | $15.00 |
| GB300 288 ГБ | $0.334 | $20.00 |
Развёртывания с ограничением по региону стоят с наценкой 1,5x и оформляются через отдел продаж.
Управляемое контролируемое дообучение и дообучение на предпочтениях тарифицируются за 1M токенов обучения:
| Размер базовой модели | LoRA SFT | LoRA DPO | SFT всех параметров | DPO всех параметров |
|---|---|---|---|---|
| До 16B | $0.50 | $1.00 | $1.00 | $2.00 |
| От 16,1B до 80B | $3.00 | $6.00 | $6.00 | $12.00 |
| От 80B до 300B | $6.00 | $12.00 | $12.00 | $24.00 |
| Более 300B | $10.00 | $20.00 | $20.00 | $40.00 |
Токены обучения оцениваются как число токенов в обучающем датасете, умноженное на число эпох. Задания Dedicated Training API тарифицируются за GPU-час по ставкам режима по требованию.
Стоимость обслуживания на разных страницах описана по-разному. На странице цен сказано, что дообученные модели можно обслуживать по той же цене, что и базовые, тогда как в FAQ по оплате сказано, что обученным LoRA-моделям для обслуживания требуется выделенное развёртывание с посекундной оплатой GPU.
Fireworks тарифицирует выделенные GPU посекундно, а Baseten — поминутно; эта разница важнее всего для коротких развёртываний со всплесками нагрузки.
По умолчанию Fireworks не записывает и не хранит промпты или генерации ни для одной открытой модели без явного согласия пользователя (opt-in), но записывает метаданные запросов, например число токенов. При включённом кешировании промптов часть их данных может несколько минут оставаться в энергозависимой памяти.
Response API — исключение: по умолчанию он сохраняет диалоги, а сохранённые диалоги автоматически удаляются через 30 дней. Условия также ограничивают обязательство нулевого хранения данных инференсом; оно не распространяется на функции, которые хранят данные по своему устройству, например обучение, дообучение или агентные функции.
Об обучении два документа говорят по-разному. Условия обслуживания гласят, что Fireworks не будет использовать ваш Контент для обучения своих моделей или улучшения Сервиса. Уведомление о конфиденциальности гласит, что Fireworks не использует промпты, обучающие данные или входные данные API для обучения или улучшения своих моделей без вашего явного согласия (opt-in). Между сторонами все права, правовой титул и интересы в отношении вашего Контента принадлежат вам; условия определяют Контент как ваши входные и выходные данные.
Администраторы Enterprise могут включить политику нулевого хранения данных для всего аккаунта, которая отклоняет всё, что сохраняло бы клиентский контент, включая задания пакетного инференса, задания дообучения и RL, загрузку датасетов и виртуальные модели FireRouter. Когда FireRouter отправляет ход диалога в Claude или GPT, закрытая модель работает в вашем собственном аккаунте Anthropic или OpenAI.
Это заявления вендора, а не независимые аудиты:
На проверенных страницах с ценами бесплатного тарифа нет. Помимо кредита в $1, упомянутого в FAQ по оплате, для дальнейшего использования нужны способ оплаты и предоплаченные кредиты.
Нет. LoRA-моделям нужно развёртывание по требованию с оплатой за время GPU; одно развёртывание может размещать до 100 LoRA-адаптеров, что распределяет эти затраты.
Цены на бессерверный инференс начисляются за каждый токен, поэтому простой ничего не стоит. Развёртывания по требованию описываются как более дешёвые при высокой загрузке; они тарифицируются посекундно за GPU, а не за токены.