Toolso.AI
Toolso.AI
ИнструментыКатегорииПопулярныеНовинкиЦеныБлог
Toolso.AI
Toolso.AI

💌Подпишитесь на AI Tools Weekly

Еженедельно отобранная подборка последних и самых популярных AI-инструментов и трендов, доставляемая на вашу почту Подписаться

Toolso.AI
Toolso.AI

Откройте для себя лучшие AI-инструменты для повышения вашей продуктивности

GitHubGitHubTwitterX (Twitter)YouTubeYouTubeTikTokEmail

Популярные категории

  • AI-письмо
  • AI-изображения
  • AI-видео
  • AI-кодирование
  • Больше категорий

Исследовать

  • Новые инструменты
  • Популярные инструменты
  • Больше инструментов
  • Предложить инструмент
  • Цены

О нас

  • О нас
  • Контакты
  • Блог
  • История изменений

Правовая информация

  • Политика использования файлов cookie
  • Политика конфиденциальности
  • Условия использования
  • Политика возврата
© 2026 Toolso.AI Все права защищены
АкцияОграниченное предложениеПродвигаемое размещениеПроверка за 24 ч · Без обратной ссылки · 30 дней продвижения$29.90затем $59.90После 31 окт. цена вырастет до $59.90До конца--:--:--Отправить
  1. Главная
  2. Все инструменты
  3. Инструменты разработки
  4. Fireworks
Предпросмотр интерфейса Fireworks
Логотип Fireworks

Fireworks

Fireworks обслуживает открытые модели через бессерверные API с оплатой за токены и выделенные развёртывания с посекундной оплатой GPU, а также предлагает управляемое дообучение, чтобы команды разработчиков обучали и размещали свои варианты моделей.

Инструменты разработкиРазработка ИИПлатформа обучения ИИ#Пакетная обработка#LLM#API, совместимая с OpenAI
Попробовать бесплатно
Сохранений
Посещений
Просмотров
Цена
Бесплатно
Опубликовано
5 окт. 2026 г.
Домен
fireworks.ai
Оценка пользователей

Пользовались этим инструментом? Оцените его

Оценить этот инструмент

Информация о продукте Fireworks

Попробовать бесплатно
Информация об инструменте
Сохранений
Посещений
Просмотров
Цена
Бесплатно
Опубликовано
5 окт. 2026 г.
Домен
fireworks.ai
Оценка пользователей

Пользовались этим инструментом? Оцените его

Оценить этот инструмент

Рекомендуемые инструменты

Похожие инструменты

Попробовать бесплатно

Что такое Fireworks?

Fireworks (в документации — Fireworks AI) — облачная платформа для запуска и обучения открытых ИИ-моделей. Разработчики вызывают размещённые модели через API инференса LLM, арендуют выделенные GPU для собственных развёртываний или дообучают открытые модели на своих данных и обслуживают результат на той же инфраструктуре.

Компания позиционирует платформу как «фундаментальную инфраструктуру для специализированного интеллекта» — принадлежащий клиенту цикл обучения, который превращает ведущие модели с открытым исходным кодом и данные клиента в преимущество, усиливающееся с каждой итерацией. Fireworks не создаёт базовые модели с нуля: сооснователь и генеральный директор Линь Цяо описывала бизнес как помощь компаниям в дообучении существующих моделей под их конкретные задачи. Ранее Цяо руководила командой разработки ИИ-платформы в Meta.

О масштабе: в сентябре 2026 года независимые технологические СМИ сообщили, что в июле Fireworks объявила, что её выручка в годовом исчислении достигла 1 млрд долларов — впятеро больше, чем годом ранее.

Ключевые функции

Бессерверный инференс

  • Оплата за токены: бессерверный режим тарифицируется за токены, есть опции Priority и Fast, а API описывается как совместимый с OpenAI и Anthropic.
  • Режим Priority: уровень Priority идёт впереди трафика Standard и реже попадает под сброс нагрузки (503 server overloaded).
  • Режим Fast: варианты Fast нацелены на пропускную способность генерации свыше 100 токенов в секунду; в документации указано, что вариант Fast — не другая модель и качество модели остаётся прежним.
  • Каталог моделей: в документации перечислено более 100 поддерживаемых моделей для текста, зрения, аудио, изображений и эмбеддингов.
  • Пакетные задания: Batch API асинхронно обрабатывает большие объёмы запросов; каждое задание выполняется в рамках выбранного лимита времени — 12, 24, 48 или 72 часа, а выполненные запросы сохраняются, если срок задания истекает.

Выделенные развёртывания

  • Развёртывания по требованию: выделенные мультирегиональные развёртывания с поддержкой моделей после пост-обучения.
  • Собственные веса: можно загрузить свои модели (для поддерживаемых архитектур) с Hugging Face или из других источников.
  • Зарезервированные мощности: корпоративные аккаунты могут покупать зарезервированные мощности, обычно с обязательством на 1 год, ради гарантированной мощности, повышенных квот и сниженных цен за GPU-час.
  • Много адаптеров на одном развёртывании: развёртывание Multi-LoRA загружает до 100 LoRA-моделей как надстройки на одно развёртывание базовой модели.

Обучение и дообучение

  • Три точки входа: управляемый путь (описать задачу, проверить план и стоимость, одобрить запуск), путь через конфигурацию, где Fireworks берёт на себя планирование и передачу в продакшен, и путь через код, где вы сами пишете функцию потерь, тренер и цикл RL на GPU Fireworks.
  • Масштаб: контролируемое дообучение и дообучение с подкреплением доступны для моделей до 1T+ параметров.
  • Serverless Training API: общий постоянно работающий пул тренеров для обучения LoRA на стартовых моделях, без выделения ресурсов и без затрат на простой.

Эти возможности превращают дообучение открытых моделей в конвейер, ведущий к обслуживанию, а не в отдельный продукт: на главной странице сказано, что каждый чекпоинт развёртывается в продакшен за секунды.

Nexus и FireRouter

  • Nexus: подключает открытые модели и маршрутизаторы моделей к средам ИИ-агентов для кода, агентам и LLM-шлюзам, давая прозрачность использования и лимиты расходов на пользователя для поддерживаемых бессерверных моделей.
  • FireRouter: даёт один ID модели и выбирает модель на каждый новый ход пользователя: простые ходы могут уходить к открытой модели Fireworks, а более сложные — к закрытой, например Claude Opus.
  • Заявление об экономии: Fireworks продвигает Nexus как прямую замену API закрытых моделей, способную сократить расходы на ИИ-программирование на 50–75 %; это цифра самого вендора.

Руководство

Типичный первый проект проходит путь от тестов в бессерверном режиме до контроля затрат:

  1. Добавьте действующий способ оплаты и платёжный адрес, затем купите кредиты; использование бессерверного режима, развёртываний по требованию и обучения списывается с этого баланса.
  2. Используйте клиентскую библиотеку OpenAI для Python, чтобы работать с Fireworks, изменив базовый URL и ключ API.
  3. Для трафика, который должен выдерживать пиковые периоды, установите уровень обслуживания запроса Priority; для функций, чувствительных к задержке, переключите ID модели на вариант Fast, если он есть.
  4. Установите месячный лимит расходов. По умолчанию Fireworks присылает предупреждение по почте, когда использование достигает 80 % месячного лимита, а дополнительные пороги оповещений добавляются на странице оплаты.
  5. Перед планированием запуска выполните firectl quota list, чтобы проверить текущие лимиты запросов, квоты GPU, лимиты расходов и использование аккаунта.
  6. Если нужна обученная LoRA-модель, собственная модель или зафиксированная версия, создайте развёртывание по требованию, а не полагайтесь на бессерверный режим.

Сценарии использования Fireworks и примеры клиентов

Цитаты клиентов на главной странице Fireworks — отзывы, отобранные вендором, а не независимые кейсы, но они показывают целевые нагрузки платформы:

  • Продукты для ИИ-программирования: директор по продукту Cursor говорит, что Fireworks была ключевым партнёром в масштабном обучении и обслуживании моделей, стоящих за Cursor, включая высокопроизводительные RL-нагрузки и продакшен-инференс для Composer.
  • Более быстрые потребительские приложения: руководитель продукта Quora сообщает, что после миграции одной модели ответы стали в 3 раза быстрее; по словам компании, это улучшило показатели вовлечённости.
  • Дообученные составные модели: CTO Vercel говорит, что модель v0 использует дообученную с Fireworks модель обучения с подкреплением и работает существенно лучше SOTA.
  • Корпоративные агенты через Azure: UiPath запускает Fireworks в Azure Foundry, чтобы Autopilot и Delegate работали на открытых моделях.
  • Замена закрытой модели на открытую: Gumloop перевела внутреннего агента, которым пользуется вся компания, с Opus 4.8 на GLM-5.2 и сообщает, что никто не заметил разницы в опыте использования.

Для кого предназначен

  • Команды прототипирования: бессерверное использование популярных моделей с оплатой за токены позиционируется как идеальный вариант для проверки качества «на глаз» и прототипирования.
  • Команды с собственными или обученными моделями: режим по требованию подходит для собственных базовых моделей, обученных LoRA-моделей и нагрузок с особыми требованиями к задержке, где нужен контроль над оборудованием и репликами.
  • Регулируемые компании: политика нулевого хранения данных на уровне всего аккаунта и инференс с привязкой к региону — функции Enterprise, а не настройки самообслуживания.

В двух случаях платформа подходит хуже. Командам, которым нужна фиксированная версия модели, бессерверный режим даёт меньше: такими моделями управляет команда Fireworks, и они могут обновляться или выводиться из употребления с выходом новых моделей. Условия запрещают использование несовершеннолетними без надзора родителя или законного опекуна.

Платформы

  • API: эндпоинты, совместимые с OpenAI и Anthropic, поэтому существующий код SDK можно направить на Fireworks.
  • CLI: firectl создаёт и развёртывает ресурсы и управляет ими из терминала; его можно установить через Homebrew.
  • Microsoft Foundry: Fireworks AI — поставщик инференса категории first-party внутри Microsoft Foundry; использование оплачивается через Azure и засчитывается в обязательство по потреблению Azure.
  • Границы Foundry PayGo: PayGo в Foundry ограничен зоной US Data Zone, а лимит пропускной способности для развёртываний PayGo составляет 500 000 токенов в минуту.
  • Регионы: выделенные развёртывания можно размещать в мультирегионах GLOBAL, US, CANADA, EUROPE и APAC.
  • Бессерверный режим только в США: отдельный американский эндпоинт обслуживает инференс исключительно из США для короткого списка моделей; бессерверный режим только в ЕС требует обращения в отдел продаж.

Ценообразование

Оплата предварительная: автопополнение может само пополнять баланс, а месячный лимит расходов ограничивает использование. Клиенты с контрактом могут получить возможность перейти на постоплату.

Цены на бессерверный инференс

Цены указаны в долларах США за 1 млн токенов в формате вход / кешированный вход / выход, по данным на 5 октября 2026 года.

МодельStandardPriority
Kimi K3$3.00 / $0.30 / $15.00$3.75 / $0.375 / $18.75
DeepSeek V4.1 Flash$0.30 / $0.006 / $1.20$0.375 / $0.0075 / $1.50
GLM 5.3$1.40 / $0.26 / $4.40$1.75 / $0.325 / $5.50
OpenAI GPT OSS 120B$0.15 / $0.015 / $0.60$0.18 / $0.018 / $0.72

Текстовые модели и модели зрения, не указанные отдельно, тарифицируются по размеру: менее 4B параметров — $0.10, от 4B до 16B — $0.20, более 16B — $0.90 за 1M токенов, без отдельной цены для кеша. Пакетный инференс тарифицируется по 50 % от бессерверных цен и на входе, и на выходе. С 1 сентября 2026 года запущенные модели только для США стоят в 1,5 раза дороже бессерверных цен базовой модели.

Цены на GPU по требованию

Развёртывания по требованию тарифицируются посекундно за GPU, без дополнительной платы за время запуска.

GPUЗа минутуЗа час
H100 80 ГБ$0.134$8.00
H200 141 ГБ$0.134$8.00
B200 180 ГБ$0.217$13.00
B300 288 ГБ$0.250$15.00
GB300 288 ГБ$0.334$20.00

Развёртывания с ограничением по региону стоят с наценкой 1,5x и оформляются через отдел продаж.

Цены на дообучение

Управляемое контролируемое дообучение и дообучение на предпочтениях тарифицируются за 1M токенов обучения:

Размер базовой моделиLoRA SFTLoRA DPOSFT всех параметровDPO всех параметров
До 16B$0.50$1.00$1.00$2.00
От 16,1B до 80B$3.00$6.00$6.00$12.00
От 80B до 300B$6.00$12.00$12.00$24.00
Более 300B$10.00$20.00$20.00$40.00

Токены обучения оцениваются как число токенов в обучающем датасете, умноженное на число эпох. Задания Dedicated Training API тарифицируются за GPU-час по ставкам режима по требованию.

Стоимость обслуживания на разных страницах описана по-разному. На странице цен сказано, что дообученные модели можно обслуживать по той же цене, что и базовые, тогда как в FAQ по оплате сказано, что обученным LoRA-моделям для обслуживания требуется выделенное развёртывание с посекундной оплатой GPU.

Кредиты, уровни и возвраты

  • Стартовый кредит: в FAQ по оплате упоминается кредит в $1; после его исчерпания аккаунт без способа оплаты приостанавливается, пока способ оплаты не будет добавлен.
  • Уровни расходов: пополнение или расход $50 в кредитах переводит аккаунт на Tier 2, $500 — на Tier 3, $5 000 — на Tier 4, а более высокие уровни поднимают потолки лимитов запросов в бессерверном режиме.
  • Оптовые цены: Fireworks предлагает скидки при оптовых или предоплаченных покупках.
  • Возвраты: в Условиях обслуживания указано, что уплаченные сборы не возвращаются, за исключением случаев, предусмотренных условиями.

Альтернативы Fireworks

  • Together AI: его тарифы охватывают бессерверный инференс, резервируемую пропускную способность, выделенный инференс на однотенантных GPU и дообучение LoRA или полное дообучение — то же деление продуктов, что продаёт Fireworks.
  • Baseten: сочетает Model APIs с выделенными развёртываниями, где вы платите только за использованные вычисления с точностью до минуты, а его тариф Basic стоит $0 в месяц с оплатой по факту использования.

Fireworks тарифицирует выделенные GPU посекундно, а Baseten — поминутно; эта разница важнее всего для коротких развёртываний со всплесками нагрузки.

Ограничения

Лимиты запросов и мощности

  • Новые аккаунты ограничены: аккаунт без способа оплаты или без кредитов ограничен 10 запросами в минуту, а общий лимит аккаунта составляет 6 000 запросов в минуту даже при наличии способа оплаты и кредитов.
  • Адаптивные бессерверные лимиты: лимиты растут и сокращаются вместе с вашим использованием, и если трафик растёт слишком быстро, вы будете получать ошибки 429.
  • Нет гарантии успеха: в бессерверном режиме возможны ответы 429 Too Many Requests или 503 Service Overloaded, и соблюдение лимитов не защищает от сброса нагрузки.
  • Потолки по размеру модели: потолки генерируемых токенов варьируются от 1,08M токенов в минуту для моделей менее 600B параметров до 216k для моделей от 1,6T параметров и более.
  • Квоты GPU: квота по умолчанию для развёртываний по требованию в мультирегионе GLOBAL — по 16 GPU каждого из H100, H200, B200 и B300, а для GB300 и A100 она начинается с 0.
  • Для квоты на обучение нужна карта: без способа оплаты квота GPU на обучение равна 0; при сохранённом способе оплаты — 32 GPU каждого типа.

Эксплуатационные границы

  • Удаление моделей: Fireworks уведомляет минимум за 2 недели до удаления бессерверной модели, а о популярных моделях — заблаговременнее.
  • Простаивающие развёртывания: по умолчанию развёртывания масштабируются до нуля, если не используются 1 час, а развёртывания с минимальным числом реплик 0 удаляются после 7 дней без трафика.
  • Вытесняемые мощности: вытесняемые развёртывания заимствуют простаивающие GPU и могут быть вытеснены посреди запроса без предупреждения, поэтому они предназначены только для оценки и пакетной работы.
  • Жёсткая остановка расходов: при достижении 100 % месячного лимита расходов приостанавливаются все API-запросы бессерверного инференса, развёртываний и обучения (корпоративные аккаунты получают только оповещения).
  • Задержка в отчётах о расходах: показатель общих расходов может отставать от реального трафика на день и более, особенно для недавно запущенных моделей.
  • Нет соответствия PCI: в условиях указано, что Fireworks не соответствует PCI и не обязана добиваться соответствия PCI.

Хранение данных и использование для обучения

По умолчанию Fireworks не записывает и не хранит промпты или генерации ни для одной открытой модели без явного согласия пользователя (opt-in), но записывает метаданные запросов, например число токенов. При включённом кешировании промптов часть их данных может несколько минут оставаться в энергозависимой памяти.

Response API — исключение: по умолчанию он сохраняет диалоги, а сохранённые диалоги автоматически удаляются через 30 дней. Условия также ограничивают обязательство нулевого хранения данных инференсом; оно не распространяется на функции, которые хранят данные по своему устройству, например обучение, дообучение или агентные функции.

Об обучении два документа говорят по-разному. Условия обслуживания гласят, что Fireworks не будет использовать ваш Контент для обучения своих моделей или улучшения Сервиса. Уведомление о конфиденциальности гласит, что Fireworks не использует промпты, обучающие данные или входные данные API для обучения или улучшения своих моделей без вашего явного согласия (opt-in). Между сторонами все права, правовой титул и интересы в отношении вашего Контента принадлежат вам; условия определяют Контент как ваши входные и выходные данные.

Администраторы Enterprise могут включить политику нулевого хранения данных для всего аккаунта, которая отклоняет всё, что сохраняло бы клиентский контент, включая задания пакетного инференса, задания дообучения и RL, загрузку датасетов и виртуальные модели FireRouter. Когда FireRouter отправляет ход диалога в Claude или GPT, закрытая модель работает в вашем собственном аккаунте Anthropic или OpenAI.

Заявления о безопасности и соответствии

Это заявления вендора, а не независимые аудиты:

  • Fireworks сообщает, что получила сертификации ISO 27001, ISO 27701 и ISO 42001 и имеет SOC 2 Type II.
  • Fireworks называет себя соответствующей HIPAA.
  • Данные шифруются при передаче с помощью TLS 1.2+ и при хранении с помощью AES-256.
  • Резидентность данных, ограничивающая инференс одним регионом, — функция Enterprise; в списке указан вариант US.

ЧаВо

Q1. Есть ли бесплатный тариф?

На проверенных страницах с ценами бесплатного тарифа нет. Помимо кредита в $1, упомянутого в FAQ по оплате, для дальнейшего использования нужны способ оплаты и предоплаченные кредиты.

Q2. Можно ли обслуживать дообученную LoRA-модель в бессерверном режиме?

Нет. LoRA-моделям нужно развёртывание по требованию с оплатой за время GPU; одно развёртывание может размещать до 100 LoRA-адаптеров, что распределяет эти затраты.

Q3. Когда выделенный GPU дешевле бессерверного режима?

Цены на бессерверный инференс начисляются за каждый токен, поэтому простой ничего не стоит. Развёртывания по требованию описываются как более дешёвые при высокой загрузке; они тарифицируются посекундно за GPU, а не за токены.

Знаете похожий инструмент?
Если вы знаете другие отличные AI-инструменты, не стесняйтесь предлагать их нам