Пользовались этим инструментом? Оцените его
Пользовались этим инструментом? Оцените его
Cerebras — платформа ИИ-инференса, которая запускает языковые модели с открытыми весами на собственных пластинчатых (wafer-scale) процессорах компании. Разработчики работают с ней через Cerebras Inference — облачный API с браузерным Playground; крупные организации могут зарезервировать выделенную мощность Dedicated или установить системы Cerebras в собственных дата-центрах, а то же оборудование обслуживает и сервисы обучения и дообучения.
Публичный облачный уровень предлагает регулярно обновляемый набор моделей на общем эндпоинте, который вызывается по API-ключу.
Главный аргумент — скорость. Cerebras представляет свою новейшую стоечную систему CS-4 как обеспечивающую инференс до 30 раз быстрее, чем GPU; это цифра поставщика, а не независимое измерение.
Компания, стоящая за продуктом, Cerebras Systems, привлекла 5,5 млрд долларов в ходе IPO в мае 2026 года, а независимые деловые издания называют среди её клиентов OpenAI, G42, Mohamed bin Zayed University of Artificial Intelligence и Amazon Web Services.
Точность воспроизведения моделей задокументирована необычно подробно. Cerebras заявляет, что каждая модель в Shared Inference — оригинальная версия без прунинга. Веса хранятся с выборочной квантизацией только весов в частично 16-, 8- или 4-битных форматах, чувствительные слои остаются в полной точности, а активации, attention и KV-кэш не квантизуются. Тем, кто сравнивает поставщиков, предлагающих быстрый ИИ-инференс, это показывает, что именно стоит за цифрами скорости.
Кэширование промптов срабатывает автоматически для всех поддерживаемых API-запросов, без точек останова кэша и изменений кода. Cerebras гарантирует время жизни кэша (TTL) 5 минут, а записи могут сохраняться до 1 часа в зависимости от нагрузки на систему. Выигрыш — в пропускной способности, а не в цене: кэшированные токены исключаются из лимита некэшированных токенов, но скидки на них нет.
Dedicated Inference резервирует мощность для одной организации; именно на этот вариант Cerebras указывает для продакшен-нагрузок, которым нужна предсказуемая производительность. Он также позволяет развертывать дообученные веса наряду со стандартными версиями моделей. Каждое развертывание настраивается по мощности, черновым (draft) моделям, конфигурации модели и квантизации и добавляет к возможностям Shared Inference дообучение, управление весами и контроль уровней обслуживания. На выделенной стороне поддерживаются, в частности, Qwen 3.8, Qwen3 и Qwen3-Coder, Llama 3 и Llama 4, GLM 4.X и 5.X, Kimi K2.X и DeepSeek V3.X.
Batch API обрабатывает группы запросов асинхронно, а выполнение пакетных запросов гарантируется в течение 24 часов.
Cerebras Code — подписка для программирования, рассчитанная на работу из вашего собственного редактора. На странице продукта сказано, что она использует GLM 4.7 для генерации кода со скоростью более 1000 токенов в секунду, однако журнал устаревания API говорит иное.
Cerebras Training Cloud описывается как способ обучать и дообучать модели от 1 млрд до десятков триллионов параметров с помощью одного и того же простого кода.
Система CS-4 работает на процессоре WSE-3 Turbo, который, по описанию Cerebras, содержит четыре триллиона транзисторов и 900 000 ИИ-ядер и обеспечивает 250 PFLOPS вычислительной мощности и 43,2 петабайта в секунду пропускной способности памяти. На странице CS-4 сказано, что первые поставки начнутся в этом квартале, но дата не названа.
Cerebras строит свои сценарии вокруг нагрузок, где ожидание токенов вредит продукту:
Самое заметное внедрение — внешнее. В феврале 2026 года независимые технологические СМИ сообщили, что GPT-5.3-Codex-Spark от OpenAI — меньшая модель Codex, созданная для более быстрого инференса и совместной работы в реальном времени, — работает на Wafer Scale Engine 3 от Cerebras.
Cerebras подходит командам, для которых скорость ответа меняет продукт, но правильная точка входа зависит от этапа:
Поддержка тоже зависит от уровня: аккаунты Developer полагаются на Discord-сообщество, а клиенты Enterprise получают выделенную команду по работе с аккаунтом.
Хуже он подходит тем, кто ждёт постоянного бесплатного уровня, очень длинных окон контекста на эндпоинте самообслуживания или широкого выбора моделей в самообслуживании; подробности — в разделах о ценах, ограничениях и функциях.
В самообслуживаемом уровне Developer цены на API Cerebras строятся по модели оплаты по факту использования и начинаются с бесплатного кредита $5, а цены Enterprise сообщаются по запросу.
| Модель (уровень Developer) | Ввод | Вывод |
|---|---|---|
| GPT OSS 120B | $0.35 за 1 млн токенов | $0.75 за 1 млн токенов |
| Qwen 3.8 27B | $0.99 за 1 млн токенов | $1.49 за 1 млн токенов |
Cerebras Code Pro указан по цене $50 за до 24 млн токенов в день и ориентирован на инди-разработчиков и проекты выходного дня. Cerebras Code Max указан по цене $200 за до 120 млн токенов в день и ориентирован на разработку полный рабочий день и мультиагентные системы. На момент снимка 4 октября 2026 года оба платных плана были отмечены как распроданные, а проверенные для этой страницы карточки планов не указывают расчётный период.
Training Cloud продаётся либо почасово — Cerebras определяет время, необходимое для отправленной нагрузки, — либо помодельно — эксперты Cerebras проектируют и дообучают модель на вашем наборе данных; страница Training Cloud перечисляет эти варианты без расценок.
Другие поставщики тоже создают собственные чипы для быстрого инференса вместо аренды стандартных GPU:
На их фоне Cerebras выделяется пластинчатым процессором, OpenAI-совместимым API с пробным кредитом самообслуживания на $5 и возможностью установить системы CS-4 on-premise, но её каталог самообслуживания ограничен двумя моделями.
Отзывы пользователей указывают в ту же сторону. В публичном обсуждении разработчиками запуска Qwen 3.8 27B на Cerebras несколько разработчиков сочли, что допускаемый Cerebras контекст 128k слишком мал для длинных агентных задач или задач программирования. Другие участники той же ветки сказали, что лимит 150 000 TPM на публичном эндпоинте затрудняет использование модели для многих задач программирования. Авторская колонка IT-издания от сентября 2025 года, написанная, когда Cerebras Code работал на Qwen3 Coder, сообщала, что генерация летела 10–20 секунд, после чего поминутный лимит токенов вызывал ошибки 429 до сброса минуты.
Cerebras сообщает, что её сравнения производительности основаны на сторонних бенчмарках или внутреннем тестировании, а наблюдаемый прирост скорости относительно GPU-систем может меняться в зависимости от нагрузки, конфигурации, даты и модели.
Доступ к API и Playground прекращается, но API-ключи, проекты и настройки сохраняются, а покупка с оплатой по факту снова активирует доступ на уровне Developer, где нет почасовых или суточных лимитов токенов.
Cerebras заявляет, что отдаёт для существующих ID моделей исходные веса без изменений, а возможные будущие варианты с прунингом выпустит под отдельными ID моделей.
Да. OpenAI-совместимое поле model принимает точный ID модели в Shared Inference и ваш стабильный ID эндпоинта в Dedicated Inference, который направляет каждый запрос в его активное развертывание.