Toolso.AI
Toolso.AI
ИнструментыКатегорииПопулярныеНовинкиЦеныБлог
Toolso.AI
Toolso.AI

💌Подпишитесь на AI Tools Weekly

Еженедельно отобранная подборка последних и самых популярных AI-инструментов и трендов, доставляемая на вашу почту Подписаться

Toolso.AI
Toolso.AI

Откройте для себя лучшие AI-инструменты для повышения вашей продуктивности

GitHubGitHubTwitterX (Twitter)YouTubeYouTubeTikTokEmail

Популярные категории

  • AI-письмо
  • AI-изображения
  • AI-видео
  • AI-кодирование
  • Больше категорий

Исследовать

  • Новые инструменты
  • Популярные инструменты
  • Больше инструментов
  • Предложить инструмент
  • Цены

О нас

  • О нас
  • Контакты
  • Блог
  • История изменений

Правовая информация

  • Политика использования файлов cookie
  • Политика конфиденциальности
  • Условия использования
  • Политика возврата
© 2026 Toolso.AI Все права защищены
АкцияОграниченное предложениеПродвигаемое размещениеПроверка за 24 ч · Без обратной ссылки · 30 дней продвижения$29.90затем $59.90После 31 окт. цена вырастет до $59.90До конца--:--:--Отправить
  1. Главная
  2. Все инструменты
  3. Инструменты разработки
  4. Cerebras
Предпросмотр интерфейса Cerebras
Логотип Cerebras

Cerebras

Cerebras запускает модели с открытыми весами, такие как GPT OSS 120B и Qwen 3.8 27B, на собственных пластинчатых процессорах через OpenAI-совместимый API, с оплатой токенов по факту, резервируемой мощностью Dedicated и системами CS-4 on-premise.

Инструменты разработкиРазработка ИИПлатформа обучения ИИ#Корпоративный#LLM#API, совместимая с OpenAI
Посмотреть цены
Сохранений
Посещений
Просмотров
Цена
Платно
Опубликовано
4 окт. 2026 г.
Домен
cerebras.ai
Оценка пользователей

Пользовались этим инструментом? Оцените его

Оценить этот инструмент

Информация о продукте Cerebras

Посмотреть цены
Информация об инструменте
Сохранений
Посещений
Просмотров
Цена
Платно
Опубликовано
4 окт. 2026 г.
Домен
cerebras.ai
Оценка пользователей

Пользовались этим инструментом? Оцените его

Оценить этот инструмент

Рекомендуемые инструменты

Похожие инструменты

Посмотреть цены

Что такое Cerebras?

Cerebras — платформа ИИ-инференса, которая запускает языковые модели с открытыми весами на собственных пластинчатых (wafer-scale) процессорах компании. Разработчики работают с ней через Cerebras Inference — облачный API с браузерным Playground; крупные организации могут зарезервировать выделенную мощность Dedicated или установить системы Cerebras в собственных дата-центрах, а то же оборудование обслуживает и сервисы обучения и дообучения.

Публичный облачный уровень предлагает регулярно обновляемый набор моделей на общем эндпоинте, который вызывается по API-ключу.

Главный аргумент — скорость. Cerebras представляет свою новейшую стоечную систему CS-4 как обеспечивающую инференс до 30 раз быстрее, чем GPU; это цифра поставщика, а не независимое измерение.

Компания, стоящая за продуктом, Cerebras Systems, привлекла 5,5 млрд долларов в ходе IPO в мае 2026 года, а независимые деловые издания называют среди её клиентов OpenAI, G42, Mohamed bin Zayed University of Artificial Intelligence и Amazon Web Services.

Ключевые функции

API Shared Inference

  • OpenAI-совместимый API: API Cerebras работает с клиентскими библиотеками OpenAI во многих типичных сценариях, поэтому существующее приложение можно переключить, сменив API-ключ, базовый URL и целевую модель.
  • Небольшой каталог самообслуживания: в Shared Inference сейчас доступны gpt-oss-120b (120 млрд параметров, контекст 65k в бесплатном пробном периоде и 131k на платных уровнях, около 3000 токенов в секунду) и qwen-3.8-27b (27 млрд параметров, контекст 64k/128k, около 1850 токенов в секунду).
  • Расширенный каталог по контракту: другие семейства моделей доступны только через Dedicated Inference.
  • Ввод изображений: в Shared Inference изображения принимает qwen-3.8-27b, а gemma-4-31b и другие модели с поддержкой изображений требуют Dedicated Inference.
  • Управление рассуждениями: для qwen-3.8-27b интенсивность рассуждений можно задать как none, low, medium или high (по умолчанию high), а рассуждения возвращаются отдельно от ответа.

Точность воспроизведения моделей задокументирована необычно подробно. Cerebras заявляет, что каждая модель в Shared Inference — оригинальная версия без прунинга. Веса хранятся с выборочной квантизацией только весов в частично 16-, 8- или 4-битных форматах, чувствительные слои остаются в полной точности, а активации, attention и KV-кэш не квантизуются. Тем, кто сравнивает поставщиков, предлагающих быстрый ИИ-инференс, это показывает, что именно стоит за цифрами скорости.

Кэширование промптов

Кэширование промптов срабатывает автоматически для всех поддерживаемых API-запросов, без точек останова кэша и изменений кода. Cerebras гарантирует время жизни кэша (TTL) 5 минут, а записи могут сохраняться до 1 часа в зависимости от нагрузки на систему. Выигрыш — в пропускной способности, а не в цене: кэшированные токены исключаются из лимита некэшированных токенов, но скидки на них нет.

Dedicated Inference

Dedicated Inference резервирует мощность для одной организации; именно на этот вариант Cerebras указывает для продакшен-нагрузок, которым нужна предсказуемая производительность. Он также позволяет развертывать дообученные веса наряду со стандартными версиями моделей. Каждое развертывание настраивается по мощности, черновым (draft) моделям, конфигурации модели и квантизации и добавляет к возможностям Shared Inference дообучение, управление весами и контроль уровней обслуживания. На выделенной стороне поддерживаются, в частности, Qwen 3.8, Qwen3 и Qwen3-Coder, Llama 3 и Llama 4, GLM 4.X и 5.X, Kimi K2.X и DeepSeek V3.X.

Batch API

Batch API обрабатывает группы запросов асинхронно, а выполнение пакетных запросов гарантируется в течение 24 часов.

Cerebras Code

Cerebras Code — подписка для программирования, рассчитанная на работу из вашего собственного редактора. На странице продукта сказано, что она использует GLM 4.7 для генерации кода со скоростью более 1000 токенов в секунду, однако журнал устаревания API говорит иное.

Обучение и дообучение

Cerebras Training Cloud описывается как способ обучать и дообучать модели от 1 млрд до десятков триллионов параметров с помощью одного и того же простого кода.

Оборудование CS-4 и WSE-3 Turbo

Система CS-4 работает на процессоре WSE-3 Turbo, который, по описанию Cerebras, содержит четыре триллиона транзисторов и 900 000 ИИ-ядер и обеспечивает 250 PFLOPS вычислительной мощности и 43,2 петабайта в секунду пропускной способности памяти. На странице CS-4 сказано, что первые поставки начнутся в этом квартале, но дата не названа.

Руководство

Начало работы с API

  1. Откройте Cloud Console, зарегистрируйтесь или войдите и создайте ключ в разделе API Keys в левой навигации.
  2. Добавьте способ оплаты: без него доступ к Playground и API остаётся неактивным.
  3. Установите официальный SDK — cerebras_cloud_sdk для Python через pip и @cerebras/cerebras_cloud_sdk для Node.js через npm — или направьте существующий клиент OpenAI на базовый URL Cerebras.
  4. В Playground оценивайте модели, дорабатывайте промпты, тестируйте вызов инструментов, настраивайте параметры и экспортируйте рабочий запрос в код. После каждого ответа он показывает расход токенов, время инференса, токены в секунду и время прохождения запроса, что позволяет быстро проверить реальную скорость на своих промптах.
  5. Задайте max_completion_tokens реалистичное значение. Cerebras оценивает каждый запрос по промпту плюс этому параметру или собственной оценке вывода, и запрос, чья оценка превышает оставшуюся квоту, ограничивается ещё до начала обработки.

Сценарии и примеры использования Cerebras

Cerebras строит свои сценарии вокруг нагрузок, где ожидание токенов вредит продукту:

  • Помощники для программирования: Cerebras обещает мгновенные циклы написания, отладки и рефакторинга кода; опубликованный кейс — Cognition.
  • Многошаговые агенты: агентные процессы призваны работать без задержек и тайм-аутов, пример — NinjaTech.
  • Поиск, копилоты и аналитика: здесь заявлено сложное рассуждение менее чем за секунду, пример — AlphaSense.
  • Голосовые интерфейсы: обещаны мгновенные и точные голосовые ответы, пример — Tavus.
  • Корпоративный поиск внутри приложения: Notion сообщает, что Cerebras обеспечивает функции реального времени, такие как корпоративный поиск.
  • Исследовательские агенты в науках о жизни: GSK сообщает, что использует скорость инференса Cerebras для создания приложений вроде интеллектуальных исследовательских агентов для своих исследователей и разработки лекарств.
  • Офлайн-задачи большого объёма: документация Batch API называет конвейеры оценки, разметку данных, массовую генерацию контента и исследовательский анализ.

Самое заметное внедрение — внешнее. В феврале 2026 года независимые технологические СМИ сообщили, что GPT-5.3-Codex-Spark от OpenAI — меньшая модель Codex, созданная для более быстрого инференса и совместной работы в реальном времени, — работает на Wafer Scale Engine 3 от Cerebras.

Для кого предназначен

Cerebras подходит командам, для которых скорость ответа меняет продукт, но правильная точка входа зависит от этапа:

  • Разработчики, оценивающие скорость: самообслуживаемый уровень Developer предназначен для разработки, оценки и экспериментов, а не для продакшена.
  • Продакшен-команды: Enterprise добавляет готовую к продакшену мощность, наивысший приоритет, более высокие лимиты и расширенные варианты задержки, которых нет в уровне Developer.
  • Операторы дата-центров и передового ИИ: CS-4 рассчитана на развертывание в гипермасштабе как инфраструктура для передового ИИ.

Поддержка тоже зависит от уровня: аккаунты Developer полагаются на Discord-сообщество, а клиенты Enterprise получают выделенную команду по работе с аккаунтом.

Хуже он подходит тем, кто ждёт постоянного бесплатного уровня, очень длинных окон контекста на эндпоинте самообслуживания или широкого выбора моделей в самообслуживании; подробности — в разделах о ценах, ограничениях и функциях.

Платформы

  • SDK: Cerebras предлагает собственные SDK для Python и TypeScript наряду с OpenAI-совместимым доступом.
  • Партнёрские каналы: Cerebras Inference также продаётся через AWS Marketplace и доступен через единый API OpenRouter.
  • Hugging Face и Vercel: модели на базе Cerebras можно вызывать из Hugging Face Hub, а эндпоинты инференса Cerebras — развертывать на Vercel.
  • Инструменты для программирования: Cerebras Code работает с любым редактором или агентом, принимающим API-ключ, включая Cline, OpenCode и Crush.
  • Места развертывания: модели предлагаются в облаке и on-premise, и Cerebras сообщает, что инференс выполняется в регионе, чтобы помочь с задержкой, резидентностью данных и обязательствами по соответствию требованиям.
  • Командный доступ: организации назначают роли Organization Admin, Project Admin или Project Member, а администраторы проектов управляют API-ключами в назначенных им проектах.

Ценообразование

В самообслуживаемом уровне Developer цены на API Cerebras строятся по модели оплаты по факту использования и начинаются с бесплатного кредита $5, а цены Enterprise сообщаются по запросу.

Модель (уровень Developer)ВводВывод
GPT OSS 120B$0.35 за 1 млн токенов$0.75 за 1 млн токенов
Qwen 3.8 27B$0.99 за 1 млн токенов$1.49 за 1 млн токенов
  • Кредит $5 — разовый промокредит, который требует действующего способа оплаты и истекает через 30 дней после активации; добавление карты не подключает платное использование, а доступ к API и Playground приостанавливается, когда кредит истекает или заканчивается, если вы не купите кредиты с оплатой по факту.
  • Постоянного бесплатного уровня нет, поскольку бесплатный пробный период ограничен и сроком, и суммой кредита.
  • Кэширование промптов не стоит ничего сверх обычного, но кэшированные входные токены оплачиваются по стандартной ставке для входных токенов.
  • Автопополнение по умолчанию выключено и включается на вкладке Pay as you go.
  • Вкладка Subscriptions в Cloud Console управляет планами инференса для отдельных моделей; каждый предлагается в нескольких уровнях с разной месячной ценой.
  • Собственные веса моделей, а также услуги дообучения или обучения — функции Enterprise, доступные только по соглашению.

Планы Cerebras Code

Cerebras Code Pro указан по цене $50 за до 24 млн токенов в день и ориентирован на инди-разработчиков и проекты выходного дня. Cerebras Code Max указан по цене $200 за до 120 млн токенов в день и ориентирован на разработку полный рабочий день и мультиагентные системы. На момент снимка 4 октября 2026 года оба платных плана были отмечены как распроданные, а проверенные для этой страницы карточки планов не указывают расчётный период.

Training Cloud

Training Cloud продаётся либо почасово — Cerebras определяет время, необходимое для отправленной нагрузки, — либо помодельно — эксперты Cerebras проектируют и дообучают модель на вашем наборе данных; страница Training Cloud перечисляет эти варианты без расценок.

Альтернативы Cerebras

Другие поставщики тоже создают собственные чипы для быстрого инференса вместо аренды стандартных GPU:

  • Groq: Groq называет себя неооблаком для быстрого инференса на базе своего LPU, который теперь работает вместе с GPU NVIDIA через LPX.
  • SambaNova SambaCloud: SambaNova утверждает, что её чип RDU позволяет SambaCloud обеспечивать быстрый инференс на самых крупных моделях. SambaCloud поддерживает семейства с открытым исходным кодом, включая DeepSeek, Llama и Qwen.

На их фоне Cerebras выделяется пластинчатым процессором, OpenAI-совместимым API с пробным кредитом самообслуживания на $5 и возможностью установить системы CS-4 on-premise, но её каталог самообслуживания ограничен двумя моделями.

Ограничения

Лимиты запросов и окна контекста

  • В бесплатном пробном периоде каждая модель Shared Inference ограничена 5 запросами в минуту, 30 000 некэшированных токенов в минуту, 90 000 токенов всего в минуту и 1 млн токенов в час и в сутки, а qwen-3.8-27b принимает 2 изображения на запрос в пределах полезной нагрузки 10 МиБ.
  • На уровне Developer gpt-oss-120b допускает 1 млн некэшированных токенов в минуту и 1000 запросов в минуту, а qwen-3.8-27b — 150 000 некэшированных токенов в минуту и 300 запросов в минуту, причём её общий лимит временно повышен с 450 000 до 750 000.
  • Лимиты действуют на организацию, а не на пользователя, и различаются по моделям.
  • Ёмкость пополняется непрерывно по алгоритму token bucket, а не сбрасывается через фиксированные интервалы, и ошибка 429 указывает, превышен ли лимит некэшированных токенов или общий лимит токенов.
  • Кэшированные токены не учитываются в лимите некэшированных, а общий лимит по умолчанию втрое выше некэшированного, так что доля попаданий в кэш напрямую определяет пропускную способность.

Отзывы пользователей указывают в ту же сторону. В публичном обсуждении разработчиками запуска Qwen 3.8 27B на Cerebras несколько разработчиков сочли, что допускаемый Cerebras контекст 128k слишком мал для длинных агентных задач или задач программирования. Другие участники той же ветки сказали, что лимит 150 000 TPM на публичном эндпоинте затрудняет использование модели для многих задач программирования. Авторская колонка IT-издания от сентября 2025 года, написанная, когда Cerebras Code работал на Qwen3 Coder, сообщала, что генерация летела 10–20 секунд, после чего поминутный лимит токенов вызывал ошибки 429 до сброса минуты.

Смена каталога и функции в превью

  • С 3 сентября 2026 года gemma-4-31b больше не доступна в Shared Inference, но остаётся в Dedicated Inference.
  • Журнал устаревания отмечает zai-glm-4.7 как устаревшую с 2026-08-17, тогда как страница Cerebras Code всё ещё рекламирует GLM 4.7, так что две официальные страницы не совпадают.
  • Batch находится в Private Preview без поддержки SDK, поэтому пакетные задания отправляются через cURL или прямые HTTP-запросы.
  • Уровни обслуживания для приоритизации запросов недоступны в Shared Inference.

Пробелы в совместимости API

  • Поддерживается только n: 1, а изображения нужно отправлять как data URI в формате PNG или JPEG в base64, поскольку внешние HTTPS-URL изображений не поддерживаются.
  • gpt-oss-120b отклоняет запросы, сочетающие tools и response_format.
  • Текст, встроенный в изображение, попадает в контекст промпта, поэтому изображение с враждебными инструкциями может заставить модель следовать им, если промпт просит ответить по изображению.

Заявления о производительности

Cerebras сообщает, что её сравнения производительности основаны на сторонних бенчмарках или внутреннем тестировании, а наблюдаемый прирост скорости относительно GPU-систем может меняться в зависимости от нагрузки, конфигурации, даты и модели.

Конфиденциальность, использование данных и условия

  • Согласно политике конфиденциальности, Cerebras не хранит входные и выходные данные своих сервисов обучения, инференса и чат-бота и удаляет связанные журналы, когда они больше не нужны для оказания услуги.
  • Cerebras заявляет, что запросы из Playground и API никогда не используются для обучения моделей.
  • Отдельно в документации Batch сказано, что результаты пакетов хранятся 7 дней после завершения, а затем автоматически удаляются.
  • Trust Center указывает в разделе соответствия SOC 2 Type 2, GDPR и CCPA, а документация по безопасности предоставляется по запросу.
  • При использовании API право собственности на вывод модели регулируется условиями сторонних моделей, и Cerebras не претендует на него.
  • Для аккаунта пользователю должно быть не менее 13 лет или минимального возраста цифрового согласия в его стране.
  • В Cloud Console нет самостоятельного удаления аккаунта, поэтому запросы на удаление направляются в поддержку.

ЧаВо

Q1. Что будет, когда пробный кредит $5 закончится?

Доступ к API и Playground прекращается, но API-ключи, проекты и настройки сохраняются, а покупка с оплатой по факту снова активирует доступ на уровне Developer, где нет почасовых или суточных лимитов токенов.

Q2. Может ли Cerebras заменить модель за существующим ID модели?

Cerebras заявляет, что отдаёт для существующих ID моделей исходные веса без изменений, а возможные будущие варианты с прунингом выпустит под отдельными ID моделей.

Q3. Работает ли OpenAI SDK с Dedicated Inference?

Да. OpenAI-совместимое поле model принимает точный ID модели в Shared Inference и ваш стабильный ID эндпоинта в Dedicated Inference, который направляет каждый запрос в его активное развертывание.

Знаете похожий инструмент?
Если вы знаете другие отличные AI-инструменты, не стесняйтесь предлагать их нам