Пользовались этим инструментом? Оцените его
Пользовались этим инструментом? Оцените его
Gemma — это семейство открытых моделей, публикуемое Google DeepMind. На собственной продуктовой странице линейка представлена как «Gemma / Наши самые способные открытые модели» и размещена в разделе навигации Open models, намеренно отделённом от Gemini, Veo и Imagen — проприетарных линеек, к которым обращаются через API, а не скачивают. Именно это размещение и есть самый важный факт об этой записи, потому что оно определяет, что вы на самом деле получаете: не учётную запись со счётчиком потребления, а веса модели, которые вы сами загружаете, размещаете и эксплуатируете.
Стоит быть точным в названиях, потому что именно отсюда берётся большая часть путаницы. Google DeepMind — это исследовательская организация. Gemini — её флагманское семейство проприетарных моделей, доступное через продукты и API самой Google. Gemma — открытый собрат, построенный, по формулировке страницы Gemma 4, как «Наши самые интеллектуальные открытые модели, созданные на основе исследований и технологий Gemini 3 для максимизации интеллекта на параметр». Эти три названия регулярно смешивают каталоги и новостные агрегаторы, но они обозначают разные вещи: организацию, размещённую модель и модель для загрузки. Эта страница — о третьей.
Замысел, стоящий за Gemma, вытекает прямо из этой открытости. Заявленная цель Google — переносимость, а не превосходство в рейтингах: «Наши самые передовые открытые модели помогают разработчикам создавать приложения на базе ИИ, которые работают там, где это нужно пользователям, — от облачных серверов до ноутбуков и даже телефонов». Всё остальное в этом семействе — необычно широкий разброс размеров, варианты со смесью экспертов, приёмы послойных вложений в малых моделях — следует из этой фразы. Gemma спроектирована так, чтобы одно и то же семейство моделей можно было развернуть и на Jetson Nano, и на стойке ускорителей, не меняя поставщика и не переписывая приложение.
У открытости есть и второе практическое следствие. Поскольку веса распространяются, а не предоставляются как сервис, здесь нет регистрации, нет учёта рабочих мест и нет счёта от Google за токены. Вместо этого появляются лицензия, счёт за оборудование и эксплуатационная нагрузка, которая целиком принадлежит вам. Понять, куда именно ложится каждая из этих трёх составляющих, — и есть основная работа по оценке Gemma.
Google также подаёт Gemma как инструмент ответственного развёртывания, а не как сырой исследовательский артефакт. Однострочное позиционирование в разделе Open models звучит как «Создавайте ответственные приложения на базе ИИ в большом масштабе», и вместе с универсальными моделями в семействе поставляются отдельные варианты-классификаторы безопасности. Насколько эта рамка выдерживает проверку практикой, сильно зависит от того, что вы построите вокруг модели, — официальная документация говорит об этом прямо, и раздел об ограничениях к этому возвращается.
Самое сложное при внедрении Gemma — не установка, а выбор правильной ступени на лестнице. Размеры не взаимозаменяемы, и решающим фактором обычно оказывается уже имеющееся оборудование, а не таблица результатов.
Пограничный уровень (E2B, E4B). Google прямо позиционирует его для устройств с ограниченными ресурсами: «Поддержка аудио и зрения для обработки на границе сети в реальном времени. Они могут работать полностью автономно с почти нулевой задержкой на пограничных устройствах вроде телефонов, Raspberry Pi и Jetson Nano». Автономная работа — ключевое свойство. Если ваше требование в том, что вывод должен работать без сети — в автомобиле, в клинике, в цеху, в сельском классе, — именно этот уровень и есть причина вообще рассматривать Gemma. Взамен вы принимаете более короткое контекстное окно и заметно более слабые результаты на сложных рассуждениях и поиске по длинным документам.
Уровень рабочих станций (12B, 26B A4B, 31B). Он нацелен на потребительские видеокарты, а не на ускорители дата-центров. По формулировке Google, они дают «продвинутые рассуждения для IDE, помощников по написанию кода и агентных сценариев. Эти модели оптимизированы под потребительские GPU, что даёт студентам, исследователям и разработчикам возможность превратить рабочую станцию в локальный ИИ-сервер». Модель 26B A4B — любопытный средний вариант: она несёт 25,2 млрд параметров суммарно, но активирует около 3,8 млрд при выводе, поэтому по скорости ведёт себя ближе к небольшой модели, сохраняя при этом бо́льшую ёмкость. Плотная модель 31B с 30,7 млрд параметров и окном 256K — потолок линейки.
Предыдущее поколение по-прежнему важно. Gemma 3 никуда не делась. Она остаётся доступной в размерах 270M, 1B, 4B, 12B и 27B с окном 128K токенов, и собственное описание Google — «Контекстное окно Gemma 3 на 128K токенов позволяет вашим приложениям обрабатывать и понимать огромные объёмы информации, открывая более сложные возможности ИИ» — по-прежнему описывает работоспособную модель. В частности, у размера 270M нет аналога в Gemma 4, поэтому для предельно малых конфигураций старшее поколение иногда оказывается единственным вариантом. Принципиально важно, что лицензии поколений различаются, и об этом следующий раздел.
Практическое правило выбора: отталкивайтесь от цели развёртывания, а не от рейтинга. Если модель должна работать автономно на носимом устройстве, вы на пограничном уровне и должны рано проверить качество на своих реальных задачах. Если у вас одна современная потребительская видеокарта и вы хотите локального помощника по коду или агента, начинайте с 12B и поднимайтесь выше только тогда, когда качества действительно не хватает. Если нужен голосовой ввод, ограничьтесь E2B, E4B или 12B. Если нужно максимальное качество и оборудование позволяет, плотная модель 31B — предел этого семейства.
Этот раздел стоит прочитать дважды, потому что самое часто повторяемое утверждение о Gemma — «Gemma лицензирована под Apache 2.0» — верно только для текущего поколения.
Gemma 4 действительно перешла на по-настоящему стандартную открытую лицензию. Официальный блог Google по открытому коду говорит об этом прямо: «Модели Gemma 4 — первые в Gemmaverse, выпущенные под одобренной OSI лицензией Apache 2.0». Официальная карточка модели подтверждает это в машиночитаемом виде: поле в её заголовке гласит просто «license: apache-2.0». Значит, для Gemma 4 вы работаете с одобренной OSI разрешительной лицензией с теми свойствами перераспространения и коммерческого использования, которых от неё ожидают разработчики.
С более ранними поколениями дело обстоит иначе. Метаданные репозиториев в официальной организации google на Hugging Face ясно показывают разделение: репозитории Gemma 4 несут метку apache-2.0, тогда как gemma-2, gemma-3n и gemma-7b по-прежнему помечены собственной лицензией Google под названием gemma. Сторонний обзор версий фиксирует тот же переход, отмечая, что Google выпустила Gemma 4 «под свободной и открытой лицензией Apache 2.0», а более ранние поколения распространялись на условиях использования Gemma типа source-available.
Практическое следствие вполне конкретно. Если ваш процесс комплаенса одобрил «Gemma» как зависимость под Apache 2.0, а инженеры затем скачали контрольную точку Gemma 3 или Gemma 2 — что совершенно разумно, поскольку они актуальны, поддерживаются и иногда подходят лучше, — то лицензия, регулирующая ваше развёртывание, не та, которую одобрил ваш процесс. Проверяйте поле лицензии конкретного репозитория, который скачиваете, каждый раз, а не полагайтесь на утверждения на уровне семейства, включая это.
О масштабах распространения Google сообщает: «С момента первого запуска сообщество скачало модели Gemma более 400 миллионов раз и построило живую вселенную из более чем 100 000 впечатляющих вариантов, известную в сообществе как Gemmaverse». Это цифры, сообщённые самим поставщиком и не прошедшие независимого аудита; они полезны как признак того, что экосистема не заброшена, но их не следует читать как меру качества.
Распространение намеренно рассредоточено по инструментам, которыми разработчики уже пользуются, а не сведено к какому-либо ресурсу Google. Официальная страница перечисляет платформы и интеграции, охватывающие Kaggle, Hugging Face, Keras, Ollama, PyTorch, Gemma.cpp, JAX, Google AI Edge, Google Cloud, Android, LM Studio и Unsloth.
Что касается непосредственно весов, страница Gemma 4 разделяет адреса загрузки и пути обучения и развёртывания, направляя загрузку весов на Hugging Face, Ollama, Kaggle, LM Studio и Docker. На практике это означает, что самый быстрый путь целиком зависит от вашего существующего стека, а не от какого-либо инструментария, специфичного для Gemma:
Поддержка имеет форму сообщества и документации, а не договора. Официальная страница указывает на «официальную документацию, руководства по быстрому старту и справочники для создания приложений с Gemma» и направляет вопросы на форум разработчиков. Со скачиванием открытой модели не приходят ни соглашение об уровне обслуживания, ни очередь заявок, ни персональный менеджер — компромисс, очевидный в принципе, но иногда неожиданный в промышленной эксплуатации.
Google публикует таблицу сравнения Gemma 4 с предшественником, и межпоколенческий скачок на задачах с высокой нагрузкой на рассуждение велик. На математике AIME 2026 без использования инструментов модель 31B заявлена на уровне 89,2 % против 20,8 % у Gemma 3 27B. Другие опубликованные на странице Gemma 4 показатели охватывают арену, соревновательное программирование и вопросы уровня аспирантуры.
К каждой цифре из этой таблицы применимы два предостережения. Во-первых, это результаты, сообщённые поставщиком и полученные стороной, заинтересованной в исходе; они разумная исходная гипотеза, но не независимый вывод. Во-вторых, заглавные средние скрывают зависящие от размера обрывы, которые важнее всего при развёртывании. Поиск в длинном контексте — самый ясный пример: по метрике поиска MRCR v2 с восемью иглами на 128K карточка модели сообщает 66,4 % для самой крупной модели, при этом каждый меньший размер резко падает ниже. Модель, заявленная как поддерживающая длинное окно, не обязательно использует это окно надёжно, и разрыв между верхом и низом лестницы по этой метрике намного шире, чем по тестам общих знаний.
Независимые комментарии поднимают связанную структурную проблему: разбор технического отчёта по Gemma 4 отмечает, что он «приписывает прирост составу данных, а затем описывает свои обучающие данные в двух предложениях». Поскольку корпус не описан подробно, внешние стороны не могут независимо оценить загрязнение тестовых наборов или проверить охват предметных областей. Это не обесценивает опубликованные цифры, но означает, что единственный тест, полностью закрывающий вопрос для вашего сценария, — тот, который вы проведёте сами на собственных отложенных данных.
Gemma подходит разработчикам, исследователям и техническим командам, которым контроль над развёртыванием важнее удобства. Если вам не в тягость подготовить оборудование, выбрать стек обслуживания и взять на себя эксплуатационную часть, семейство даёт вам необычно широкую лестницу размеров от одного поставщика с единообразным инструментарием.
Она подходит организациям с жёсткими ограничениями, которые размещённые API удовлетворить не могут: автономная работа, резидентность данных, конфиденциальность кода или юнит-экономика на масштабе, при которой оплата за токены становится неподъёмной. В этих случаях эксплуатационная нагрузка — не недостаток, а цена требования, которое иначе выполнить нельзя.
Она подходит тем, кто намерен изменять модель. Тонкая настройка, квантизация, дистилляция или встраивание модели в образ устройства требуют весов. Если в вашем плане есть любой из этих глаголов, открытая модель — не один из вариантов, а единственная подходящая категория.
Она плохо подходит нетехническим пользователям, которые хотят открыть вкладку браузера и получить результат. Потребительского продукта здесь нет. За вычетом пробы через AI Studio использование Gemma означает инженерную работу. Тому, чья потребность — «пообщаться с ИИ-помощником», лучше подойдёт размещённый продукт, весьма вероятно Gemini, и эта запись окажется для него ненужным крюком.
Она также сомнительно подходит командам, которым нужны договорные гарантии поддержки. Документация и форум разработчиков — вот и вся модель поддержки. Если ваш закупочный процесс требует поставщика с соглашением об уровне обслуживания и путём эскалации, скачивание открытой модели этого не даёт, независимо от того, насколько велика компания за ней.
Собственная документация Google необычно прямо говорит о границах модели, и эти самостоятельно заявленные ограничения полезнее большинства сторонней критики, потому что их можно атрибутировать.
Это не база знаний. Карточка модели утверждает, что модели «формируют ответы на основе информации, усвоенной из обучающих наборов данных, но они не являются базами знаний. Они могут порождать неверные или устаревшие фактические утверждения». Относитесь к фактическому выводу как к требующему проверки, а не как к результату поиска.
У обучающих данных есть дата отсечки. Задокументированная отсечка предобучения — январь 2025 года, охват включает веб-документы, код, математику, изображения и аудио. Всё, что после этой даты, вне знаний модели, поэтому приложения, чувствительные ко времени, нуждаются во внешнем поиске независимо от размера модели.
Открытые задачи труднее чётко поставленных. Как формулирует карточка модели, модели «хорошо справляются с задачами, которые можно оформить чёткими подсказками и инструкциями. Открытые или крайне сложные задачи могут представлять трудность». Структура запроса здесь действительно работает.
Возможности неоднородны по лестнице. Это стоит подчеркнуть, потому что это самое частое практическое разочарование. Ввод аудио существует только на E2B, E4B и 12B. Поиск в длинном контексте резко деградирует на меньших моделях. Возможность, показанную на модели 31B, никогда не следует считать переносимой на E2B.
Профессиональные консультации вне области применения. Собственное указание Google в нижнем колонтитуле однозначно: «Не полагайтесь на большие языковые модели в вопросах медицинских, юридических, финансовых или иных профессиональных консультаций. Любой контент по этим темам предоставляется в информационных целях и не заменяет совета квалифицированного специалиста». Существование MedGemma этого не меняет; модель, дообученная под предметную область, всё равно не является врачом.
Прозрачность обучающих данных ограничена. Как отмечено выше, независимый анализ критикует краткость описания обучающих данных. Полностью проверить, что вошло в модель, вы не сможете.
Вы наследуете эксплуатационную нагрузку. Отсутствие размещённой конечной точки означает, что доступность, масштабирование, установка обновлений безопасности, планирование ёмкости GPU и расходы — ваши. Небольшие команды часто недооценивают это в момент принятия решения.
Позиция открытой модели в отношении приватности структурно отличается от позиции размещённого сервиса, и различие работает в обе стороны.
С положительной стороны, самостоятельное размещение означает, что данные вывода вообще не обязаны покидать вашу инфраструктуру. Не нужно договариваться о журналировании запросов на стороне поставщика, потому что вывода на стороне поставщика попросту нет. Для конфиденциальных нагрузок это самый сильный довод, который есть у всей категории.
Со стороны обучения Google сообщает о работе по фильтрации предобучающего корпуса: «В рамках усилий по обеспечению безопасности и надёжности предобученных моделей Gemma автоматизированные методы использовались для отсеивания определённой персональной информации и других чувствительных данных из обучающих наборов», с применением фильтрации CSAM на нескольких этапах. Это заявление поставщика о процессе, а не независимый аудит, и читать его следует именно так.
Ключевой момент для любого, кто разворачивает Gemma, в том, что Google явно возлагает ответственность за безопасность на последующих этапах на вас. Карточка модели перечисляет нарушение приватности среди выявленных рисков и указывает, что «разработчикам рекомендуется соблюдать нормы о защите персональных данных с применением методов, сохраняющих приватность». В части безопасности контента она столь же пряма: «Разработчикам рекомендуется проявлять осторожность и внедрять надлежащие меры защиты контента, исходя из своих конкретных продуктовых политик и сценариев применения».
Это распределение ответственности — не формальность. При размещённом API слой модерации поставщика стоит между вашими пользователями и сырой моделью, хотите вы того или нет. Когда вы скачиваете веса, этот слой вместе с ними не приходит. Ограничители, мониторинг злоупотреблений, политика журналирования, возрастные ограничения и соответствие требованиям становятся тем, что строите вы. ShieldGemma 2 помогает с частью этого, но подключение — ваша работа.
Со стороны инфраструктуры Google заявляет, что «модели Gemma 4 проходят те же строгие протоколы безопасности инфраструктуры, что и наши проприетарные модели», позиционируя семейство как надёжную основу для корпоративных и государственных развёртываний. Это утверждение касается того, как модели производятся и выпускаются, а не того, как вы их затем эксплуатируете.
Честный набор для сравнения Gemma — другие семейства с открытыми весами, а не размещённые ассистенты, потому что решение о самостоятельном размещении принимается первым, а выбор модели — вторым.
В сравнении с Gemini речь на самом деле о модели развёртывания, а не о качестве. Gemini обслуживается, администрируется и непрерывно обновляется силами Google; Gemma скачивается, эксплуатируется вами и фиксируется по версии. Если никакое ограничение не вынуждает к самостоятельному размещению, размещённый путь требует меньше труда. Если такое ограничение есть, Gemini не удовлетворит его ни за какие деньги.
В сравнении с другими семействами с открытыми весами — обычно сопоставляют линейки Llama, Qwen и Mistral — отличительные черты Gemma это необычная широта лестницы размеров, особенно в её нижней части, лицензия Apache 2.0 для текущего поколения и глубина официальных предметных вариантов. Впрочем, конкуренты движутся быстро, и у любого утверждения о том, кто лидирует по качеству, короткий срок годности. Оценивайте на своих задачах в момент принятия решения, а не доверяйте общим рейтингам, включая это описание.
В сравнении с вариантом не запускать локально ничего расчёт прост: размещённые API выигрывают по времени до первого результата и проигрывают по контролю над данными, автономности и предельным издержкам на масштабе. Gemma оправдывает свою эксплуатационную стоимость, когда хотя бы один из этих трёх факторов является жёстким требованием, а не предпочтением.
Внутри самого семейства самая недооценённая альтернатива — предыдущее поколение. У Gemma 3 есть размер 270M, которого нет у Gemma 4, и для крайне ограниченных развёртываний это может стать решающим — при условии, что вы учтёте различия в лицензионных условиях, о которых сказано выше.
Веса можно скачать бесплатно, и Google не берёт плату за токены при их запуске, потому что вычислительные ресурсы предоставляете вы. Gemma 4 выпущена под одобренной OSI лицензией Apache 2.0. Реальные расходы — это оборудование, электроэнергия или время облачных инстансов, а также инженерные усилия по самостоятельной эксплуатации модели. «Бесплатно» здесь означает «без лицензионных отчислений», а не «без затрат».
Для Gemma 4 лицензия Apache 2.0 разрешает коммерческое использование, изменение и перераспространение на стандартных условиях. Для более ранних поколений проверяйте отдельно: Gemma 2, Gemma 3n и другие старые репозитории по-прежнему помечены собственной лицензией Google gemma, а не Apache 2.0, и эти особые условия содержат ограничения на использование, которых в Apache 2.0 нет. Всегда сверяйтесь с полем лицензии того самого репозитория, который вы скачиваете.
Gemini — проприетарное семейство моделей Google, доступное как размещённый сервис. Gemma — открытое семейство, чьи веса вы скачиваете и запускаете сами, построенное на смежных исследованиях: страница Gemma 4 описывает её как созданную на основе исследований и технологий Gemini 3. Одна родословная, противоположные модели распространения. А Google DeepMind — исследовательская организация, которая публикует и то и другое.
Это полностью зависит от выбранного размера. E2B и E4B рассчитаны на телефоны и небольшие платы, включая Raspberry Pi и Jetson Nano, и могут работать полностью автономно. Модели 12B, 26B A4B и 31B нацелены на потребительские GPU. Модель 26B A4B построена по схеме смеси экспертов и активирует при выводе около 3,8 млрд из своих 25,2 млрд параметров, поэтому работает быстрее, чем подсказывает её суммарный размер, — часто это лучшее соотношение ёмкости к видеопамяти в семействе.
До 256K токенов на уровне рабочих станций, при этом пограничные модели несут меньшее окно в 128K. Учтите, что поддерживать окно и надёжно его использовать — разные вещи: по метрике поиска в длинном контексте из карточки модели самая крупная модель достигает 66,4 %, а меньшие размеры заметно проседают. Проверьте поведение поиска на вашей фактической длине контекста, прежде чем строить вокруг этого архитектуру.
Понимание изображений и видео доступно во всей линейке Gemma 4, поддерживается и чередующийся мультимодальный ввод. Аудио — исключение: официальная карточка модели ограничивает автоматическое распознавание речи и перевод речи в переведённый текст моделями E2B, E4B и 12B. Если голосовой ввод обязателен, две самые крупные модели вам не подойдут.
Google заявляет поддержку 140 языков и формулирует цель как понимание культурного контекста, а не буквальный перевод. Как и с любым широким многоязычным заявлением, качество в этом диапазоне заметно различается, поэтому проверяйте работу на ваших конкретных целевых языках, а не исходите из предположения об однородности.
При самостоятельном размещении данные вывода не обязаны покидать вашу инфраструктуру, и это самое сильное свойство приватности у подхода с открытыми весами. Однако Google явно возлагает ответственность на последующих этапах на вас, призывая разработчиков соблюдать нормы о защите персональных данных методами, сохраняющими приватность. Соответствие требованиям защиты данных, политика журналирования и меры защиты контента — то, что предстоит спроектировать и внедрить вам.
Да: тонкая настройка — одна из пяти возможностей, которые Google перечисляет для этого семейства, а официальная страница распространения ведёт к инструментам обучения, включая Unsloth, Keras, JAX и GKE. Полученная модель остаётся под вашим контролем, и это одна из главных причин, по которым команды выбирают открытые веса вместо размещённого API.
Gemma 4 сильнее на тестах рассуждения и несёт более разрешительную лицензию Apache 2.0, поэтому это выбор по умолчанию. Gemma 3 остаётся уместной в двух случаях: когда вам нужен размер 270M, аналога которому в Gemma 4 нет, и когда существующий инструментарий уже привязан к ней. Если вы всё же выбираете Gemma 3, помните, что её лицензионные условия отличаются от условий Gemma 4 и требуют отдельного рассмотрения.