Já usou esta ferramenta? Avalie-a
Já usou esta ferramenta? Avalie-a
O Gemma é a família de modelos abertos publicada pela Google DeepMind. Na própria página de produto, a linha é apresentada como «Gemma / Os nossos modelos abertos mais capazes» e figura numa coluna de navegação intitulada Open models, deliberadamente separada do Gemini, do Veo e do Imagen, as linhas proprietárias a que se acede através de uma API em vez de as descarregar. Essa colocação é, por si só, o facto mais importante desta ficha, porque define o que realmente se obtém: não uma conta com um contador de utilização, mas pesos de modelo que o próprio utilizador descarrega, aloja e opera.
Vale a pena ser preciso quanto aos nomes, porque é daí que nasce a maior parte da confusão. A Google DeepMind é uma organização de investigação. O Gemini é a sua família de modelos proprietários de referência, servida através dos produtos e das API da própria Google. O Gemma é o irmão aberto, construído, nos termos da página do Gemma 4, como «Os nossos modelos abertos mais inteligentes, criados a partir da investigação e da tecnologia do Gemini 3 para maximizar a inteligência por parâmetro». Os três nomes são confundidos com frequência por diretórios e agregadores de notícias, mas designam coisas distintas: uma organização, um modelo alojado e um modelo descarregável. Esta página trata do terceiro.
A intenção de projeto por detrás do Gemma decorre diretamente dessa abertura. O objetivo declarado da Google é a portabilidade e não a supremacia nas tabelas classificativas: «Os nossos modelos abertos mais avançados ajudam os programadores a criar aplicações de IA que funcionam onde os utilizadores precisam delas, desde servidores na nuvem a portáteis e até telemóveis». Tudo o resto nesta família — a amplitude invulgar de tamanhos de parâmetros, as variantes com mistura de especialistas, os truques de incorporações por camada nos modelos pequenos — decorre dessa frase. O Gemma foi concebido para que a mesma família de modelos possa ser implantada num Jetson Nano e num bastidor de aceleradores, sem mudar de fornecedor nem reescrever a aplicação.
A abertura tem uma segunda consequência prática. Como os pesos são distribuídos em vez de servidos, não há processo de registo, não há contagem de lugares e não há fatura por token emitida pela Google para executar o modelo. O que ocupa esse lugar é uma licença, uma fatura de equipamento e uma carga operacional que lhe pertence por inteiro. Perceber onde cai cada uma dessas três coisas constitui a maior parte do trabalho de avaliar o Gemma.
A Google enquadra igualmente o Gemma como instrumento de implantação responsável e não como artefacto de investigação em bruto. O posicionamento de uma linha associado à coluna Open models diz «Construa aplicações de IA responsáveis à escala», e a família inclui variantes classificadoras de segurança dedicadas a par dos modelos de uso geral. Se esse enquadramento se sustenta na prática depende muito do que se construir em torno do modelo, um ponto que a documentação oficial afirma sem rodeios e ao qual a secção de limitações regressa.
A parte mais difícil de adotar o Gemma não é a instalação, mas escolher o degrau certo da escada. Os tamanhos não são intermutáveis e o fator decisivo é normalmente o equipamento de que já se dispõe e não uma tabela de resultados.
O patamar de periferia (E2B, E4B). A Google posiciona-o explicitamente para dispositivos com recursos limitados: «Suporte de áudio e visão para processamento na periferia em tempo real. Podem funcionar completamente offline com latência quase nula em dispositivos de periferia como telemóveis, Raspberry Pi e Jetson Nano». O funcionamento offline é a propriedade central. Se o seu requisito for que a inferência tenha de funcionar sem rede — dentro de um veículo, numa clínica, no chão de fábrica, numa sala de aula rural —, este patamar é a própria razão para considerar o Gemma. Em troca, aceita uma janela de contexto mais curta e um desempenho nitidamente mais fraco em raciocínio difícil e pesquisa em documentos longos.
O patamar de estação de trabalho (12B, 26B A4B, 31B). Este visa placas gráficas de consumo e não aceleradores de centro de dados. Segundo a Google, oferecem «raciocínio avançado para IDE, assistentes de programação e fluxos com agentes. Estes modelos estão otimizados para GPU de consumo, dando a estudantes, investigadores e programadores a possibilidade de transformar estações de trabalho em servidores de IA locais». O 26B A4B é a opção intermédia interessante: soma 25,2 mil milhões de parâmetros no total, mas ativa cerca de 3,8 mil milhões na inferência, comportando-se em velocidade mais como um modelo pequeno e mantendo mais capacidade. O modelo denso 31B, com 30,7 mil milhões de parâmetros e uma janela de 256K, é o topo da gama.
A geração anterior continua a contar. O Gemma 3 não desapareceu. Mantém-se disponível nos tamanhos 270M, 1B, 4B, 12B e 27B com uma janela de 128K tokens, e a própria descrição da Google — «A janela de contexto de 128K tokens do Gemma 3 permite que as suas aplicações processem e compreendam grandes volumes de informação, viabilizando funcionalidades de IA mais sofisticadas» — continua a descrever um modelo utilizável. O tamanho de 270M, em particular, não tem equivalente no Gemma 4, pelo que para pegadas extremamente reduzidas a geração anterior é por vezes a única opção. Fundamental: as licenças diferem entre gerações, tema da secção seguinte.
Uma heurística prática de seleção: parta do seu alvo de implantação e não de uma tabela classificativa. Se tiver de correr offline num dispositivo portátil, está no patamar de periferia e deve validar a qualidade cedo com as suas tarefas reais. Se tiver uma GPU de consumo moderna e quiser um assistente local de programação ou de agentes, comece nos 12B e suba apenas se a qualidade o exigir. Se precisar de entrada de voz, restrinja-se a E2B, E4B ou 12B. Se procurar a máxima qualidade e tiver o equipamento, o modelo denso 31B é o teto da família.
Esta secção merece dupla leitura, porque a afirmação mais repetida sobre o Gemma — «o Gemma tem licença Apache 2.0» — só é verdadeira para a geração atual.
O Gemma 4 passou de facto para uma licença de código aberto genuinamente padrão. O blogue de código aberto da Google diz-lo sem rodeios: «Os modelos Gemma 4 são os primeiros do Gemmaverse a serem lançados sob a licença Apache 2.0 aprovada pela OSI». A ficha oficial do modelo confirma-o em formato legível por máquina, com o campo do seu cabeçalho a indicar simplesmente «license: apache-2.0». Para o Gemma 4, portanto, trabalha-se com uma licença permissiva aprovada pela OSI, com as propriedades de redistribuição e uso comercial que os programadores dela esperam.
As gerações anteriores são outra questão. Os metadados dos repositórios na organização oficial google no Hugging Face mostram a divisão com clareza: os repositórios do Gemma 4 têm a etiqueta apache-2.0, ao passo que gemma-2, gemma-3n e gemma-7b continuam etiquetados com a licença própria da Google chamada gemma. Um historial de versões de terceiros regista a mesma transição, notando que a Google lançou o Gemma 4 «sob a licença livre e de código aberto Apache 2.0», enquanto as gerações anteriores foram distribuídas sob termos de utilização Gemma do tipo source-available.
A consequência prática é concreta. Se o seu processo de conformidade aprovou «Gemma» como dependência ao abrigo da Apache 2.0 e os seus engenheiros descarregarem depois um ponto de controlo do Gemma 3 ou do Gemma 2 — algo perfeitamente razoável, já que continuam atuais, mantidos e por vezes mais adequados —, a licença que rege a sua implantação não é a que o seu processo aprovou. Verifique o campo de licença do repositório concreto que descarrega, de cada vez, em vez de confiar em afirmações ao nível da família, incluindo esta.
Quanto à escala de adoção, a Google reporta que «desde o primeiro lançamento, a comunidade descarregou modelos Gemma mais de 400 milhões de vezes e construiu um universo vibrante de mais de 100 000 variantes inspiradoras, conhecido na comunidade como Gemmaverse». São números reportados pelo fornecedor sem auditoria independente; servem como sinal de que o ecossistema não está abandonado e não devem ser lidos como medida de qualidade.
A distribuição está deliberadamente espalhada pelas ferramentas que os programadores já usam, em vez de canalizada para uma propriedade da Google. A página oficial enumera plataformas e integrações que abrangem Kaggle, Hugging Face, Keras, Ollama, PyTorch, Gemma.cpp, JAX, Google AI Edge, Google Cloud, Android, LM Studio e Unsloth.
Quanto aos pesos em concreto, a página do Gemma 4 separa os destinos de descarga das vias de treino e implantação, encaminhando as descargas para Hugging Face, Ollama, Kaggle, LM Studio e Docker. Na prática, isto significa que a via mais rápida depende inteiramente da sua pilha existente e não de ferramentas específicas do Gemma:
O apoio assume forma comunitária e documental e não contratual. A página oficial remete para «documentação oficial, guias de início rápido e manuais para criar aplicações com o Gemma» e encaminha as perguntas para um fórum de programadores. Descarregar um modelo aberto não traz consigo acordos de nível de serviço, fila de pedidos de apoio nem gestor de conta — um compromisso óbvio em princípio, mas por vezes surpreendente em produção.
A Google publica uma tabela comparativa entre o Gemma 4 e o antecessor, e o salto geracional em tarefas com forte carga de raciocínio é grande. Na matemática AIME 2026 sem uso de ferramentas, o modelo 31B é indicado com 89,2 % contra 20,8 % do Gemma 3 27B. Outros números publicados na página do Gemma 4 abrangem classificações de arena, programação competitiva e perguntas de nível de pós-graduação.
A cada número dessa tabela aplicam-se duas cautelas. Primeiro, são resultados reportados pelo fornecedor, produzidos pela parte com interesse no desfecho; constituem uma hipótese de partida razoável e não uma conclusão independente. Segundo, as médias em destaque escondem as quebras dependentes do tamanho que mais importam na implantação. A pesquisa em contexto longo é o exemplo mais nítido: na medida de pesquisa MRCR v2 com oito agulhas a 128K, a ficha do modelo reporta 66,4 % para o maior modelo, com cada tamanho inferior a cair acentuadamente abaixo. Um modelo anunciado como suportando uma janela longa não utiliza necessariamente essa janela de forma fiável, e a distância entre o topo e a base da escada nesta medida é bem maior do que nos testes de conhecimento geral.
Um comentário independente levanta uma preocupação estrutural relacionada: a análise do relatório técnico do Gemma 4 nota que este «atribui o ganho à composição dos dados e depois descreve os seus dados de treino em duas frases». Como o corpus não é descrito em detalhe, terceiros não conseguem avaliar de forma independente a contaminação dos testes nem verificar a cobertura por domínios. Isso não invalida os números publicados, mas significa que o único teste que resolve por completo a questão para o seu caso de uso é aquele que executar por si, com os seus próprios dados reservados.
O Gemma adequa-se a programadores, investigadores e equipas técnicas que valorizam o controlo da implantação mais do que a comodidade. Se lhe for confortável aprovisionar equipamento, escolher uma pilha de serviço e assumir a superfície operacional, a família oferece-lhe uma escada de tamanhos invulgarmente ampla de um único fornecedor e com ferramentas coerentes.
Adequa-se a organizações com restrições rígidas que as API alojadas não conseguem satisfazer: funcionamento offline, residência de dados, confidencialidade do código, ou uma economia unitária à escala que torna insustentável o preço por token. Nesses casos, a carga operacional não é uma desvantagem mas o preço de um requisito que de outro modo não se consegue cumprir.
Adequa-se a quem tenciona modificar o modelo. Ajustar, quantizar, destilar ou embeber um modelo numa imagem de dispositivo exige pesos. Se o seu plano incluir algum destes verbos, um modelo aberto não é uma opção entre várias: é a única categoria elegível.
Adequa-se mal a utilizadores não técnicos que querem abrir um separador do navegador e obter um resultado. Não há aqui um produto de consumo. Tirando a experimentação via AI Studio, usar o Gemma significa trabalho de engenharia. Quem tiver como necessidade «conversar com um assistente de IA» será mais bem servido por um produto alojado, muito provavelmente o Gemini, e acharia esta ficha um desvio desnecessário.
Adequa-se igualmente mal a equipas que precisam de garantias contratuais de apoio. A documentação e um fórum de programadores constituem todo o modelo de apoio. Se o seu processo de aquisição exigir um fornecedor com acordo de nível de serviço e caminho de escalamento, a descarga de um modelo aberto não o fornece, por maior que seja a empresa que está por trás.
A própria documentação da Google é invulgarmente direta sobre os limites do modelo, e esses limites autodeclarados são mais úteis do que a maioria das críticas externas por serem atribuíveis.
Não é uma base de conhecimento. A ficha do modelo afirma que os modelos «geram respostas com base na informação que aprenderam dos seus conjuntos de dados de treino, mas não são bases de conhecimento. Podem gerar afirmações factuais incorretas ou desatualizadas». Trate a saída factual como algo que exige verificação, e não como uma consulta.
Os dados de treino têm data de corte. O corte de pré-treino documentado é janeiro de 2025 e abrange documentos web, código, matemática, imagens e áudio. Tudo o que for posterior a essa data fica fora do conhecimento do modelo, pelo que aplicações sensíveis ao tempo precisam de pesquisa externa independentemente do tamanho escolhido.
As tarefas abertas são mais difíceis do que as bem especificadas. Como formula a ficha do modelo, os modelos «têm bom desempenho em tarefas que possam ser enquadradas com instruções e indicações claras. Tarefas abertas ou muito complexas podem ser desafiantes». A estrutura do prompt faz aqui trabalho real.
A capacidade não é uniforme ao longo da escada. Merece ênfase por ser a deceção prática mais frequente. A entrada de áudio existe apenas em E2B, E4B e 12B. A pesquisa em contexto longo degrada-se acentuadamente nos modelos menores. Uma capacidade demonstrada no modelo 31B nunca deve ser presumida transferível para o E2B.
O aconselhamento profissional está fora do âmbito. A própria indicação da Google no rodapé é explícita: «Não confie em LLM para aconselhamento médico, jurídico, financeiro ou outro aconselhamento profissional. Qualquer conteúdo sobre esses temas é fornecido para fins informativos e não substitui o parecer de um profissional qualificado». A existência do MedGemma não altera isto; um modelo afinado para um domínio continua a não ser um clínico.
A transparência sobre os dados de treino é limitada. Como referido, a análise independente critica a brevidade da descrição dos dados de treino. Não é possível auditar por completo o que entrou no modelo.
Herda-se a carga operacional. A ausência de um ponto de acesso alojado significa que disponibilidade, escalabilidade, correções de segurança, planeamento de capacidade de GPU e custos lhe pertencem. As equipas pequenas subestimam frequentemente este ponto no momento da decisão.
A postura de privacidade de um modelo aberto difere estruturalmente da de um serviço alojado, e a diferença funciona nos dois sentidos.
Do lado favorável, alojar por conta própria significa que os dados de inferência não precisam de sair da sua infraestrutura. Não há registo de prompts do lado do fornecedor a negociar, porque não há inferência do lado do fornecedor. Para cargas confidenciais, este é o argumento mais forte de toda a categoria.
Do lado do treino, a Google reporta trabalho de filtragem sobre o corpus de pré-treino: «Como parte do esforço para tornar os modelos pré-treinados Gemma seguros e fiáveis, foram usadas técnicas automatizadas para filtrar determinada informação pessoal e outros dados sensíveis dos conjuntos de treino», com filtragem de CSAM aplicada em várias fases. Trata-se de uma declaração do fornecedor sobre um processo e não de uma auditoria independente, devendo ser lida como tal.
O ponto crítico para quem implanta o Gemma é que a Google lhe atribui explicitamente a responsabilidade de segurança a jusante. A ficha do modelo enumera a violação da privacidade entre os riscos identificados e refere que «os programadores são incentivados a cumprir a regulamentação de privacidade recorrendo a técnicas que a preservem». Quanto à segurança dos conteúdos é igualmente direta: «Os programadores são incentivados a agir com prudência e a implementar salvaguardas adequadas de segurança de conteúdos com base nas suas políticas de produto e casos de utilização concretos».
Esta atribuição não é uma formalidade. Com uma API alojada, a camada de moderação do fornecedor coloca-se entre os seus utilizadores e o modelo em bruto, queira ou não. Quando descarrega pesos, essa camada não vem com eles. Salvaguardas, monitorização de abusos, política de registos, controlo de idade e conformidade regulamentar passam a ser artefactos que você constrói. O ShieldGemma 2 ajuda em parte disto, mas integrá-lo é trabalho seu.
Do lado da infraestrutura, a Google declara que «os modelos Gemma 4 são submetidos aos mesmos rigorosos protocolos de segurança de infraestrutura que os nossos modelos proprietários», posicionando a família como base fiável para implantações empresariais e soberanas. Essa afirmação diz respeito ao modo como os modelos são produzidos e lançados, e não ao modo como você os opera depois.
O conjunto honesto de comparação para o Gemma são outras famílias de pesos abertos e não os assistentes alojados, porque a decisão de alojar por conta própria vem primeiro e a escolha do modelo depois.
Perante o Gemini, a comparação é na verdade uma questão de modelo de implantação e não de qualidade. O Gemini é servido, administrado e continuamente atualizado pela Google; o Gemma é descarregado, operado por si e fixado numa versão. Se nenhuma restrição obrigar a alojar por conta própria, a via alojada dá menos trabalho. Se essa restrição existir, o Gemini não a satisfaz por preço nenhum.
Perante outras famílias de pesos abertos — os comparadores habituais são as linhas Llama, Qwen e Mistral —, os traços distintivos do Gemma são a amplitude invulgar da sua escada de tamanhos, sobretudo na extremidade pequena, a licença Apache 2.0 na geração atual e a profundidade das variantes oficiais por domínio. Os concorrentes, porém, movem-se depressa, e qualquer afirmação sobre qual o modelo que lidera em qualidade tem vida curta. Avalie com as suas próprias tarefas no momento de decidir, em vez de confiar numa classificação geral, incluindo esta descrição.
Perante não executar nada localmente, a conta é simples: as API alojadas ganham no tempo até ao primeiro resultado e perdem no controlo dos dados, na capacidade offline e no custo marginal à escala. O Gemma compensa o seu custo operacional quando pelo menos um destes três fatores for um requisito firme e não uma preferência.
Dentro da própria família, a alternativa mais subestimada é a geração anterior. O Gemma 3 oferece um tamanho de 270M que o Gemma 4 não tem, e para implantações muito restringidas isso pode ser decisivo, desde que tenha em conta as condições de licença diferentes discutidas acima.
Os pesos descarregam-se gratuitamente e a Google não cobra por token para os executar, porque a capacidade de cálculo é fornecida por si. O Gemma 4 é lançado sob a licença Apache 2.0 aprovada pela OSI. Os custos reais são o equipamento, a eletricidade ou o tempo de instância na nuvem, e o esforço de engenharia de operar um modelo por conta própria. Aqui «gratuito» significa «sem taxa de licença» e não «sem custos».
Para o Gemma 4, a licença Apache 2.0 permite utilização comercial, modificação e redistribuição nos seus termos padrão. Para gerações anteriores, verifique separadamente: o Gemma 2, o Gemma 3n e outros repositórios mais antigos continuam etiquetados com a licença própria da Google chamada gemma em vez da Apache 2.0, e esses termos próprios incluem restrições de utilização que a Apache 2.0 não contempla. Verifique sempre o campo de licença do repositório exato que descarrega.
O Gemini é a família de modelos proprietários da Google, acedida como serviço alojado. O Gemma é a família aberta cujos pesos descarrega e executa por si, construída a partir de investigação relacionada: a página do Gemma 4 descreve-a como criada a partir da investigação e da tecnologia do Gemini 3. Mesma linhagem, modelos de distribuição opostos. Já a Google DeepMind é a organização de investigação que publica ambos.
Depende inteiramente do tamanho que escolher. O E2B e o E4B foram feitos para telemóveis e placas pequenas, incluindo Raspberry Pi e Jetson Nano, e podem funcionar totalmente offline. Os modelos 12B, 26B A4B e 31B visam GPU de consumo. O 26B A4B é um desenho de mistura de especialistas que ativa cerca de 3,8 mil milhões dos seus 25,2 mil milhões de parâmetros na inferência, pelo que corre mais depressa do que o seu tamanho total sugere — muitas vezes a melhor relação capacidade/VRAM da família.
Até 256K tokens no patamar de estação de trabalho, tendo os modelos de periferia uma janela menor de 128K. Note que suportar uma janela e utilizá-la de forma fiável são coisas distintas: na medida de pesquisa em contexto longo da ficha do modelo, o maior modelo atinge 66,4 % enquanto os tamanhos menores caem acentuadamente. Teste o comportamento de pesquisa no seu comprimento de contexto real antes de desenhar em torno dele.
A compreensão de imagem e vídeo está disponível em toda a linha Gemma 4, e a entrada multimodal intercalada é suportada. O áudio é a exceção: a ficha oficial do modelo limita o reconhecimento automático de fala e a tradução de fala para texto traduzido ao E2B, E4B e 12B. Se a entrada de voz for um requisito, os dois maiores modelos ficam de fora.
A Google declara suporte para 140 línguas e enquadra o objetivo como compreender o contexto cultural em vez de fazer tradução literal. Como em qualquer afirmação multilingue ampla, a qualidade varia consideravelmente nesse leque, pelo que deve validar o desempenho nas suas línguas-alvo concretas em vez de presumir uniformidade.
Se alojar por conta própria, os dados de inferência não precisam de sair da sua infraestrutura, o que constitui a propriedade de privacidade mais forte da abordagem de pesos abertos. Mas a Google atribui-lhe explicitamente a responsabilidade a jusante, incentivando os programadores a cumprir a regulamentação de privacidade com técnicas que a preservem. A conformidade em proteção de dados, a política de registos e as salvaguardas de conteúdo cabem-lhe a si conceber e implementar.
Sim: o ajuste fino é uma das cinco capacidades que a Google enumera para a família, e a página oficial de distribuição encaminha para ferramentas de treino que incluem Unsloth, Keras, JAX e GKE. O modelo resultante permanece sob o seu controlo, o que constitui uma razão principal pela qual as equipas escolhem pesos abertos em vez de uma API alojada.
O Gemma 4 é mais forte nos testes de raciocínio e traz a licença Apache 2.0, mais permissiva, sendo por isso a escolha por omissão. O Gemma 3 continua pertinente em duas situações: quando precisa do tamanho de 270M, que não tem equivalente no Gemma 4, e quando as ferramentas existentes já estão fixadas nele. Se optar pelo Gemma 3, lembre-se de que as suas condições de licença diferem das do Gemma 4 e devem ser analisadas separadamente.