Toolso.AI
Toolso.AI
FerramentasCategoriasTendênciaNovidadesPreçosBlog
Toolso.AI
Toolso.AI

💌Subscreva a Ferramentas de IA Semanal

Seleção semanal das últimas e mais populares ferramentas e tendências de IA, entregues na sua caixa de correio Subscrever

Toolso.AI
Toolso.AI

Descubra as melhores ferramentas de IA para impulsionar a sua produtividade

GitHubGitHubTwitterX (Twitter)YouTubeYouTubeTikTokEmail

Categorias Populares

  • Escrita com IA
  • Imagem IA
  • Vídeo IA
  • Programação IA
  • Mais Categorias

Explorar

  • Últimas Ferramentas
  • Ferramentas Populares
  • Mais Ferramentas
  • Submeter Ferramenta
  • Preços

Sobre

  • Sobre Nós
  • Contacto
  • Blog
  • Registo de Alterações

Legal

  • Política de Cookies
  • Política de Privacidade
  • Termos de Serviço
  • Política de Reembolso
© 2026 Toolso.AI Todos os Direitos Reservados
Oferta limitadaOferta por tempo limitadoDestaque promocionalRevisão em 24 h · Sem backlink · 30 dias em destaque$29.90depois $59.90Sobe para $59.90 após 31 de out.Termina em--:--:--Enviar agora
  1. Início
  2. Todas as Ferramentas
  3. Biblioteca de Modelos
  4. Gemma
Prévia da interface do Gemma
Logotipo do Gemma

Gemma

O Gemma é a linha de modelos abertos da Google DeepMind, nascida da mesma investigação que o Gemini mas publicada como pesos descarregáveis que o próprio utilizador executa. O Gemma 4 sai sob licença Apache 2.0 em tamanhos que vão do telemóvel e do Raspberry Pi até uma única GPU de consumo.

Biblioteca de ModelosIA de Código AbertoDesenvolvimento de IA#Código aberto#Ferramentas de desenvolvimento#Google
Experimentar Grátis
Salvos
Visitas
Visualizações
Preço
Freemium
Publicado
14 de ago. de 2026
Domínio
deepmind.google
Avaliação dos utilizadores

Já usou esta ferramenta? Avalie-a

Avaliar esta ferramenta

Informação do Produto Gemma

Experimentar Grátis
Informações da Ferramenta
Salvos
Visitas
Visualizações
Preço
Freemium
Publicado
14 de ago. de 2026
Domínio
deepmind.google
Avaliação dos utilizadores

Já usou esta ferramenta? Avalie-a

Avaliar esta ferramenta

Ferramentas em Destaque

Ferramentas Relacionadas

Experimentar Grátis

O que é o Gemma?

O Gemma é a família de modelos abertos publicada pela Google DeepMind. Na própria página de produto, a linha é apresentada como «Gemma / Os nossos modelos abertos mais capazes» e figura numa coluna de navegação intitulada Open models, deliberadamente separada do Gemini, do Veo e do Imagen, as linhas proprietárias a que se acede através de uma API em vez de as descarregar. Essa colocação é, por si só, o facto mais importante desta ficha, porque define o que realmente se obtém: não uma conta com um contador de utilização, mas pesos de modelo que o próprio utilizador descarrega, aloja e opera.

Vale a pena ser preciso quanto aos nomes, porque é daí que nasce a maior parte da confusão. A Google DeepMind é uma organização de investigação. O Gemini é a sua família de modelos proprietários de referência, servida através dos produtos e das API da própria Google. O Gemma é o irmão aberto, construído, nos termos da página do Gemma 4, como «Os nossos modelos abertos mais inteligentes, criados a partir da investigação e da tecnologia do Gemini 3 para maximizar a inteligência por parâmetro». Os três nomes são confundidos com frequência por diretórios e agregadores de notícias, mas designam coisas distintas: uma organização, um modelo alojado e um modelo descarregável. Esta página trata do terceiro.

A intenção de projeto por detrás do Gemma decorre diretamente dessa abertura. O objetivo declarado da Google é a portabilidade e não a supremacia nas tabelas classificativas: «Os nossos modelos abertos mais avançados ajudam os programadores a criar aplicações de IA que funcionam onde os utilizadores precisam delas, desde servidores na nuvem a portáteis e até telemóveis». Tudo o resto nesta família — a amplitude invulgar de tamanhos de parâmetros, as variantes com mistura de especialistas, os truques de incorporações por camada nos modelos pequenos — decorre dessa frase. O Gemma foi concebido para que a mesma família de modelos possa ser implantada num Jetson Nano e num bastidor de aceleradores, sem mudar de fornecedor nem reescrever a aplicação.

A abertura tem uma segunda consequência prática. Como os pesos são distribuídos em vez de servidos, não há processo de registo, não há contagem de lugares e não há fatura por token emitida pela Google para executar o modelo. O que ocupa esse lugar é uma licença, uma fatura de equipamento e uma carga operacional que lhe pertence por inteiro. Perceber onde cai cada uma dessas três coisas constitui a maior parte do trabalho de avaliar o Gemma.

A Google enquadra igualmente o Gemma como instrumento de implantação responsável e não como artefacto de investigação em bruto. O posicionamento de uma linha associado à coluna Open models diz «Construa aplicações de IA responsáveis à escala», e a família inclui variantes classificadoras de segurança dedicadas a par dos modelos de uso geral. Se esse enquadramento se sustenta na prática depende muito do que se construir em torno do modelo, um ponto que a documentação oficial afirma sem rodeios e ao qual a secção de limitações regressa.

Funcionalidades principais

  • Uma escada graduada de tamanhos de modelo, e não um modelo único. A geração atual, o Gemma 4, é publicada em dois patamares. O patamar de periferia abrange E2B e E4B; o patamar de estação de trabalho abrange 12B, 26B A4B e 31B. Cada patamar visa um ambiente de implantação diferente em vez de oferecer simplesmente «o mesmo, mas maior». Escolher um modelo Gemma é, portanto, uma decisão guiada primeiro pelo equipamento e não pela qualidade.
  • Chamada de funções nativa para fluxos com agentes. A lista oficial de capacidades descreve o objetivo assim: «Construa agentes autónomos que planeiam, navegam por aplicações e concluem tarefas em seu nome, com suporte nativo para chamada de funções». Aqui a chamada de funções é uma capacidade treinada de primeira linha e não uma convenção de prompts acrescentada mais tarde, o que conta quando se integra o modelo em ciclos de utilização de ferramentas.
  • Entrada multimodal abrangendo texto, imagem e, em alguns tamanhos, áudio. A Google descreve a capacidade assim: «Desenvolva aplicações com forte compreensão áudio e visual, para um suporte multimodal rico». A ressalva importante é que o suporte de modalidades não é uniforme em toda a escada: a ficha oficial do modelo assinala o tratamento de áudio como «Áudio (apenas E2B, E4B e 12B) — reconhecimento automático de fala (ASR) e tradução de fala para texto traduzido em várias línguas». Se precisar de entrada de voz, essa restrição elimina desde logo os dois maiores tamanhos.
  • Contexto longo, escalonado consoante o tamanho do modelo. A ficha oficial indica que «o Gemma 4 dispõe de uma janela de contexto até 256K tokens e mantém o suporte multilingue em mais de 140 línguas». O valor de 256K aplica-se ao patamar de estação de trabalho; os modelos de periferia têm uma janela menor. As análises independentes do lançamento registam a mesma divisão — modelos de periferia com 128K tokens e modelos de estação de trabalho com 256K — o que está de acordo com a documentação do fornecedor.
  • Cobertura multilingue declarada em 140 línguas. A página de capacidades apresenta isto como algo mais do que tradução mecânica: «Crie experiências multilingues que vão além da tradução e compreendem o contexto cultural». Tal como em qualquer afirmação de amplitude deste tipo, a qualidade não é uniforme nas 140 línguas; convém tomá-la como ponto de partida para avaliar nas suas línguas-alvo e não como garantia.
  • Uma opção de mistura de especialistas para inferência barata com elevada capacidade. O modelo 26B A4B tem um desenho esparso, e a ficha do modelo explica o benefício diretamente: «Ao ativar apenas um subconjunto de 4B de parâmetros durante a inferência, o modelo de mistura de especialistas corre muito mais depressa do que o seu total de 26B faria supor». Isto oferece um caminho intermédio entre um modelo denso pequeno e um grande e dispendioso.
  • Engenharia de eficiência de parâmetros nos modelos de periferia. Os tamanhos mais pequenos não são meras versões truncadas dos grandes. Como explica a ficha do modelo, «O "E" em E2B e E4B significa parâmetros "efetivos". Os modelos mais pequenos incorporam incorporações por camada (PLE) para maximizar a eficiência de parâmetros em implantações no dispositivo». É essa escolha arquitetónica que permite fazer caber num telemóvel um modelo com uma contagem nominal de mil milhões de parâmetros.
  • O ajuste fino como via suportada de primeira linha. O ajuste fino consta da lista oficial de cinco capacidades, e a página de distribuição encaminha diretamente para as ferramentas de treino. O Gemma foi pensado para ser especializado e não apenas consumido tal como é entregue.
  • Uma família de variantes oficiais criadas para fins específicos. Para além dos modelos gerais, a Google publica derivados dirigidos a domínios particulares — entre eles o DiffusionGemma, o codificador-descodificador T5Gemma, o médico MedGemma e o classificador de segurança ShieldGemma 2, descrito como «um modelo classificador modular para detetar conteúdos que violam as políticas e manter padrões de segurança». São lançamentos oficiais e não bifurcações da comunidade.

Gama de modelos e como escolher

A parte mais difícil de adotar o Gemma não é a instalação, mas escolher o degrau certo da escada. Os tamanhos não são intermutáveis e o fator decisivo é normalmente o equipamento de que já se dispõe e não uma tabela de resultados.

O patamar de periferia (E2B, E4B). A Google posiciona-o explicitamente para dispositivos com recursos limitados: «Suporte de áudio e visão para processamento na periferia em tempo real. Podem funcionar completamente offline com latência quase nula em dispositivos de periferia como telemóveis, Raspberry Pi e Jetson Nano». O funcionamento offline é a propriedade central. Se o seu requisito for que a inferência tenha de funcionar sem rede — dentro de um veículo, numa clínica, no chão de fábrica, numa sala de aula rural —, este patamar é a própria razão para considerar o Gemma. Em troca, aceita uma janela de contexto mais curta e um desempenho nitidamente mais fraco em raciocínio difícil e pesquisa em documentos longos.

O patamar de estação de trabalho (12B, 26B A4B, 31B). Este visa placas gráficas de consumo e não aceleradores de centro de dados. Segundo a Google, oferecem «raciocínio avançado para IDE, assistentes de programação e fluxos com agentes. Estes modelos estão otimizados para GPU de consumo, dando a estudantes, investigadores e programadores a possibilidade de transformar estações de trabalho em servidores de IA locais». O 26B A4B é a opção intermédia interessante: soma 25,2 mil milhões de parâmetros no total, mas ativa cerca de 3,8 mil milhões na inferência, comportando-se em velocidade mais como um modelo pequeno e mantendo mais capacidade. O modelo denso 31B, com 30,7 mil milhões de parâmetros e uma janela de 256K, é o topo da gama.

A geração anterior continua a contar. O Gemma 3 não desapareceu. Mantém-se disponível nos tamanhos 270M, 1B, 4B, 12B e 27B com uma janela de 128K tokens, e a própria descrição da Google — «A janela de contexto de 128K tokens do Gemma 3 permite que as suas aplicações processem e compreendam grandes volumes de informação, viabilizando funcionalidades de IA mais sofisticadas» — continua a descrever um modelo utilizável. O tamanho de 270M, em particular, não tem equivalente no Gemma 4, pelo que para pegadas extremamente reduzidas a geração anterior é por vezes a única opção. Fundamental: as licenças diferem entre gerações, tema da secção seguinte.

Uma heurística prática de seleção: parta do seu alvo de implantação e não de uma tabela classificativa. Se tiver de correr offline num dispositivo portátil, está no patamar de periferia e deve validar a qualidade cedo com as suas tarefas reais. Se tiver uma GPU de consumo moderna e quiser um assistente local de programação ou de agentes, comece nos 12B e suba apenas se a qualidade o exigir. Se precisar de entrada de voz, restrinja-se a E2B, E4B ou 12B. Se procurar a máxima qualidade e tiver o equipamento, o modelo denso 31B é o teto da família.

Licenciamento: o detalhe que a maioria dos resumos erra

Esta secção merece dupla leitura, porque a afirmação mais repetida sobre o Gemma — «o Gemma tem licença Apache 2.0» — só é verdadeira para a geração atual.

O Gemma 4 passou de facto para uma licença de código aberto genuinamente padrão. O blogue de código aberto da Google diz-lo sem rodeios: «Os modelos Gemma 4 são os primeiros do Gemmaverse a serem lançados sob a licença Apache 2.0 aprovada pela OSI». A ficha oficial do modelo confirma-o em formato legível por máquina, com o campo do seu cabeçalho a indicar simplesmente «license: apache-2.0». Para o Gemma 4, portanto, trabalha-se com uma licença permissiva aprovada pela OSI, com as propriedades de redistribuição e uso comercial que os programadores dela esperam.

As gerações anteriores são outra questão. Os metadados dos repositórios na organização oficial google no Hugging Face mostram a divisão com clareza: os repositórios do Gemma 4 têm a etiqueta apache-2.0, ao passo que gemma-2, gemma-3n e gemma-7b continuam etiquetados com a licença própria da Google chamada gemma. Um historial de versões de terceiros regista a mesma transição, notando que a Google lançou o Gemma 4 «sob a licença livre e de código aberto Apache 2.0», enquanto as gerações anteriores foram distribuídas sob termos de utilização Gemma do tipo source-available.

A consequência prática é concreta. Se o seu processo de conformidade aprovou «Gemma» como dependência ao abrigo da Apache 2.0 e os seus engenheiros descarregarem depois um ponto de controlo do Gemma 3 ou do Gemma 2 — algo perfeitamente razoável, já que continuam atuais, mantidos e por vezes mais adequados —, a licença que rege a sua implantação não é a que o seu processo aprovou. Verifique o campo de licença do repositório concreto que descarrega, de cada vez, em vez de confiar em afirmações ao nível da família, incluindo esta.

Quanto à escala de adoção, a Google reporta que «desde o primeiro lançamento, a comunidade descarregou modelos Gemma mais de 400 milhões de vezes e construiu um universo vibrante de mais de 100 000 variantes inspiradoras, conhecido na comunidade como Gemmaverse». São números reportados pelo fornecedor sem auditoria independente; servem como sinal de que o ecossistema não está abandonado e não devem ser lidos como medida de qualidade.

Onde obter e como executar

A distribuição está deliberadamente espalhada pelas ferramentas que os programadores já usam, em vez de canalizada para uma propriedade da Google. A página oficial enumera plataformas e integrações que abrangem Kaggle, Hugging Face, Keras, Ollama, PyTorch, Gemma.cpp, JAX, Google AI Edge, Google Cloud, Android, LM Studio e Unsloth.

Quanto aos pesos em concreto, a página do Gemma 4 separa os destinos de descarga das vias de treino e implantação, encaminhando as descargas para Hugging Face, Ollama, Kaggle, LM Studio e Docker. Na prática, isto significa que a via mais rápida depende inteiramente da sua pilha existente e não de ferramentas específicas do Gemma:

  1. Só experimentar, sem instalar nada. A Google disponibiliza um ponto de entrada alojado para experimentação através do AI Studio, permitindo avaliar a qualidade das saídas antes de comprometer equipamento. É o único passo de todo o percurso que se assemelha a usar uma ferramenta SaaS convencional.
  2. Utilização local em computador. O Ollama ou o LM Studio descarregam uma compilação quantizada e dão-lhe um ponto de acesso local funcional em meia dúzia de comandos. É a via padrão para o posto de um programador individual.
  3. Integração em aplicações. Descarregue a partir do Hugging Face e sirva através da sua pilha de inferência existente, ou use imagens Docker quando quiser contentores reproduzíveis.
  4. Móvel e embebido. O Google AI Edge e a via Android visam a implantação no dispositivo; o Gemma.cpp existe para inferência nativa com dependências mínimas.
  5. Ajuste fino. As vias do lado do treino incluem Unsloth, Keras, JAX e GKE. A Google inclui o ajuste fino entre as cinco capacidades de destaque do modelo, descrevendo o treino com as estruturas e técnicas que preferir.

O apoio assume forma comunitária e documental e não contratual. A página oficial remete para «documentação oficial, guias de início rápido e manuais para criar aplicações com o Gemma» e encaminha as perguntas para um fórum de programadores. Descarregar um modelo aberto não traz consigo acordos de nível de serviço, fila de pedidos de apoio nem gestor de conta — um compromisso óbvio em princípio, mas por vezes surpreendente em produção.

Desempenho: ler com cuidado os números do fornecedor

A Google publica uma tabela comparativa entre o Gemma 4 e o antecessor, e o salto geracional em tarefas com forte carga de raciocínio é grande. Na matemática AIME 2026 sem uso de ferramentas, o modelo 31B é indicado com 89,2 % contra 20,8 % do Gemma 3 27B. Outros números publicados na página do Gemma 4 abrangem classificações de arena, programação competitiva e perguntas de nível de pós-graduação.

A cada número dessa tabela aplicam-se duas cautelas. Primeiro, são resultados reportados pelo fornecedor, produzidos pela parte com interesse no desfecho; constituem uma hipótese de partida razoável e não uma conclusão independente. Segundo, as médias em destaque escondem as quebras dependentes do tamanho que mais importam na implantação. A pesquisa em contexto longo é o exemplo mais nítido: na medida de pesquisa MRCR v2 com oito agulhas a 128K, a ficha do modelo reporta 66,4 % para o maior modelo, com cada tamanho inferior a cair acentuadamente abaixo. Um modelo anunciado como suportando uma janela longa não utiliza necessariamente essa janela de forma fiável, e a distância entre o topo e a base da escada nesta medida é bem maior do que nos testes de conhecimento geral.

Um comentário independente levanta uma preocupação estrutural relacionada: a análise do relatório técnico do Gemma 4 nota que este «atribui o ganho à composição dos dados e depois descreve os seus dados de treino em duas frases». Como o corpus não é descrito em detalhe, terceiros não conseguem avaliar de forma independente a contaminação dos testes nem verificar a cobertura por domínios. Isso não invalida os números publicados, mas significa que o único teste que resolve por completo a questão para o seu caso de uso é aquele que executar por si, com os seus próprios dados reservados.

Casos de utilização

  • Implantações offline e em redes isoladas. A capacidade do patamar de periferia de funcionar «completamente offline com latência quase nula» torna o Gemma adequado a ambientes onde enviar dados para uma API alojada é impossível, seja por conectividade, regulação ou confidencialidade. A própria montra da Google destaca a Lentera a operar um microservidor de IA offline para docentes e alunos, exatamente este padrão.
  • Ferramentas de desenvolvimento com prioridade local. Os assistentes de IDE e auxiliares de programação construídos sobre o patamar de estação de trabalho mantêm o código-fonte na máquina do próprio programador. Para organizações que não podem enviar código proprietário para um ponto de acesso de terceiros, este é muitas vezes o argumento decisivo.
  • Inferência de grande volume com custo controlado. Quando o volume de pedidos é grande e previsível, possuir o equipamento e executar um modelo aberto pode sair mais barato do que a faturação por token. O 26B A4B com mistura de especialistas foi desenhado exatamente para esse terreno intermédio ditado pela economia.
  • Especialização por domínio através de ajuste fino. Como os pesos estão disponíveis, as equipas podem treinar com dados proprietários e manter o modelo resultante em casa. A montra da Google inclui a Crane AI Labs a construir um modelo leve de suaíli sobre o Gemma, ilustração de como adaptar um modelo geral a uma língua ou domínio que a versão base serve pior.
  • Cadeias de segurança e moderação. O ShieldGemma 2 existe como classificador dedicado à deteção de conteúdos que violam as políticas, pelo que a família pode fornecer tanto o componente generativo como parte da camada de salvaguardas.
  • Investigação e ensino. Os pesos abertos tornam o comportamento inspecionável de formas que uma API não permite. Para trabalhos de interpretabilidade, estudos de ablação ou aulas práticas, esse acesso é precisamente o objetivo.
  • Tratamento de dados regulados. Quando regras de residência de dados limitam onde a inferência pode ocorrer, alojar por conta própria um modelo aberto coloca a fronteira da implantação sob o seu controlo e não sob o de um fornecedor.

A quem se destina o Gemma?

O Gemma adequa-se a programadores, investigadores e equipas técnicas que valorizam o controlo da implantação mais do que a comodidade. Se lhe for confortável aprovisionar equipamento, escolher uma pilha de serviço e assumir a superfície operacional, a família oferece-lhe uma escada de tamanhos invulgarmente ampla de um único fornecedor e com ferramentas coerentes.

Adequa-se a organizações com restrições rígidas que as API alojadas não conseguem satisfazer: funcionamento offline, residência de dados, confidencialidade do código, ou uma economia unitária à escala que torna insustentável o preço por token. Nesses casos, a carga operacional não é uma desvantagem mas o preço de um requisito que de outro modo não se consegue cumprir.

Adequa-se a quem tenciona modificar o modelo. Ajustar, quantizar, destilar ou embeber um modelo numa imagem de dispositivo exige pesos. Se o seu plano incluir algum destes verbos, um modelo aberto não é uma opção entre várias: é a única categoria elegível.

Adequa-se mal a utilizadores não técnicos que querem abrir um separador do navegador e obter um resultado. Não há aqui um produto de consumo. Tirando a experimentação via AI Studio, usar o Gemma significa trabalho de engenharia. Quem tiver como necessidade «conversar com um assistente de IA» será mais bem servido por um produto alojado, muito provavelmente o Gemini, e acharia esta ficha um desvio desnecessário.

Adequa-se igualmente mal a equipas que precisam de garantias contratuais de apoio. A documentação e um fórum de programadores constituem todo o modelo de apoio. Se o seu processo de aquisição exigir um fornecedor com acordo de nível de serviço e caminho de escalamento, a descarga de um modelo aberto não o fornece, por maior que seja a empresa que está por trás.

Limitações e cuidados

A própria documentação da Google é invulgarmente direta sobre os limites do modelo, e esses limites autodeclarados são mais úteis do que a maioria das críticas externas por serem atribuíveis.

Não é uma base de conhecimento. A ficha do modelo afirma que os modelos «geram respostas com base na informação que aprenderam dos seus conjuntos de dados de treino, mas não são bases de conhecimento. Podem gerar afirmações factuais incorretas ou desatualizadas». Trate a saída factual como algo que exige verificação, e não como uma consulta.

Os dados de treino têm data de corte. O corte de pré-treino documentado é janeiro de 2025 e abrange documentos web, código, matemática, imagens e áudio. Tudo o que for posterior a essa data fica fora do conhecimento do modelo, pelo que aplicações sensíveis ao tempo precisam de pesquisa externa independentemente do tamanho escolhido.

As tarefas abertas são mais difíceis do que as bem especificadas. Como formula a ficha do modelo, os modelos «têm bom desempenho em tarefas que possam ser enquadradas com instruções e indicações claras. Tarefas abertas ou muito complexas podem ser desafiantes». A estrutura do prompt faz aqui trabalho real.

A capacidade não é uniforme ao longo da escada. Merece ênfase por ser a deceção prática mais frequente. A entrada de áudio existe apenas em E2B, E4B e 12B. A pesquisa em contexto longo degrada-se acentuadamente nos modelos menores. Uma capacidade demonstrada no modelo 31B nunca deve ser presumida transferível para o E2B.

O aconselhamento profissional está fora do âmbito. A própria indicação da Google no rodapé é explícita: «Não confie em LLM para aconselhamento médico, jurídico, financeiro ou outro aconselhamento profissional. Qualquer conteúdo sobre esses temas é fornecido para fins informativos e não substitui o parecer de um profissional qualificado». A existência do MedGemma não altera isto; um modelo afinado para um domínio continua a não ser um clínico.

A transparência sobre os dados de treino é limitada. Como referido, a análise independente critica a brevidade da descrição dos dados de treino. Não é possível auditar por completo o que entrou no modelo.

Herda-se a carga operacional. A ausência de um ponto de acesso alojado significa que disponibilidade, escalabilidade, correções de segurança, planeamento de capacidade de GPU e custos lhe pertencem. As equipas pequenas subestimam frequentemente este ponto no momento da decisão.

Privacidade, segurança e responsabilidade

A postura de privacidade de um modelo aberto difere estruturalmente da de um serviço alojado, e a diferença funciona nos dois sentidos.

Do lado favorável, alojar por conta própria significa que os dados de inferência não precisam de sair da sua infraestrutura. Não há registo de prompts do lado do fornecedor a negociar, porque não há inferência do lado do fornecedor. Para cargas confidenciais, este é o argumento mais forte de toda a categoria.

Do lado do treino, a Google reporta trabalho de filtragem sobre o corpus de pré-treino: «Como parte do esforço para tornar os modelos pré-treinados Gemma seguros e fiáveis, foram usadas técnicas automatizadas para filtrar determinada informação pessoal e outros dados sensíveis dos conjuntos de treino», com filtragem de CSAM aplicada em várias fases. Trata-se de uma declaração do fornecedor sobre um processo e não de uma auditoria independente, devendo ser lida como tal.

O ponto crítico para quem implanta o Gemma é que a Google lhe atribui explicitamente a responsabilidade de segurança a jusante. A ficha do modelo enumera a violação da privacidade entre os riscos identificados e refere que «os programadores são incentivados a cumprir a regulamentação de privacidade recorrendo a técnicas que a preservem». Quanto à segurança dos conteúdos é igualmente direta: «Os programadores são incentivados a agir com prudência e a implementar salvaguardas adequadas de segurança de conteúdos com base nas suas políticas de produto e casos de utilização concretos».

Esta atribuição não é uma formalidade. Com uma API alojada, a camada de moderação do fornecedor coloca-se entre os seus utilizadores e o modelo em bruto, queira ou não. Quando descarrega pesos, essa camada não vem com eles. Salvaguardas, monitorização de abusos, política de registos, controlo de idade e conformidade regulamentar passam a ser artefactos que você constrói. O ShieldGemma 2 ajuda em parte disto, mas integrá-lo é trabalho seu.

Do lado da infraestrutura, a Google declara que «os modelos Gemma 4 são submetidos aos mesmos rigorosos protocolos de segurança de infraestrutura que os nossos modelos proprietários», posicionando a família como base fiável para implantações empresariais e soberanas. Essa afirmação diz respeito ao modo como os modelos são produzidos e lançados, e não ao modo como você os opera depois.

Alternativas e comparação

O conjunto honesto de comparação para o Gemma são outras famílias de pesos abertos e não os assistentes alojados, porque a decisão de alojar por conta própria vem primeiro e a escolha do modelo depois.

Perante o Gemini, a comparação é na verdade uma questão de modelo de implantação e não de qualidade. O Gemini é servido, administrado e continuamente atualizado pela Google; o Gemma é descarregado, operado por si e fixado numa versão. Se nenhuma restrição obrigar a alojar por conta própria, a via alojada dá menos trabalho. Se essa restrição existir, o Gemini não a satisfaz por preço nenhum.

Perante outras famílias de pesos abertos — os comparadores habituais são as linhas Llama, Qwen e Mistral —, os traços distintivos do Gemma são a amplitude invulgar da sua escada de tamanhos, sobretudo na extremidade pequena, a licença Apache 2.0 na geração atual e a profundidade das variantes oficiais por domínio. Os concorrentes, porém, movem-se depressa, e qualquer afirmação sobre qual o modelo que lidera em qualidade tem vida curta. Avalie com as suas próprias tarefas no momento de decidir, em vez de confiar numa classificação geral, incluindo esta descrição.

Perante não executar nada localmente, a conta é simples: as API alojadas ganham no tempo até ao primeiro resultado e perdem no controlo dos dados, na capacidade offline e no custo marginal à escala. O Gemma compensa o seu custo operacional quando pelo menos um destes três fatores for um requisito firme e não uma preferência.

Dentro da própria família, a alternativa mais subestimada é a geração anterior. O Gemma 3 oferece um tamanho de 270M que o Gemma 4 não tem, e para implantações muito restringidas isso pode ser decisivo, desde que tenha em conta as condições de licença diferentes discutidas acima.

Perguntas frequentes(FAQ)

Q1. O Gemma é gratuito?

Os pesos descarregam-se gratuitamente e a Google não cobra por token para os executar, porque a capacidade de cálculo é fornecida por si. O Gemma 4 é lançado sob a licença Apache 2.0 aprovada pela OSI. Os custos reais são o equipamento, a eletricidade ou o tempo de instância na nuvem, e o esforço de engenharia de operar um modelo por conta própria. Aqui «gratuito» significa «sem taxa de licença» e não «sem custos».

Q2. Posso usar o Gemma para fins comerciais?

Para o Gemma 4, a licença Apache 2.0 permite utilização comercial, modificação e redistribuição nos seus termos padrão. Para gerações anteriores, verifique separadamente: o Gemma 2, o Gemma 3n e outros repositórios mais antigos continuam etiquetados com a licença própria da Google chamada gemma em vez da Apache 2.0, e esses termos próprios incluem restrições de utilização que a Apache 2.0 não contempla. Verifique sempre o campo de licença do repositório exato que descarrega.

Q3. Qual é a diferença entre o Gemma e o Gemini?

O Gemini é a família de modelos proprietários da Google, acedida como serviço alojado. O Gemma é a família aberta cujos pesos descarrega e executa por si, construída a partir de investigação relacionada: a página do Gemma 4 descreve-a como criada a partir da investigação e da tecnologia do Gemini 3. Mesma linhagem, modelos de distribuição opostos. Já a Google DeepMind é a organização de investigação que publica ambos.

Q4. De que equipamento preciso?

Depende inteiramente do tamanho que escolher. O E2B e o E4B foram feitos para telemóveis e placas pequenas, incluindo Raspberry Pi e Jetson Nano, e podem funcionar totalmente offline. Os modelos 12B, 26B A4B e 31B visam GPU de consumo. O 26B A4B é um desenho de mistura de especialistas que ativa cerca de 3,8 mil milhões dos seus 25,2 mil milhões de parâmetros na inferência, pelo que corre mais depressa do que o seu tamanho total sugere — muitas vezes a melhor relação capacidade/VRAM da família.

Q5. Que comprimento de contexto suporta o Gemma?

Até 256K tokens no patamar de estação de trabalho, tendo os modelos de periferia uma janela menor de 128K. Note que suportar uma janela e utilizá-la de forma fiável são coisas distintas: na medida de pesquisa em contexto longo da ficha do modelo, o maior modelo atinge 66,4 % enquanto os tamanhos menores caem acentuadamente. Teste o comportamento de pesquisa no seu comprimento de contexto real antes de desenhar em torno dele.

Q6. O Gemma consegue processar imagens e áudio?

A compreensão de imagem e vídeo está disponível em toda a linha Gemma 4, e a entrada multimodal intercalada é suportada. O áudio é a exceção: a ficha oficial do modelo limita o reconhecimento automático de fala e a tradução de fala para texto traduzido ao E2B, E4B e 12B. Se a entrada de voz for um requisito, os dois maiores modelos ficam de fora.

Q7. Quantas línguas suporta o Gemma?

A Google declara suporte para 140 línguas e enquadra o objetivo como compreender o contexto cultural em vez de fazer tradução literal. Como em qualquer afirmação multilingue ampla, a qualidade varia consideravelmente nesse leque, pelo que deve validar o desempenho nas suas línguas-alvo concretas em vez de presumir uniformidade.

Q8. Os meus dados ficam privados se usar o Gemma?

Se alojar por conta própria, os dados de inferência não precisam de sair da sua infraestrutura, o que constitui a propriedade de privacidade mais forte da abordagem de pesos abertos. Mas a Google atribui-lhe explicitamente a responsabilidade a jusante, incentivando os programadores a cumprir a regulamentação de privacidade com técnicas que a preservem. A conformidade em proteção de dados, a política de registos e as salvaguardas de conteúdo cabem-lhe a si conceber e implementar.

Q9. Posso afinar o Gemma com os meus próprios dados?

Sim: o ajuste fino é uma das cinco capacidades que a Google enumera para a família, e a página oficial de distribuição encaminha para ferramentas de treino que incluem Unsloth, Keras, JAX e GKE. O modelo resultante permanece sob o seu controlo, o que constitui uma razão principal pela qual as equipas escolhem pesos abertos em vez de uma API alojada.

Q10. Devo usar o Gemma 4 ou o Gemma 3?

O Gemma 4 é mais forte nos testes de raciocínio e traz a licença Apache 2.0, mais permissiva, sendo por isso a escolha por omissão. O Gemma 3 continua pertinente em duas situações: quando precisa do tamanho de 270M, que não tem equivalente no Gemma 4, e quando as ferramentas existentes já estão fixadas nele. Se optar pelo Gemma 3, lembre-se de que as suas condições de licença diferem das do Gemma 4 e devem ser analisadas separadamente.

Conhece uma Ferramenta Semelhante?
Se conhece outras ótimas ferramentas de IA, sinta-se à vontade para as submeter-nos