Toolso.AI
Toolso.AI
HerramientasCategoríasTendenciasNovedadesPreciosBlog
Toolso.AI
Toolso.AI

💌Suscríbete a AI Tools Weekly

Selección semanal curada de las últimas y más populares herramientas de IA y tendencias, entregadas en tu bandeja de entrada Suscribirse

Toolso.AI
Toolso.AI

Descubre las mejores herramientas de IA para aumentar tu productividad

GitHubGitHubTwitterX (Twitter)YouTubeYouTubeTikTokEmail

Categorías populares

  • Escritura con IA
  • Imágenes con IA
  • Video con IA
  • Programación con IA
  • Más categorías

Explorar

  • Herramientas más recientes
  • Herramientas populares
  • Más herramientas
  • Enviar herramienta
  • Precios

Acerca de

  • Acerca de nosotros
  • Contacto
  • Blog
  • Registro de cambios

Legal

  • Política de cookies
  • Política de privacidad
  • Términos de servicio
  • Política de reembolso
© 2026 Toolso.AI Todos los derechos reservados
Oferta limitadaOferta por tiempo limitadoListado destacadoRevisión en 24 h · Sin backlink · 30 días destacado$29.90luego $59.90Sube a $59.90 después del 31 octTermina en--:--:--Enviar ahora
  1. Inicio
  2. Todas las herramientas
  3. Biblioteca de Modelos
  4. Gemma
Vista previa de la interfaz de Gemma
Logotipo de Gemma

Gemma

Gemma es la línea de modelos abiertos de Google DeepMind, nacida de la misma investigación que Gemini pero publicada como pesos descargables que tú mismo ejecutas. Gemma 4 sale bajo licencia Apache 2.0 en tamaños que van del teléfono y la Raspberry Pi a una sola GPU de consumo.

Biblioteca de ModelosIA de Código AbiertoDesarrollo de IA#Código abierto#Herramientas de desarrollo#Google
Probar gratis
Guardados
Visitas
Vistas
Precio
Freemium
Publicado
14 ago 2026
Dominio
deepmind.google
Valoración de usuarios

¿Has usado esta herramienta? Valórala

Valorar esta herramienta

Información del producto Gemma

Probar gratis
Información de la herramienta
Guardados
Visitas
Vistas
Precio
Freemium
Publicado
14 ago 2026
Dominio
deepmind.google
Valoración de usuarios

¿Has usado esta herramienta? Valórala

Valorar esta herramienta

Herramientas destacadas

Herramientas relacionadas

Probar gratis

¿Qué es Gemma?

Gemma es la familia de modelos abiertos que publica Google DeepMind. En su propia página de producto, la línea se presenta como «Gemma / Nuestros modelos abiertos más capaces», y aparece en una columna de navegación titulada Open models, deliberadamente separada de Gemini, Veo e Imagen, las líneas propietarias a las que se accede mediante una API en lugar de descargarlas. Esa ubicación es, por sí sola, el dato más importante de esta ficha, porque define lo que realmente se obtiene: no una cuenta con un contador de uso, sino pesos de modelo que uno mismo descarga, aloja y opera.

Conviene ser preciso con los nombres, porque de ahí nace la mayor parte de la confusión. Google DeepMind es una organización de investigación. Gemini es su familia insignia de modelos propietarios, servida a través de los productos y las API de Google. Gemma es el hermano abierto, construido, según los términos de la página de Gemma 4, como «Nuestros modelos abiertos más inteligentes, creados a partir de la investigación y la tecnología de Gemini 3 para maximizar la inteligencia por parámetro». Los tres nombres se confunden con frecuencia en directorios y agregadores de noticias, pero designan cosas distintas: una organización, un modelo alojado y un modelo descargable. Esta página trata del tercero.

La intención de diseño detrás de Gemma se deriva directamente de esa apertura. El objetivo declarado de Google es la portabilidad y no la supremacía en las clasificaciones: «Nuestros modelos abiertos más avanzados ayudan a los desarrolladores a crear aplicaciones de IA que funcionan allí donde los usuarios las necesiten, desde servidores en la nube hasta portátiles e incluso teléfonos». Todo lo demás en esta familia —la amplitud inusual de tamaños de parámetros, las variantes de mezcla de expertos, los trucos de incrustaciones por capa en los modelos pequeños— se deriva de esa frase. Gemma está diseñada para que la misma familia de modelos pueda desplegarse en una Jetson Nano y en un bastidor de aceleradores sin cambiar de proveedor ni reescribir la aplicación.

La apertura tiene una segunda consecuencia práctica. Como los pesos se distribuyen en lugar de servirse, no hay proceso de registro, ni recuento de licencias por usuario, ni factura por token emitida por Google por ejecutar el modelo. Lo que ocupa su lugar es una licencia, una factura de hardware y una carga operativa que le pertenece por completo. Entender dónde recae cada una de esas tres cosas constituye la mayor parte del trabajo de evaluar Gemma.

Google también presenta Gemma como un instrumento de despliegue responsable y no como un artefacto de investigación en bruto. El posicionamiento de una línea asociado a la columna Open models dice «Cree aplicaciones de IA responsables a escala», y la familia incluye variantes clasificadoras de seguridad específicas junto a los modelos de propósito general. Que ese encuadre se sostenga en la práctica depende en gran medida de lo que se construya alrededor del modelo, un punto que la documentación oficial expresa sin rodeos y sobre el que vuelve la sección de limitaciones.

Funciones principales

  • Una escalera graduada de tamaños de modelo, no un modelo único. La generación actual, Gemma 4, se publica en dos niveles. El nivel de borde abarca E2B y E4B; el nivel de estación de trabajo abarca 12B, 26B A4B y 31B. Cada nivel apunta a un entorno de despliegue distinto en lugar de ofrecer simplemente «lo mismo pero más grande». Elegir un modelo Gemma es, por tanto, una decisión guiada primero por el hardware y no por la calidad.
  • Llamada a funciones nativa para flujos con agentes. La lista oficial de capacidades describe el objetivo así: «Cree agentes autónomos que planifican, navegan por aplicaciones y completan tareas en su nombre, con soporte nativo para la llamada a funciones». Aquí la llamada a funciones es una capacidad entrenada de primer nivel y no una convención de prompts añadida después, lo cual importa cuando se integra el modelo en bucles de uso de herramientas.
  • Entrada multimodal que abarca texto, imagen y, en algunos tamaños, audio. Google describe la capacidad así: «Desarrolle aplicaciones con una sólida comprensión auditiva y visual, para un rico soporte multimodal». La salvedad importante es que el soporte de modalidades no es uniforme en toda la escalera: la ficha oficial del modelo señala el tratamiento de audio como «Audio (solo E2B, E4B y 12B): reconocimiento automático del habla (ASR) y traducción de voz a texto traducido en varios idiomas». Si necesita entrada de voz, esa restricción elimina de entrada los dos tamaños mayores.
  • Contexto largo, escalonado según el tamaño del modelo. La ficha oficial indica que «Gemma 4 cuenta con una ventana de contexto de hasta 256K tokens y mantiene el soporte multilingüe en más de 140 idiomas». La cifra de 256K se aplica al nivel de estación de trabajo; los modelos de borde llevan una ventana menor. Los análisis independientes del lanzamiento registran la misma división —modelos de borde con 128K tokens y modelos de estación de trabajo con 256K—, lo que concuerda con la documentación del proveedor.
  • Cobertura multilingüe declarada en 140 idiomas. La página de capacidades lo plantea como algo más que traducción mecánica: «Cree experiencias multilingües que van más allá de la traducción y entienden el contexto cultural». Como en cualquier afirmación de amplitud de este tipo, la calidad no es uniforme en los 140 idiomas; conviene tomarlo como punto de partida para evaluar en sus idiomas objetivo y no como una garantía.
  • Una opción de mezcla de expertos para inferencia barata con alta capacidad. El modelo 26B A4B es un diseño disperso, y la ficha del modelo explica el beneficio directamente: «Al activar solo un subconjunto de 4B de parámetros durante la inferencia, el modelo de mezcla de expertos se ejecuta mucho más rápido de lo que sugeriría su total de 26B». Esto ofrece una vía intermedia entre un modelo denso pequeño y uno grande y costoso.
  • Ingeniería de eficiencia de parámetros en los modelos de borde. Los tamaños más pequeños no son simples versiones recortadas de los grandes. Como explica la ficha del modelo, «La "E" de E2B y E4B significa parámetros "efectivos". Los modelos más pequeños incorporan incrustaciones por capa (PLE) para maximizar la eficiencia de parámetros en despliegues en el dispositivo». Esa decisión arquitectónica es la razón por la que un modelo con miles de millones de parámetros nominales puede caber en un teléfono.
  • El ajuste fino como vía admitida de primer nivel. El ajuste fino figura en la lista oficial de cinco capacidades, y la página de distribución enlaza directamente con el instrumental de entrenamiento. Gemma está pensada para especializarse, no solo para consumirse tal como se entrega.
  • Una familia de variantes oficiales creadas para fines concretos. Más allá de los modelos generales, Google publica derivados dirigidos a dominios particulares, entre ellos DiffusionGemma, el codificador-decodificador T5Gemma, el médico MedGemma y el clasificador de seguridad ShieldGemma 2, descrito como «un modelo clasificador modular para detectar contenido que infringe las políticas y mantener los estándares de seguridad». Son lanzamientos oficiales y no bifurcaciones de la comunidad.

Gama de modelos y cómo elegir

La parte más difícil de adoptar Gemma no es la instalación, sino elegir el peldaño correcto de la escalera. Los tamaños no son intercambiables y el factor decisivo suele ser el hardware del que ya se dispone y no una tabla de resultados.

El nivel de borde (E2B, E4B). Google lo posiciona explícitamente para dispositivos con recursos limitados: «Soporte de audio y visión para procesamiento en el borde en tiempo real. Pueden funcionar completamente sin conexión y con una latencia casi nula en dispositivos de borde como teléfonos, Raspberry Pi y Jetson Nano». El funcionamiento sin conexión es la propiedad central. Si su requisito es que la inferencia funcione sin red —en un vehículo, en una clínica, en una planta de producción, en un aula rural—, este nivel es la razón misma para considerar Gemma. A cambio, se acepta una ventana de contexto más corta y un rendimiento notablemente inferior en razonamiento difícil y búsqueda en documentos extensos.

El nivel de estación de trabajo (12B, 26B A4B, 31B). Este nivel apunta a tarjetas gráficas de consumo y no a aceleradores de centro de datos. Según Google, ofrecen «razonamiento avanzado para IDE, asistentes de programación y flujos con agentes. Estos modelos están optimizados para GPU de consumo, lo que da a estudiantes, investigadores y desarrolladores la capacidad de convertir estaciones de trabajo en servidores de IA locales». El 26B A4B es la opción intermedia interesante: suma 25 200 millones de parámetros en total pero activa unos 3 800 millones durante la inferencia, de modo que se comporta más como un modelo pequeño en velocidad conservando más capacidad. El modelo denso 31B, con 30 700 millones de parámetros y una ventana de 256K, es el techo de la gama.

La generación anterior sigue importando. Gemma 3 no ha desaparecido. Sigue disponible en tamaños de 270M, 1B, 4B, 12B y 27B con una ventana de 128K tokens, y la propia descripción de Google —«La ventana de contexto de 128K tokens de Gemma 3 permite a sus aplicaciones procesar y comprender grandes cantidades de información, habilitando funciones de IA más sofisticadas»— sigue describiendo un modelo utilizable. El tamaño de 270M en particular no tiene equivalente en Gemma 4, por lo que para huellas extremadamente reducidas la generación anterior es a veces la única opción. Crucialmente, las licencias difieren entre generaciones, algo que cubre la siguiente sección.

Una regla práctica de selección: parta de su objetivo de despliegue, no de una clasificación. Si debe funcionar sin conexión en un dispositivo de mano, está en el nivel de borde y debería validar la calidad pronto con sus tareas reales. Si dispone de una GPU de consumo moderna y quiere un asistente local de programación o de agentes, empiece por 12B y suba solo si la calidad lo exige. Si necesita entrada de voz, limítese a E2B, E4B o 12B. Si busca la máxima calidad y tiene el hardware, el modelo denso 31B es el techo de la familia.

Licencias: el detalle que la mayoría de los resúmenes yerra

Esta sección merece una segunda lectura, porque la afirmación más repetida sobre Gemma —«Gemma tiene licencia Apache 2.0»— solo es cierta para la generación actual.

Gemma 4 sí pasó a una licencia de código abierto genuinamente estándar. El blog de código abierto de Google lo dice sin ambages: «Los modelos Gemma 4 son los primeros del Gemmaverse que se publican bajo la licencia Apache 2.0 aprobada por la OSI». La ficha oficial del modelo lo confirma en formato legible por máquina, con el campo de su encabezado indicando simplemente «license: apache-2.0». Para Gemma 4, por tanto, se trabaja con una licencia permisiva aprobada por la OSI, con las propiedades de redistribución y uso comercial que los desarrolladores esperan de ella.

Las generaciones anteriores son otra cuestión. Los metadatos de los repositorios en la organización oficial de Google en Hugging Face muestran la división con claridad: los repositorios de Gemma 4 llevan la etiqueta apache-2.0, mientras que gemma-2, gemma-3n y gemma-7b siguen etiquetados con la licencia propia de Google denominada gemma. Un historial de versiones de terceros registra la misma transición y señala que Google publicó Gemma 4 «bajo la licencia libre y de código abierto Apache 2.0», mientras que las generaciones anteriores se distribuyeron con condiciones de uso Gemma de tipo source-available.

La consecuencia práctica es concreta. Si su proceso de cumplimiento aprobó «Gemma» como dependencia bajo Apache 2.0 y sus ingenieros descargan después un punto de control de Gemma 3 o Gemma 2 —algo perfectamente razonable, ya que siguen vigentes, mantenidos y a veces son la mejor opción—, la licencia que rige su despliegue no es la que aprobó su proceso. Compruebe el campo de licencia del repositorio concreto que descarga, cada vez, en lugar de fiarse de afirmaciones a nivel de familia, incluida esta.

Sobre la escala de adopción, Google informa de que «desde el primer lanzamiento, la comunidad ha descargado los modelos Gemma más de 400 millones de veces y ha construido un universo vibrante de más de 100 000 variantes inspiradoras, conocido en la comunidad como el Gemmaverse». Son cifras comunicadas por el proveedor sin auditoría independiente; sirven como señal de que el ecosistema no está abandonado y no deben leerse como una medida de calidad.

Dónde obtenerla y cómo ejecutarla

La distribución está deliberadamente repartida entre las herramientas que los desarrolladores ya usan, en lugar de canalizarse hacia una propiedad de Google. La página oficial enumera plataformas e integraciones que abarcan Kaggle, Hugging Face, Keras, Ollama, PyTorch, Gemma.cpp, JAX, Google AI Edge, Google Cloud, Android, LM Studio y Unsloth.

En cuanto a los pesos en concreto, la página de Gemma 4 separa los destinos de descarga de las vías de entrenamiento y despliegue, dirigiendo las descargas a Hugging Face, Ollama, Kaggle, LM Studio y Docker. En la práctica, esto significa que la vía más rápida depende por completo de su pila existente y no de un instrumental específico de Gemma:

  1. Solo probarla, sin instalar nada. Google ofrece un punto de entrada de prueba alojado a través de AI Studio, de modo que pueda juzgar la calidad de las salidas antes de comprometer hardware. Es el único paso de todo el recorrido que se parece a usar una herramienta SaaS convencional.
  2. Uso local en escritorio. Ollama o LM Studio descargan una compilación cuantizada y le dan un punto de acceso local funcional en un par de órdenes. Es la vía estándar para el puesto de un único desarrollador.
  3. Integración en aplicaciones. Descargue desde Hugging Face y sirva a través de su pila de inferencia existente, o use imágenes de Docker cuando quiera contenedores reproducibles.
  4. Móvil y embebido. Google AI Edge y la vía de Android apuntan al despliegue en el dispositivo; Gemma.cpp existe para inferencia nativa con dependencias mínimas.
  5. Ajuste fino. Las vías del lado de entrenamiento incluyen Unsloth, Keras, JAX y GKE. Google incluye el ajuste fino entre las cinco capacidades destacadas del modelo, describiendo el entrenamiento con los marcos y técnicas que usted prefiera.

El soporte tiene forma comunitaria y documental, no contractual. La página oficial remite a «documentación oficial, guías de inicio rápido y manuales para crear aplicaciones con Gemma» y dirige las preguntas a un foro de desarrolladores. Descargar un modelo abierto no trae consigo acuerdos de nivel de servicio, ni cola de tickets, ni gestor de cuenta: un compromiso obvio en principio pero que en producción a veces sorprende.

Rendimiento: leer con cuidado las cifras del proveedor

Google publica una tabla comparativa que enfrenta Gemma 4 con su predecesora, y el salto generacional en tareas con mucha carga de razonamiento es grande. En matemáticas AIME 2026 sin uso de herramientas, el modelo 31B se declara en 89,2 % frente al 20,8 % de Gemma 3 27B. Otras cifras publicadas en la página de Gemma 4 cubren valoraciones de arena, programación competitiva y preguntas de nivel de posgrado.

A cada cifra de esa tabla se le aplican dos advertencias. Primero, son resultados comunicados por el proveedor, producidos por la parte con interés en el desenlace; constituyen una hipótesis de partida razonable, no un hallazgo independiente. Segundo, los promedios destacados ocultan los desplomes dependientes del tamaño que más importan en el despliegue. La búsqueda en contexto largo es el ejemplo más claro: en la medida de búsqueda MRCR v2 con ocho agujas a 128K, la ficha del modelo informa de un 66,4 % para el modelo mayor, con cada tamaño inferior cayendo bruscamente por debajo. Un modelo anunciado como compatible con una ventana larga no necesariamente aprovecha esa ventana de forma fiable, y la distancia entre la cima y la base de la escalera en esta medida es mucho mayor que en las pruebas de conocimiento general.

Un comentario independiente plantea una preocupación estructural relacionada: el análisis del informe técnico de Gemma 4 señala que «atribuye la mejora a la composición de los datos y luego describe sus datos de entrenamiento en dos frases». Como el corpus no se describe en detalle, terceros no pueden evaluar de forma independiente la contaminación de las pruebas ni verificar la cobertura por dominios. Eso no invalida las cifras publicadas, pero significa que la única prueba que zanja por completo la cuestión para su caso de uso es la que ejecute usted mismo con sus propios datos reservados.

Casos de uso

  • Despliegues sin conexión y en redes aisladas. La capacidad del nivel de borde de funcionar «completamente sin conexión y con una latencia casi nula» hace de Gemma una opción adecuada para entornos donde enviar datos a una API alojada es imposible, sea por conectividad, por regulación o por confidencialidad. El propio escaparate de Google destaca a Lentera operando un microservidor de IA sin conexión para docentes y estudiantes, exactamente este patrón.
  • Herramientas de desarrollo con prioridad local. Los asistentes de IDE y los ayudantes de programación construidos sobre el nivel de estación de trabajo mantienen el código fuente en la máquina del propio desarrollador. Para organizaciones que no pueden enviar código propietario a un punto de acceso de terceros, este suele ser el argumento decisivo.
  • Inferencia de alto volumen con coste controlado. Cuando el volumen de peticiones es grande y predecible, poseer el hardware y ejecutar un modelo abierto puede salir más barato que la facturación por token. El 26B A4B de mezcla de expertos está diseñado exactamente para ese terreno intermedio guiado por la economía.
  • Especialización por dominio mediante ajuste fino. Como los pesos están disponibles, los equipos pueden entrenar con datos propietarios y conservar el modelo resultante de forma privada. El escaparate de Google incluye a Crane AI Labs construyendo un modelo ligero de suajili sobre Gemma, una ilustración de cómo adaptar un modelo general a un idioma o dominio que la versión base atiende peor.
  • Cadenas de seguridad y moderación. ShieldGemma 2 existe como clasificador dedicado a detectar contenido que infringe las políticas, de modo que la familia puede aportar tanto el componente generativo como parte de la capa de salvaguardas.
  • Investigación y docencia. Los pesos abiertos hacen inspeccionable el comportamiento de formas que una API no permite. Para trabajos de interpretabilidad, estudios de ablación o prácticas docentes, ese acceso es justamente el objetivo.
  • Tratamiento de datos regulados. Cuando las normas de residencia de datos limitan dónde puede producirse la inferencia, autoalojar un modelo abierto sitúa la frontera del despliegue bajo su control y no bajo el de un proveedor.

¿Para quién es Gemma?

Gemma encaja con desarrolladores, investigadores y equipos técnicos que valoran el control del despliegue por encima de la comodidad. Si le resulta cómodo aprovisionar hardware, elegir una pila de servicio y asumir la superficie operativa, la familia le ofrece una escalera de tamaños inusualmente amplia de un único proveedor y con instrumental coherente.

Encaja con organizaciones sujetas a restricciones duras que las API alojadas no pueden satisfacer: funcionamiento sin conexión, residencia de datos, confidencialidad del código o una economía unitaria a escala que hace insostenible el precio por token. En esos casos, la carga operativa no es un inconveniente sino el precio de un requisito que no puede cubrirse de otro modo.

Encaja con quienes pretenden modificar el modelo. Ajustar, cuantizar, destilar o incrustar un modelo en la imagen de un dispositivo requiere pesos. Si su plan incluye alguno de esos verbos, un modelo abierto no es una opción entre varias: es la única categoría que cumple.

Encaja mal con usuarios no técnicos que quieren abrir una pestaña del navegador y obtener un resultado. Aquí no hay un producto de consumo. Salvo la prueba mediante AI Studio, usar Gemma significa trabajo de ingeniería. Quien necesite «conversar con un asistente de IA» estará mejor servido por un producto alojado, muy probablemente Gemini, y encontraría esta ficha un rodeo innecesario.

Encaja también mal con equipos que necesitan garantías contractuales de soporte. La documentación y un foro de desarrolladores constituyen todo el modelo de soporte. Si su proceso de compras exige un proveedor con acuerdo de nivel de servicio y ruta de escalado, la descarga de un modelo abierto no lo proporciona, por grande que sea la empresa que hay detrás.

Limitaciones y advertencias

La propia documentación de Google es inusualmente directa sobre los límites del modelo, y esos límites autodeclarados resultan más útiles que la mayoría de las críticas externas porque son atribuibles.

No es una base de conocimiento. La ficha del modelo señala que los modelos «generan respuestas a partir de la información que aprendieron de sus conjuntos de datos de entrenamiento, pero no son bases de conocimiento. Pueden generar afirmaciones fácticas incorrectas o desactualizadas». Trate la salida fáctica como algo que requiere verificación, no como una consulta.

Los datos de entrenamiento tienen fecha de corte. El corte de preentrenamiento documentado es enero de 2025 y abarca documentos web, código, matemáticas, imágenes y audio. Todo lo posterior a esa fecha queda fuera del conocimiento del modelo, por lo que las aplicaciones sensibles al tiempo necesitan búsqueda externa con independencia del tamaño elegido.

Las tareas abiertas son más difíciles que las bien especificadas. Como lo formula la ficha del modelo, los modelos «funcionan bien en tareas que pueden enmarcarse con indicaciones e instrucciones claras. Las tareas abiertas o muy complejas pueden resultar difíciles». La estructura del prompt hace aquí un trabajo real.

La capacidad no es uniforme a lo largo de la escalera. Merece énfasis porque es la decepción práctica más frecuente. La entrada de audio existe solo en E2B, E4B y 12B. La búsqueda en contexto largo se degrada acusadamente en los modelos menores. Una capacidad demostrada en el modelo 31B nunca debe suponerse transferible a E2B.

El asesoramiento profesional queda fuera del alcance. La propia indicación de Google en el pie de página es explícita: «No confíe en los LLM para obtener asesoramiento médico, jurídico, financiero ni de otro tipo profesional. Cualquier contenido sobre esos temas se ofrece con fines informativos y no sustituye el consejo de un profesional cualificado». La existencia de MedGemma no cambia esto; un modelo ajustado a un dominio sigue sin ser un clínico.

La transparencia sobre los datos de entrenamiento es limitada. Como se ha señalado, el análisis independiente critica la brevedad de la descripción de los datos de entrenamiento. No es posible auditar por completo qué entró en el modelo.

Se hereda la carga operativa. No tener un punto de acceso alojado significa que la disponibilidad, el escalado, los parches de seguridad, la planificación de capacidad de GPU y los costes son suyos. Los equipos pequeños subestiman este punto con frecuencia en el momento de decidir.

Privacidad, seguridad y responsabilidad

La posición de privacidad de un modelo abierto difiere estructuralmente de la de un servicio alojado, y la diferencia opera en ambos sentidos.

En el lado favorable, autoalojar significa que los datos de inferencia no necesitan salir de su infraestructura. No hay registro de prompts del lado del proveedor que negociar, porque no hay inferencia del lado del proveedor. Para cargas confidenciales, este es el argumento más sólido que posee toda la categoría.

Del lado del entrenamiento, Google informa de un trabajo de filtrado sobre el corpus de preentrenamiento: «Como parte del esfuerzo por hacer que los modelos preentrenados Gemma sean seguros y fiables, se emplearon técnicas automatizadas para filtrar cierta información personal y otros datos sensibles de los conjuntos de entrenamiento», con filtrado de CSAM aplicado en varias etapas. Se trata de una declaración del proveedor sobre un proceso, no de una auditoría independiente, y así debe leerse.

El punto crítico para cualquiera que despliegue Gemma es que Google le asigna explícitamente la responsabilidad de seguridad aguas abajo. La ficha del modelo enumera la vulneración de la privacidad entre los riesgos identificados e indica que «se anima a los desarrolladores a cumplir la normativa de privacidad mediante técnicas que la preserven». Sobre seguridad de contenidos es igual de directa: «Se anima a los desarrolladores a actuar con cautela y a implementar las salvaguardas de seguridad de contenidos adecuadas según sus políticas de producto y sus casos de uso concretos».

Esa asignación no es una formalidad. Con una API alojada, la capa de moderación del proveedor se interpone entre sus usuarios y el modelo en bruto, lo quiera usted o no. Cuando descarga pesos, esa capa no viene con ellos. Salvaguardas, vigilancia de abusos, política de registro, control de edad y cumplimiento normativo pasan a ser elementos que usted construye. ShieldGemma 2 ayuda con una parte de esto, pero integrarlo es trabajo suyo.

Del lado de la infraestructura, Google afirma que «los modelos Gemma 4 se someten a los mismos rigurosos protocolos de seguridad de infraestructura que nuestros modelos propietarios», posicionando la familia como base fiable para despliegues empresariales y soberanos. Esa afirmación se refiere a cómo se producen y publican los modelos, no a cómo los opera usted después.

Alternativas y comparación

El conjunto honesto de comparación para Gemma son otras familias de pesos abiertos y no los asistentes alojados, porque la decisión de autoalojar viene primero y la elección del modelo, después.

Frente a Gemini, la comparación es en realidad una cuestión de modelo de despliegue y no de calidad. Gemini lo sirve, administra y actualiza continuamente Google; Gemma la descarga usted, la opera por su cuenta y fija la versión. Si ninguna restricción obliga a autoalojar, la vía alojada supone menos trabajo. Si esa restricción existe, Gemini no puede satisfacerla a ningún precio.

Frente a otras familias de pesos abiertos —los comparadores habituales son las líneas Llama, Qwen y Mistral—, los rasgos diferenciales de Gemma son la amplitud inusual de su escalera de tamaños, sobre todo en el extremo pequeño, la licencia Apache 2.0 en la generación actual y la profundidad de las variantes oficiales por dominio. Ahora bien, los competidores se mueven deprisa y cualquier afirmación sobre qué modelo lidera en calidad tiene una vida útil corta. Evalúe con sus propias tareas en el momento de decidir en lugar de fiarse de una clasificación general, incluida esta descripción.

Frente a no ejecutar nada en local, el cálculo es sencillo: las API alojadas ganan en tiempo hasta el primer resultado y pierden en control de datos, capacidad sin conexión y coste marginal a escala. Gemma justifica su coste operativo cuando al menos uno de esos tres factores es un requisito firme y no una preferencia.

Dentro de la propia familia, la alternativa más infravalorada es la generación anterior. Gemma 3 ofrece un tamaño de 270M que Gemma 4 no tiene, y para despliegues muy restringidos eso puede ser decisivo, siempre que se tengan en cuenta las condiciones de licencia distintas comentadas antes.

Preguntas frecuentes(FAQ)

Q1. ¿Se puede usar Gemma gratis?

Los pesos se descargan gratis y Google no cobra por token por ejecutarlos, porque la capacidad de cómputo la aporta usted. Gemma 4 se publica bajo la licencia Apache 2.0 aprobada por la OSI. Los costes reales son el hardware, la electricidad o el tiempo de instancia en la nube, y el esfuerzo de ingeniería de operar un modelo por cuenta propia. Aquí «gratis» significa «sin cuota de licencia», no «sin coste».

Q2. ¿Puedo usar Gemma con fines comerciales?

Para Gemma 4, la licencia Apache 2.0 permite el uso comercial, la modificación y la redistribución conforme a sus condiciones estándar. Para generaciones anteriores, verifique por separado: Gemma 2, Gemma 3n y otros repositorios más antiguos siguen etiquetados con la licencia propia de Google denominada gemma en lugar de Apache 2.0, y esas condiciones particulares incluyen restricciones de uso que Apache 2.0 no contempla. Compruebe siempre el campo de licencia del repositorio exacto que descargue.

Q3. ¿Cuál es la diferencia entre Gemma y Gemini?

Gemini es la familia de modelos propietarios de Google, a la que se accede como servicio alojado. Gemma es la familia abierta cuyos pesos descarga y ejecuta usted mismo, construida a partir de investigación relacionada: la página de Gemma 4 la describe como creada desde la investigación y la tecnología de Gemini 3. Mismo linaje, modelos de distribución opuestos. Google DeepMind, por su parte, es la organización de investigación que publica ambas.

Q4. ¿Qué hardware necesito?

Depende por completo del tamaño que elija. E2B y E4B están pensados para teléfonos y placas pequeñas, incluidas Raspberry Pi y Jetson Nano, y pueden funcionar totalmente sin conexión. Los modelos 12B, 26B A4B y 31B apuntan a GPU de consumo. El 26B A4B es un diseño de mezcla de expertos que activa unos 3800 millones de sus 25 200 millones de parámetros durante la inferencia, por lo que se ejecuta más rápido de lo que sugiere su tamaño total; suele ser la mejor relación capacidad/VRAM de la familia.

Q5. ¿Qué longitud de contexto admite Gemma?

Hasta 256K tokens en el nivel de estación de trabajo, mientras que los modelos de borde llevan una ventana menor de 128K. Tenga presente que admitir una ventana y aprovecharla de forma fiable son cosas distintas: en la medida de búsqueda en contexto largo de la ficha del modelo, el modelo mayor alcanza el 66,4 % mientras que los tamaños menores decaen con fuerza. Pruebe el comportamiento de búsqueda con su longitud de contexto real antes de diseñar en torno a ella.

Q6. ¿Puede Gemma procesar imágenes y audio?

La comprensión de imágenes y vídeo está disponible en toda la línea Gemma 4, y se admite la entrada multimodal intercalada. El audio es la excepción: la ficha oficial del modelo limita el reconocimiento automático del habla y la traducción de voz a texto traducido a E2B, E4B y 12B. Si la entrada de voz es un requisito, los dos modelos mayores quedan descartados.

Q7. ¿Cuántos idiomas admite Gemma?

Google declara soporte para 140 idiomas y plantea el objetivo como comprender el contexto cultural más que realizar una traducción literal. Como en cualquier afirmación multilingüe amplia, la calidad varía considerablemente en ese abanico, así que valide el rendimiento en sus idiomas objetivo concretos en lugar de presuponer uniformidad.

Q8. ¿Mis datos son privados si uso Gemma?

Si autoaloja, los datos de inferencia no necesitan salir de su infraestructura, que es la propiedad de privacidad más fuerte del enfoque de pesos abiertos. Pero Google le asigna explícitamente la responsabilidad aguas abajo, animando a los desarrolladores a cumplir la normativa de privacidad mediante técnicas que la preserven. El cumplimiento en protección de datos, la política de registro y las salvaguardas de contenido le corresponde diseñarlos e implementarlos a usted.

Q9. ¿Puedo ajustar Gemma con mis propios datos?

Sí: el ajuste fino es una de las cinco capacidades que Google enumera para la familia, y la página oficial de distribución enlaza con instrumental de entrenamiento que incluye Unsloth, Keras, JAX y GKE. El modelo resultante permanece bajo su control, lo que constituye una razón principal por la que los equipos eligen pesos abiertos en lugar de una API alojada.

Q10. ¿Debo usar Gemma 4 o Gemma 3?

Gemma 4 es más sólida en las pruebas de razonamiento y lleva la licencia Apache 2.0, más permisiva, de modo que es la opción por defecto. Gemma 3 sigue siendo pertinente en dos situaciones: cuando necesita el tamaño de 270M, que no tiene equivalente en Gemma 4, y cuando el instrumental existente ya está fijado a ella. Si opta por Gemma 3, recuerde que sus condiciones de licencia difieren de las de Gemma 4 y deben revisarse por separado.

¿Conoces una herramienta similar?
Si conoces otras grandes herramientas de IA, no dudes en enviárnoslas