
Gemma est la gamme de modèles ouverts de Google DeepMind, issue des mêmes travaux de recherche que Gemini mais diffusée sous forme de poids téléchargeables que vous exécutez vous-même. Gemma 4 paraît sous licence Apache 2.0, dans des tailles allant du téléphone au Raspberry Pi jusqu'à un seul GPU grand public.
Vous avez utilisé cet outil ? Notez-le
Vous avez utilisé cet outil ? Notez-le
Gemma est la famille de modèles ouverts publiée par Google DeepMind. Sur son propre espace produit, cette gamme est présentée comme « Gemma / Nos modèles ouverts les plus performants », et elle figure dans une colonne de navigation intitulée Open models, délibérément séparée de Gemini, Veo et Imagen, les lignes propriétaires auxquelles on accède par une API plutôt qu'en les téléchargeant. Ce placement constitue à lui seul le fait le plus important concernant cette fiche, car il définit ce que vous obtenez réellement : non pas un compte et un compteur d'usage, mais des poids de modèle que vous récupérez, hébergez et exploitez vous-même.
Il vaut la peine d'être précis sur la nomenclature, car c'est de là que naît l'essentiel de la confusion. Google DeepMind est une organisation de recherche. Gemini est sa famille de modèles propriétaires phare, servie à travers les produits et les API de Google. Gemma est le frère ouvert, construit, selon les termes de la page Gemma 4, comme « Nos modèles ouverts les plus intelligents, construits à partir de la recherche et de la technologie de Gemini 3 pour maximiser l'intelligence par paramètre ». Ces trois noms sont régulièrement confondus par les annuaires et les agrégateurs d'actualité, mais ils désignent des choses différentes : une organisation, un modèle hébergé et un modèle téléchargeable. Cette page traite du troisième.
L'intention de conception derrière Gemma découle directement de cette ouverture. L'objectif affiché par Google est la portabilité plutôt que la suprématie brute dans les classements : « Nos modèles ouverts les plus avancés aident les développeurs à créer des applications d'IA qui fonctionnent là où les utilisateurs en ont besoin, des serveurs cloud aux ordinateurs portables et même aux téléphones. » Tout le reste dans cette famille, l'étendue inhabituelle des tailles de paramètres, les variantes à mélange d'experts, les astuces d'embarquement par couche dans les petits modèles, découle de cette phrase. Gemma est conçu pour que la même famille de modèles puisse être déployée sur un Jetson Nano comme sur une baie d'accélérateurs, sans changer de fournisseur ni réécrire l'application.
L'ouverture a une seconde conséquence pratique. Parce que les poids sont distribués plutôt que servis, il n'y a pas de parcours d'inscription, pas de décompte de sièges, et pas de facture au jeton émise par Google pour faire tourner le modèle. Ce qui remplace ces éléments, c'est une licence, une facture matérielle et une charge opérationnelle qui vous appartient entièrement. Comprendre où chacun de ces éléments retombe constitue l'essentiel du travail d'évaluation de Gemma.
Google présente également Gemma comme un instrument de déploiement responsable plutôt que comme un artefact de recherche brut. Le positionnement en une ligne attaché à la colonne Open models se lit « Construire des applications d'IA responsables à grande échelle », et la famille est livrée avec des variantes de classificateurs de sécurité dédiées aux côtés des modèles généralistes. Que ce cadrage tienne en pratique dépend fortement de ce que vous construisez autour du modèle, un point que la documentation officielle formule sans détour et sur lequel la section consacrée aux limites revient.
La partie la plus difficile de l'adoption de Gemma n'est pas l'installation, c'est le choix du bon barreau sur l'échelle. Les tailles ne sont pas interchangeables, et le facteur décisif est généralement le matériel dont vous disposez déjà plutôt qu'un tableau de résultats.
Le palier périphérique (E2B, E4B). Google le positionne explicitement pour les appareils contraints : « Prise en charge audio et vision pour le traitement en périphérie en temps réel. Ils peuvent fonctionner entièrement hors ligne avec une latence quasi nulle sur des appareils périphériques comme les téléphones, le Raspberry Pi et le Jetson Nano. » Le fonctionnement hors ligne est la propriété maîtresse. Si votre exigence est que l'inférence doit fonctionner sans réseau, dans un véhicule, une clinique, un atelier ou une salle de classe rurale, ce palier est la raison même de considérer Gemma. En contrepartie, vous acceptez une fenêtre de contexte plus courte et des performances nettement plus faibles sur le raisonnement difficile et la recherche dans de longs documents.
Le palier station de travail (12B, 26B A4B, 31B). Ces modèles visent les cartes graphiques grand public plutôt que les accélérateurs de centre de données. Google les présente comme offrant « un raisonnement avancé pour les IDE, les assistants de codage et les flux agentiques. Ces modèles sont optimisés pour les GPU grand public, donnant aux étudiants, aux chercheurs et aux développeurs la possibilité de transformer leur station de travail en serveur d'IA local. » Le 26B A4B est l'option intermédiaire intéressante : il porte 25,2 milliards de paramètres au total mais en active environ 3,8 milliards à l'inférence, se comportant donc davantage comme un petit modèle en vitesse tout en conservant plus de capacité. Le modèle dense 31B, avec 30,7 milliards de paramètres et une fenêtre de 256K, constitue le sommet de la gamme.
La génération précédente compte toujours. Gemma 3 n'a pas disparu. Il reste disponible en tailles 270M, 1B, 4B, 12B et 27B avec une fenêtre de 128K jetons, et la description de Google, « la fenêtre de contexte de 128K jetons de Gemma 3 permet à vos applications de traiter et de comprendre de vastes quantités d'informations, rendant possibles des fonctionnalités d'IA plus sophistiquées », décrit encore un modèle exploitable. La taille 270M en particulier n'a pas d'équivalent dans Gemma 4, de sorte que pour les empreintes extrêmement réduites, l'ancienne génération est parfois la seule option. Point crucial, les licences diffèrent entre les générations, ce que traite la section suivante.
Une heuristique de sélection pratique : partez de votre cible de déploiement, pas d'un classement. Si le modèle doit fonctionner hors ligne sur un appareil portable, vous êtes dans le palier périphérique et vous devriez valider la qualité tôt sur vos tâches réelles. Si vous disposez d'un GPU grand public récent et souhaitez un assistant de codage ou d'agent local, commencez à 12B et ne montez que si la qualité l'exige. Si vous avez besoin d'entrée vocale, limitez-vous à E2B, E4B ou 12B. Si vous cherchez la qualité maximale et disposez du matériel, le modèle dense 31B est le plafond de la famille.
Cette section mérite une double lecture, car l'affirmation la plus répandue au sujet de Gemma, « Gemma est sous licence Apache 2.0 », n'est vraie que pour la génération actuelle.
Gemma 4 est bien passé à une licence open source authentiquement standard. Le blog open source de Google l'énonce clairement : « Les modèles Gemma 4 sont les premiers du Gemmaverse à être publiés sous la licence Apache 2.0 approuvée par l'OSI. » La fiche modèle officielle le confirme sous forme lisible par machine, le champ de son en-tête indiquant simplement « license: apache-2.0 ». Pour Gemma 4, vous travaillez donc avec une licence permissive approuvée par l'OSI, dotée des propriétés de redistribution et d'usage commercial que les développeurs en attendent.
Les générations antérieures relèvent d'un autre régime. Les métadonnées des dépôts sur l'organisation officielle Google de Hugging Face montrent nettement la coupure : les dépôts Gemma 4 portent l'étiquette apache-2.0, tandis que les dépôts gemma-2, gemma-3n et gemma-7b restent étiquetés avec la licence gemma propre à Google. Un historique de versions tiers consigne la même transition, notant que Google a publié Gemma 4 « sous la licence libre et open source Apache 2.0 » alors que les générations antérieures étaient distribuées sous des conditions d'utilisation Gemma de type source-available.
La conséquence pratique est concrète. Si votre processus de conformité a validé « Gemma » comme une dépendance Apache 2.0 et que vos ingénieurs récupèrent ensuite un point de contrôle Gemma 3 ou Gemma 2, ce qui est parfaitement raisonnable puisque ces modèles restent actuels, maintenus et parfois plus adaptés, la licence qui régit votre déploiement n'est pas celle que votre processus a validée. Vérifiez le champ de licence du dépôt précis que vous téléchargez, à chaque fois, plutôt que de vous fier à des affirmations au niveau de la famille, y compris celle-ci.
Sur l'échelle d'adoption, Google rapporte que « depuis le premier lancement, la communauté a téléchargé les modèles Gemma plus de 400 millions de fois et a bâti un univers foisonnant de plus de 100 000 variantes inspirantes, connu dans la communauté sous le nom de Gemmaverse ». Ce sont des chiffres communiqués par le fournisseur, sans audit indépendant ; ils sont utiles comme signal que l'écosystème n'est pas abandonné et ne doivent pas être lus comme une mesure de qualité.
La distribution est délibérément répartie sur l'outillage que les développeurs utilisent déjà plutôt que canalisée vers une propriété de Google. L'espace officiel recense des plateformes et intégrations couvrant Kaggle, Hugging Face, Keras, Ollama, PyTorch, Gemma.cpp, JAX, Google AI Edge, Google Cloud, Android, LM Studio et Unsloth.
Pour les poids spécifiquement, la page Gemma 4 sépare les destinations de téléchargement des voies d'entraînement et de déploiement, en orientant les téléchargements vers Hugging Face, Ollama, Kaggle, LM Studio et Docker. En pratique, cela signifie que la voie la plus rapide dépend entièrement de votre pile existante plutôt que d'un outillage propre à Gemma :
Le support prend une forme communautaire et documentaire plutôt que contractuelle. L'espace officiel renvoie vers « la documentation officielle, les démarrages rapides et les guides pour créer des applications avec Gemma » et oriente les questions vers un forum de développeurs. Aucun engagement de niveau de service, aucune file de tickets et aucun gestionnaire de compte n'accompagne le téléchargement d'un modèle ouvert, un compromis évident sur le principe mais parfois surprenant en production.
Google publie un tableau comparatif opposant Gemma 4 à son prédécesseur, et le bond générationnel sur les tâches à forte charge de raisonnement est important. Sur les mathématiques AIME 2026 sans usage d'outils, le modèle 31B est rapporté à 89,2 % contre 20,8 % pour Gemma 3 27B. D'autres chiffres publiés sur la page Gemma 4 couvrent les évaluations en arène, la programmation compétitive et les questions de niveau doctoral.
Deux mises en garde s'appliquent à chaque chiffre de ce tableau. D'abord, ce sont des résultats communiqués par le fournisseur, produits par la partie qui a un intérêt dans l'issue ; ce sont une hypothèse de départ raisonnable, pas une conclusion indépendante. Ensuite, les moyennes affichées masquent les décrochages dépendants de la taille qui comptent le plus en déploiement. La recherche en contexte long en est l'exemple le plus net : sur la mesure de recherche MRCR v2 à huit aiguilles en 128K, la fiche modèle rapporte 66,4 % pour le plus grand modèle, chaque taille inférieure chutant fortement en dessous. Un modèle annoncé comme prenant en charge une longue fenêtre n'exploite pas nécessairement cette fenêtre de manière fiable, et l'écart entre le haut et le bas de l'échelle sur cette mesure est bien plus large que sur les tests de connaissances générales.
Un commentaire indépendant soulève une préoccupation structurelle connexe : l'analyse du rapport technique de Gemma 4 note qu'il « attribue le gain à la composition des données, puis décrit ses données d'entraînement en deux phrases ». Parce que le corpus n'est pas décrit en détail, des tiers ne peuvent évaluer de façon indépendante la contamination des jeux de tests ni vérifier la couverture des domaines. Cela n'invalide pas les chiffres rapportés, mais cela signifie que le seul test qui tranche entièrement la question pour votre cas d'usage est celui que vous exécutez vous-même, sur vos propres données réservées.
Gemma convient aux développeurs, chercheurs et équipes techniques qui veulent le contrôle du déploiement plus qu'ils ne veulent la commodité. Si vous êtes à l'aise pour provisionner du matériel, choisir une pile de service et assumer la surface opérationnelle, la famille vous offre une échelle de tailles exceptionnellement large chez un seul fournisseur, avec un outillage cohérent.
Elle convient aux organisations soumises à des contraintes fortes que les API hébergées ne peuvent satisfaire : fonctionnement hors ligne, résidence des données, confidentialité du code, ou une économie unitaire à l'échelle qui rend la tarification au jeton intenable. Dans ces cas, la charge opérationnelle n'est pas un inconvénient mais le prix d'une exigence que rien d'autre ne permet de satisfaire.
Elle convient à ceux qui comptent modifier le modèle. Régler finement, quantifier, distiller ou embarquer un modèle dans une image d'appareil requiert des poids. Si votre projet comporte l'un de ces verbes, un modèle ouvert n'est pas une option parmi d'autres ; c'est la seule catégorie éligible.
Elle convient mal aux utilisateurs non techniques qui veulent ouvrir un onglet et obtenir un résultat. Il n'y a pas de produit grand public ici. Hormis l'essai via AI Studio, utiliser Gemma signifie faire du travail d'ingénierie. Quiconque a pour besoin « discuter avec un assistant d'IA » sera mieux servi par un produit hébergé, très probablement Gemini, et trouverait cette fiche un détour inutile.
Elle convient également mal aux équipes qui exigent des garanties de support contractuelles. La documentation et un forum de développeurs constituent tout le modèle de support. Si votre processus d'achat impose un fournisseur avec un engagement de service et un chemin d'escalade, le téléchargement d'un modèle ouvert n'en fournit pas, quelle que soit la taille de l'entreprise qui le publie.
La documentation de Google est inhabituellement directe sur les limites du modèle, et ces limites auto-déclarées sont plus utiles que la plupart des critiques externes parce qu'elles sont attribuables.
Ce n'est pas une base de connaissances. La fiche modèle indique que les modèles « génèrent des réponses à partir des informations apprises dans leurs jeux de données d'entraînement, mais ce ne sont pas des bases de connaissances. Ils peuvent produire des affirmations factuelles incorrectes ou obsolètes. » Traitez les sorties factuelles comme nécessitant une vérification, non comme une consultation.
Les données d'entraînement ont une date de coupure. La coupure de pré-entraînement documentée est janvier 2025, couvrant documents web, code, mathématiques, images et audio. Tout ce qui suit cette date échappe à la connaissance du modèle, si bien que les applications sensibles au temps nécessitent une recherche externe quelle que soit la taille retenue.
Les tâches ouvertes sont plus difficiles que les tâches bien spécifiées. Comme le formule la fiche modèle, les modèles « fonctionnent bien sur des tâches que l'on peut cadrer par des instructions et des invites claires. Les tâches ouvertes ou très complexes peuvent poser problème. » La structure de l'invite joue ici un rôle réel.
Les capacités ne sont pas uniformes sur l'échelle. Ce point mérite d'être souligné car il constitue la déception pratique la plus fréquente. L'entrée audio n'existe que sur E2B, E4B et 12B. La recherche en contexte long se dégrade fortement sur les petits modèles. Une capacité démontrée sur le modèle 31B ne doit jamais être supposée transférable à E2B.
Les conseils professionnels sont hors périmètre. L'avertissement de Google en pied de page est explicite : « Ne comptez pas sur les LLM pour des conseils médicaux, juridiques, financiers ou d'autres conseils professionnels. Tout contenu portant sur ces sujets est fourni à titre informatif et ne remplace pas l'avis d'un professionnel qualifié. » L'existence de MedGemma ne change rien à cela ; un modèle réglé pour un domaine reste étranger à la pratique clinique.
La transparence sur les données d'entraînement est limitée. Comme indiqué plus haut, l'analyse indépendante critique la brièveté de la description des données d'entraînement. Vous ne pouvez pas auditer pleinement ce qui est entré dans le modèle.
Vous héritez de la charge opérationnelle. L'absence de point de terminaison hébergé signifie que la disponibilité, la mise à l'échelle, les correctifs de sécurité, la planification de capacité GPU et les coûts vous incombent. Pour les petites équipes, ce point est fréquemment sous-estimé au moment de la décision.
La posture de confidentialité d'un modèle ouvert diffère structurellement de celle d'un service hébergé, et la différence joue dans les deux sens.
Du côté favorable, l'auto-hébergement signifie que les données d'inférence n'ont pas besoin de quitter votre infrastructure. Il n'y a pas de journalisation des invites côté fournisseur à négocier, puisqu'il n'y a pas d'inférence côté fournisseur. Pour les charges confidentielles, c'est l'argument le plus fort de toute la catégorie.
Côté entraînement, Google rapporte un travail de filtrage sur le corpus de pré-entraînement : « Dans le cadre des efforts pour rendre les modèles pré-entraînés Gemma sûrs et fiables, des techniques automatisées ont été utilisées pour filtrer certaines informations personnelles et autres données sensibles des ensembles d'entraînement », avec un filtrage CSAM appliqué à plusieurs étapes. Il s'agit d'une déclaration du fournisseur sur un processus, non d'un audit indépendant, et il convient de la lire comme telle.
Le point critique pour quiconque déploie Gemma est que Google vous attribue explicitement la responsabilité de la sécurité en aval. La fiche modèle range l'atteinte à la vie privée parmi les risques identifiés et indique que « les développeurs sont encouragés à respecter les réglementations relatives à la vie privée en recourant à des techniques préservant la confidentialité ». Sur la sécurité des contenus, elle est tout aussi directe : « Les développeurs sont encouragés à faire preuve de prudence et à mettre en œuvre des protections adaptées en matière de sécurité des contenus, en fonction de leurs politiques produit et de leurs cas d'usage. »
Cette répartition n'est pas une formalité. Avec une API hébergée, la couche de modération du fournisseur s'interpose entre vos utilisateurs et le modèle brut, que vous le vouliez ou non. Lorsque vous téléchargez des poids, cette couche ne les accompagne pas. Garde-fous, surveillance des abus, politique de journalisation, contrôle de l'âge et conformité réglementaire deviennent des éléments que vous construisez. ShieldGemma 2 aide pour une partie de cela, mais son intégration vous revient.
Du côté de l'infrastructure, Google déclare que « les modèles Gemma 4 sont soumis aux mêmes protocoles rigoureux de sécurité d'infrastructure que nos modèles propriétaires », positionnant la famille comme une base fiable pour des déploiements en entreprise et souverains. Cette affirmation concerne la manière dont les modèles sont produits et publiés, non la manière dont vous les exploitez ensuite.
L'ensemble de comparaison honnête pour Gemma est constitué des autres familles à poids ouverts plutôt que des assistants hébergés, car la décision de s'auto-héberger vient en premier et le choix du modèle à héberger en second.
Face à Gemini, la comparaison porte en réalité sur le modèle de déploiement plutôt que sur la qualité. Gemini est servi, administré et continuellement mis à jour par Google ; Gemma est téléchargé, exploité par vous et figé sur une version. Si aucune contrainte n'impose l'auto-hébergement, la voie hébergée demande moins de travail. Si une telle contrainte existe, Gemini ne peut la satisfaire à aucun prix.
Face aux autres familles à poids ouverts, les lignées Llama, Qwen et Mistral étant les comparateurs habituels, les éléments distinctifs de Gemma sont l'étendue inhabituelle de son échelle de tailles, en particulier vers le bas, la licence Apache 2.0 sur la génération actuelle et la profondeur des variantes officielles par domaine. Les concurrents évoluent toutefois rapidement, et toute affirmation sur le modèle en tête en qualité a une durée de vie courte. Évaluez sur vos propres tâches au moment de décider plutôt que de vous fier à un classement général, y compris à cette description.
Face à ne rien exécuter localement, le calcul est simple : les API hébergées l'emportent sur le délai jusqu'au premier résultat et perdent sur le contrôle des données, la capacité hors ligne et le coût marginal à l'échelle. Gemma vaut son coût opérationnel lorsqu'au moins un de ces trois facteurs est une exigence ferme plutôt qu'une préférence.
Au sein même de la famille, l'alternative la plus sous-estimée est la génération précédente. Gemma 3 propose une taille 270M absente de Gemma 4, ce qui peut être décisif pour les déploiements très contraints, à condition de tenir compte des conditions de licence différentes évoquées plus haut.
Les poids se téléchargent gratuitement et Google ne facture rien au jeton pour les exécuter, puisque vous fournissez la puissance de calcul. Gemma 4 est publié sous la licence Apache 2.0 approuvée par l'OSI. Les coûts réels sont le matériel, l'électricité ou le temps d'instance cloud, et l'effort d'ingénierie nécessaire pour exploiter un modèle soi-même. « Gratuit » signifie ici « sans frais de licence », non « sans coût ».
Pour Gemma 4, la licence Apache 2.0 autorise l'usage commercial, la modification et la redistribution selon ses conditions standard. Pour les générations antérieures, vérifiez séparément : Gemma 2, Gemma 3n et d'autres dépôts plus anciens restent étiquetés avec la licence gemma propre à Google plutôt qu'Apache 2.0, et ces conditions particulières comportent des restrictions d'usage absentes d'Apache 2.0. Contrôlez toujours le champ de licence du dépôt exact que vous téléchargez.
Gemini est la famille de modèles propriétaires de Google, accessible en tant que service hébergé. Gemma est la famille ouverte dont vous téléchargez et exécutez vous-même les poids, construite à partir de recherches apparentées : la page Gemma 4 la décrit comme issue de la recherche et de la technologie de Gemini 3. Même lignée, modèles de distribution opposés. Google DeepMind, pour sa part, est l'organisation de recherche qui publie les deux.
Cela dépend entièrement de la taille choisie. E2B et E4B sont conçus pour les téléphones et les petites cartes, dont le Raspberry Pi et le Jetson Nano, et peuvent fonctionner entièrement hors ligne. Les modèles 12B, 26B A4B et 31B visent les GPU grand public. Le 26B A4B est une conception à mélange d'experts qui active environ 3,8 milliards de ses 25,2 milliards de paramètres à l'inférence, il tourne donc plus vite que sa taille totale ne le suggère, ce qui en fait souvent le meilleur rapport capacité/VRAM de la famille.
Jusqu'à 256K jetons sur le palier station de travail, les modèles périphériques disposant d'une fenêtre plus réduite de 128K. Notez que prendre en charge une fenêtre et l'exploiter de façon fiable sont deux choses distinctes : sur la mesure de recherche en contexte long de la fiche modèle, le plus grand modèle atteint 66,4 % tandis que les tailles inférieures décrochent nettement. Testez le comportement de recherche à votre longueur de contexte réelle avant de concevoir autour.
La compréhension des images et des vidéos est disponible sur toute la gamme Gemma 4, et l'entrée multimodale entrelacée est prise en charge. L'audio fait exception : la fiche modèle officielle restreint la reconnaissance automatique de la parole et la traduction parole-vers-texte à E2B, E4B et 12B. Si l'entrée vocale est une exigence, les deux plus grands modèles ne sont pas des options.
Google annonce la prise en charge de 140 langues et présente l'objectif comme la compréhension du contexte culturel plutôt que la traduction littérale. Comme pour toute affirmation multilingue large, la qualité varie considérablement sur cet éventail ; validez donc les performances dans vos langues cibles précises au lieu de présumer une uniformité.
Si vous auto-hébergez, les données d'inférence n'ont pas besoin de quitter votre infrastructure, ce qui constitue la propriété de confidentialité la plus forte de l'approche à poids ouverts. Mais Google vous attribue explicitement la responsabilité en aval, en encourageant les développeurs à respecter les réglementations sur la vie privée au moyen de techniques préservant la confidentialité. La conformité en matière de protection des données, la politique de journalisation et les protections de contenu vous reviennent à concevoir et à mettre en œuvre.
Oui : le réglage fin est l'une des cinq capacités que Google recense pour la famille, et la page officielle de distribution renvoie vers un outillage d'entraînement incluant Unsloth, Keras, JAX et GKE. Le modèle obtenu reste sous votre contrôle, ce qui constitue une raison majeure pour laquelle des équipes choisissent les poids ouverts plutôt qu'une API hébergée.
Gemma 4 est plus performant sur les tests de raisonnement et porte la licence Apache 2.0, plus permissive ; c'est donc le choix par défaut. Gemma 3 reste pertinent dans deux situations : lorsque vous avez besoin de la taille 270M, sans équivalent dans Gemma 4, et lorsque votre outillage existant y est déjà figé. Si vous retenez Gemma 3, rappelez-vous que ses conditions de licence diffèrent de celles de Gemma 4 et doivent être examinées séparément.