Hast du dieses Tool genutzt? Bewerte es
Hast du dieses Tool genutzt? Bewerte es
Gemma ist die offene Modellfamilie von Google DeepMind. Auf der eigenen Produktseite wird die Reihe als „Gemma / Unsere leistungsfähigsten offenen Modelle" eingeführt, und sie steht in einer Navigationsspalte mit der Überschrift Open models, bewusst getrennt von Gemini, Veo und Imagen, also den proprietären Linien, die man über eine API erreicht statt sie herunterzuladen. Diese Einordnung ist die wichtigste Einzelinformation zu diesem Eintrag, denn sie legt fest, was Sie tatsächlich erhalten: kein Konto mit Nutzungszähler, sondern Modellgewichte, die Sie selbst beziehen, hosten und betreiben.
Es lohnt sich, bei den Namen genau zu sein, denn hier beginnt die meiste Verwirrung. Google DeepMind ist eine Forschungsorganisation. Gemini ist ihre proprietäre Vorzeigemodellfamilie, ausgeliefert über Googles eigene Produkte und APIs. Gemma ist das offene Geschwistermodell, laut Formulierung der Gemma-4-Seite gebaut als „Unsere intelligentesten offenen Modelle, entwickelt aus der Forschung und Technologie von Gemini 3, um die Intelligenz pro Parameter zu maximieren". Die drei Namen werden von Verzeichnisseiten und Nachrichtenaggregatoren regelmäßig vermengt, bezeichnen aber Verschiedenes: eine Organisation, ein gehostetes Modell und ein herunterladbares. Diese Seite behandelt das dritte.
Die Entwurfsabsicht hinter Gemma folgt unmittelbar aus dieser Offenheit. Googles erklärtes Ziel ist Portabilität statt roher Bestenlistenherrschaft: „Unsere fortschrittlichsten offenen Modelle helfen Entwicklern, KI-Anwendungen zu erstellen, die überall dort laufen, wo Nutzer sie brauchen – von Cloud-Servern über Laptops bis hin zu Telefonen." Alles Weitere an dieser Familie, die ungewöhnliche Spannweite der Parametergrößen, die Mixture-of-Experts-Varianten, die Per-Layer-Embedding-Kniffe in den kleinen Modellen, ist eine Folge dieses Satzes. Gemma ist so konstruiert, dass dieselbe Modellfamilie auf einem Jetson Nano und auf einem Rack voller Beschleuniger betrieben werden kann, ohne den Anbieter zu wechseln oder die Anwendung neu zu schreiben.
Die Offenheit hat eine zweite praktische Konsequenz. Weil die Gewichte verteilt und nicht als Dienst bereitgestellt werden, gibt es keinen Registrierungsprozess, keine Platzzählung und keine Token-Rechnung von Google für den Betrieb des Modells. An deren Stelle treten eine Lizenz, eine Hardwarerechnung und eine Betriebslast, die vollständig Ihnen gehört. Zu verstehen, wo diese drei jeweils anfallen, macht den Großteil der Bewertung von Gemma aus.
Google rahmt Gemma zudem als Instrument verantwortungsvoller Bereitstellung und nicht als rohes Forschungsartefakt. Die einzeilige Positionierung an der Spalte Open models lautet „Verantwortungsvolle KI-Anwendungen im großen Maßstab bauen", und die Familie enthält neben den Allzweckmodellen eigene Sicherheitsklassifikatoren. Ob diese Rahmung in der Praxis trägt, hängt stark davon ab, was Sie rund um das Modell bauen – ein Punkt, den die offizielle Dokumentation unverblümt benennt und auf den der Abschnitt zu den Grenzen zurückkommt.
Der schwierigste Teil bei der Einführung von Gemma ist nicht die Installation, sondern die Wahl der richtigen Sprosse auf der Leiter. Die Größen sind nicht austauschbar, und ausschlaggebend ist meist die vorhandene Hardware und nicht eine Benchmark-Tabelle.
Die Edge-Stufe (E2B, E4B). Google positioniert sie ausdrücklich für eingeschränkte Geräte: „Audio- und Bildunterstützung für Echtzeitverarbeitung am Rand. Sie können vollständig offline mit nahezu null Latenz auf Edge-Geräten wie Telefonen, Raspberry Pi und Jetson Nano laufen." Der Offlinebetrieb ist die Kerneigenschaft. Wenn Ihre Anforderung lautet, dass Inferenz ohne Netz funktionieren muss – im Fahrzeug, in der Klinik, in der Werkhalle, im ländlichen Klassenzimmer –, ist genau diese Stufe der Grund, Gemma überhaupt zu betrachten. Im Gegenzug akzeptieren Sie ein kürzeres Kontextfenster und deutlich schwächere Leistung bei schwierigem Schlussfolgern und langer Dokumentensuche.
Die Workstation-Stufe (12B, 26B A4B, 31B). Diese zielt auf Consumer-Grafikkarten statt auf Rechenzentrumsbeschleuniger. Googles Darstellung: Sie liefern „fortgeschrittenes Schlussfolgern für IDEs, Coding-Assistenten und agentische Workflows. Diese Modelle sind für Consumer-GPUs optimiert und geben Studierenden, Forschenden und Entwicklern die Möglichkeit, Workstations in lokal-erste KI-Server zu verwandeln." Das 26B A4B ist die interessante Mitteloption: Es trägt 25,2 Milliarden Parameter insgesamt, aktiviert bei der Inferenz aber rund 3,8 Milliarden, verhält sich also geschwindigkeitsseitig eher wie ein kleines Modell und behält dabei mehr Kapazität. Das dichte 31B-Modell mit 30,7 Milliarden Parametern und einem 256K-Fenster bildet die Spitze der Reihe.
Die vorige Generation zählt weiterhin. Gemma 3 ist nicht verschwunden. Es bleibt in den Größen 270M, 1B, 4B, 12B und 27B mit einem 128K-Token-Fenster verfügbar, und Googles eigene Beschreibung – „Das 128K-Token-Kontextfenster von Gemma 3 lässt Ihre Anwendungen riesige Informationsmengen verarbeiten und verstehen und ermöglicht anspruchsvollere KI-Funktionen" – beschreibt weiterhin ein brauchbares Modell. Insbesondere die Größe 270M hat kein Gegenstück in Gemma 4, weshalb für extrem kleine Fußabdrücke die ältere Generation mitunter die einzige Option ist. Entscheidend ist, dass sich die Lizenzen zwischen den Generationen unterscheiden, was der nächste Abschnitt behandelt.
Eine praktische Auswahlheuristik: Gehen Sie vom Bereitstellungsziel aus, nicht von einer Bestenliste. Muss es offline auf einem Handgerät laufen, sind Sie in der Edge-Stufe und sollten die Qualität früh an Ihren echten Aufgaben prüfen. Haben Sie eine moderne Consumer-GPU und wollen einen lokalen Coding- oder Agentenassistenten, beginnen Sie bei 12B und gehen nur höher, wenn die Qualität es verlangt. Brauchen Sie Spracheingabe, beschränken Sie sich auf E2B, E4B oder 12B. Brauchen Sie maximale Qualität und haben die Hardware, ist das dichte 31B-Modell die Obergrenze der Familie.
Dieser Abschnitt lohnt zweimaliges Lesen, denn die am häufigsten wiederholte Aussage über Gemma – „Gemma ist Apache-2.0-lizenziert" – trifft nur auf die aktuelle Generation zu.
Gemma 4 ist tatsächlich zu einer echten Standard-Open-Source-Lizenz übergegangen. Googles Open-Source-Blog sagt es unmissverständlich: „Die Gemma-4-Modelle sind die ersten im Gemmaverse, die unter der OSI-anerkannten Apache-2.0-Lizenz veröffentlicht werden." Die offizielle Modellkarte bestätigt es maschinenlesbar, das Feld im Kopfbereich lautet schlicht „license: apache-2.0". Für Gemma 4 arbeiten Sie also mit einer OSI-anerkannten permissiven Lizenz mit den Weiterverbreitungs- und Kommerzialisierungseigenschaften, die Entwickler davon erwarten.
Frühere Generationen sind eine andere Sache. Die Repository-Metadaten in der offiziellen Google-Organisation auf Hugging Face zeigen die Trennung deutlich: Gemma-4-Repositories tragen die Kennzeichnung apache-2.0, während gemma-2, gemma-3n und gemma-7b weiterhin mit Googles eigener Lizenz gemma gekennzeichnet sind. Eine Versionsübersicht dritter Seite verzeichnet denselben Übergang und hält fest, dass Google Gemma 4 „unter der freien und quelloffenen Apache-2.0-Lizenz" veröffentlichte, während die früheren Generationen unter quelloffen einsehbaren Gemma-Nutzungsbedingungen verteilt wurden.
Die praktische Folge ist konkret. Hat Ihr Compliance-Prozess „Gemma" als Apache-2.0-Abhängigkeit freigegeben und Ihre Entwickler ziehen anschließend einen Gemma-3- oder Gemma-2-Checkpoint – völlig naheliegend, da diese aktuell, gepflegt und mitunter besser geeignet sind –, dann ist die für Ihren Einsatz maßgebliche Lizenz nicht diejenige, die Ihr Prozess freigegeben hat. Prüfen Sie jedes Mal das Lizenzfeld des konkreten Repositorys, das Sie herunterladen, statt sich auf Aussagen auf Familienebene zu verlassen, diese hier eingeschlossen.
Zur Verbreitung berichtet Google: „Seit der ersten Veröffentlichung hat die Community Gemma-Modelle über 400 Millionen Mal heruntergeladen und ein lebendiges Universum von über 100.000 inspirierenden Varianten aufgebaut, in der Community als Gemmaverse bekannt." Das sind vom Hersteller berichtete Zahlen ohne unabhängige Prüfung; sie taugen als Signal, dass das Ökosystem nicht verwaist ist, und nicht als Qualitätsmaß.
Die Verteilung ist bewusst über das Werkzeug gestreut, das Entwickler ohnehin nutzen, statt in ein Google-eigenes Angebot kanalisiert zu werden. Die offizielle Seite listet Plattformen und Integrationen von Kaggle, Hugging Face, Keras, Ollama, PyTorch, Gemma.cpp, JAX, Google AI Edge, Google Cloud, Android, LM Studio bis Unsloth.
Speziell für Gewichte trennt die Gemma-4-Seite Downloadziele von Trainings- und Bereitstellungswegen und verweist für Downloads auf Hugging Face, Ollama, Kaggle, LM Studio und Docker. In der Praxis heißt das, dass der schnellste Weg vollständig von Ihrem vorhandenen Stack abhängt und nicht von Gemma-spezifischem Werkzeug:
Der Support hat Community- und Dokumentationsform statt Vertragsform. Die offizielle Seite verweist auf „offizielle Dokumentation, Schnellstarts und Leitfäden zum Bau von Anwendungen mit Gemma" und lenkt Fragen in ein Entwicklerforum. Mit dem Herunterladen eines offenen Modells kommen weder Service-Level-Zusagen noch eine Ticket-Warteschlange noch ein Kundenbetreuer – ein Kompromiss, der im Grundsatz offensichtlich ist, im Produktivbetrieb aber gelegentlich überrascht.
Google veröffentlicht eine Benchmark-Tabelle, die Gemma 4 dem Vorgänger gegenüberstellt, und der Generationssprung bei stark schlussfolgernden Aufgaben ist groß. In der Mathematik AIME 2026 ohne Werkzeugeinsatz wird das 31B-Modell mit 89,2 Prozent gegenüber 20,8 Prozent für Gemma 3 27B angegeben. Weitere auf der Gemma-4-Seite veröffentlichte Werte betreffen Arena-Wertungen, Wettbewerbsprogrammierung und Fragen auf Graduiertenniveau.
Für jede Zahl dieser Tabelle gelten zwei Vorbehalte. Erstens sind es vom Hersteller berichtete Ergebnisse, erzeugt von der Partei mit Interesse am Ausgang; sie sind eine vernünftige Ausgangshypothese, kein unabhängiger Befund. Zweitens verdecken Schlagzeilenmittelwerte die größenabhängigen Abbrüche, die bei der Bereitstellung am meisten zählen. Die Suche im langen Kontext ist das deutlichste Beispiel: Beim Suchmaß MRCR v2 mit acht Nadeln über 128K berichtet die Modellkarte 66,4 Prozent für das größte Modell, wobei jede kleinere Größe steil darunter abfällt. Ein Modell, das mit einem langen Fenster beworben wird, nutzt dieses Fenster nicht zwangsläufig verlässlich, und der Abstand zwischen oberem und unterem Ende der Leiter ist bei diesem Maß weit größer als bei allgemeinen Wissensbenchmarks.
Unabhängige Kommentare werfen ein verwandtes strukturelles Problem auf: Eine Analyse des technischen Berichts zu Gemma 4 merkt an, er „schreibt den Zugewinn der Datenzusammensetzung zu und beschreibt seine Trainingsdaten dann in zwei Sätzen." Da das Korpus nicht im Detail beschrieben wird, können Außenstehende weder Benchmark-Kontamination unabhängig einschätzen noch die Domänenabdeckung prüfen. Das entwertet die berichteten Zahlen nicht, bedeutet aber, dass der einzige Benchmark, der die Frage für Ihren Anwendungsfall abschließend klärt, derjenige ist, den Sie selbst auf eigenen zurückgehaltenen Daten fahren.
Gemma passt zu Entwicklern, Forschenden und technischen Teams, denen die Kontrolle über die Bereitstellung wichtiger ist als Bequemlichkeit. Wenn Sie sicher Hardware bereitstellen, einen Serving-Stack auswählen und die Betriebsfläche verantworten können, bietet Ihnen die Familie eine ungewöhnlich breite Größenleiter von einem einzigen Anbieter mit einheitlichem Werkzeug.
Sie passt zu Organisationen mit harten Randbedingungen, die gehostete APIs nicht erfüllen können: Offlinebetrieb, Datenresidenz, Codevertraulichkeit oder eine Stückkostenrechnung im Volumen, die eine Abrechnung pro Token untragbar macht. In diesen Fällen ist die Betriebslast kein Nachteil, sondern der Preis für eine Anforderung, die anders nicht zu erfüllen ist.
Sie passt zu Menschen, die das Modell verändern wollen. Feinabstimmen, quantisieren, destillieren oder ein Modell in ein Geräteabbild einbetten setzt Gewichte voraus. Enthält Ihr Vorhaben eines dieser Verben, ist ein offenes Modell nicht eine Option unter mehreren, sondern die einzige infrage kommende Kategorie.
Sie passt schlecht zu nichttechnischen Nutzern, die einen Browser-Tab öffnen und ein Ergebnis wollen. Ein Endkundenprodukt gibt es hier nicht. Abgesehen vom Test über AI Studio bedeutet der Einsatz von Gemma Ingenieursarbeit. Wer schlicht „mit einem KI-Assistenten chatten" will, ist mit einem gehosteten Produkt besser bedient, sehr wahrscheinlich Gemini, und fände diesen Eintrag einen unnötigen Umweg.
Sie passt ebenso wenig zu Teams, die vertragliche Supportzusagen brauchen. Dokumentation und ein Entwicklerforum sind das gesamte Supportmodell. Verlangt Ihr Beschaffungsprozess einen Anbieter mit Service-Level-Zusage und Eskalationspfad, liefert der Download eines offenen Modells das nicht, unabhängig davon, wie groß der dahinterstehende Anbieter ist.
Googles eigene Dokumentation ist ungewöhnlich direkt zu den Grenzen des Modells, und diese selbst berichteten Grenzen sind nützlicher als die meiste Fremdkritik, weil sie zurechenbar sind.
Es ist keine Wissensdatenbank. Die Modellkarte hält fest, dass Modelle „Antworten auf Grundlage der Informationen erzeugen, die sie aus ihren Trainingsdatensätzen gelernt haben, aber sie sind keine Wissensdatenbanken. Sie können unzutreffende oder veraltete Tatsachenbehauptungen erzeugen." Behandeln Sie faktische Ausgaben als überprüfungsbedürftig, nicht als Abruf.
Die Trainingsdaten haben einen Stichtag. Der dokumentierte Vortrainingsstichtag ist Januar 2025 und umfasst Webdokumente, Code, Mathematik, Bilder und Audio. Alles nach diesem Datum liegt außerhalb des Modellwissens, weshalb zeitkritische Anwendungen unabhängig von der Modellgröße externe Recherche benötigen.
Offene Aufgaben sind schwieriger als klar umrissene. Wie es die Modellkarte formuliert, schneiden Modelle „bei Aufgaben gut ab, die sich mit klaren Prompts und Anweisungen fassen lassen. Offene oder hochkomplexe Aufgaben können schwierig sein." Die Struktur des Prompts leistet hier echte Arbeit.
Die Fähigkeiten sind über die Leiter hinweg nicht einheitlich. Das verdient Betonung, weil es die häufigste praktische Enttäuschung ist. Audioeingabe existiert nur bei E2B, E4B und 12B. Die Suche im langen Kontext verschlechtert sich bei kleineren Modellen deutlich. Eine am 31B-Modell gezeigte Fähigkeit sollte nie als auf E2B übertragbar angenommen werden.
Fachliche Beratung liegt außerhalb des Anwendungsbereichs. Googles eigener Hinweis in der Fußzeile ist eindeutig: „Verlassen Sie sich bei medizinischer, juristischer, finanzieller oder anderer fachlicher Beratung nicht auf LLMs. Alle Inhalte zu diesen Themen dienen der Information und ersetzen nicht den Rat einer qualifizierten Fachperson." Die Existenz von MedGemma ändert daran nichts; ein domänenangepasstes Modell ist noch immer keine Ärztin und kein Arzt.
Die Transparenz der Trainingsdaten ist begrenzt. Wie erwähnt kritisiert eine unabhängige Analyse die Kürze der Trainingsdatenbeschreibung. Sie können nicht vollständig prüfen, was in das Modell eingeflossen ist.
Sie erben die Betriebslast. Kein gehosteter Endpunkt bedeutet, dass Verfügbarkeit, Skalierung, Sicherheitsaktualisierungen, GPU-Kapazitätsplanung und Kosten Ihnen gehören. Kleine Teams unterschätzen diesen Punkt im Moment der Entscheidung häufig.
Die Datenschutzlage eines offenen Modells unterscheidet sich strukturell von der eines gehosteten Dienstes, und der Unterschied wirkt in beide Richtungen.
Positiv gewendet bedeutet Selbsthosten, dass Inferenzdaten Ihre Infrastruktur gar nicht verlassen müssen. Es gibt keine anbieterseitige Prompt-Protokollierung zu verhandeln, weil es keine anbieterseitige Inferenz gibt. Für vertrauliche Arbeitslasten ist das das stärkste Argument, das diese Kategorie insgesamt besitzt.
Trainingsseitig berichtet Google von Filterarbeit am Vortrainingskorpus: „Um die vortrainierten Gemma-Modelle sicher und verlässlich zu machen, wurden automatisierte Verfahren eingesetzt, um bestimmte personenbezogene Daten und andere sensible Daten aus den Trainingsmengen herauszufiltern", wobei CSAM-Filterung in mehreren Stufen angewandt wurde. Das ist eine Herstelleraussage über einen Prozess, keine unabhängige Prüfung, und sollte so gelesen werden.
Entscheidend für jeden, der Gemma einsetzt, ist, dass Google die nachgelagerte Sicherheitsverantwortung ausdrücklich Ihnen zuweist. Die Modellkarte führt Datenschutzverstöße als erkanntes Risiko auf und hält fest, dass „Entwicklern nahegelegt wird, Datenschutzvorschriften mit datenschutzwahrenden Techniken einzuhalten." Zur Inhaltssicherheit ist sie ebenso direkt: „Entwicklern wird nahegelegt, Vorsicht walten zu lassen und angemessene Schutzmaßnahmen für Inhaltssicherheit auf Grundlage ihrer konkreten Produktrichtlinien und Anwendungsfälle umzusetzen."
Diese Zuweisung ist keine Formsache. Bei einer gehosteten API steht die Moderationsschicht des Anbieters zwischen Ihren Nutzern und dem rohen Modell, ob Sie wollen oder nicht. Beim Herunterladen von Gewichten kommt diese Schicht nicht mit. Schutzgeländer, Missbrauchsüberwachung, Protokollierungsrichtlinien, Altersprüfung und regulatorische Konformität werden zu Artefakten, die Sie bauen. ShieldGemma 2 hilft bei einem Teil davon, aber die Einbindung ist Ihre Arbeit.
Infrastrukturseitig erklärt Google, dass „Gemma-4-Modelle denselben strengen Infrastruktursicherheitsprotokollen unterliegen wie unsere proprietären Modelle", und positioniert die Familie damit als vertrauenswürdige Grundlage für Unternehmen und staatliche Stellen. Diese Aussage betrifft, wie die Modelle erzeugt und veröffentlicht werden, nicht, wie Sie sie anschließend betreiben.
Die redliche Vergleichsgruppe für Gemma sind andere Familien mit offenen Gewichten und nicht gehostete Assistenten, denn die Entscheidung fürs Selbsthosten kommt zuerst und die Wahl des Modells danach.
Gegenüber Gemini ist der Vergleich eigentlich eine Frage des Bereitstellungsmodells und nicht der Qualität. Gemini wird von Google ausgeliefert, verwaltet und fortlaufend aktualisiert; Gemma laden Sie herunter, betreiben es selbst und legen die Version fest. Zwingt Sie nichts zum Selbsthosten, ist der gehostete Weg weniger Aufwand. Besteht eine solche Randbedingung, kann Gemini sie um keinen Preis erfüllen.
Gegenüber anderen Familien mit offenen Gewichten – üblicherweise werden Llama, Qwen und Mistral herangezogen – liegen Gemmas Unterscheidungsmerkmale in der ungewöhnlichen Breite der Größenleiter, besonders am unteren Ende, in der Apache-2.0-Lizenz der aktuellen Generation und in der Tiefe der offiziellen Domänenvarianten. Die Konkurrenz bewegt sich allerdings schnell, und jede Aussage darüber, welches Modell qualitativ führt, hat eine kurze Haltbarkeit. Bewerten Sie im Moment der Entscheidung an Ihren eigenen Aufgaben, statt einer allgemeinen Rangliste zu vertrauen, diese Beschreibung eingeschlossen.
Gegenüber gar nichts lokal betreiben ist die Rechnung einfach: Gehostete APIs gewinnen bei der Zeit bis zum ersten Ergebnis und verlieren bei Datenkontrolle, Offlinefähigkeit und Grenzkosten im Volumen. Gemma ist seinen Betriebsaufwand wert, wenn mindestens einer dieser drei Faktoren eine harte Anforderung und keine Vorliebe ist.
Innerhalb der Familie ist die am meisten unterschätzte Alternative die vorige Generation. Gemma 3 bietet eine Größe 270M, die Gemma 4 nicht hat, und für sehr eingeschränkte Bereitstellungen kann das ausschlaggebend sein – vorausgesetzt, Sie berücksichtigen die oben erörterten abweichenden Lizenzbedingungen.
Die Gewichte lassen sich kostenlos herunterladen, und Google berechnet für den Betrieb nichts pro Token, weil Sie die Rechenleistung stellen. Gemma 4 erscheint unter der OSI-anerkannten Apache-2.0-Lizenz. Die tatsächlichen Kosten sind Hardware, Strom oder Cloud-Instanzzeit sowie der Ingenieursaufwand, ein Modell selbst zu betreiben. „Kostenlos" heißt hier „ohne Lizenzgebühr", nicht „ohne Kosten".
Für Gemma 4 erlaubt die Apache-2.0-Lizenz kommerzielle Nutzung, Änderung und Weiterverbreitung nach ihren Standardbedingungen. Für frühere Generationen prüfen Sie gesondert: Gemma 2, Gemma 3n und weitere ältere Repositories sind weiterhin mit Googles eigener Lizenz gemma statt mit Apache 2.0 gekennzeichnet, und diese eigenen Bedingungen enthalten Nutzungsbeschränkungen, die Apache 2.0 nicht kennt. Prüfen Sie stets das Lizenzfeld genau des Repositorys, das Sie herunterladen.
Gemini ist Googles proprietäre Modellfamilie, erreichbar als gehosteter Dienst. Gemma ist die offene Familie, deren Gewichte Sie selbst herunterladen und betreiben, entstanden aus verwandter Forschung – die Gemma-4-Seite beschreibt sie als aus Forschung und Technologie von Gemini 3 entwickelt. Gleiche Herkunft, entgegengesetzte Verteilungsmodelle. Google DeepMind wiederum ist die Forschungsorganisation, die beides veröffentlicht.
Das hängt vollständig von der gewählten Größe ab. E2B und E4B sind für Telefone und kleine Platinen einschließlich Raspberry Pi und Jetson Nano gebaut und können vollständig offline laufen. Die Modelle 12B, 26B A4B und 31B zielen auf Consumer-GPUs. Das 26B A4B ist ein Mixture-of-Experts-Entwurf, der bei der Inferenz rund 3,8 von 25,2 Milliarden Parametern aktiviert und daher schneller läuft, als seine Gesamtgröße vermuten lässt – häufig das beste Verhältnis von Kapazität zu VRAM in der Familie.
Bis zu 256K Token auf der Workstation-Stufe, wobei die Edge-Modelle ein kleineres Fenster von 128K tragen. Beachten Sie, dass ein Fenster zu unterstützen und es verlässlich zu nutzen zweierlei ist: Beim Maß der Modellkarte zur Suche im langen Kontext erreicht das größte Modell 66,4 Prozent, während kleinere Größen deutlich abfallen. Prüfen Sie das Suchverhalten bei Ihrer tatsächlichen Kontextlänge, bevor Sie darum herum entwerfen.
Bild- und Videoverständnis stehen in der gesamten Gemma-4-Reihe zur Verfügung, und verschachtelte multimodale Eingaben werden unterstützt. Audio ist die Ausnahme: Die offizielle Modellkarte beschränkt automatische Spracherkennung und Sprache-zu-übersetztem-Text auf E2B, E4B und 12B. Ist Spracheingabe erforderlich, scheiden die beiden größten Modelle aus.
Google gibt die Unterstützung von 140 Sprachen an und fasst das Ziel als Verstehen kulturellen Kontexts statt wörtlicher Übersetzung. Wie bei jeder breiten mehrsprachigen Angabe schwankt die Qualität über diesen Bereich erheblich; prüfen Sie daher die Leistung in Ihren konkreten Zielsprachen, statt Einheitlichkeit zu unterstellen.
Beim Selbsthosten müssen Inferenzdaten Ihre Infrastruktur nicht verlassen, was die stärkste Datenschutzeigenschaft des Ansatzes mit offenen Gewichten ist. Google weist die nachgelagerte Verantwortung jedoch ausdrücklich Ihnen zu und legt Entwicklern nahe, Datenschutzvorschriften mit datenschutzwahrenden Techniken einzuhalten. Datenschutzkonformität, Protokollierungsrichtlinie und Inhaltsschutz sind von Ihnen zu entwerfen und umzusetzen.
Ja – die Feinabstimmung ist eine der fünf Fähigkeiten, die Google für die Familie aufführt, und die offizielle Verteilungsseite verweist auf Trainingswerkzeug einschließlich Unsloth, Keras, JAX und GKE. Das entstehende Modell bleibt unter Ihrer Kontrolle, was ein Hauptgrund dafür ist, dass Teams offene Gewichte einer gehosteten API vorziehen.
Gemma 4 ist bei Schlussfolgerungs-Benchmarks stärker und trägt die freizügigere Apache-2.0-Lizenz, es ist daher die Standardwahl. Gemma 3 bleibt in zwei Situationen relevant: wenn Sie die Größe 270M benötigen, die in Gemma 4 kein Gegenstück hat, und wenn vorhandenes Werkzeug bereits darauf festgelegt ist. Entscheiden Sie sich für Gemma 3, denken Sie daran, dass sich dessen Lizenzbedingungen von denen von Gemma 4 unterscheiden und gesondert geprüft werden müssen.