Toolso.AI
Toolso.AI
Alle ToolsKategorienIm TrendNeueste ToolsPreiseBlog
Toolso.AI
Toolso.AI

💌Abonnieren Sie AI Tools Weekly

Wöchentlich kuratierte Auswahl der neuesten und angesagtesten KI-Tools und Trends, direkt in Ihrem Posteingang Abonnieren

Toolso.AI
Toolso.AI

Entdecken Sie die besten KI-Tools, um Ihre Produktivität zu steigern

GitHubGitHubTwitterX (Twitter)YouTubeYouTubeTikTokEmail

Beliebte Kategorien

  • KI-Schreiben
  • KI-Bild
  • KI-Video
  • KI-Programmierung
  • Weitere Kategorien

Entdecken

  • Neueste Tools
  • Beliebte Tools
  • Mehr Tools
  • Tool einreichen
  • Preise

Über

  • Über uns
  • Kontakt
  • Blog
  • Änderungsprotokoll

Rechtliches

  • Cookie-Richtlinie
  • Datenschutzrichtlinie
  • Nutzungsbedingungen
  • Rückerstattungsrichtlinie
© 2026 Toolso.AI Alle Rechte vorbehalten
BefristetZeitlich begrenztHervorgehobener EintragPrüfung in 24 Std. · Kein Backlink · 30 Tage hervorgehoben$29.90danach $59.90Nach dem 31. Okt. steigt der Preis auf $59.90Endet in--:--:--Jetzt einreichen
  1. Startseite
  2. Alle Tools
  3. Modellbibliothek
  4. Gemma
Oberflächenvorschau von Gemma
Logo von Gemma

Gemma

Gemma ist die offene Modellreihe von Google DeepMind, entstanden aus derselben Forschung wie Gemini, aber als herunterladbare Gewichte veröffentlicht, die Sie selbst betreiben. Gemma 4 erscheint unter Apache 2.0 in Größen vom Smartphone über den Raspberry Pi bis zur einzelnen Consumer-GPU.

ModellbibliothekOpen Source KIKI-Entwicklung#Open Source#Entwicklertools#Google
Kostenlos testen
Gespeichert
Besuche
Aufrufe
Preis
Freemium
Veröffentlicht
14. Aug. 2026
Domain
deepmind.google
Nutzerbewertung

Hast du dieses Tool genutzt? Bewerte es

Dieses Tool bewerten

Gemma Produktinformationen

Kostenlos testen
Tool-Informationen
Gespeichert
Besuche
Aufrufe
Preis
Freemium
Veröffentlicht
14. Aug. 2026
Domain
deepmind.google
Nutzerbewertung

Hast du dieses Tool genutzt? Bewerte es

Dieses Tool bewerten

Empfohlene Tools

Verwandte Tools

Kostenlos testen

Was ist Gemma?

Gemma ist die offene Modellfamilie von Google DeepMind. Auf der eigenen Produktseite wird die Reihe als „Gemma / Unsere leistungsfähigsten offenen Modelle" eingeführt, und sie steht in einer Navigationsspalte mit der Überschrift Open models, bewusst getrennt von Gemini, Veo und Imagen, also den proprietären Linien, die man über eine API erreicht statt sie herunterzuladen. Diese Einordnung ist die wichtigste Einzelinformation zu diesem Eintrag, denn sie legt fest, was Sie tatsächlich erhalten: kein Konto mit Nutzungszähler, sondern Modellgewichte, die Sie selbst beziehen, hosten und betreiben.

Es lohnt sich, bei den Namen genau zu sein, denn hier beginnt die meiste Verwirrung. Google DeepMind ist eine Forschungsorganisation. Gemini ist ihre proprietäre Vorzeigemodellfamilie, ausgeliefert über Googles eigene Produkte und APIs. Gemma ist das offene Geschwistermodell, laut Formulierung der Gemma-4-Seite gebaut als „Unsere intelligentesten offenen Modelle, entwickelt aus der Forschung und Technologie von Gemini 3, um die Intelligenz pro Parameter zu maximieren". Die drei Namen werden von Verzeichnisseiten und Nachrichtenaggregatoren regelmäßig vermengt, bezeichnen aber Verschiedenes: eine Organisation, ein gehostetes Modell und ein herunterladbares. Diese Seite behandelt das dritte.

Die Entwurfsabsicht hinter Gemma folgt unmittelbar aus dieser Offenheit. Googles erklärtes Ziel ist Portabilität statt roher Bestenlistenherrschaft: „Unsere fortschrittlichsten offenen Modelle helfen Entwicklern, KI-Anwendungen zu erstellen, die überall dort laufen, wo Nutzer sie brauchen – von Cloud-Servern über Laptops bis hin zu Telefonen." Alles Weitere an dieser Familie, die ungewöhnliche Spannweite der Parametergrößen, die Mixture-of-Experts-Varianten, die Per-Layer-Embedding-Kniffe in den kleinen Modellen, ist eine Folge dieses Satzes. Gemma ist so konstruiert, dass dieselbe Modellfamilie auf einem Jetson Nano und auf einem Rack voller Beschleuniger betrieben werden kann, ohne den Anbieter zu wechseln oder die Anwendung neu zu schreiben.

Die Offenheit hat eine zweite praktische Konsequenz. Weil die Gewichte verteilt und nicht als Dienst bereitgestellt werden, gibt es keinen Registrierungsprozess, keine Platzzählung und keine Token-Rechnung von Google für den Betrieb des Modells. An deren Stelle treten eine Lizenz, eine Hardwarerechnung und eine Betriebslast, die vollständig Ihnen gehört. Zu verstehen, wo diese drei jeweils anfallen, macht den Großteil der Bewertung von Gemma aus.

Google rahmt Gemma zudem als Instrument verantwortungsvoller Bereitstellung und nicht als rohes Forschungsartefakt. Die einzeilige Positionierung an der Spalte Open models lautet „Verantwortungsvolle KI-Anwendungen im großen Maßstab bauen", und die Familie enthält neben den Allzweckmodellen eigene Sicherheitsklassifikatoren. Ob diese Rahmung in der Praxis trägt, hängt stark davon ab, was Sie rund um das Modell bauen – ein Punkt, den die offizielle Dokumentation unverblümt benennt und auf den der Abschnitt zu den Grenzen zurückkommt.

Kernfunktionen

  • Eine abgestufte Leiter von Modellgrößen, kein einzelnes Modell. Die aktuelle Generation Gemma 4 erscheint in zwei Stufen. Die Edge-Stufe umfasst E2B und E4B, die Workstation-Stufe umfasst 12B, 26B A4B und 31B. Jede Stufe zielt auf eine andere Bereitstellungsumgebung, statt lediglich „dasselbe in größer" anzubieten. Die Wahl eines Gemma-Modells ist daher eine hardwaregetriebene und keine qualitätsgetriebene Entscheidung.
  • Nativer Funktionsaufruf für Agenten-Workflows. Die offizielle Fähigkeitsliste beschreibt das Ziel so: „Bauen Sie autonome Agenten, die planen, durch Apps navigieren und Aufgaben in Ihrem Namen erledigen, mit nativer Unterstützung für Funktionsaufrufe." Der Funktionsaufruf ist hier eine antrainierte erstklassige Fähigkeit und keine nachträglich aufgesetzte Prompt-Konvention, was zählt, sobald Sie das Modell in werkzeugnutzende Schleifen einbinden.
  • Multimodale Eingabe über Text, Bild und – bei einigen Größen – Audio. Google beschreibt die Fähigkeit als „Entwickeln Sie Anwendungen mit starkem Audio- und Bildverständnis für umfassende multimodale Unterstützung." Der wichtige Vorbehalt: Die Modalitätsunterstützung ist über die Leiter hinweg nicht einheitlich. Die offizielle Modellkarte vermerkt die Audioverarbeitung als „Audio (nur E2B, E4B und 12B) – automatische Spracherkennung (ASR) und Übersetzung von Sprache in übersetzten Text über mehrere Sprachen hinweg." Wer Spracheingabe braucht, scheidet damit die beiden größten Größen aus.
  • Langer Kontext, nach Modellgröße gestaffelt. Die offizielle Modellkarte hält fest: „Gemma 4 verfügt über ein Kontextfenster von bis zu 256K Token und behält die mehrsprachige Unterstützung in über 140 Sprachen bei." Der Wert von 256K gilt für die Workstation-Stufe, die Edge-Modelle tragen ein kleineres Fenster. Unabhängige Berichte zur Veröffentlichung verzeichnen dieselbe Aufteilung – Edge-Modelle bei 128K Token, Workstation-Modelle bei 256K – was mit der Herstellerdokumentation übereinstimmt.
  • Mehrsprachige Abdeckung mit 140 Sprachen angegeben. Die Fähigkeitsseite rahmt dies als mehr als mechanische Übersetzung: „Schaffen Sie mehrsprachige Erlebnisse, die über Übersetzung hinausgehen und kulturellen Kontext verstehen." Wie bei jeder derartigen Breitenangabe ist die Qualität über alle 140 Sprachen hinweg nicht gleichmäßig; behandeln Sie sie als Ausgangspunkt für eine Bewertung in Ihren Zielsprachen und nicht als Zusicherung.
  • Eine Mixture-of-Experts-Option für günstige Inferenz bei hoher Kapazität. Das Modell 26B A4B ist ein dünn besetzter Entwurf, und die Modellkarte erklärt den Nutzen direkt: „Da während der Inferenz nur eine Teilmenge von 4B Parametern aktiviert wird, läuft das Mixture-of-Experts-Modell deutlich schneller, als seine 26B Gesamtgröße vermuten ließe." Das eröffnet einen Mittelweg zwischen kleinem dichten Modell und teurem großen Modell.
  • Parametereffizienz als Ingenieursleistung in den Edge-Modellen. Die kleinsten Größen sind keine bloß gekürzten Fassungen der großen. Die Modellkarte erläutert: „Das "E" in E2B und E4B steht für "effektive" Parameter. Die kleineren Modelle nutzen Per-Layer Embeddings (PLE), um die Parametereffizienz bei Bereitstellungen auf dem Gerät zu maximieren." Diese architektonische Entscheidung ist der Grund, weshalb sich ein Modell mit nominell milliardenschwerer Parameterzahl auf ein Telefon bringen lässt.
  • Feinabstimmung als unterstützter erstklassiger Weg. Fine tuning steht in der offiziellen Fünferliste der Fähigkeiten, und die Verteilungsseite führt direkt zum Trainingswerkzeug. Gemma ist darauf angelegt, spezialisiert zu werden, nicht nur im Auslieferungszustand konsumiert.
  • Eine Familie eigens gebauter offizieller Varianten. Über die Allzweckmodelle hinaus veröffentlicht Google Ableitungen für bestimmte Domänen, darunter DiffusionGemma, das Encoder-Decoder-Modell T5Gemma, das medizinische MedGemma und den Sicherheitsklassifikator ShieldGemma 2, beschrieben als „ein modulares Klassifikatormodell zur Erkennung richtlinienwidriger Inhalte und zur Wahrung von Sicherheitsstandards". Es handelt sich um offizielle Veröffentlichungen, nicht um Community-Forks.

Modellpalette und Auswahl

Der schwierigste Teil bei der Einführung von Gemma ist nicht die Installation, sondern die Wahl der richtigen Sprosse auf der Leiter. Die Größen sind nicht austauschbar, und ausschlaggebend ist meist die vorhandene Hardware und nicht eine Benchmark-Tabelle.

Die Edge-Stufe (E2B, E4B). Google positioniert sie ausdrücklich für eingeschränkte Geräte: „Audio- und Bildunterstützung für Echtzeitverarbeitung am Rand. Sie können vollständig offline mit nahezu null Latenz auf Edge-Geräten wie Telefonen, Raspberry Pi und Jetson Nano laufen." Der Offlinebetrieb ist die Kerneigenschaft. Wenn Ihre Anforderung lautet, dass Inferenz ohne Netz funktionieren muss – im Fahrzeug, in der Klinik, in der Werkhalle, im ländlichen Klassenzimmer –, ist genau diese Stufe der Grund, Gemma überhaupt zu betrachten. Im Gegenzug akzeptieren Sie ein kürzeres Kontextfenster und deutlich schwächere Leistung bei schwierigem Schlussfolgern und langer Dokumentensuche.

Die Workstation-Stufe (12B, 26B A4B, 31B). Diese zielt auf Consumer-Grafikkarten statt auf Rechenzentrumsbeschleuniger. Googles Darstellung: Sie liefern „fortgeschrittenes Schlussfolgern für IDEs, Coding-Assistenten und agentische Workflows. Diese Modelle sind für Consumer-GPUs optimiert und geben Studierenden, Forschenden und Entwicklern die Möglichkeit, Workstations in lokal-erste KI-Server zu verwandeln." Das 26B A4B ist die interessante Mitteloption: Es trägt 25,2 Milliarden Parameter insgesamt, aktiviert bei der Inferenz aber rund 3,8 Milliarden, verhält sich also geschwindigkeitsseitig eher wie ein kleines Modell und behält dabei mehr Kapazität. Das dichte 31B-Modell mit 30,7 Milliarden Parametern und einem 256K-Fenster bildet die Spitze der Reihe.

Die vorige Generation zählt weiterhin. Gemma 3 ist nicht verschwunden. Es bleibt in den Größen 270M, 1B, 4B, 12B und 27B mit einem 128K-Token-Fenster verfügbar, und Googles eigene Beschreibung – „Das 128K-Token-Kontextfenster von Gemma 3 lässt Ihre Anwendungen riesige Informationsmengen verarbeiten und verstehen und ermöglicht anspruchsvollere KI-Funktionen" – beschreibt weiterhin ein brauchbares Modell. Insbesondere die Größe 270M hat kein Gegenstück in Gemma 4, weshalb für extrem kleine Fußabdrücke die ältere Generation mitunter die einzige Option ist. Entscheidend ist, dass sich die Lizenzen zwischen den Generationen unterscheiden, was der nächste Abschnitt behandelt.

Eine praktische Auswahlheuristik: Gehen Sie vom Bereitstellungsziel aus, nicht von einer Bestenliste. Muss es offline auf einem Handgerät laufen, sind Sie in der Edge-Stufe und sollten die Qualität früh an Ihren echten Aufgaben prüfen. Haben Sie eine moderne Consumer-GPU und wollen einen lokalen Coding- oder Agentenassistenten, beginnen Sie bei 12B und gehen nur höher, wenn die Qualität es verlangt. Brauchen Sie Spracheingabe, beschränken Sie sich auf E2B, E4B oder 12B. Brauchen Sie maximale Qualität und haben die Hardware, ist das dichte 31B-Modell die Obergrenze der Familie.

Lizenzierung: das Detail, das die meisten Zusammenfassungen falsch wiedergeben

Dieser Abschnitt lohnt zweimaliges Lesen, denn die am häufigsten wiederholte Aussage über Gemma – „Gemma ist Apache-2.0-lizenziert" – trifft nur auf die aktuelle Generation zu.

Gemma 4 ist tatsächlich zu einer echten Standard-Open-Source-Lizenz übergegangen. Googles Open-Source-Blog sagt es unmissverständlich: „Die Gemma-4-Modelle sind die ersten im Gemmaverse, die unter der OSI-anerkannten Apache-2.0-Lizenz veröffentlicht werden." Die offizielle Modellkarte bestätigt es maschinenlesbar, das Feld im Kopfbereich lautet schlicht „license: apache-2.0". Für Gemma 4 arbeiten Sie also mit einer OSI-anerkannten permissiven Lizenz mit den Weiterverbreitungs- und Kommerzialisierungseigenschaften, die Entwickler davon erwarten.

Frühere Generationen sind eine andere Sache. Die Repository-Metadaten in der offiziellen Google-Organisation auf Hugging Face zeigen die Trennung deutlich: Gemma-4-Repositories tragen die Kennzeichnung apache-2.0, während gemma-2, gemma-3n und gemma-7b weiterhin mit Googles eigener Lizenz gemma gekennzeichnet sind. Eine Versionsübersicht dritter Seite verzeichnet denselben Übergang und hält fest, dass Google Gemma 4 „unter der freien und quelloffenen Apache-2.0-Lizenz" veröffentlichte, während die früheren Generationen unter quelloffen einsehbaren Gemma-Nutzungsbedingungen verteilt wurden.

Die praktische Folge ist konkret. Hat Ihr Compliance-Prozess „Gemma" als Apache-2.0-Abhängigkeit freigegeben und Ihre Entwickler ziehen anschließend einen Gemma-3- oder Gemma-2-Checkpoint – völlig naheliegend, da diese aktuell, gepflegt und mitunter besser geeignet sind –, dann ist die für Ihren Einsatz maßgebliche Lizenz nicht diejenige, die Ihr Prozess freigegeben hat. Prüfen Sie jedes Mal das Lizenzfeld des konkreten Repositorys, das Sie herunterladen, statt sich auf Aussagen auf Familienebene zu verlassen, diese hier eingeschlossen.

Zur Verbreitung berichtet Google: „Seit der ersten Veröffentlichung hat die Community Gemma-Modelle über 400 Millionen Mal heruntergeladen und ein lebendiges Universum von über 100.000 inspirierenden Varianten aufgebaut, in der Community als Gemmaverse bekannt." Das sind vom Hersteller berichtete Zahlen ohne unabhängige Prüfung; sie taugen als Signal, dass das Ökosystem nicht verwaist ist, und nicht als Qualitätsmaß.

Bezugsquellen und Betrieb

Die Verteilung ist bewusst über das Werkzeug gestreut, das Entwickler ohnehin nutzen, statt in ein Google-eigenes Angebot kanalisiert zu werden. Die offizielle Seite listet Plattformen und Integrationen von Kaggle, Hugging Face, Keras, Ollama, PyTorch, Gemma.cpp, JAX, Google AI Edge, Google Cloud, Android, LM Studio bis Unsloth.

Speziell für Gewichte trennt die Gemma-4-Seite Downloadziele von Trainings- und Bereitstellungswegen und verweist für Downloads auf Hugging Face, Ollama, Kaggle, LM Studio und Docker. In der Praxis heißt das, dass der schnellste Weg vollständig von Ihrem vorhandenen Stack abhängt und nicht von Gemma-spezifischem Werkzeug:

  1. Nur ausprobieren, ohne Installation. Google bietet über AI Studio einen gehosteten Einstiegspunkt zum Testen, sodass Sie die Ausgabequalität beurteilen können, bevor Sie Hardware binden. Das ist der einzige Schritt im gesamten Ablauf, der der Nutzung eines gewöhnlichen SaaS-Werkzeugs ähnelt.
  2. Lokale Desktop-Nutzung. Ollama oder LM Studio holen einen quantisierten Build und liefern Ihnen mit wenigen Befehlen einen funktionierenden lokalen Endpunkt. Das ist der Standardweg für den Arbeitsplatz einzelner Entwickler.
  3. Anwendungsintegration. Von Hugging Face beziehen und über Ihren bestehenden Inferenz-Stack ausliefern, oder Docker-Images verwenden, wenn Sie reproduzierbare Container wollen.
  4. Mobil und eingebettet. Google AI Edge und der Android-Weg zielen auf Bereitstellung auf dem Gerät; Gemma.cpp existiert für native Inferenz mit minimalen Abhängigkeiten.
  5. Feinabstimmung. Zu den trainingsseitigen Wegen zählen Unsloth, Keras, JAX und GKE. Google führt die Feinabstimmung unter den fünf Kernfähigkeiten des Modells auf und beschreibt das Training mit den Frameworks und Techniken, die Sie bevorzugen.

Der Support hat Community- und Dokumentationsform statt Vertragsform. Die offizielle Seite verweist auf „offizielle Dokumentation, Schnellstarts und Leitfäden zum Bau von Anwendungen mit Gemma" und lenkt Fragen in ein Entwicklerforum. Mit dem Herunterladen eines offenen Modells kommen weder Service-Level-Zusagen noch eine Ticket-Warteschlange noch ein Kundenbetreuer – ein Kompromiss, der im Grundsatz offensichtlich ist, im Produktivbetrieb aber gelegentlich überrascht.

Leistung: Herstellerzahlen sorgfältig lesen

Google veröffentlicht eine Benchmark-Tabelle, die Gemma 4 dem Vorgänger gegenüberstellt, und der Generationssprung bei stark schlussfolgernden Aufgaben ist groß. In der Mathematik AIME 2026 ohne Werkzeugeinsatz wird das 31B-Modell mit 89,2 Prozent gegenüber 20,8 Prozent für Gemma 3 27B angegeben. Weitere auf der Gemma-4-Seite veröffentlichte Werte betreffen Arena-Wertungen, Wettbewerbsprogrammierung und Fragen auf Graduiertenniveau.

Für jede Zahl dieser Tabelle gelten zwei Vorbehalte. Erstens sind es vom Hersteller berichtete Ergebnisse, erzeugt von der Partei mit Interesse am Ausgang; sie sind eine vernünftige Ausgangshypothese, kein unabhängiger Befund. Zweitens verdecken Schlagzeilenmittelwerte die größenabhängigen Abbrüche, die bei der Bereitstellung am meisten zählen. Die Suche im langen Kontext ist das deutlichste Beispiel: Beim Suchmaß MRCR v2 mit acht Nadeln über 128K berichtet die Modellkarte 66,4 Prozent für das größte Modell, wobei jede kleinere Größe steil darunter abfällt. Ein Modell, das mit einem langen Fenster beworben wird, nutzt dieses Fenster nicht zwangsläufig verlässlich, und der Abstand zwischen oberem und unterem Ende der Leiter ist bei diesem Maß weit größer als bei allgemeinen Wissensbenchmarks.

Unabhängige Kommentare werfen ein verwandtes strukturelles Problem auf: Eine Analyse des technischen Berichts zu Gemma 4 merkt an, er „schreibt den Zugewinn der Datenzusammensetzung zu und beschreibt seine Trainingsdaten dann in zwei Sätzen." Da das Korpus nicht im Detail beschrieben wird, können Außenstehende weder Benchmark-Kontamination unabhängig einschätzen noch die Domänenabdeckung prüfen. Das entwertet die berichteten Zahlen nicht, bedeutet aber, dass der einzige Benchmark, der die Frage für Ihren Anwendungsfall abschließend klärt, derjenige ist, den Sie selbst auf eigenen zurückgehaltenen Daten fahren.

Anwendungsfälle

  • Offline- und luftspaltgetrennte Bereitstellungen. Die Fähigkeit der Edge-Stufe, „vollständig offline mit nahezu null Latenz" zu laufen, macht Gemma passend für Umgebungen, in denen das Senden von Daten an eine gehostete API unmöglich ist, sei es aus Gründen der Anbindung, der Regulierung oder der Vertraulichkeit. Googles eigene Beispielsammlung hebt Lentera hervor, das einen Offline-KI-Mikroserver für Lehrende und Lernende betreibt, genau dieses Muster.
  • Lokal-erste Entwicklerwerkzeuge. Auf der Workstation-Stufe gebaute IDE-Assistenten und Coding-Helfer halten den Quellcode auf dem Rechner der Entwickler. Für Organisationen, die proprietären Code nicht an einen Drittanbieter-Endpunkt senden dürfen, ist das oft das entscheidende Argument.
  • Kostenkontrollierte Inferenz bei hohem Volumen. Bei großem und planbarem Anfragevolumen kann eigene Hardware mit einem offenen Modell günstiger sein als Abrechnung pro Token. Das Mixture-of-Experts-Modell 26B A4B ist genau für diesen ökonomisch getriebenen Mittelbereich entworfen.
  • Domänenspezialisierung durch Feinabstimmung. Weil Gewichte verfügbar sind, können Teams auf proprietären Daten trainieren und das entstehende Modell im Haus behalten. Googles Beispielsammlung nennt Crane AI Labs, das auf Gemma ein leichtgewichtiges Suaheli-Modell aufgebaut hat – eine Illustration dafür, wie ein Allzweckmodell an eine Sprache oder Domäne angepasst wird, die die Basisveröffentlichung schwächer bedient.
  • Sicherheits- und Moderationspipelines. ShieldGemma 2 existiert als eigener Klassifikator zur Erkennung richtlinienwidriger Inhalte, sodass die Familie sowohl die generative Komponente als auch einen Teil der Schutzschicht liefern kann.
  • Forschung und Lehre. Offene Gewichte machen das Verhalten auf eine Weise inspizierbar, die eine API nicht erlaubt. Für Interpretierbarkeitsarbeit, Ablationsstudien oder Lehrveranstaltungen ist genau dieser Zugang der eigentliche Zweck.
  • Umgang mit regulierten Daten. Wo Regeln zur Datenresidenz begrenzen, wo Inferenz stattfinden darf, verlegt das Selbsthosten eines offenen Modells die Bereitstellungsgrenze in Ihre Kontrolle statt in die eines Anbieters.

Für wen ist Gemma gedacht?

Gemma passt zu Entwicklern, Forschenden und technischen Teams, denen die Kontrolle über die Bereitstellung wichtiger ist als Bequemlichkeit. Wenn Sie sicher Hardware bereitstellen, einen Serving-Stack auswählen und die Betriebsfläche verantworten können, bietet Ihnen die Familie eine ungewöhnlich breite Größenleiter von einem einzigen Anbieter mit einheitlichem Werkzeug.

Sie passt zu Organisationen mit harten Randbedingungen, die gehostete APIs nicht erfüllen können: Offlinebetrieb, Datenresidenz, Codevertraulichkeit oder eine Stückkostenrechnung im Volumen, die eine Abrechnung pro Token untragbar macht. In diesen Fällen ist die Betriebslast kein Nachteil, sondern der Preis für eine Anforderung, die anders nicht zu erfüllen ist.

Sie passt zu Menschen, die das Modell verändern wollen. Feinabstimmen, quantisieren, destillieren oder ein Modell in ein Geräteabbild einbetten setzt Gewichte voraus. Enthält Ihr Vorhaben eines dieser Verben, ist ein offenes Modell nicht eine Option unter mehreren, sondern die einzige infrage kommende Kategorie.

Sie passt schlecht zu nichttechnischen Nutzern, die einen Browser-Tab öffnen und ein Ergebnis wollen. Ein Endkundenprodukt gibt es hier nicht. Abgesehen vom Test über AI Studio bedeutet der Einsatz von Gemma Ingenieursarbeit. Wer schlicht „mit einem KI-Assistenten chatten" will, ist mit einem gehosteten Produkt besser bedient, sehr wahrscheinlich Gemini, und fände diesen Eintrag einen unnötigen Umweg.

Sie passt ebenso wenig zu Teams, die vertragliche Supportzusagen brauchen. Dokumentation und ein Entwicklerforum sind das gesamte Supportmodell. Verlangt Ihr Beschaffungsprozess einen Anbieter mit Service-Level-Zusage und Eskalationspfad, liefert der Download eines offenen Modells das nicht, unabhängig davon, wie groß der dahinterstehende Anbieter ist.

Grenzen und Vorbehalte

Googles eigene Dokumentation ist ungewöhnlich direkt zu den Grenzen des Modells, und diese selbst berichteten Grenzen sind nützlicher als die meiste Fremdkritik, weil sie zurechenbar sind.

Es ist keine Wissensdatenbank. Die Modellkarte hält fest, dass Modelle „Antworten auf Grundlage der Informationen erzeugen, die sie aus ihren Trainingsdatensätzen gelernt haben, aber sie sind keine Wissensdatenbanken. Sie können unzutreffende oder veraltete Tatsachenbehauptungen erzeugen." Behandeln Sie faktische Ausgaben als überprüfungsbedürftig, nicht als Abruf.

Die Trainingsdaten haben einen Stichtag. Der dokumentierte Vortrainingsstichtag ist Januar 2025 und umfasst Webdokumente, Code, Mathematik, Bilder und Audio. Alles nach diesem Datum liegt außerhalb des Modellwissens, weshalb zeitkritische Anwendungen unabhängig von der Modellgröße externe Recherche benötigen.

Offene Aufgaben sind schwieriger als klar umrissene. Wie es die Modellkarte formuliert, schneiden Modelle „bei Aufgaben gut ab, die sich mit klaren Prompts und Anweisungen fassen lassen. Offene oder hochkomplexe Aufgaben können schwierig sein." Die Struktur des Prompts leistet hier echte Arbeit.

Die Fähigkeiten sind über die Leiter hinweg nicht einheitlich. Das verdient Betonung, weil es die häufigste praktische Enttäuschung ist. Audioeingabe existiert nur bei E2B, E4B und 12B. Die Suche im langen Kontext verschlechtert sich bei kleineren Modellen deutlich. Eine am 31B-Modell gezeigte Fähigkeit sollte nie als auf E2B übertragbar angenommen werden.

Fachliche Beratung liegt außerhalb des Anwendungsbereichs. Googles eigener Hinweis in der Fußzeile ist eindeutig: „Verlassen Sie sich bei medizinischer, juristischer, finanzieller oder anderer fachlicher Beratung nicht auf LLMs. Alle Inhalte zu diesen Themen dienen der Information und ersetzen nicht den Rat einer qualifizierten Fachperson." Die Existenz von MedGemma ändert daran nichts; ein domänenangepasstes Modell ist noch immer keine Ärztin und kein Arzt.

Die Transparenz der Trainingsdaten ist begrenzt. Wie erwähnt kritisiert eine unabhängige Analyse die Kürze der Trainingsdatenbeschreibung. Sie können nicht vollständig prüfen, was in das Modell eingeflossen ist.

Sie erben die Betriebslast. Kein gehosteter Endpunkt bedeutet, dass Verfügbarkeit, Skalierung, Sicherheitsaktualisierungen, GPU-Kapazitätsplanung und Kosten Ihnen gehören. Kleine Teams unterschätzen diesen Punkt im Moment der Entscheidung häufig.

Datenschutz, Sicherheit und Verantwortung

Die Datenschutzlage eines offenen Modells unterscheidet sich strukturell von der eines gehosteten Dienstes, und der Unterschied wirkt in beide Richtungen.

Positiv gewendet bedeutet Selbsthosten, dass Inferenzdaten Ihre Infrastruktur gar nicht verlassen müssen. Es gibt keine anbieterseitige Prompt-Protokollierung zu verhandeln, weil es keine anbieterseitige Inferenz gibt. Für vertrauliche Arbeitslasten ist das das stärkste Argument, das diese Kategorie insgesamt besitzt.

Trainingsseitig berichtet Google von Filterarbeit am Vortrainingskorpus: „Um die vortrainierten Gemma-Modelle sicher und verlässlich zu machen, wurden automatisierte Verfahren eingesetzt, um bestimmte personenbezogene Daten und andere sensible Daten aus den Trainingsmengen herauszufiltern", wobei CSAM-Filterung in mehreren Stufen angewandt wurde. Das ist eine Herstelleraussage über einen Prozess, keine unabhängige Prüfung, und sollte so gelesen werden.

Entscheidend für jeden, der Gemma einsetzt, ist, dass Google die nachgelagerte Sicherheitsverantwortung ausdrücklich Ihnen zuweist. Die Modellkarte führt Datenschutzverstöße als erkanntes Risiko auf und hält fest, dass „Entwicklern nahegelegt wird, Datenschutzvorschriften mit datenschutzwahrenden Techniken einzuhalten." Zur Inhaltssicherheit ist sie ebenso direkt: „Entwicklern wird nahegelegt, Vorsicht walten zu lassen und angemessene Schutzmaßnahmen für Inhaltssicherheit auf Grundlage ihrer konkreten Produktrichtlinien und Anwendungsfälle umzusetzen."

Diese Zuweisung ist keine Formsache. Bei einer gehosteten API steht die Moderationsschicht des Anbieters zwischen Ihren Nutzern und dem rohen Modell, ob Sie wollen oder nicht. Beim Herunterladen von Gewichten kommt diese Schicht nicht mit. Schutzgeländer, Missbrauchsüberwachung, Protokollierungsrichtlinien, Altersprüfung und regulatorische Konformität werden zu Artefakten, die Sie bauen. ShieldGemma 2 hilft bei einem Teil davon, aber die Einbindung ist Ihre Arbeit.

Infrastrukturseitig erklärt Google, dass „Gemma-4-Modelle denselben strengen Infrastruktursicherheitsprotokollen unterliegen wie unsere proprietären Modelle", und positioniert die Familie damit als vertrauenswürdige Grundlage für Unternehmen und staatliche Stellen. Diese Aussage betrifft, wie die Modelle erzeugt und veröffentlicht werden, nicht, wie Sie sie anschließend betreiben.

Alternativen und Einordnung

Die redliche Vergleichsgruppe für Gemma sind andere Familien mit offenen Gewichten und nicht gehostete Assistenten, denn die Entscheidung fürs Selbsthosten kommt zuerst und die Wahl des Modells danach.

Gegenüber Gemini ist der Vergleich eigentlich eine Frage des Bereitstellungsmodells und nicht der Qualität. Gemini wird von Google ausgeliefert, verwaltet und fortlaufend aktualisiert; Gemma laden Sie herunter, betreiben es selbst und legen die Version fest. Zwingt Sie nichts zum Selbsthosten, ist der gehostete Weg weniger Aufwand. Besteht eine solche Randbedingung, kann Gemini sie um keinen Preis erfüllen.

Gegenüber anderen Familien mit offenen Gewichten – üblicherweise werden Llama, Qwen und Mistral herangezogen – liegen Gemmas Unterscheidungsmerkmale in der ungewöhnlichen Breite der Größenleiter, besonders am unteren Ende, in der Apache-2.0-Lizenz der aktuellen Generation und in der Tiefe der offiziellen Domänenvarianten. Die Konkurrenz bewegt sich allerdings schnell, und jede Aussage darüber, welches Modell qualitativ führt, hat eine kurze Haltbarkeit. Bewerten Sie im Moment der Entscheidung an Ihren eigenen Aufgaben, statt einer allgemeinen Rangliste zu vertrauen, diese Beschreibung eingeschlossen.

Gegenüber gar nichts lokal betreiben ist die Rechnung einfach: Gehostete APIs gewinnen bei der Zeit bis zum ersten Ergebnis und verlieren bei Datenkontrolle, Offlinefähigkeit und Grenzkosten im Volumen. Gemma ist seinen Betriebsaufwand wert, wenn mindestens einer dieser drei Faktoren eine harte Anforderung und keine Vorliebe ist.

Innerhalb der Familie ist die am meisten unterschätzte Alternative die vorige Generation. Gemma 3 bietet eine Größe 270M, die Gemma 4 nicht hat, und für sehr eingeschränkte Bereitstellungen kann das ausschlaggebend sein – vorausgesetzt, Sie berücksichtigen die oben erörterten abweichenden Lizenzbedingungen.

Häufige Fragen(FAQ)

Q1. Ist Gemma kostenlos nutzbar?

Die Gewichte lassen sich kostenlos herunterladen, und Google berechnet für den Betrieb nichts pro Token, weil Sie die Rechenleistung stellen. Gemma 4 erscheint unter der OSI-anerkannten Apache-2.0-Lizenz. Die tatsächlichen Kosten sind Hardware, Strom oder Cloud-Instanzzeit sowie der Ingenieursaufwand, ein Modell selbst zu betreiben. „Kostenlos" heißt hier „ohne Lizenzgebühr", nicht „ohne Kosten".

Q2. Darf ich Gemma kommerziell nutzen?

Für Gemma 4 erlaubt die Apache-2.0-Lizenz kommerzielle Nutzung, Änderung und Weiterverbreitung nach ihren Standardbedingungen. Für frühere Generationen prüfen Sie gesondert: Gemma 2, Gemma 3n und weitere ältere Repositories sind weiterhin mit Googles eigener Lizenz gemma statt mit Apache 2.0 gekennzeichnet, und diese eigenen Bedingungen enthalten Nutzungsbeschränkungen, die Apache 2.0 nicht kennt. Prüfen Sie stets das Lizenzfeld genau des Repositorys, das Sie herunterladen.

Q3. Worin unterscheiden sich Gemma und Gemini?

Gemini ist Googles proprietäre Modellfamilie, erreichbar als gehosteter Dienst. Gemma ist die offene Familie, deren Gewichte Sie selbst herunterladen und betreiben, entstanden aus verwandter Forschung – die Gemma-4-Seite beschreibt sie als aus Forschung und Technologie von Gemini 3 entwickelt. Gleiche Herkunft, entgegengesetzte Verteilungsmodelle. Google DeepMind wiederum ist die Forschungsorganisation, die beides veröffentlicht.

Q4. Welche Hardware brauche ich?

Das hängt vollständig von der gewählten Größe ab. E2B und E4B sind für Telefone und kleine Platinen einschließlich Raspberry Pi und Jetson Nano gebaut und können vollständig offline laufen. Die Modelle 12B, 26B A4B und 31B zielen auf Consumer-GPUs. Das 26B A4B ist ein Mixture-of-Experts-Entwurf, der bei der Inferenz rund 3,8 von 25,2 Milliarden Parametern aktiviert und daher schneller läuft, als seine Gesamtgröße vermuten lässt – häufig das beste Verhältnis von Kapazität zu VRAM in der Familie.

Q5. Wie langen Kontext unterstützt Gemma?

Bis zu 256K Token auf der Workstation-Stufe, wobei die Edge-Modelle ein kleineres Fenster von 128K tragen. Beachten Sie, dass ein Fenster zu unterstützen und es verlässlich zu nutzen zweierlei ist: Beim Maß der Modellkarte zur Suche im langen Kontext erreicht das größte Modell 66,4 Prozent, während kleinere Größen deutlich abfallen. Prüfen Sie das Suchverhalten bei Ihrer tatsächlichen Kontextlänge, bevor Sie darum herum entwerfen.

Q6. Kann Gemma Bilder und Audio verarbeiten?

Bild- und Videoverständnis stehen in der gesamten Gemma-4-Reihe zur Verfügung, und verschachtelte multimodale Eingaben werden unterstützt. Audio ist die Ausnahme: Die offizielle Modellkarte beschränkt automatische Spracherkennung und Sprache-zu-übersetztem-Text auf E2B, E4B und 12B. Ist Spracheingabe erforderlich, scheiden die beiden größten Modelle aus.

Q7. Wie viele Sprachen beherrscht Gemma?

Google gibt die Unterstützung von 140 Sprachen an und fasst das Ziel als Verstehen kulturellen Kontexts statt wörtlicher Übersetzung. Wie bei jeder breiten mehrsprachigen Angabe schwankt die Qualität über diesen Bereich erheblich; prüfen Sie daher die Leistung in Ihren konkreten Zielsprachen, statt Einheitlichkeit zu unterstellen.

Q8. Sind meine Daten privat, wenn ich Gemma nutze?

Beim Selbsthosten müssen Inferenzdaten Ihre Infrastruktur nicht verlassen, was die stärkste Datenschutzeigenschaft des Ansatzes mit offenen Gewichten ist. Google weist die nachgelagerte Verantwortung jedoch ausdrücklich Ihnen zu und legt Entwicklern nahe, Datenschutzvorschriften mit datenschutzwahrenden Techniken einzuhalten. Datenschutzkonformität, Protokollierungsrichtlinie und Inhaltsschutz sind von Ihnen zu entwerfen und umzusetzen.

Q9. Kann ich Gemma auf eigenen Daten feinabstimmen?

Ja – die Feinabstimmung ist eine der fünf Fähigkeiten, die Google für die Familie aufführt, und die offizielle Verteilungsseite verweist auf Trainingswerkzeug einschließlich Unsloth, Keras, JAX und GKE. Das entstehende Modell bleibt unter Ihrer Kontrolle, was ein Hauptgrund dafür ist, dass Teams offene Gewichte einer gehosteten API vorziehen.

Q10. Sollte ich Gemma 4 oder Gemma 3 verwenden?

Gemma 4 ist bei Schlussfolgerungs-Benchmarks stärker und trägt die freizügigere Apache-2.0-Lizenz, es ist daher die Standardwahl. Gemma 3 bleibt in zwei Situationen relevant: wenn Sie die Größe 270M benötigen, die in Gemma 4 kein Gegenstück hat, und wenn vorhandenes Werkzeug bereits darauf festgelegt ist. Entscheiden Sie sich für Gemma 3, denken Sie daran, dass sich dessen Lizenzbedingungen von denen von Gemma 4 unterscheiden und gesondert geprüft werden müssen.

Kennen Sie ein ähnliches Tool?
Wenn Sie andere großartige KI-Tools kennen, können Sie sie uns gerne einreichen