Gemma는 Google DeepMind가 공개한 오픈 모델 제품군입니다. 공식 제품 허브에서 이 라인은 "Gemma / 가장 뛰어난 성능의 오픈 모델"로 소개되며, Open models라는 내비게이션 항목 아래에 배치되어 Gemini, Veo, Imagen처럼 API를 통해서만 접근하는 독점 라인과 의도적으로 구분됩니다. 이 배치 자체가 이 항목에 관한 가장 중요한 사실입니다. 여러분이 받는 것은 계정과 사용량 계량기가 아니라, 직접 내려받아 직접 호스팅하고 직접 실행하는 모델 가중치이기 때문입니다.
이름을 정확히 짚고 넘어갈 필요가 있습니다. 대부분의 혼동이 여기서 시작되기 때문입니다. Google DeepMind는 연구 조직이고, Gemini는 Google 자사 제품과 API를 통해 제공되는 플래그십 독점 모델 제품군이며, Gemma는 그 개방형 형제 제품입니다. Gemma 4 페이지의 표현을 빌리면 "Gemini 3 연구와 기술에서 출발해 파라미터당 지능을 극대화하도록 만든, 가장 지능적인 오픈 모델"입니다. 이 세 이름은 디렉터리 사이트와 뉴스 수집기에서 흔히 뒤섞여 쓰이지만, 각각 조직, 호스팅 모델, 내려받는 모델이라는 완전히 다른 대상을 가리킵니다. 이 페이지가 다루는 것은 세 번째입니다.
Gemma의 설계 의도는 이 개방성에서 곧바로 따라 나옵니다. Google이 내세우는 목표는 리더보드 정상이 아니라 이식성입니다. "가장 앞선 오픈 모델은 개발자가 사용자가 필요로 하는 어느 곳에서든 실행되는 AI 애플리케이션을 만들도록 돕습니다. 클라우드 서버부터 노트북, 나아가 휴대폰까지." 이 제품군의 다른 모든 특징, 즉 비정상적으로 넓은 파라미터 구간, 전문가 혼합 변형, 소형 모델의 레이어별 임베딩 기법은 모두 이 문장의 파생물입니다. Gemma는 같은 모델 제품군을 Jetson Nano에도, 가속기 랙에도 배포할 수 있도록, 그 사이에 공급업체를 바꾸거나 애플리케이션을 다시 쓰지 않도록 설계되었습니다.
개방성에는 두 번째 실질적 결과가 따릅니다. 가중치가 서비스로 제공되는 대신 배포되기 때문에, 여기에는 가입 절차도, 좌석 수도, Google이 토큰 단위로 청구하는 명세서도 없습니다. 그 자리를 대신하는 것은 라이선스, 하드웨어 비용, 그리고 전적으로 여러분이 지는 운영 부담입니다. Gemma를 평가하는 작업의 대부분은 이 세 가지가 각각 어디에 떨어지는지 파악하는 일입니다.
Google은 동시에 Gemma를 원시 연구 산출물이 아니라 책임 있는 배포를 위한 도구로 자리매김합니다. Open models 항목에 붙은 한 줄 정의는 "책임감 있게 대규모로 AI 애플리케이션을 구축하세요"이며, 제품군에는 실제로 전용 안전 분류기 변형이 함께 제공됩니다. 다만 이 자리매김이 실제로 성립하는지는 여러분이 모델 주위에 무엇을 만들어 붙이느냐에 크게 좌우되며, 공식 문서도 이 점을 매우 직설적으로 밝히고 있습니다. 이 글의 한계 항목에서 다시 다룹니다.
Gemma 도입에서 가장 어려운 부분은 설치가 아니라 사다리에서 올바른 칸을 고르는 일입니다. 각 크기는 서로 대체 가능하지 않으며, 결정적 요인은 대개 벤치마크 표가 아니라 이미 보유한 하드웨어입니다.
엣지 등급(E2B, E4B). Google은 이 등급을 제약된 기기용으로 명확히 자리매김합니다. "실시간 엣지 처리를 위한 오디오 및 비전 지원. 휴대폰, Raspberry Pi, Jetson Nano 같은 엣지 기기에서 완전히 오프라인으로, 거의 지연 없이 실행할 수 있습니다." 오프라인 동작이 핵심 속성입니다. 추론이 네트워크 없이 작동해야 한다는 요구가 있다면(차량 안, 진료소, 공장 현장, 시골 교실 등) 바로 이 등급이 Gemma를 검토할 근본적인 이유가 됩니다. 대가로 더 짧은 컨텍스트 창과, 어려운 추론 및 장문서 검색에서 눈에 띄게 약한 성능을 받아들여야 합니다.
워크스테이션 등급(12B, 26B A4B, 31B). 이 등급은 데이터센터 가속기가 아니라 소비자용 그래픽 카드를 겨냥합니다. Google의 표현으로는 "IDE, 코딩 어시스턴트, 에이전트 워크플로를 위한 고급 추론 능력을 제공합니다. 이 모델들은 소비자용 GPU에 최적화되어 학생, 연구자, 개발자가 워크스테이션을 로컬 우선 AI 서버로 바꿀 수 있게 합니다." 그중 26B A4B가 흥미로운 중간 선택지입니다. 총 25.2B 파라미터를 가지지만 추론 시 약 3.8B만 활성화하므로 속도는 소형 모델에 가깝게 동작하면서 더 큰 용량을 유지합니다. 30.7B 파라미터에 256K 창을 갖춘 31B 밀집 모델이 이 제품군의 상한선입니다.
이전 세대도 여전히 중요합니다. Gemma 3는 사라지지 않았습니다. 여전히 270M, 1B, 4B, 12B, 27B 다섯 크기로 제공되며 128K 토큰 창을 갖추고 있고, Google 자체 설명인 "Gemma 3의 128K 토큰 컨텍스트 창은 애플리케이션이 방대한 정보를 처리하고 이해하게 하여 더 정교한 AI 기능을 가능하게 합니다"는 지금도 쓸 만한 모델을 묘사합니다. 특히 270M 크기는 Gemma 4에 대응 모델이 없으므로, 극단적으로 제약된 배포에서는 이전 세대가 유일한 선택지가 되기도 합니다. 중요한 것은 세대 간 라이선스가 다르다는 점이며, 이는 다음 항목에서 다룹니다.
실무적인 선택 요령은 이렇습니다. 리더보드가 아니라 배포 대상에서 출발하십시오. 휴대 기기에서 오프라인으로 돌아가야 한다면 여러분은 엣지 등급에 있으며, 실제 과제로 품질을 일찍 검증해야 합니다. 최신 소비자용 GPU 한 장이 있고 로컬 코딩이나 에이전트 어시스턴트를 원한다면 12B에서 시작해 품질이 부족할 때만 위로 올라가십시오. 음성 입력이 필요하면 E2B, E4B, 12B로 범위를 좁히십시오. 최고 품질이 필요하고 하드웨어가 받쳐준다면 31B 밀집 모델이 이 제품군의 천장입니다.
이 항목은 두 번 읽을 가치가 있습니다. Gemma에 관해 가장 널리 반복되는 문장, 즉 "Gemma는 Apache 2.0 라이선스"라는 말이 현재 세대에만 참이기 때문입니다.
Gemma 4는 실제로 표준적인 오픈소스 라이선스로 이동했습니다. Google 오픈소스 블로그는 이를 분명히 밝힙니다. "Gemma 4 모델은 OSI가 승인한 Apache 2.0 라이선스로 공개된 Gemmaverse 최초의 모델입니다." 공식 모델 카드도 기계 판독 가능한 형태로 이를 확인해 주며, front matter 필드에 그대로 license: apache-2.0이라고 적혀 있습니다. 따라서 Gemma 4에 대해서는 개발자가 기대하는 재배포 및 상업적 이용 속성을 갖춘, OSI 승인 허용적 라이선스를 다루게 됩니다.
이전 세대는 사정이 다릅니다. Hugging Face의 공식 google 조직 저장소 메타데이터는 이 경계를 뚜렷이 보여줍니다. Gemma 4 저장소는 apache-2.0 태그를 달고 있는 반면, gemma-2, gemma-3n, gemma-7b 등의 저장소는 여전히 Google의 맞춤 gemma 라이선스로 표기되어 있습니다. 제3자 버전 정리 자료도 같은 전환을 기록하면서, Google이 Gemma 4를 "자유 오픈소스인 Apache 2.0 라이선스로" 공개했고 이전 세대들은 source-available 성격의 Gemma 이용약관으로 배포되었다고 명시합니다.
실무적 결과는 매우 구체적입니다. 컴플라이언스 절차가 "Gemma"를 Apache 2.0 의존성으로 승인했는데 이후 엔지니어가 Gemma 3나 Gemma 2 체크포인트를 내려받았다면(그 모델들도 현행이고 유지보수되며 때로는 더 적합하므로 충분히 있을 수 있는 일입니다), 실제 배포를 규율하는 라이선스는 절차가 승인한 그것이 아닙니다. 이 문장을 포함해 제품군 단위의 서술에 기대지 말고, 매번 내려받는 그 저장소의 라이선스 필드를 직접 확인하십시오.
도입 규모에 관해 Google은 "최초 출시 이후 커뮤니티는 Gemma 모델을 4억 회 이상 내려받았고, 커뮤니티에서 Gemmaverse라 부르는 10만 개 이상의 인상적인 변형을 만들어냈습니다"라고 보고합니다. 이는 독립 감사를 거치지 않은 공급업체 자체 보고 수치입니다. 생태계가 방치되지 않았다는 신호로는 유용하지만 품질 지표로 읽어서는 안 됩니다.
배포는 Google 자사 자산으로 모으는 대신, 개발자가 이미 쓰고 있는 도구 위에 의도적으로 넓게 펼쳐져 있습니다. 공식 허브가 열거하는 플랫폼과 통합에는 Kaggle, Hugging Face, Keras, Ollama, PyTorch, Gemma.cpp, JAX, Google AI Edge, Google Cloud, Android, LM Studio, Unsloth가 포함됩니다.
가중치에 한정하면, Gemma 4 페이지는 다운로드 경로와 학습·배포 경로를 분리해 제시하며 가중치 다운로드는 Hugging Face, Ollama, Kaggle, LM Studio, Docker로 안내합니다. 실무적으로는 가장 빠른 경로가 Gemma 전용 도구가 아니라 여러분이 이미 갖춘 스택에 전적으로 달려 있다는 뜻입니다.
지원 체계는 계약이 아니라 커뮤니티와 문서의 형태를 띱니다. 공식 허브는 "Gemma로 애플리케이션을 구축하기 위한 공식 문서, 빠른 시작, 가이드"를 안내하고 질문은 개발자 포럼으로 유도합니다. 오픈 모델을 내려받는 데에는 SLA도, 지원 티켓 대기열도, 전담 매니저도 따라오지 않습니다. 원칙적으로는 자명한 트레이드오프지만 프로덕션에서는 이따금 예상 밖으로 다가옵니다.
Google은 Gemma 4와 이전 세대를 비교한 벤치마크 표를 공개하며, 추론 부담이 큰 과제에서 세대 간 도약 폭이 큽니다. 도구를 쓰지 않은 AIME 2026 수학에서 31B 모델은 89.2%로 보고되며, Gemma 3 27B는 20.8%입니다. Gemma 4 페이지에 공개된 다른 수치는 아레나 평점, 경쟁 코딩, 대학원 수준 QA 등을 다룹니다.
그 표의 모든 수치에는 두 가지 주의가 따릅니다. 첫째, 이 결과들은 결과에 이해관계가 있는 당사자가 산출한 공급업체 자체 보고치이며, 독립적 발견이 아니라 합리적인 초기 가설입니다. 둘째, 대표 평균은 배포에서 가장 중요한, 크기에 따른 성능 절벽을 가립니다. 긴 컨텍스트 검색이 가장 분명한 예입니다. MRCR v2 8-needle 128K 검색 지표에서 모델 카드는 최대 모델을 66.4%로 보고하며 작은 크기일수록 가파르게 떨어집니다. 긴 창을 지원한다고 광고된 모델이 그 창을 신뢰성 있게 활용한다는 보장은 없으며, 이 지표에서 사다리 위아래의 격차는 일반 지식 벤치마크보다 훨씬 큽니다.
독립적 논평은 이와 관련된 구조적 문제를 제기합니다. Gemma 4 기술 보고서를 분석한 글은 보고서가 "성능 향상의 공을 데이터 구성에 돌린 다음, 자신의 학습 데이터를 두 문장으로 설명한다"고 지적합니다. 말뭉치 구성이 상세히 공개되지 않았기 때문에 외부에서는 벤치마크 오염을 독립적으로 평가하거나 도메인 커버리지를 검증할 수 없습니다. 이것이 공개된 수치를 무효화하지는 않지만, 여러분의 용례에 대해 문제를 완전히 매듭짓는 유일한 벤치마크는 여러분이 보유한 홀드아웃 데이터로 직접 돌린 것이라는 뜻이 됩니다.
Gemma는 편의성보다 배포 통제권을 중시하는 개발자, 연구자, 기술 팀에 적합합니다. 하드웨어를 준비하고 서빙 스택을 고르며 운영 영역을 감당하는 데 무리가 없다면, 이 제품군은 한 공급업체에서 일관된 도구와 함께 유난히 폭넓은 크기 사다리를 제공합니다.
호스팅 API가 충족할 수 없는 확고한 제약이 있는 조직에도 적합합니다. 오프라인 동작, 데이터 소재지, 코드 기밀성, 또는 규모에서 토큰당 과금을 감당하기 어렵게 만드는 단위 경제성이 그런 제약입니다. 이런 경우 운영 부담은 단점이 아니라 달리 충족할 수 없는 요구사항의 대가입니다.
모델을 개조할 계획이 있는 사람에게 적합합니다. 파인튜닝, 양자화, 증류, 기기 이미지에 모델 내장은 모두 가중치를 필요로 합니다. 계획에 이 동사들 중 하나라도 들어 있다면, 오픈 모델은 여러 선택지 중 하나가 아니라 조건을 충족하는 유일한 범주입니다.
브라우저 탭을 열어 바로 결과를 얻고 싶은 비기술 사용자에게는 맞지 않습니다. 여기에 소비자용 제품은 없습니다. AI Studio 시험 사용을 빼면 Gemma를 쓴다는 것은 곧 엔지니어링 작업을 뜻합니다. 요구가 "AI 어시스턴트와 대화하기"인 사람이라면 호스팅 제품, 아마도 Gemini가 더 낫고, 이 항목은 불필요한 우회가 됩니다.
계약상 지원 보장이 필요한 팀에도 적합하지 않습니다. 문서와 개발자 포럼이 지원 모델의 전부입니다. 조달 절차가 SLA와 에스컬레이션 경로를 갖춘 공급업체를 요구한다면, 아무리 큰 회사가 뒤에 있더라도 오픈 모델 다운로드는 그것을 제공하지 않습니다.
Google 자체 문서는 모델의 경계에 대해 이례적으로 직설적이며, 이런 자기 보고 한계는 귀속이 명확하다는 점에서 대부분의 제3자 비판보다 유용합니다.
지식 베이스가 아닙니다. 모델 카드는 모델이 "학습 데이터셋에서 배운 정보를 바탕으로 응답을 생성하지만 지식 베이스는 아닙니다. 부정확하거나 오래된 사실 진술을 생성할 수 있습니다"라고 명시합니다. 사실성 출력은 검색 결과가 아니라 검증이 필요한 대상으로 다루십시오.
학습 데이터에는 컷오프가 있습니다. 문서화된 사전학습 컷오프는 2025년 1월이며 웹 문서, 코드, 수학, 이미지, 오디오를 포괄합니다. 그 이후의 모든 것은 모델의 지식 밖이므로, 시의성이 중요한 애플리케이션은 크기와 무관하게 외부 검색이 필요합니다.
개방형 과제는 잘 정의된 과제보다 어렵습니다. 모델 카드의 표현대로 모델은 "명확한 프롬프트와 지시로 규정할 수 있는 과제에서 좋은 성능을 냅니다. 개방형이거나 매우 복잡한 과제는 어려울 수 있습니다." 프롬프트 구조가 실제로 역할을 합니다.
능력은 사다리 전체에 균일하지 않습니다. 실무에서 가장 흔한 실망의 원인이므로 강조할 가치가 있습니다. 오디오 입력은 E2B, E4B, 12B에만 존재합니다. 긴 컨텍스트 검색은 작은 모델에서 급격히 저하됩니다. 31B에서 확인한 능력이 E2B로 이전된다고 절대 가정해서는 안 됩니다.
전문 자문은 적용 범위 밖입니다. Google 자체 안내는 명확합니다. "의료, 법률, 재무 또는 기타 전문적 조언을 LLM에 의존하지 마십시오. 해당 주제에 관한 어떤 내용도 정보 제공 목적일 뿐이며 자격을 갖춘 전문가의 조언을 대체하지 않습니다." MedGemma의 존재도 이 점을 바꾸지 않습니다. 도메인 튜닝 모델도 임상의는 아닙니다.
학습 데이터 투명성이 제한적입니다. 앞서 언급했듯 독립 분석은 학습 데이터 설명이 지나치게 간략하다고 비판합니다. 모델에 무엇이 들어갔는지 완전히 감사할 수 없습니다.
운영 부담을 떠안게 됩니다. 호스팅 엔드포인트가 없다는 것은 가용성, 확장, 보안 패치, GPU 용량 계획, 비용이 모두 여러분 몫이라는 뜻입니다. 소규모 팀은 결정 시점에 이 점을 자주 과소평가합니다.
오픈 모델의 프라이버시 구조는 호스팅 서비스와 근본적으로 다르며, 그 차이는 양방향으로 작용합니다.
긍정적인 면에서, 자체 호스팅은 추론 데이터가 여러분의 인프라를 떠날 필요가 전혀 없다는 뜻입니다. 공급업체 측 추론 자체가 없으므로 공급업체 측 프롬프트 로깅을 두고 협상할 일도 없습니다. 기밀 워크로드에서는 이것이 이 범주 전체가 가진 가장 강력한 논거입니다.
학습 측면에서 Google은 사전학습 말뭉치에 대한 필터링 작업을 보고합니다. "Gemma 사전학습 모델을 안전하고 신뢰할 수 있게 만들기 위해, 자동화 기법을 사용해 학습 세트에서 특정 개인정보와 기타 민감 데이터를 걸러냈습니다"라고 밝히며 여러 단계에서 CSAM 필터링을 적용했다고 설명합니다. 이는 절차에 관한 공급업체 진술이지 독립 감사가 아니므로 그렇게 읽어야 합니다.
Gemma를 배포하는 사람에게 결정적인 지점은 Google이 다운스트림 안전 책임을 명시적으로 여러분에게 배정한다는 사실입니다. 모델 카드는 프라이버시 침해를 식별된 위험으로 열거하며 "개발자는 프라이버시 보호 기술을 통해 프라이버시 규정을 준수할 것을 권장합니다"라고 밝힙니다. 콘텐츠 안전에 대해서도 마찬가지로 직접적입니다. "개발자는 신중을 기하고, 각자의 제품 정책과 애플리케이션 사용 사례에 근거하여 적절한 콘텐츠 안전 보호 장치를 구현할 것을 권장합니다."
이 책임 배분은 형식적인 문구가 아닙니다. 호스팅 API에서는 원하든 원하지 않든 공급업체의 모더레이션 계층이 사용자와 원시 모델 사이에 놓입니다. 가중치를 내려받으면 그 계층은 함께 오지 않습니다. 가드레일, 남용 모니터링, 로깅 정책, 연령 제한, 규제 준수가 모두 여러분이 만들어야 할 산출물이 됩니다. ShieldGemma 2가 그중 일부를 도와줄 수 있지만, 그것을 연결하는 일은 여러분의 몫입니다.
인프라 측면에서 Google은 "Gemma 4 모델은 자사 독점 모델과 동일한 엄격한 인프라 보안 프로토콜을 거칩니다"라고 밝히며, 이 제품군을 기업과 주권 기관을 위한 신뢰할 수 있는 기반으로 자리매김합니다. 이 진술은 모델이 어떻게 생산되고 공개되는지에 관한 것이지, 여러분이 이후 그것을 어떻게 운영하는지에 관한 것이 아닙니다.
Gemma의 정직한 비교 대상은 호스팅 어시스턴트가 아니라 다른 오픈 가중치 제품군입니다. 자체 호스팅 여부를 정하는 결정이 먼저이고, 어떤 모델을 호스팅할지는 그다음이기 때문입니다.
Gemini와의 비교는 사실 품질이 아니라 배포 모델에 관한 질문입니다. Gemini는 Google이 서빙하고 관리하며 지속적으로 갱신합니다. Gemma는 여러분이 내려받아 직접 운영하고 버전을 고정합니다. 자체 호스팅을 강제하는 제약이 없다면 호스팅 경로가 훨씬 수월합니다. 그런 제약이 있다면 Gemini는 어떤 비용을 치르더라도 그것을 충족할 수 없습니다.
다른 오픈 가중치 제품군과 비교할 때(대개 Llama, Qwen, Mistral 계열이 비교 대상입니다) Gemma의 차별점은 특히 소형 쪽에서 두드러지는 크기 사다리의 폭, 현재 세대의 Apache 2.0 라이선스, 그리고 공식 도메인 변형의 두께입니다. 다만 경쟁자들의 이동 속도가 빨라 어느 모델이 품질에서 앞선다는 주장은 유효기간이 짧습니다. 이 설명을 포함한 일반적 순위를 믿기보다, 결정 시점에 여러분의 과제로 직접 평가하십시오.
로컬에서 아무것도 돌리지 않는 선택과 비교하면 계산은 단순합니다. 호스팅 API는 첫 결과까지의 시간에서 이기고, 데이터 통제, 오프라인 능력, 규모에서의 한계비용에서 집니다. 이 세 가지 중 적어도 하나가 선호가 아니라 확고한 요구사항일 때 Gemma의 운영 비용이 지불할 가치가 있습니다.
제품군 내부에서 가장 저평가된 대안은 이전 세대입니다. Gemma 3에는 Gemma 4에 없는 270M 크기가 있어 극도로 제약된 배포에서는 결정적일 수 있습니다. 다만 앞서 논의한 라이선스 조건 차이를 함께 계산에 넣어야 합니다.
가중치는 무료로 내려받을 수 있고, 연산을 여러분이 부담하므로 Google이 토큰 단위로 청구하지도 않습니다. Gemma 4는 OSI 승인 Apache 2.0 라이선스로 공개됩니다. 실제 비용은 하드웨어, 전력 또는 클라우드 인스턴스 시간, 그리고 모델을 직접 운영하는 엔지니어링 노력입니다. 여기서 "무료"는 "비용이 없다"가 아니라 "라이선스 비용이 없다"는 뜻입니다.
Gemma 4의 경우 Apache 2.0 라이선스가 표준 조건 아래 상업적 이용, 수정, 재배포를 허용합니다. 이전 세대는 별도로 확인해야 합니다. Gemma 2, Gemma 3n을 비롯한 구형 저장소는 Apache 2.0이 아니라 Google의 맞춤 gemma 라이선스로 표기되어 있으며, 그 맞춤 조건에는 Apache 2.0에 없는 사용 제한이 들어 있습니다. 항상 실제로 내려받는 저장소의 라이선스 필드를 확인하십시오.
Gemini는 호스팅 서비스로 접근하는 Google의 독점 모델 제품군입니다. Gemma는 가중치를 직접 내려받아 실행하는 오픈 제품군이며 관련 연구에서 만들어졌습니다. Gemma 4 페이지는 이를 Gemini 3 연구와 기술에서 출발했다고 설명합니다. 계보는 같고 배포 모델은 반대입니다. 한편 Google DeepMind는 둘 다를 공개하는 연구 조직입니다.
선택하는 크기에 전적으로 달려 있습니다. E2B와 E4B는 Raspberry Pi, Jetson Nano를 포함한 휴대폰과 소형 보드용으로 만들어졌고 완전히 오프라인으로 실행할 수 있습니다. 12B, 26B A4B, 31B는 소비자용 GPU를 겨냥합니다. 26B A4B는 전문가 혼합 설계로 추론 시 25.2B 파라미터 중 약 3.8B를 활성화하므로 총 크기가 시사하는 것보다 빠르게 동작하며, 흔히 이 제품군에서 VRAM 대비 용량 효율이 가장 좋은 선택입니다.
워크스테이션 등급은 최대 256K 토큰, 엣지 모델은 더 작은 128K 창을 갖습니다. 창을 지원하는 것과 그것을 신뢰성 있게 활용하는 것은 다르다는 점에 유의하십시오. 모델 카드의 긴 컨텍스트 검색 지표에서 최대 모델은 66.4%에 도달하지만 작은 크기는 가파르게 떨어집니다. 긴 컨텍스트를 전제로 설계하기 전에 실제 사용할 길이에서 검색 거동을 시험해 보십시오.
이미지와 비디오 이해는 Gemma 4 라인 전반에서 제공되며 교차 멀티모달 입력도 지원합니다. 오디오는 예외입니다. 공식 모델 카드는 자동 음성 인식과 음성-번역 텍스트 변환을 E2B, E4B, 12B로 한정합니다. 음성 입력이 필수라면 가장 큰 두 모델은 선택지에서 제외됩니다.
Google은 140개 언어 지원을 표명하며, 목표를 문자 그대로의 번역이 아니라 문화적 맥락 이해로 설정합니다. 다만 폭넓은 다국어 주장이 늘 그렇듯 품질은 그 범위 안에서 상당히 갈리므로, 균일성을 가정하지 말고 구체적인 대상 언어에서 성능을 검증하십시오.
자체 호스팅한다면 추론 데이터가 여러분의 인프라를 떠날 필요가 없으며, 이는 오픈 가중치 방식이 가진 가장 강력한 프라이버시 속성입니다. 다만 Google은 다운스트림 책임을 명시적으로 여러분에게 배정하며, 프라이버시 보호 기술로 규정을 준수하도록 권장합니다. 데이터 보호 준수, 로깅 정책, 콘텐츠 보호 장치는 여러분이 설계하고 구현해야 합니다.
가능합니다. 파인튜닝은 Google이 이 제품군에 대해 제시한 다섯 가지 기능 중 하나이며, 공식 배포 페이지는 Unsloth, Keras, JAX, GKE를 포함한 학습 도구로 연결합니다. 그 결과 모델은 여러분의 통제 아래 남으며, 이는 팀이 호스팅 API 대신 오픈 가중치를 선택하는 주된 이유입니다.
Gemma 4가 추론 벤치마크에서 더 강하고 더 허용적인 Apache 2.0 라이선스를 쓰므로 기본 선택지입니다. Gemma 3는 두 경우에 여전히 유효합니다. Gemma 4에 대응 모델이 없는 270M 크기가 필요할 때, 그리고 기존 도구가 이미 그것에 고정되어 있을 때입니다. Gemma 3를 선택한다면 라이선스 조건이 Gemma 4와 다르며 별도로 검토해야 한다는 점을 기억하십시오.