Toolso.AI
Toolso.AI
모든 도구카테고리인기최신 도구가격블로그
Toolso.AI
Toolso.AI

💌AI 도구 위클리 구독

매주 선별된 최신 및 핫한 AI 도구와 트렌드를 받은편지함으로 받아보세요 구독

Toolso.AI
Toolso.AI

생산성을 높일 최고의 AI 도구 발견

GitHubGitHubTwitterX (Twitter)YouTubeYouTubeTikTokEmail

인기 카테고리

  • AI 글쓰기
  • AI 이미지
  • AI 비디오
  • AI 코딩
  • 더 많은 카테고리

탐색

  • 최신 도구
  • 인기 도구
  • 더 많은 도구
  • 도구 제출
  • 요금

회사 소개

  • 회사 소개
  • 문의하기
  • 블로그
  • 변경 로그

법률

  • 쿠키 정책
  • 개인정보 보호정책
  • 서비스 약관
  • 환불 정책
© 2026 Toolso.AI 모든 권리 보유
기간 한정기간 한정 프로모션추천 등록24시간 우선 심사 · 백링크 불필요 · 30일 추천 노출$29.90이후 $59.9010월 31일 이후 $59.90로 인상종료까지--:--:--지금 제출
  1. 홈
  2. 모든 도구
  3. 모델 라이브러리
  4. Gemma
Gemma 인터페이스 미리보기
Gemma 로고

Gemma

Gemma는 Google DeepMind의 오픈 모델 제품군으로, Gemini와 같은 연구에서 출발했지만 직접 내려받아 실행하는 가중치 형태로 공개됩니다. Gemma 4는 Apache 2.0 라이선스로 배포되며 휴대폰, 라즈베리파이부터 소비자용 GPU 한 장까지 아우르는 크기로 제공됩니다.

모델 라이브러리오픈 소스 AIAI 개발#오픈 소스#개발 도구#Google
무료로 사용해보기
저장
방문 횟수
조회수
가격
부분 유료
출시일
2026년 8월 14일
도메인
deepmind.google
사용자 평점

이 도구를 사용해 보셨나요? 평점을 남겨 주세요

이 도구 평가하기

Gemma 제품 정보

무료로 사용해보기
도구 정보
저장
방문 횟수
조회수
가격
부분 유료
출시일
2026년 8월 14일
도메인
deepmind.google
사용자 평점

이 도구를 사용해 보셨나요? 평점을 남겨 주세요

이 도구 평가하기

추천 도구

관련 도구

무료로 사용해보기

Gemma란 무엇인가요?

Gemma는 Google DeepMind가 공개한 오픈 모델 제품군입니다. 공식 제품 허브에서 이 라인은 "Gemma / 가장 뛰어난 성능의 오픈 모델"로 소개되며, Open models라는 내비게이션 항목 아래에 배치되어 Gemini, Veo, Imagen처럼 API를 통해서만 접근하는 독점 라인과 의도적으로 구분됩니다. 이 배치 자체가 이 항목에 관한 가장 중요한 사실입니다. 여러분이 받는 것은 계정과 사용량 계량기가 아니라, 직접 내려받아 직접 호스팅하고 직접 실행하는 모델 가중치이기 때문입니다.

이름을 정확히 짚고 넘어갈 필요가 있습니다. 대부분의 혼동이 여기서 시작되기 때문입니다. Google DeepMind는 연구 조직이고, Gemini는 Google 자사 제품과 API를 통해 제공되는 플래그십 독점 모델 제품군이며, Gemma는 그 개방형 형제 제품입니다. Gemma 4 페이지의 표현을 빌리면 "Gemini 3 연구와 기술에서 출발해 파라미터당 지능을 극대화하도록 만든, 가장 지능적인 오픈 모델"입니다. 이 세 이름은 디렉터리 사이트와 뉴스 수집기에서 흔히 뒤섞여 쓰이지만, 각각 조직, 호스팅 모델, 내려받는 모델이라는 완전히 다른 대상을 가리킵니다. 이 페이지가 다루는 것은 세 번째입니다.

Gemma의 설계 의도는 이 개방성에서 곧바로 따라 나옵니다. Google이 내세우는 목표는 리더보드 정상이 아니라 이식성입니다. "가장 앞선 오픈 모델은 개발자가 사용자가 필요로 하는 어느 곳에서든 실행되는 AI 애플리케이션을 만들도록 돕습니다. 클라우드 서버부터 노트북, 나아가 휴대폰까지." 이 제품군의 다른 모든 특징, 즉 비정상적으로 넓은 파라미터 구간, 전문가 혼합 변형, 소형 모델의 레이어별 임베딩 기법은 모두 이 문장의 파생물입니다. Gemma는 같은 모델 제품군을 Jetson Nano에도, 가속기 랙에도 배포할 수 있도록, 그 사이에 공급업체를 바꾸거나 애플리케이션을 다시 쓰지 않도록 설계되었습니다.

개방성에는 두 번째 실질적 결과가 따릅니다. 가중치가 서비스로 제공되는 대신 배포되기 때문에, 여기에는 가입 절차도, 좌석 수도, Google이 토큰 단위로 청구하는 명세서도 없습니다. 그 자리를 대신하는 것은 라이선스, 하드웨어 비용, 그리고 전적으로 여러분이 지는 운영 부담입니다. Gemma를 평가하는 작업의 대부분은 이 세 가지가 각각 어디에 떨어지는지 파악하는 일입니다.

Google은 동시에 Gemma를 원시 연구 산출물이 아니라 책임 있는 배포를 위한 도구로 자리매김합니다. Open models 항목에 붙은 한 줄 정의는 "책임감 있게 대규모로 AI 애플리케이션을 구축하세요"이며, 제품군에는 실제로 전용 안전 분류기 변형이 함께 제공됩니다. 다만 이 자리매김이 실제로 성립하는지는 여러분이 모델 주위에 무엇을 만들어 붙이느냐에 크게 좌우되며, 공식 문서도 이 점을 매우 직설적으로 밝히고 있습니다. 이 글의 한계 항목에서 다시 다룹니다.

핵심 기능

  • 하나의 모델이 아니라 등급이 나뉜 모델 사다리. 현재 세대인 Gemma 4는 두 등급으로 공개됩니다. 엣지 등급은 E2B와 E4B, 워크스테이션 등급은 12B, 26B A4B, 31B을 포함합니다. 각 등급은 단순히 "같은 것을 더 크게" 만든 결과가 아니라 서로 다른 배포 환경을 겨냥합니다. 따라서 Gemma 모델을 고르는 일은 품질 우선이 아니라 하드웨어 우선의 의사결정입니다.
  • 에이전트 워크플로를 위한 네이티브 함수 호출. 공식 기능 목록은 이를 "계획을 세우고, 앱을 조작하며, 여러분을 대신해 작업을 완수하는 자율 에이전트를 구축하세요. 함수 호출을 네이티브로 지원합니다"라고 설명합니다. 여기서 함수 호출은 나중에 프롬프트 관례로 덧붙인 것이 아니라 학습된 일급 기능이며, 모델을 도구 사용 루프에 연결할 때 그 차이가 큽니다.
  • 텍스트와 이미지, 그리고 일부 등급의 오디오를 아우르는 멀티모달 입력. Google은 이를 "강력한 오디오 및 시각 이해 능력을 갖춘 애플리케이션을 개발하여 풍부한 멀티모달 지원을 제공하세요"라고 표현합니다. 중요한 단서는 모달리티 지원이 전 등급에 균일하지 않다는 점입니다. 공식 모델 카드는 오디오 처리를 "오디오(E2B, E4B, 12B 전용) – 여러 언어에 걸친 자동 음성 인식(ASR) 및 음성-번역 텍스트 변환"으로 한정합니다. 음성 입력이 필요하다면 이 제약이 가장 큰 두 등급을 곧바로 제외시킵니다.
  • 모델 크기에 따라 계층화된 긴 컨텍스트. 공식 모델 카드는 "Gemma 4는 최대 256K 토큰의 컨텍스트 창을 갖추고 140개 이상의 언어에서 다국어 지원을 유지합니다"라고 명시합니다. 256K는 워크스테이션 등급에 적용되며 엣지 모델은 더 작은 창을 갖습니다. 출시를 다룬 제3자 기사도 같은 구분, 즉 엣지 모델 128K 토큰과 워크스테이션 모델 256K 토큰을 기록하고 있어 공급업체 문서와 서로 일치합니다.
  • 140개 언어 지원이라는 공식 표명. 기능 페이지는 이를 기계적 번역을 넘어서는 것으로 규정합니다. "번역을 넘어 문화적 맥락을 이해하는 다국어 경험을 만드세요." 다만 이런 종류의 폭넓은 주장이 늘 그렇듯 140개 언어의 품질이 균일하지는 않으므로, 보장이 아니라 대상 언어에서 평가를 시작하는 출발점으로 삼는 것이 맞습니다.
  • 높은 용량에서 저렴한 추론을 얻기 위한 전문가 혼합 옵션. 26B A4B는 희소 설계이며, 모델 카드는 그 이점을 직접 설명합니다. "추론 시 4B 규모의 파라미터 부분집합만 활성화함으로써, 전문가 혼합 모델은 총 26B라는 규모가 시사하는 것보다 훨씬 빠르게 동작합니다." 이는 작은 밀집 모델과 값비싼 대형 모델 사이의 중간 경로를 제공합니다.
  • 엣지 모델의 파라미터 효율 엔지니어링. 가장 작은 크기들은 큰 모델을 단순히 잘라낸 것이 아닙니다. 모델 카드의 설명대로 "E2B와 E4B의 E는 유효(effective) 파라미터를 뜻합니다. 더 작은 모델들은 온디바이스 배포에서 파라미터 효율을 극대화하기 위해 레이어별 임베딩(PLE)을 도입했습니다." 명목상 수십억 파라미터 규모의 모델을 휴대폰에 담을 수 있는 이유가 바로 이 구조적 선택입니다.
  • 일급 경로로 지원되는 파인튜닝. Fine tuning은 공식 5대 기능 목록에 포함되어 있고, 배포 페이지도 학습 측 도구로 바로 연결됩니다. Gemma는 받은 그대로 소비되기보다 특화되도록 의도된 모델입니다.
  • 목적별로 만들어진 공식 변형군. 범용 모델 외에도 Google은 특정 도메인을 겨냥한 파생 모델을 공개합니다. DiffusionGemma, 인코더-디코더 구조의 T5Gemma, 의료용 MedGemma, 그리고 "정책 위반 콘텐츠를 탐지하고 안전 기준을 유지하기 위한 모듈형 분류기 모델"로 설명되는 안전 분류기 ShieldGemma 2 등이 여기에 해당합니다. 이들은 커뮤니티 포크가 아니라 공식 릴리스입니다.

모델 라인업과 선택 방법

Gemma 도입에서 가장 어려운 부분은 설치가 아니라 사다리에서 올바른 칸을 고르는 일입니다. 각 크기는 서로 대체 가능하지 않으며, 결정적 요인은 대개 벤치마크 표가 아니라 이미 보유한 하드웨어입니다.

엣지 등급(E2B, E4B). Google은 이 등급을 제약된 기기용으로 명확히 자리매김합니다. "실시간 엣지 처리를 위한 오디오 및 비전 지원. 휴대폰, Raspberry Pi, Jetson Nano 같은 엣지 기기에서 완전히 오프라인으로, 거의 지연 없이 실행할 수 있습니다." 오프라인 동작이 핵심 속성입니다. 추론이 네트워크 없이 작동해야 한다는 요구가 있다면(차량 안, 진료소, 공장 현장, 시골 교실 등) 바로 이 등급이 Gemma를 검토할 근본적인 이유가 됩니다. 대가로 더 짧은 컨텍스트 창과, 어려운 추론 및 장문서 검색에서 눈에 띄게 약한 성능을 받아들여야 합니다.

워크스테이션 등급(12B, 26B A4B, 31B). 이 등급은 데이터센터 가속기가 아니라 소비자용 그래픽 카드를 겨냥합니다. Google의 표현으로는 "IDE, 코딩 어시스턴트, 에이전트 워크플로를 위한 고급 추론 능력을 제공합니다. 이 모델들은 소비자용 GPU에 최적화되어 학생, 연구자, 개발자가 워크스테이션을 로컬 우선 AI 서버로 바꿀 수 있게 합니다." 그중 26B A4B가 흥미로운 중간 선택지입니다. 총 25.2B 파라미터를 가지지만 추론 시 약 3.8B만 활성화하므로 속도는 소형 모델에 가깝게 동작하면서 더 큰 용량을 유지합니다. 30.7B 파라미터에 256K 창을 갖춘 31B 밀집 모델이 이 제품군의 상한선입니다.

이전 세대도 여전히 중요합니다. Gemma 3는 사라지지 않았습니다. 여전히 270M, 1B, 4B, 12B, 27B 다섯 크기로 제공되며 128K 토큰 창을 갖추고 있고, Google 자체 설명인 "Gemma 3의 128K 토큰 컨텍스트 창은 애플리케이션이 방대한 정보를 처리하고 이해하게 하여 더 정교한 AI 기능을 가능하게 합니다"는 지금도 쓸 만한 모델을 묘사합니다. 특히 270M 크기는 Gemma 4에 대응 모델이 없으므로, 극단적으로 제약된 배포에서는 이전 세대가 유일한 선택지가 되기도 합니다. 중요한 것은 세대 간 라이선스가 다르다는 점이며, 이는 다음 항목에서 다룹니다.

실무적인 선택 요령은 이렇습니다. 리더보드가 아니라 배포 대상에서 출발하십시오. 휴대 기기에서 오프라인으로 돌아가야 한다면 여러분은 엣지 등급에 있으며, 실제 과제로 품질을 일찍 검증해야 합니다. 최신 소비자용 GPU 한 장이 있고 로컬 코딩이나 에이전트 어시스턴트를 원한다면 12B에서 시작해 품질이 부족할 때만 위로 올라가십시오. 음성 입력이 필요하면 E2B, E4B, 12B로 범위를 좁히십시오. 최고 품질이 필요하고 하드웨어가 받쳐준다면 31B 밀집 모델이 이 제품군의 천장입니다.

라이선스: 대부분의 요약이 틀리는 지점

이 항목은 두 번 읽을 가치가 있습니다. Gemma에 관해 가장 널리 반복되는 문장, 즉 "Gemma는 Apache 2.0 라이선스"라는 말이 현재 세대에만 참이기 때문입니다.

Gemma 4는 실제로 표준적인 오픈소스 라이선스로 이동했습니다. Google 오픈소스 블로그는 이를 분명히 밝힙니다. "Gemma 4 모델은 OSI가 승인한 Apache 2.0 라이선스로 공개된 Gemmaverse 최초의 모델입니다." 공식 모델 카드도 기계 판독 가능한 형태로 이를 확인해 주며, front matter 필드에 그대로 license: apache-2.0이라고 적혀 있습니다. 따라서 Gemma 4에 대해서는 개발자가 기대하는 재배포 및 상업적 이용 속성을 갖춘, OSI 승인 허용적 라이선스를 다루게 됩니다.

이전 세대는 사정이 다릅니다. Hugging Face의 공식 google 조직 저장소 메타데이터는 이 경계를 뚜렷이 보여줍니다. Gemma 4 저장소는 apache-2.0 태그를 달고 있는 반면, gemma-2, gemma-3n, gemma-7b 등의 저장소는 여전히 Google의 맞춤 gemma 라이선스로 표기되어 있습니다. 제3자 버전 정리 자료도 같은 전환을 기록하면서, Google이 Gemma 4를 "자유 오픈소스인 Apache 2.0 라이선스로" 공개했고 이전 세대들은 source-available 성격의 Gemma 이용약관으로 배포되었다고 명시합니다.

실무적 결과는 매우 구체적입니다. 컴플라이언스 절차가 "Gemma"를 Apache 2.0 의존성으로 승인했는데 이후 엔지니어가 Gemma 3나 Gemma 2 체크포인트를 내려받았다면(그 모델들도 현행이고 유지보수되며 때로는 더 적합하므로 충분히 있을 수 있는 일입니다), 실제 배포를 규율하는 라이선스는 절차가 승인한 그것이 아닙니다. 이 문장을 포함해 제품군 단위의 서술에 기대지 말고, 매번 내려받는 그 저장소의 라이선스 필드를 직접 확인하십시오.

도입 규모에 관해 Google은 "최초 출시 이후 커뮤니티는 Gemma 모델을 4억 회 이상 내려받았고, 커뮤니티에서 Gemmaverse라 부르는 10만 개 이상의 인상적인 변형을 만들어냈습니다"라고 보고합니다. 이는 독립 감사를 거치지 않은 공급업체 자체 보고 수치입니다. 생태계가 방치되지 않았다는 신호로는 유용하지만 품질 지표로 읽어서는 안 됩니다.

어디서 받고 어떻게 실행하나요

배포는 Google 자사 자산으로 모으는 대신, 개발자가 이미 쓰고 있는 도구 위에 의도적으로 넓게 펼쳐져 있습니다. 공식 허브가 열거하는 플랫폼과 통합에는 Kaggle, Hugging Face, Keras, Ollama, PyTorch, Gemma.cpp, JAX, Google AI Edge, Google Cloud, Android, LM Studio, Unsloth가 포함됩니다.

가중치에 한정하면, Gemma 4 페이지는 다운로드 경로와 학습·배포 경로를 분리해 제시하며 가중치 다운로드는 Hugging Face, Ollama, Kaggle, LM Studio, Docker로 안내합니다. 실무적으로는 가장 빠른 경로가 Gemma 전용 도구가 아니라 여러분이 이미 갖춘 스택에 전적으로 달려 있다는 뜻입니다.

  1. 설치 없이 일단 써보기. Google은 AI Studio를 통해 호스팅된 시험 경로를 제공하므로, 하드웨어를 투입하기 전에 출력 품질을 판단할 수 있습니다. 전체 흐름에서 일반적인 SaaS 도구 사용과 닮은 유일한 단계입니다.
  2. 로컬 데스크톱 사용. Ollama나 LM Studio가 양자화 빌드를 받아 두어 개의 명령으로 동작하는 로컬 엔드포인트를 제공합니다. 1인 개발 워크스테이션의 표준 경로입니다.
  3. 애플리케이션 통합. Hugging Face에서 받아 기존 추론 스택으로 서빙하거나, 재현 가능한 컨테이너가 필요하면 Docker 이미지를 사용합니다.
  4. 모바일과 임베디드. Google AI Edge와 Android 경로가 온디바이스 배포를 겨냥하며, 의존성을 최소화한 네이티브 추론에는 Gemma.cpp가 있습니다.
  5. 파인튜닝. 학습 측 경로에는 Unsloth, Keras, JAX, GKE가 포함됩니다. Google은 파인튜닝을 모델의 5대 대표 기능 중 하나로 제시하며, 선호하는 프레임워크와 기법으로 학습할 수 있다고 설명합니다.

지원 체계는 계약이 아니라 커뮤니티와 문서의 형태를 띱니다. 공식 허브는 "Gemma로 애플리케이션을 구축하기 위한 공식 문서, 빠른 시작, 가이드"를 안내하고 질문은 개발자 포럼으로 유도합니다. 오픈 모델을 내려받는 데에는 SLA도, 지원 티켓 대기열도, 전담 매니저도 따라오지 않습니다. 원칙적으로는 자명한 트레이드오프지만 프로덕션에서는 이따금 예상 밖으로 다가옵니다.

성능: 공급업체 수치는 신중히 읽어야 합니다

Google은 Gemma 4와 이전 세대를 비교한 벤치마크 표를 공개하며, 추론 부담이 큰 과제에서 세대 간 도약 폭이 큽니다. 도구를 쓰지 않은 AIME 2026 수학에서 31B 모델은 89.2%로 보고되며, Gemma 3 27B는 20.8%입니다. Gemma 4 페이지에 공개된 다른 수치는 아레나 평점, 경쟁 코딩, 대학원 수준 QA 등을 다룹니다.

그 표의 모든 수치에는 두 가지 주의가 따릅니다. 첫째, 이 결과들은 결과에 이해관계가 있는 당사자가 산출한 공급업체 자체 보고치이며, 독립적 발견이 아니라 합리적인 초기 가설입니다. 둘째, 대표 평균은 배포에서 가장 중요한, 크기에 따른 성능 절벽을 가립니다. 긴 컨텍스트 검색이 가장 분명한 예입니다. MRCR v2 8-needle 128K 검색 지표에서 모델 카드는 최대 모델을 66.4%로 보고하며 작은 크기일수록 가파르게 떨어집니다. 긴 창을 지원한다고 광고된 모델이 그 창을 신뢰성 있게 활용한다는 보장은 없으며, 이 지표에서 사다리 위아래의 격차는 일반 지식 벤치마크보다 훨씬 큽니다.

독립적 논평은 이와 관련된 구조적 문제를 제기합니다. Gemma 4 기술 보고서를 분석한 글은 보고서가 "성능 향상의 공을 데이터 구성에 돌린 다음, 자신의 학습 데이터를 두 문장으로 설명한다"고 지적합니다. 말뭉치 구성이 상세히 공개되지 않았기 때문에 외부에서는 벤치마크 오염을 독립적으로 평가하거나 도메인 커버리지를 검증할 수 없습니다. 이것이 공개된 수치를 무효화하지는 않지만, 여러분의 용례에 대해 문제를 완전히 매듭짓는 유일한 벤치마크는 여러분이 보유한 홀드아웃 데이터로 직접 돌린 것이라는 뜻이 됩니다.

활용 사례

  • 오프라인 및 망 분리 배포. 엣지 등급이 "완전히 오프라인으로, 거의 지연 없이" 실행되는 능력은 연결성, 규제, 기밀 유지 어느 이유로든 데이터를 호스팅 API로 보낼 수 없는 환경에 Gemma를 적합하게 만듭니다. Google의 사례 소개에도 Lentera가 교육자와 학생을 위해 오프라인 AI 마이크로서버를 운영하는 바로 이 패턴이 등장합니다.
  • 로컬 우선 개발자 도구. 워크스테이션 등급 위에 만든 IDE 어시스턴트와 코딩 도우미는 소스 코드를 개발자 자신의 컴퓨터에 남겨둡니다. 독점 코드를 제3자 엔드포인트로 보낼 수 없는 조직에는 이것이 결정적 논거가 되는 경우가 많습니다.
  • 비용을 통제한 대량 추론. 요청량이 크고 예측 가능하다면 하드웨어를 직접 보유해 오픈 모델을 돌리는 편이 토큰 단위 과금보다 저렴할 수 있습니다. 전문가 혼합인 26B A4B는 바로 이 경제성 중심의 중간 지대를 위해 설계되었습니다.
  • 파인튜닝을 통한 도메인 특화. 가중치를 확보할 수 있으므로 팀은 독점 데이터로 학습하고 그 결과 모델을 외부에 내보내지 않고 보유할 수 있습니다. Google의 사례에는 Crane AI Labs가 Gemma 기반으로 만든 경량 스와힐리어 모델이 포함되어 있는데, 기본 릴리스가 상대적으로 덜 지원하는 언어나 도메인에 범용 모델을 맞춰가는 좋은 예입니다.
  • 안전 및 모더레이션 파이프라인. ShieldGemma 2가 정책 위반 콘텐츠 탐지를 위한 전용 분류기로 존재하므로, 이 제품군은 생성 구성요소와 가드레일 계층의 일부를 함께 제공할 수 있습니다.
  • 연구와 교육. 오픈 가중치는 API로는 불가능한 방식으로 모델 거동을 들여다보게 해 줍니다. 해석 가능성 연구, 제거 실험, 수업 과제에서는 그 접근성 자체가 목적입니다.
  • 규제 대상 데이터 처리. 데이터 소재지 규정이 추론 수행 위치를 제약할 때, 오픈 모델 자체 호스팅은 배포 경계를 공급업체가 아닌 여러분의 통제 아래 둡니다.

어떤 사람에게 적합한가요?

Gemma는 편의성보다 배포 통제권을 중시하는 개발자, 연구자, 기술 팀에 적합합니다. 하드웨어를 준비하고 서빙 스택을 고르며 운영 영역을 감당하는 데 무리가 없다면, 이 제품군은 한 공급업체에서 일관된 도구와 함께 유난히 폭넓은 크기 사다리를 제공합니다.

호스팅 API가 충족할 수 없는 확고한 제약이 있는 조직에도 적합합니다. 오프라인 동작, 데이터 소재지, 코드 기밀성, 또는 규모에서 토큰당 과금을 감당하기 어렵게 만드는 단위 경제성이 그런 제약입니다. 이런 경우 운영 부담은 단점이 아니라 달리 충족할 수 없는 요구사항의 대가입니다.

모델을 개조할 계획이 있는 사람에게 적합합니다. 파인튜닝, 양자화, 증류, 기기 이미지에 모델 내장은 모두 가중치를 필요로 합니다. 계획에 이 동사들 중 하나라도 들어 있다면, 오픈 모델은 여러 선택지 중 하나가 아니라 조건을 충족하는 유일한 범주입니다.

브라우저 탭을 열어 바로 결과를 얻고 싶은 비기술 사용자에게는 맞지 않습니다. 여기에 소비자용 제품은 없습니다. AI Studio 시험 사용을 빼면 Gemma를 쓴다는 것은 곧 엔지니어링 작업을 뜻합니다. 요구가 "AI 어시스턴트와 대화하기"인 사람이라면 호스팅 제품, 아마도 Gemini가 더 낫고, 이 항목은 불필요한 우회가 됩니다.

계약상 지원 보장이 필요한 팀에도 적합하지 않습니다. 문서와 개발자 포럼이 지원 모델의 전부입니다. 조달 절차가 SLA와 에스컬레이션 경로를 갖춘 공급업체를 요구한다면, 아무리 큰 회사가 뒤에 있더라도 오픈 모델 다운로드는 그것을 제공하지 않습니다.

한계와 주의사항

Google 자체 문서는 모델의 경계에 대해 이례적으로 직설적이며, 이런 자기 보고 한계는 귀속이 명확하다는 점에서 대부분의 제3자 비판보다 유용합니다.

지식 베이스가 아닙니다. 모델 카드는 모델이 "학습 데이터셋에서 배운 정보를 바탕으로 응답을 생성하지만 지식 베이스는 아닙니다. 부정확하거나 오래된 사실 진술을 생성할 수 있습니다"라고 명시합니다. 사실성 출력은 검색 결과가 아니라 검증이 필요한 대상으로 다루십시오.

학습 데이터에는 컷오프가 있습니다. 문서화된 사전학습 컷오프는 2025년 1월이며 웹 문서, 코드, 수학, 이미지, 오디오를 포괄합니다. 그 이후의 모든 것은 모델의 지식 밖이므로, 시의성이 중요한 애플리케이션은 크기와 무관하게 외부 검색이 필요합니다.

개방형 과제는 잘 정의된 과제보다 어렵습니다. 모델 카드의 표현대로 모델은 "명확한 프롬프트와 지시로 규정할 수 있는 과제에서 좋은 성능을 냅니다. 개방형이거나 매우 복잡한 과제는 어려울 수 있습니다." 프롬프트 구조가 실제로 역할을 합니다.

능력은 사다리 전체에 균일하지 않습니다. 실무에서 가장 흔한 실망의 원인이므로 강조할 가치가 있습니다. 오디오 입력은 E2B, E4B, 12B에만 존재합니다. 긴 컨텍스트 검색은 작은 모델에서 급격히 저하됩니다. 31B에서 확인한 능력이 E2B로 이전된다고 절대 가정해서는 안 됩니다.

전문 자문은 적용 범위 밖입니다. Google 자체 안내는 명확합니다. "의료, 법률, 재무 또는 기타 전문적 조언을 LLM에 의존하지 마십시오. 해당 주제에 관한 어떤 내용도 정보 제공 목적일 뿐이며 자격을 갖춘 전문가의 조언을 대체하지 않습니다." MedGemma의 존재도 이 점을 바꾸지 않습니다. 도메인 튜닝 모델도 임상의는 아닙니다.

학습 데이터 투명성이 제한적입니다. 앞서 언급했듯 독립 분석은 학습 데이터 설명이 지나치게 간략하다고 비판합니다. 모델에 무엇이 들어갔는지 완전히 감사할 수 없습니다.

운영 부담을 떠안게 됩니다. 호스팅 엔드포인트가 없다는 것은 가용성, 확장, 보안 패치, GPU 용량 계획, 비용이 모두 여러분 몫이라는 뜻입니다. 소규모 팀은 결정 시점에 이 점을 자주 과소평가합니다.

프라이버시, 안전, 그리고 책임

오픈 모델의 프라이버시 구조는 호스팅 서비스와 근본적으로 다르며, 그 차이는 양방향으로 작용합니다.

긍정적인 면에서, 자체 호스팅은 추론 데이터가 여러분의 인프라를 떠날 필요가 전혀 없다는 뜻입니다. 공급업체 측 추론 자체가 없으므로 공급업체 측 프롬프트 로깅을 두고 협상할 일도 없습니다. 기밀 워크로드에서는 이것이 이 범주 전체가 가진 가장 강력한 논거입니다.

학습 측면에서 Google은 사전학습 말뭉치에 대한 필터링 작업을 보고합니다. "Gemma 사전학습 모델을 안전하고 신뢰할 수 있게 만들기 위해, 자동화 기법을 사용해 학습 세트에서 특정 개인정보와 기타 민감 데이터를 걸러냈습니다"라고 밝히며 여러 단계에서 CSAM 필터링을 적용했다고 설명합니다. 이는 절차에 관한 공급업체 진술이지 독립 감사가 아니므로 그렇게 읽어야 합니다.

Gemma를 배포하는 사람에게 결정적인 지점은 Google이 다운스트림 안전 책임을 명시적으로 여러분에게 배정한다는 사실입니다. 모델 카드는 프라이버시 침해를 식별된 위험으로 열거하며 "개발자는 프라이버시 보호 기술을 통해 프라이버시 규정을 준수할 것을 권장합니다"라고 밝힙니다. 콘텐츠 안전에 대해서도 마찬가지로 직접적입니다. "개발자는 신중을 기하고, 각자의 제품 정책과 애플리케이션 사용 사례에 근거하여 적절한 콘텐츠 안전 보호 장치를 구현할 것을 권장합니다."

이 책임 배분은 형식적인 문구가 아닙니다. 호스팅 API에서는 원하든 원하지 않든 공급업체의 모더레이션 계층이 사용자와 원시 모델 사이에 놓입니다. 가중치를 내려받으면 그 계층은 함께 오지 않습니다. 가드레일, 남용 모니터링, 로깅 정책, 연령 제한, 규제 준수가 모두 여러분이 만들어야 할 산출물이 됩니다. ShieldGemma 2가 그중 일부를 도와줄 수 있지만, 그것을 연결하는 일은 여러분의 몫입니다.

인프라 측면에서 Google은 "Gemma 4 모델은 자사 독점 모델과 동일한 엄격한 인프라 보안 프로토콜을 거칩니다"라고 밝히며, 이 제품군을 기업과 주권 기관을 위한 신뢰할 수 있는 기반으로 자리매김합니다. 이 진술은 모델이 어떻게 생산되고 공개되는지에 관한 것이지, 여러분이 이후 그것을 어떻게 운영하는지에 관한 것이 아닙니다.

대안과 비교

Gemma의 정직한 비교 대상은 호스팅 어시스턴트가 아니라 다른 오픈 가중치 제품군입니다. 자체 호스팅 여부를 정하는 결정이 먼저이고, 어떤 모델을 호스팅할지는 그다음이기 때문입니다.

Gemini와의 비교는 사실 품질이 아니라 배포 모델에 관한 질문입니다. Gemini는 Google이 서빙하고 관리하며 지속적으로 갱신합니다. Gemma는 여러분이 내려받아 직접 운영하고 버전을 고정합니다. 자체 호스팅을 강제하는 제약이 없다면 호스팅 경로가 훨씬 수월합니다. 그런 제약이 있다면 Gemini는 어떤 비용을 치르더라도 그것을 충족할 수 없습니다.

다른 오픈 가중치 제품군과 비교할 때(대개 Llama, Qwen, Mistral 계열이 비교 대상입니다) Gemma의 차별점은 특히 소형 쪽에서 두드러지는 크기 사다리의 폭, 현재 세대의 Apache 2.0 라이선스, 그리고 공식 도메인 변형의 두께입니다. 다만 경쟁자들의 이동 속도가 빨라 어느 모델이 품질에서 앞선다는 주장은 유효기간이 짧습니다. 이 설명을 포함한 일반적 순위를 믿기보다, 결정 시점에 여러분의 과제로 직접 평가하십시오.

로컬에서 아무것도 돌리지 않는 선택과 비교하면 계산은 단순합니다. 호스팅 API는 첫 결과까지의 시간에서 이기고, 데이터 통제, 오프라인 능력, 규모에서의 한계비용에서 집니다. 이 세 가지 중 적어도 하나가 선호가 아니라 확고한 요구사항일 때 Gemma의 운영 비용이 지불할 가치가 있습니다.

제품군 내부에서 가장 저평가된 대안은 이전 세대입니다. Gemma 3에는 Gemma 4에 없는 270M 크기가 있어 극도로 제약된 배포에서는 결정적일 수 있습니다. 다만 앞서 논의한 라이선스 조건 차이를 함께 계산에 넣어야 합니다.

자주 묻는 질문(FAQ)

Q1. Gemma는 무료로 사용할 수 있나요?

가중치는 무료로 내려받을 수 있고, 연산을 여러분이 부담하므로 Google이 토큰 단위로 청구하지도 않습니다. Gemma 4는 OSI 승인 Apache 2.0 라이선스로 공개됩니다. 실제 비용은 하드웨어, 전력 또는 클라우드 인스턴스 시간, 그리고 모델을 직접 운영하는 엔지니어링 노력입니다. 여기서 "무료"는 "비용이 없다"가 아니라 "라이선스 비용이 없다"는 뜻입니다.

Q2. 생성한 콘텐츠를 상업적으로 사용할 수 있나요?

Gemma 4의 경우 Apache 2.0 라이선스가 표준 조건 아래 상업적 이용, 수정, 재배포를 허용합니다. 이전 세대는 별도로 확인해야 합니다. Gemma 2, Gemma 3n을 비롯한 구형 저장소는 Apache 2.0이 아니라 Google의 맞춤 gemma 라이선스로 표기되어 있으며, 그 맞춤 조건에는 Apache 2.0에 없는 사용 제한이 들어 있습니다. 항상 실제로 내려받는 저장소의 라이선스 필드를 확인하십시오.

Q3. Gemma와 Gemini의 차이는 무엇인가요?

Gemini는 호스팅 서비스로 접근하는 Google의 독점 모델 제품군입니다. Gemma는 가중치를 직접 내려받아 실행하는 오픈 제품군이며 관련 연구에서 만들어졌습니다. Gemma 4 페이지는 이를 Gemini 3 연구와 기술에서 출발했다고 설명합니다. 계보는 같고 배포 모델은 반대입니다. 한편 Google DeepMind는 둘 다를 공개하는 연구 조직입니다.

Q4. 어떤 하드웨어가 필요한가요?

선택하는 크기에 전적으로 달려 있습니다. E2B와 E4B는 Raspberry Pi, Jetson Nano를 포함한 휴대폰과 소형 보드용으로 만들어졌고 완전히 오프라인으로 실행할 수 있습니다. 12B, 26B A4B, 31B는 소비자용 GPU를 겨냥합니다. 26B A4B는 전문가 혼합 설계로 추론 시 25.2B 파라미터 중 약 3.8B를 활성화하므로 총 크기가 시사하는 것보다 빠르게 동작하며, 흔히 이 제품군에서 VRAM 대비 용량 효율이 가장 좋은 선택입니다.

Q5. Gemma는 얼마나 긴 컨텍스트를 지원하나요?

워크스테이션 등급은 최대 256K 토큰, 엣지 모델은 더 작은 128K 창을 갖습니다. 창을 지원하는 것과 그것을 신뢰성 있게 활용하는 것은 다르다는 점에 유의하십시오. 모델 카드의 긴 컨텍스트 검색 지표에서 최대 모델은 66.4%에 도달하지만 작은 크기는 가파르게 떨어집니다. 긴 컨텍스트를 전제로 설계하기 전에 실제 사용할 길이에서 검색 거동을 시험해 보십시오.

Q6. Gemma는 이미지와 오디오를 처리할 수 있나요?

이미지와 비디오 이해는 Gemma 4 라인 전반에서 제공되며 교차 멀티모달 입력도 지원합니다. 오디오는 예외입니다. 공식 모델 카드는 자동 음성 인식과 음성-번역 텍스트 변환을 E2B, E4B, 12B로 한정합니다. 음성 입력이 필수라면 가장 큰 두 모델은 선택지에서 제외됩니다.

Q7. Gemma는 몇 개 언어를 지원하나요?

Google은 140개 언어 지원을 표명하며, 목표를 문자 그대로의 번역이 아니라 문화적 맥락 이해로 설정합니다. 다만 폭넓은 다국어 주장이 늘 그렇듯 품질은 그 범위 안에서 상당히 갈리므로, 균일성을 가정하지 말고 구체적인 대상 언어에서 성능을 검증하십시오.

Q8. Gemma를 사용하면 제 데이터는 비공개인가요?

자체 호스팅한다면 추론 데이터가 여러분의 인프라를 떠날 필요가 없으며, 이는 오픈 가중치 방식이 가진 가장 강력한 프라이버시 속성입니다. 다만 Google은 다운스트림 책임을 명시적으로 여러분에게 배정하며, 프라이버시 보호 기술로 규정을 준수하도록 권장합니다. 데이터 보호 준수, 로깅 정책, 콘텐츠 보호 장치는 여러분이 설계하고 구현해야 합니다.

Q9. 제 데이터로 Gemma를 파인튜닝할 수 있나요?

가능합니다. 파인튜닝은 Google이 이 제품군에 대해 제시한 다섯 가지 기능 중 하나이며, 공식 배포 페이지는 Unsloth, Keras, JAX, GKE를 포함한 학습 도구로 연결합니다. 그 결과 모델은 여러분의 통제 아래 남으며, 이는 팀이 호스팅 API 대신 오픈 가중치를 선택하는 주된 이유입니다.

Q10. Gemma 4와 Gemma 3 중 무엇을 써야 하나요?

Gemma 4가 추론 벤치마크에서 더 강하고 더 허용적인 Apache 2.0 라이선스를 쓰므로 기본 선택지입니다. Gemma 3는 두 경우에 여전히 유효합니다. Gemma 4에 대응 모델이 없는 270M 크기가 필요할 때, 그리고 기존 도구가 이미 그것에 고정되어 있을 때입니다. Gemma 3를 선택한다면 라이선스 조건이 Gemma 4와 다르며 별도로 검토해야 한다는 점을 기억하십시오.

비슷한 도구를 아시나요?
다른 훌륭한 AI 도구를 알고 계시다면 저희에게 제출해 주세요