Replicate는 클라우드 API로 AI 모델을 실행하게 해 주며, 머신러닝을 이해하거나 인프라를 직접 운영할 필요가 없습니다. HTTP 요청 한 번이면 이미지·영상·오디오·언어 모델에 입력을 보내고 결과를 받아옵니다. GPU를 빌릴 일도 컨테이너를 빌드할 일도 없는, 말하자면 AI 모델 API 래퍼입니다.
이 인터페이스 뒤에는 세 가지 일이 있습니다. 다른 사람이 이미 공개한 모델을 실행하는 일, 자기 데이터로 파인튜닝해 새 모델을 만드는 일, 직접 패키징한 코드를 배포하는 일입니다. 세 가지 모두 코드 한 줄이면 닿습니다.
운영 주체는 Replicate, LLC.이며 주소는 샌프란시스코 101 Townsend Street입니다. 2025년 11월 17일 소유권이 바뀌어 "AI 모델을 실행하는 선도 플랫폼"이 Cloudflare에 합류한다고 발표했습니다. 다만 제품 표면은 이 변화에서 명시적으로 제외됐습니다. 공급사는 API가 바뀌지 않으며 지금 쓰는 모델도 계속 동작한다고 밝혔고, 인수 측도 기존 사용자의 API와 워크플로가 중단 없이 이어진다고 같은 약속을 했습니다. 개발도 멈추지 않았습니다. 최신 체인지로그 항목은 코딩 어시스턴트가 이 플랫폼에서 AI 모델을 다루는 전문 지식을 갖추도록 돕는 마크다운 지침 파일 묶음을 추가했습니다.
카탈로그 규모는 공급사 측 수치입니다. 인수 발표는 5만 개가 넘는 오픈소스 모델과 파인튜닝 모델을 포괄한다고 밝혔지만, 이번 회차에 확인한 채널에서는 독립적인 집계가 나오지 않았습니다.
하나의 API 뒤에는 지연과 비용 측면에서 서로 다르게 움직이는 네 부류가 있습니다.
이 구분 때문에 "이 플랫폼의 모델"은 하나의 성능 프로필이 아닙니다. 공식 모델은 항상 예열된 상태로 요청에 응답할 준비가 되어 있어 콜드 부팅 걱정 없이 실행할 수 있지만, 거의 쓰이지 않는 커뮤니티 모델은 처음부터 로드된 뒤에야 처리됩니다.
용량은 설정 없이 양방향으로 움직입니다. 트래픽이 몰리면 수요를 감당하도록 자동으로 확장하고, 트래픽이 없으면 0까지 줄어듭니다. 이 기본값이 너무 느슨할 때는 배포(deployment) 기능으로 어떤 모델이든 하드웨어와 스케일링 파라미터를 직접 제어할 수 있습니다. 팀 단위로는 조직(organization)이 모델, API 토큰, 결제, 대시보드 등의 접근 권한을 공유하게 해 줍니다.
기본 안전 필터의 적용 범위는 이름에서 짐작하는 것보다 좁습니다. 웹 예측에 한해 SDXL 기본 모델, Flux 기본 모델, 그리고 두 모델의 모든 파생 파인튜닝에만 안전 검사기가 켜집니다. 빠져나갈 길도 열려 있어서, API로 모델을 실행할 때는 안전 검사기를 끌 수 있습니다. 그 대가로 API 경로에는 보장된 필터가 없습니다.
첫 연동은 짧지만, 그중 두 단계는 지금은 싸고 나중에는 비쌉니다.
문서로 확인되는 기능은 넓지 않은 범위의 작업으로 이어집니다.
같은 사실이 경계선도 그어 줍니다. 보장된 응답 시간, 30분을 넘기는 실행, 결과물을 플랫폼에 두었다가 나중에 꺼내는 일은 표준 계정에 대해 문서화된 범위 밖입니다.
머신러닝 스택을 직접 떠안지 않고 서버리스 GPU 추론을 쓰고 싶은, 그리고 클러스터 운영 대신 변동 청구서를 감당할 수 있는 소프트웨어 팀에 맞습니다. 모델 제작자에게도 맞는데, 이곳에서는 공개와 파인튜닝이 일급 동작이기 때문입니다.
반대로 네 가지 상황에서는 잘 맞지 않으며, 네 가지 모두 공개된 조항으로 거슬러 올라갑니다.
모든 것은 HTTP로 닿습니다. 퍼스트파티 클라이언트는 Node.js, Python, Swift, Go를 지원하고 호스팅형 MCP 클라이언트도 있습니다. Elixir 같은 다른 생태계는 공급사가 아니라 커뮤니티 기여자가 유지하므로, 기대할 수 있는 지원의 성격이 달라집니다.
브라우저 경로도 있습니다. 코드를 쓰기 전에 모델의 입력 항목을 살펴보기에는 이 방법이 가장 빠릅니다.
Replicate 가격에는 플랜 등급이 없습니다. 쓴 만큼만 냅니다. 일부 모델은 하드웨어와 시간으로, 다른 모델은 입력과 출력으로 과금됩니다. 어느 계량이 적용되는지는 계정이 아니라 모델의 속성입니다. 시간 계량에서는 단가가 하드웨어를 따라갑니다.
| 하드웨어 | 초당 | 시간당 |
|---|---|---|
| Nvidia T4 | $0.000225 | $0.81 |
| Nvidia L40S | $0.000975 | $3.51 |
| Nvidia A100(80GB) | $0.001400 | $5.04 |
| Nvidia H100 | $0.001525 | $5.49 |
이 값은 요청당이 아니라 실행 1초당 가격입니다. 대부분의 모델은 실행에 걸린 시간으로 과금되고 초당 가격은 사용 중인 하드웨어에 따라 달라지므로, 같은 프롬프트도 더 무거운 모델에서 더 비쌉니다. 출력 계량은 반대 방향으로 움직입니다. 공식 모델은 출력 이미지 수, 출력 영상 초, 입력·출력 토큰 수처럼 예측 가능한 지표로 가격이 매겨지고, 공개된 예시는 출력 이미지 1장 $0.04부터 입력 토큰 100만 개 $3.75까지입니다. 요청 단위 예산을 미리 계산할 수 있는 쪽은 여기뿐이며, 최상위 등급은 셀프서비스 대상도 아닙니다. 추가 멀티 GPU H100 용량은 약정 지출 계약으로만 제공됩니다.
콜드 스타트는 공유 용량에서는 지연 문제이고 전용 용량에서는 과금 문제입니다. 공유 쪽에서는 공개 모델을 쓸 때 요청을 실제로 처리하는 활성 시간에 대해서만 지불하며, 모델의 셋업 시간과 유휴 시간은 무료입니다. 그렇다고 대기가 사라지지는 않습니다. 경우에 따라 이 과정은 몇 분이 걸릴 수 있고, 기본적으로 다른 고객과 하드웨어 풀을 공유해 요청이 같은 대기열에 들어가므로 통제권도 온전히 내 쪽에 있지 않습니다.
대기를 없애면 계량이 바뀝니다. 전용 용량에서는 모델 인스턴스가 온라인인 모든 시간에 대해 지불합니다. 셋업에 쓰는 시간, 요청을 기다리며 유휴로 있는 시간, 그리고 요청을 처리하는 활성 시간 전부입니다. 빠른 부팅 파인튜닝만 예외여서, 공개든 비공개든 활성 처리 시간만 과금됩니다.
무료 이용은 존재하지만 범위가 있고 수치는 공개돼 있지 않습니다. 일부 모델은 무료로 실행할 수 있지만 얼마 지나면 결제 설정을 요구받으며, 금액도 모델 목록도 기간도 붙어 있지 않습니다. 충전하지 않은 계정은 속도 제한도 받습니다. 크레딧을 받았지만 결제 수단이 등록돼 있지 않으면 초당 1회, 분당 최대 6회 요청으로 제한됩니다.
유료 이용은 선불이고 만료됩니다. 구매한 크레딧은 구매일로부터 1년간 유효하고 법이 요구하는 경우를 빼면 환불되지 않으며, 계약도 같은 만료 규칙을 다시 적습니다. 선불 잔액을 채운 각 결제는 전액 사용되지 않으면 결제일로부터 12개월째 말에 만료됩니다. 자동 충전에는 하한이 있어 최소 임계값은 $5, 최소 충전 잔액은 $15이고, 잔액이 0이 되는 즉시 새 작업은 시작이 막히고 실행 중이던 인프라는 종료됩니다.
엔터프라이즈 조건은 공개가 아니라 협상입니다. 전담 계정 매니저, 우선 지원, 더 높은 GPU 한도, 성능 SLA가 제시되며 물량 할인은 약정 지출과 연결됩니다.
비교의 대부분은 두 가지 사실이 처리합니다. 첫째는 폭입니다. 엔터프라이즈 사용자는 하나의 API와 하나의 계약으로 5만 개 이상의 모델에 접근하는데, 이는 단일 모달리티에 특화한 서비스와는 다른 제안입니다. 둘째는 가장 저렴한 구성이 곧 공유 구성이라는 점이며, 그곳에서는 다른 고객이 해당 모델을 어떻게 쓰느냐에 따라 콜드 부팅이나 스케일링 제한을 종종 만나게 됩니다.
독립적인 출처는 순위가 아니라 진용을 알려 줍니다. 이 회사가 2023년 2월 모습을 드러냈을 때의 기명 기술 보도는 붐비는 시장을 묘사했습니다. 이 스타트업은 Hugging Face, OctoML, 그리고 어느 정도는 Runway ML 같은 업체들과 경쟁하며, 이들은 합쳐서 수억 달러를 조달했습니다. 이후 공개된 개발자 토론에서는 현업 관점의 더 긴 목록이 나왔습니다. 이 분야에 도대체 몇 곳이 있느냐는 물음에 Replicate, RunPod, Modal, Northflank, FAL이 열거됐습니다.
실무에서 이들을 가르는 질문은 셋입니다. 초당 하드웨어 단가를 공개하는가, 아니면 출력 단가만 공개하는가. 인스턴스를 고정한 뒤 유휴 시간에도 과금하는가. 결과물을 보관하는가, 아니면 이곳처럼 타이머로 지우는가. 이번 회차에는 출처 기준을 통과한 독립 벤치마크가 없었고, 검색에 걸린 비교 페이지는 경쟁 플랫폼이 낸 것이거나 추천 링크로 수익을 내는 집계 사이트였습니다.
실패한 작업에 대해 문서와 계약이 서로 다른 말을 합니다. 과금 문서는 어떤 모델이든 실패한 실행에는 과금하지 않되 공식 모델의 실행을 취소하면 여전히 청구될 수 있다고 적습니다. 약관은 반대로, 부분 실행과 실패한 시도는 공급사 로그에 기록된 정확한 실패 지점에 따라 청구 대상이 된다고 적습니다. 세 번째 규칙은 연쇄 호출을 다룹니다. 모델이 실패하면 해당 실행에 걸린 시간에 더해, 실패 전에 호출된 하위 모델의 비용까지 청구됩니다. 이 페이지들은 서로 일치하지 않고, 그 로그가 곧 과금 분쟁을 정리하는 기준 기록이므로, 실패가 잦은 워크로드라면 적용 규칙을 서면으로 확인해 두어야 합니다.
셀프서비스 플랜에서는 계약으로 고정된 것이 없습니다. 공급사는 서비스의 일부 기능을 제한하거나 중단하는 것을 포함해 언제든 단독 재량으로 서비스를 변경할 권리를, 일시적으로든 영구적으로든 사전 통지 없이 보유합니다. 모델 가용성 약속도 없으니 의존하던 모델이 예고 없이 사라질 수 있습니다. 버전을 고정하고 대체 경로를 남겨 두어야 하는 이유입니다. 분쟁 절차도 제약이 있어서, 약관은 미국 캘리포니아주 법을 준거법으로 삼고 집단 중재 절차를 허용하지 않습니다.
균일한 인터페이스가 균일하지 않은 라이선스를 가립니다. 모델 소유자의 오픈소스 라이선스 제한을 위반하는 방식으로 머신러닝 모델을 사용해서는 안 됩니다. 허용적 라이선스, 연구 전용, 독점 조건이 모두 같은 호출 뒤에 있습니다.
보존 기간은 비대칭입니다. API 예측은 한 시간 타이머로 지워지지만 웹 인터페이스로 만든 예측 데이터는 무기한 보관되므로, 기록이 쌓이는 쪽은 브라우저 경로입니다. 모니터링은 명시적입니다. 공급사는 이 정책 준수를 확인하기 위해 서비스 이용을 모니터링할 권리를 보유하며, 여기에는 콘텐츠와 활동에 대한 자동 및 수동 검토가 포함됩니다. 개인정보처리방침은 별도로, 업로드한 학습 데이터에 온갖 종류의 정보가 포함될 수 있고 그중 일부는 여러 개인정보보호법에서 "민감" 정보로 간주될 수 있다고 경고합니다.
산출물 권리는 넓지만 조건부입니다. 공급사는 판매나 게시 같은 상업적 이용을 포함해 산출물에 대한 모든 권리·소유권·이익을 사용자에게 부여하되, 적용되는 제3자 조항을 조건으로 답니다. 그 조건이란 결국 그 산출물을 만든 모델의 라이선스입니다. 반대급부로 사용자는 자신의 입력에 대해, 산출물 제공, 고객 파생 모델 학습·생성, 약관에 따른 서비스 제공, 그리고 Resultant Data 작성과 취합에 필요한 범위로 한정된 라이선스를 부여합니다. 그 입력이 공급사 자체 모델 학습에 쓰이는지에 대해서는 공개된 정책 어디에도 긍정도 부정도 없으며, 여기서도 대신 메우지 않습니다.
플랫폼은 미국 각 주 개인정보보호법이 정의하는 의미에서 개인정보를 "판매"하거나 "공유"하지 않는다고 밝히고 있으며, 정책은 16세 미만 아동의 개인정보를 의도적으로 수집하지 않는다고 적고 있습니다.
무료 요금제라기보다 범위가 정해진 무료 허용량입니다. 일부 모델은 결제 설정을 요구받기 전까지 무료로 실행되지만, 허용량·기간·모델 목록은 공개돼 있지 않습니다. 결제 수단 등록 전에는 처리량이 초당 1회로 제한됩니다.
공개 모델에서는 들지 않습니다. 그쪽은 셋업과 유휴 시간이 무료입니다. 다만 용량을 고정하면 달라져, 전용 인스턴스와 배포는 셋업과 유휴 시간에도 과금합니다.
만료됩니다. 크레딧은 구매일로부터 1년간 유효하고, 계약은 각 결제가 전액 사용되지 않으면 결제 후 12개월째 말에 만료된다고 적습니다. 모든 선불 잔액은 법이 요구하거나 본 계약에 명시된 경우를 제외하면 환불되지 않습니다.
API에서는 기본적으로 저장되지 않습니다. 입력, 출력, 파일, 로그는 한 시간 뒤 삭제되므로 필요한 것은 직접 복사해 두어야 합니다. 브라우저에서 만든 예측만 직접 지울 때까지 남습니다.