Together AI는 API와 임대형 GPU 인프라를 통해 오픈소스 및 오픈 웨이트 AI 모델을 실행하고 맞춤화하고 학습시키는 클라우드 플랫폼입니다. 회사는 이를 최첨단 연구를 기반으로 한 풀스택 AI 플랫폼, 즉 AI 네이티브 클라우드로 홍보합니다. 대부분의 개발자에게 진입점은 오픈소스 LLM API입니다.
이 서비스는 델라웨어주 법인인 Together Computer, Inc.가 운영하며, 약관은 대규모 AI 모델을 호스팅·사용·파인튜닝·학습하기 위한 API와 웹 인터페이스를 다룹니다. 독립 IT 매체는 Together AI를 Nvidia GPU 클러스터를 임대하는 AI 네오클라우드로 묘사했으며, 83억 달러의 기업가치로 8억 달러 규모의 시리즈 C 투자를 유치했다고 보도했습니다. 같은 보도에 따르면 회사는 수천 곳의 유료 고객을 보유하고 있다고 주장하며, 그중 Cursor, Cognition, Decagon을 꼽았습니다.
대부분의 결정을 좌우하는 사실은 세 가지입니다. 무료 체험이 없고 $5 크레딧 구매로 이용이 시작된다는 점, 제로 데이터 보존을 켜지 않으면 프롬프트가 기본적으로 저장된다는 점, 공유 서버리스 용량은 최선 노력(best-effort) 방식이라는 점입니다.
Together AI는 제품을 추론, 컴퓨팅, 모델 조정으로 나누며, 모두 같은 선불 크레딧 잔액에서 청구됩니다.
회사는 gpt-oss-20B 서버리스 추론에서 그다음으로 빠른 제공업체보다 거의 2배 빠른 속도를 달성했다고 밝힙니다. 이는 벤더 자체 벤치마크이며, 해당 모델은 이후 서버리스에서 제거될 예정으로 잡혔습니다.
따라서 LLM 파인튜닝 결과물은 토큰당 과금되는 서버리스 카탈로그에 합류하지 않고, 전용 하드웨어에서 실행되거나 가중치 형태로 플랫폼을 떠납니다.
첫 API 호출에는 충전된 계정, API 키, 그리고 공식 SDK나 기존 OpenAI 클라이언트 중 하나가 필요합니다.
파인튜닝 비용은 돈을 쓰기 전에 확인할 수 있습니다. CLI가 작업을 제출하기 전에 예상 가격을 출력하고 확인을 요청하기 때문입니다.
위 고객 수치는 Together AI가 자사 페이지에 게시한 것으로, 이 소개 페이지를 위해 독립적으로 검증되지 않았습니다.
Together AI는 API, SDK, 명령줄 도구를 능숙하게 다루고, 자체 추론 스택을 운영하지 않고 오픈 웨이트 모델을 쓰려는 개발자와 ML 팀에 적합합니다.
두 추론 방식 중 무엇을 고를지는 사용률에 달려 있습니다. 레플리카가 하루 대부분 바쁘게 돌아간다면 대체로 전용 모델 추론이 더 저렴합니다. 트래픽이 적거나 들쭉날쭉해서 전용 레플리카가 대부분의 시간 동안 유휴 상태로 남는다면 대체로 서버리스가 더 저렴합니다. 가격 페이지는 또한 대부분의 팀이 서버리스 추론으로 시작해 규모가 커지면 전용 엔드포인트로 옮긴다고 설명합니다.
무료 체험이 없으므로 결제 전에 모델을 먼저 써 보고 싶은 사용자에게는 덜 적합하며, 호환 계층이 OpenAI의 Assistants API를 구현하지 않으므로 이 API로 만든 앱에도 덜 적합합니다.
Together AI는 소비자용 앱이 아니라 웹 콘솔, SDK, CLI, REST API로 사용합니다.
Together AI 가격은 사용량 기반이며 전액 선불입니다. Together AI는 현재 무료 체험을 제공하지 않으며, 플랫폼을 이용하려면 최소 $5의 크레딧을 구매해야 합니다. 플랫폼을 사용하려면 크레딧 잔액이 양수여야 합니다. 선불 잔액 크레딧에는 현재 만료일이 없습니다. 자동 충전으로 잔액을 자동으로 채울 수 있지만, 기본 결제 수단이 신용카드나 체크카드일 때만 가능합니다. 서비스 약관에 따라 약관이나 주문서에 달리 명시되지 않는 한 지불한 요금은 환불되지 않습니다.
서버리스 가격은 100만 토큰당 기준으로 표시되며 자주 바뀝니다. 아래 대표 항목은 2026년 10월 5일에 수집했습니다.
| 모델 | 입력 | 캐시된 입력 | 출력 |
|---|---|---|---|
| MiniMax M3 | $0.30 | $0.06 | $1.20 |
| Kimi K3 | $3.00 | $0.30 | $15.00 |
| gpt-oss-120B | $0.15 | 미기재 | $0.60 |
| Llama 3.3 70B | $1.04 | 미기재 | $1.04 |
배치 API는 서버리스 요금 대비 최대 50% 할인과 별도의 요청 한도 풀을 내세웁니다. 그러나 배치 문서의 할인 모델 표에는 Llama 3.3 70B Turbo 변형과 Whisper Large v3만 50% 할인으로 올라 있으며, 표에 없는 모델은 표준 요금으로 실행됩니다.
모든 GPU 클러스터 가격은 GPU당 시간당 기준입니다.
| GPU | 선점형 | 온디맨드 | 예약 7–30일 | 31–90일 | 91–180일 | 181일 이상 |
|---|---|---|---|---|---|---|
| NVIDIA HGX H100 | $1.99 | $3.99 | $3.69 | $3.45 | $3.19 | 문의 |
| NVIDIA HGX H200 | $2.99 | $5.99 | $4.99 | $4.15 | $3.99 | 문의 |
| NVIDIA HGX B200 | $4.09 | $8.19 | $7.99 | $7.79 | $6.79 | 문의 |
예약은 클러스터가 프로비저닝되면 예약 기간 전체에 대해 청구되며, 예약 용량을 넘는 사용량은 온디맨드 요금으로 청구됩니다. 스타트업 액셀러레이터 크레딧은 예약 GPU 클러스터에는 적용되지 않습니다.
전용 레플리카는 준비되어 트래픽을 처리할 수 있는 동안에만 과금되므로 프로비저닝과 콜드 스타트 시간은 청구되지 않습니다. H100 요금은 공식 페이지마다 다릅니다. 가격 페이지의 전용 추론 표에는 온디맨드 GPU 시간당 $5.49로 나와 있습니다. 반면 문서의 변경 로그 항목은 H100 80GB 전용 엔드포인트 하드웨어가 이제 시간당 $3.99이며 $5.49에서 인하되었다고 말합니다.
파인튜닝은 처리된 토큰, 즉 학습 데이터셋 크기에 에포크 수를 곱하고 평가 토큰이 있으면 더한 양을 기준으로 청구되며, 작업마다 모델별 최소 요금이 붙습니다. 가격 페이지의 첫 번째 파인튜닝 표(탭 이름은 LoRA와 전체 파인튜닝)에는 Qwen3.5 0.8B가 지도 파인튜닝 100만 토큰당 $0.34, DPO $0.84, 최소 요금 $4.00으로 나와 있습니다. 같은 표 아래쪽의 GLM-5.2는 지도 파인튜닝 $40.00, DPO $100.00, 최소 요금 $60.00입니다. 취소되거나 조기 중단된 작업은 완료된 스텝에 대해서만 청구됩니다. 파인튜닝된 모델을 전용 엔드포인트에서 호스팅하는 비용은 분 단위로 별도 청구됩니다.
비슷한 오픈 모델 추론 제공업체들은 주로 파인튜닝된 모델의 과금 방식과 신규 계정에 무료 크레딧을 주는지에서 차이가 납니다.
이들과 비교하면 Together AI는 무료 체험 없이 첫 구매로 $5를 요구하고, 파인튜닝된 모델 호스팅을 전용 하드웨어에서 분 단위로 과금합니다. 그 대신 계정 하나로 서버리스 모델, 배치 작업, 전용 엔드포인트, GPU 클러스터, 샌드박스, 스토리지를 모두 이용할 수 있습니다.
이 페이지를 위해 확인한 독립 매체와 리뷰 출처에서는 제품 수준의 장애나 보안 보고가 발견되지 않았고, 리뷰 표본은 20건 미만으로 품질을 판단하기에는 너무 적었습니다.
아니요. 이용하려면 최소 $5 크레딧을 구매해야 하며 무료 체험은 제공되지 않습니다. 액셀러레이터 프로그램에 선정된 스타트업은 대신 플랫폼 크레딧을 받을 수 있지만, 이 크레딧은 예약 GPU 클러스터에는 적용되지 않습니다.
네, 채팅, 완성, 비전, 이미지 생성, 텍스트 음성 변환, 임베딩에는 쓸 수 있습니다. OpenAI 클라이언트가 Together의 기본 URL을 가리키게 하고 Together의 네임스페이스 모델 ID로 바꾸면 됩니다. Assistants, Threads, Runs는 사용할 수 없으며, 배치 작업은 Together 자체 배치 API를 사용합니다.
기본적으로는 아닙니다. 학습 사용은 옵트인 설정으로, 활성화하지 않으면 꺼진 상태로 유지됩니다. 다만 제로 데이터 보존을 켜지 않으면 프롬프트와 응답은 여전히 기본적으로 저장됩니다.
크레딧을 추가할 때까지 API 접근이 중단됩니다. 온디맨드 GPU 클러스터는 일시 중지되고 크레딧이 복구되지 않으면 이후 해제되며, 기존 GPU 클러스터 예약은 예정된 종료일까지 계속 유효합니다.
네. 작업이 끝나면 모델을 Together 전용 엔드포인트에서 서빙하거나, 로컬 추론이나 다른 호스트에서 쓸 수 있도록 체크포인트로 다운로드할 수 있습니다.