Toolso.AI
Toolso.AI
모든 도구카테고리인기최신 도구가격블로그
Toolso.AI
Toolso.AI

💌AI 도구 위클리 구독

매주 선별된 최신 및 핫한 AI 도구와 트렌드를 받은편지함으로 받아보세요 구독

Toolso.AI
Toolso.AI

생산성을 높일 최고의 AI 도구 발견

GitHubGitHubTwitterX (Twitter)YouTubeYouTubeTikTokEmail

인기 카테고리

  • AI 글쓰기
  • AI 이미지
  • AI 비디오
  • AI 코딩
  • 더 많은 카테고리

탐색

  • 최신 도구
  • 인기 도구
  • 더 많은 도구
  • 도구 제출
  • 요금

회사 소개

  • 회사 소개
  • 문의하기
  • 블로그
  • 변경 로그

법률

  • 쿠키 정책
  • 개인정보 보호정책
  • 서비스 약관
  • 환불 정책
© 2026 Toolso.AI 모든 권리 보유
기간 한정기간 한정 프로모션추천 등록24시간 우선 심사 · 백링크 불필요 · 30일 추천 노출$29.90이후 $59.9010월 31일 이후 $59.90로 인상종료까지--:--:--지금 제출
  1. 홈
  2. 모든 도구
  3. 개발 도구
  4. Together AI
Together AI 인터페이스 미리보기
Together AI 로고

Together AI

Together AI는 OpenAI 호환 서버리스 API로 오픈 웨이트 모델을 실행하고 전용 엔드포인트, 파인튜닝, GPU 클러스터, 샌드박스까지 제공하며, 모든 비용은 선불 크레딧에서 차감됩니다.

개발 도구AI 개발AI 훈련 플랫폼#일괄 처리#SDK#LLM
무료로 사용해보기
저장
방문 횟수
조회수
가격
부분 유료
출시일
2026년 10월 6일
도메인
together.ai
사용자 평점

이 도구를 사용해 보셨나요? 평점을 남겨 주세요

이 도구 평가하기

Together AI 제품 정보

무료로 사용해보기
도구 정보
저장
방문 횟수
조회수
가격
부분 유료
출시일
2026년 10월 6일
도메인
together.ai
사용자 평점

이 도구를 사용해 보셨나요? 평점을 남겨 주세요

이 도구 평가하기

추천 도구

관련 도구

무료로 사용해보기

Together AI, 어떤 도구인가요?

Together AI는 API와 임대형 GPU 인프라를 통해 오픈소스 및 오픈 웨이트 AI 모델을 실행하고 맞춤화하고 학습시키는 클라우드 플랫폼입니다. 회사는 이를 최첨단 연구를 기반으로 한 풀스택 AI 플랫폼, 즉 AI 네이티브 클라우드로 홍보합니다. 대부분의 개발자에게 진입점은 오픈소스 LLM API입니다.

이 서비스는 델라웨어주 법인인 Together Computer, Inc.가 운영하며, 약관은 대규모 AI 모델을 호스팅·사용·파인튜닝·학습하기 위한 API와 웹 인터페이스를 다룹니다. 독립 IT 매체는 Together AI를 Nvidia GPU 클러스터를 임대하는 AI 네오클라우드로 묘사했으며, 83억 달러의 기업가치로 8억 달러 규모의 시리즈 C 투자를 유치했다고 보도했습니다. 같은 보도에 따르면 회사는 수천 곳의 유료 고객을 보유하고 있다고 주장하며, 그중 Cursor, Cognition, Decagon을 꼽았습니다.

대부분의 결정을 좌우하는 사실은 세 가지입니다. 무료 체험이 없고 $5 크레딧 구매로 이용이 시작된다는 점, 제로 데이터 보존을 켜지 않으면 프롬프트가 기본적으로 저장된다는 점, 공유 서버리스 용량은 최선 노력(best-effort) 방식이라는 점입니다.

핵심 기능

Together AI는 제품을 추론, 컴퓨팅, 모델 조정으로 나누며, 모두 같은 선불 크레딧 잔액에서 청구됩니다.

추론 옵션

  • 서버리스 추론: 개발자는 아무것도 배포하거나 관리하지 않고 단일 API로 오픈 웨이트 모델을 호출하며, 사용한 토큰만큼만 비용을 냅니다. 카탈로그에는 텍스트, 이미지, 동영상, 코드, 음성 모델이 포함됩니다.
  • 배치 추론: 대규모 비동기 작업은 모델당 300억 토큰까지 확장할 수 있으며, 모든 서버리스 모델이나 프라이빗 배포를 사용할 수 있습니다.
  • 프로비저닝된 처리량: 약정 추론 용량에는 토큰 기반 요금, 예약 처리량, 99% 가동 시간 SLA가 제공됩니다.
  • 전용 엔드포인트와 컨테이너: 전용 모델 추론은 예약된 격리 하드웨어에서 모델을 실행하고, 전용 컨테이너 추론은 동영상, 오디오, 이미지 모델 같은 생성형 미디어 워크로드를 겨냥합니다.

회사는 gpt-oss-20B 서버리스 추론에서 그다음으로 빠른 제공업체보다 거의 2배 빠른 속도를 달성했다고 밝힙니다. 이는 벤더 자체 벤치마크이며, 해당 모델은 이후 서버리스에서 제거될 예정으로 잡혔습니다.

파인튜닝과 모델 조정

  • 모델 가져오기: Together AI는 Hugging Face Hub의 모든 오픈소스 모델을 형식 변환 없이 파인튜닝할 수 있다고 말합니다.
  • 도구 호출 데이터: 도구 호출 학습은 기존 에이전트 로그를 그대로 받아들이며, 함수 정의와 도구 호출을 데이터셋에 직접 넣습니다.
  • 비전 파인튜닝: 비전 모델은 특별한 전처리 없이 원본 PNG, JPEG, WEBP 이미지로 직접 학습하며, LoRA 또는 전체 파인튜닝을 사용합니다.
  • 이동 가능한 결과물: 완성된 모델은 Together 전용 엔드포인트에서 호스팅하거나 독립 체크포인트로 다운로드할 수 있습니다.

따라서 LLM 파인튜닝 결과물은 토큰당 과금되는 서버리스 카탈로그에 합류하지 않고, 전용 하드웨어에서 실행되거나 가중치 형태로 플랫폼을 떠납니다.

컴퓨팅, 샌드박스, 스토리지

  • GPU 클러스터: 고객은 학습이나 서빙용으로 GPU를 8개부터 4,000개 이상까지 예약할 수 있습니다.
  • 코드 샌드박스: 샌드박스 VM은 AI 개발 환경용으로 vCPU 264개, RAM 1128GB 범위에서 제공됩니다.
  • 관리형 스토리지: 관리형 스토리지는 이그레스 요금 없이 오브젝트 스토리지와 병렬 파일 시스템을 제공합니다.

가이드

첫 API 호출에는 충전된 계정, API 키, 그리고 공식 SDK나 기존 OpenAI 클라이언트 중 하나가 필요합니다.

  1. Together AI 콘솔에 가입하고 결제 설정에서 최소 $5 크레딧을 추가합니다.
  2. 프로젝트의 API 키 페이지에서 키를 만듭니다. 새 API 키는 한 번만 표시되므로 값을 바로 저장하세요.
  3. 공식 Python 또는 TypeScript SDK를 설치하거나, 기존 OpenAI 클라이언트를 유지한 채 기본 URL을 바꾼 뒤 키를 환경 변수로 설정합니다.
  4. 빠른 시작 예제를 실행합니다. 이 예제는 MiniMax M3에 채팅 완성 요청을 보내고 응답을 출력합니다.
  5. 오프라인 워크로드에는 배치 API를 쓰면 업로드한 JSONL 파일 하나로 다수의 독립 요청을 비동기로 실행할 수 있습니다.

파인튜닝 비용은 돈을 쓰기 전에 확인할 수 있습니다. CLI가 작업을 제출하기 전에 예상 가격을 출력하고 확인을 요청하기 때문입니다.

Together AI 활용 사례와 예시

  • 오프라인 배치 작업: 배치 작업은 대규모 데이터셋 분류, 평가 실행, 합성 데이터 생성, 오프라인 요약처럼 지연 시간에 관대한 작업에 적합합니다.
  • 실시간 음성 에이전트: Decagon의 1초 미만 음성 AI를 다룬 Together AI 고객 사례는 gpt-5 mini 대비 턴당 비용 6배 절감을 제시합니다.
  • 지연 시간이 짧은 프로덕션 API: Salesforce AI Research의 고객 추천사는 지연 시간 2배 단축과 약 3분의 1의 비용 절감을 언급합니다.
  • 연구 및 학습 실행: GPU 클러스터는 몇 분 만에 클러스터를 띄워 가설을 검증하고 실험이 끝나면 종료하는 용도로 소개됩니다.
  • 오픈 모델 기반 코딩 에이전트: Together Link는 Together가 호스팅하는 모델에서 코딩 에이전트 6개를 실행하며, 여기에는 터미널의 Claude Code, Codex, OpenCode, Pi Code와 Claude Desktop, ChatGPT Desktop이 포함됩니다.

위 고객 수치는 Together AI가 자사 페이지에 게시한 것으로, 이 소개 페이지를 위해 독립적으로 검증되지 않았습니다.

누구를 위한 것인가

Together AI는 API, SDK, 명령줄 도구를 능숙하게 다루고, 자체 추론 스택을 운영하지 않고 오픈 웨이트 모델을 쓰려는 개발자와 ML 팀에 적합합니다.

  • 프로토타이핑과 변동 트래픽: 서버리스 추론은 변동이 크거나 예측하기 어려운 트래픽, 빠른 프로토타이핑, 비용에 민감하거나 초기 단계인 프로덕션 워크로드에 가장 적합하다고 소개됩니다.
  • 안정적이고 지연 시간에 민감한 프로덕션: 전용 모델 추론은 예측 가능한 트래픽, 지연 시간에 민감한 애플리케이션, 높은 처리량의 프로덕션 워크로드를 겨냥합니다.
  • 투자를 유치한 스타트업: 선발제 액셀러레이터는 투자 유치액이 $5M 이하인 스타트업에 최대 $15K, $5M–$10M이면 최대 $30K, $10M 초과면 최대 $50K의 플랫폼 크레딧을 제공합니다.

두 추론 방식 중 무엇을 고를지는 사용률에 달려 있습니다. 레플리카가 하루 대부분 바쁘게 돌아간다면 대체로 전용 모델 추론이 더 저렴합니다. 트래픽이 적거나 들쭉날쭉해서 전용 레플리카가 대부분의 시간 동안 유휴 상태로 남는다면 대체로 서버리스가 더 저렴합니다. 가격 페이지는 또한 대부분의 팀이 서버리스 추론으로 시작해 규모가 커지면 전용 엔드포인트로 옮긴다고 설명합니다.

무료 체험이 없으므로 결제 전에 모델을 먼저 써 보고 싶은 사용자에게는 덜 적합하며, 호환 계층이 OpenAI의 Assistants API를 구현하지 않으므로 이 API로 만든 앱에도 덜 적합합니다.

플랫폼

Together AI는 소비자용 앱이 아니라 웹 콘솔, SDK, CLI, REST API로 사용합니다.

  • SDK와 API: Together AI는 Python과 TypeScript용 공식 SDK를 제공하며, OpenAI SDK나 어떤 언어에서든 일반 REST 호출로도 사용할 수 있습니다.
  • OpenAI 호환성: API는 채팅, 완성, 비전, 이미지 생성, 텍스트 음성 변환, 임베딩 전반에서 OpenAI REST API 및 SDK와 호환됩니다.
  • 배치 도구: 배치 작업은 콘솔, API나 SDK, 또는 CLI에서 시작할 수 있습니다.
  • 클러스터 관리: GPU 클러스터 접근 권한은 CLI, SDK, API, Terraform 또는 웹 콘솔에서 프로젝트 수준 RBAC로 관리합니다.
  • 리전: 서버리스 엔드포인트는 리전 선택을 지원하지 않습니다. 프라이빗 네트워킹과 EU 리전을 포함한 VPC 기반 배포는 전용 구성으로 이용할 수 있습니다.

가격

Together AI 가격은 사용량 기반이며 전액 선불입니다. Together AI는 현재 무료 체험을 제공하지 않으며, 플랫폼을 이용하려면 최소 $5의 크레딧을 구매해야 합니다. 플랫폼을 사용하려면 크레딧 잔액이 양수여야 합니다. 선불 잔액 크레딧에는 현재 만료일이 없습니다. 자동 충전으로 잔액을 자동으로 채울 수 있지만, 기본 결제 수단이 신용카드나 체크카드일 때만 가능합니다. 서비스 약관에 따라 약관이나 주문서에 달리 명시되지 않는 한 지불한 요금은 환불되지 않습니다.

서버리스 토큰 가격

서버리스 가격은 100만 토큰당 기준으로 표시되며 자주 바뀝니다. 아래 대표 항목은 2026년 10월 5일에 수집했습니다.

모델입력캐시된 입력출력
MiniMax M3$0.30$0.06$1.20
Kimi K3$3.00$0.30$15.00
gpt-oss-120B$0.15미기재$0.60
Llama 3.3 70B$1.04미기재$1.04

배치 API는 서버리스 요금 대비 최대 50% 할인과 별도의 요청 한도 풀을 내세웁니다. 그러나 배치 문서의 할인 모델 표에는 Llama 3.3 70B Turbo 변형과 Whisper Large v3만 50% 할인으로 올라 있으며, 표에 없는 모델은 표준 요금으로 실행됩니다.

GPU 클러스터

모든 GPU 클러스터 가격은 GPU당 시간당 기준입니다.

GPU선점형온디맨드예약 7–30일31–90일91–180일181일 이상
NVIDIA HGX H100$1.99$3.99$3.69$3.45$3.19문의
NVIDIA HGX H200$2.99$5.99$4.99$4.15$3.99문의
NVIDIA HGX B200$4.09$8.19$7.99$7.79$6.79문의

예약은 클러스터가 프로비저닝되면 예약 기간 전체에 대해 청구되며, 예약 용량을 넘는 사용량은 온디맨드 요금으로 청구됩니다. 스타트업 액셀러레이터 크레딧은 예약 GPU 클러스터에는 적용되지 않습니다.

전용 추론

전용 레플리카는 준비되어 트래픽을 처리할 수 있는 동안에만 과금되므로 프로비저닝과 콜드 스타트 시간은 청구되지 않습니다. H100 요금은 공식 페이지마다 다릅니다. 가격 페이지의 전용 추론 표에는 온디맨드 GPU 시간당 $5.49로 나와 있습니다. 반면 문서의 변경 로그 항목은 H100 80GB 전용 엔드포인트 하드웨어가 이제 시간당 $3.99이며 $5.49에서 인하되었다고 말합니다.

파인튜닝

파인튜닝은 처리된 토큰, 즉 학습 데이터셋 크기에 에포크 수를 곱하고 평가 토큰이 있으면 더한 양을 기준으로 청구되며, 작업마다 모델별 최소 요금이 붙습니다. 가격 페이지의 첫 번째 파인튜닝 표(탭 이름은 LoRA와 전체 파인튜닝)에는 Qwen3.5 0.8B가 지도 파인튜닝 100만 토큰당 $0.34, DPO $0.84, 최소 요금 $4.00으로 나와 있습니다. 같은 표 아래쪽의 GLM-5.2는 지도 파인튜닝 $40.00, DPO $100.00, 최소 요금 $60.00입니다. 취소되거나 조기 중단된 작업은 완료된 스텝에 대해서만 청구됩니다. 파인튜닝된 모델을 전용 엔드포인트에서 호스팅하는 비용은 분 단위로 별도 청구됩니다.

Together AI 대안

비슷한 오픈 모델 추론 제공업체들은 주로 파인튜닝된 모델의 과금 방식과 신규 계정에 무료 크레딧을 주는지에서 차이가 납니다.

  • Fireworks AI: Fireworks AI는 파인튜닝된 모델을 기본 모델과 같은 가격에 서빙한다고 밝힙니다. 서버리스 추론은 선불·사용량 기반으로 토큰당 과금됩니다.
  • Baseten: Baseten은 신규 계정에 배포를 무료로 실험해 볼 수 있는 크레딧이 제공된다고 말합니다. 전용 배포는 실제 사용한 컴퓨팅에 대해서만 분 단위로 과금됩니다.

이들과 비교하면 Together AI는 무료 체험 없이 첫 구매로 $5를 요구하고, 파인튜닝된 모델 호스팅을 전용 하드웨어에서 분 단위로 과금합니다. 그 대신 계정 하나로 서버리스 모델, 배치 작업, 전용 엔드포인트, GPU 클러스터, 샌드박스, 스토리지를 모두 이용할 수 있습니다.

제한 사항

서비스 한도

  • 최선 노력 방식의 서버리스: 서버리스 성능은 최선 노력 방식이며, 약정 처리량이 필요하면 프로비저닝된 처리량을 이용해야 합니다.
  • 스로틀링: 수요가 높을 때 Together는 요청을 제한할 수 있으며, 클라이언트는 429 Too Many Requests 또는 503 Service Unavailable 응답을 받을 수 있습니다.
  • 모델 변동: 한 변경 로그 항목은 openai/gpt-oss-20b 등 여러 모델을 2026년 9월 14일에 서버리스에서 제거하도록 예정했습니다. 해당 항목의 모델 중 하나를 제외한 나머지는 온디맨드 전용 엔드포인트로 계속 이용할 수 있으며, 이 경우 토큰이 아니라 하드웨어 사용 시간으로 과금됩니다.
  • 부분적인 OpenAI 호환성: OpenAI API의 Assistants, Threads, Runs는 구현되어 있지 않습니다. gpt-4o나 text-embedding-3-large 같은 OpenAI 모델 이름은 Together에서 404를 반환합니다.
  • 배치 한도: 배치 하나에는 최대 50,000건의 요청을 담을 수 있습니다. 배치 입력·출력·오류 파일은 7일간 보관되므로 결과는 그 기간 안에 다운로드해야 합니다.

결제 및 지원 범위

  • 잔액 0: 잔액이 0이 되면 크레딧을 추가할 때까지 API 접근이 중단됩니다.
  • 온디맨드 클러스터: 완전 온디맨드 GPU 클러스터는 크레딧이 소진되면 먼저 일시 중지되고, 크레딧이 복구되지 않으면 이후 해제됩니다.
  • 지원 등급: 지원 페이지는 여전히 등급별 지원을 설명하며, Build 등급 사용자에게는 커뮤니티 Discord 도움을 안내합니다. 그러나 한 변경 로그 항목은 Build 등급 1–5, Scale, Enterprise 등급 라벨이 폐지되었다고 말합니다.

개인정보, 데이터 사용, 소유권

  • 기본 저장: 기본적으로 Together는 프롬프트와 모델 응답을 저장하며, 이를 제품 개선에 사용할 수 있습니다.
  • 학습: 고객 데이터를 모델 학습에 사용하는 것은 별도의 옵트인 항목이며 기본적으로 꺼져 있습니다. 개인정보처리방침은 명시적인 옵트인 동의 없이는 수집한 데이터를 회사 모델 학습에 사용하지 않는다고 밝힙니다.
  • 제로 데이터 보존: 제로 데이터 보존은 기본적으로 활성화되어 있지 않습니다. ZDR을 켜면 프롬프트와 출력은 Together가 저장하지 않으며 어떤 부차적 목적에도 사용되지 않습니다. ZDR은 활성화한 시점부터만 적용되며 그 이전에 처리된 데이터에는 영향을 주지 않습니다. 파인튜닝이나 배치 API용으로 업로드한 파일은 API, CLI 또는 웹 콘솔에서 삭제할 때까지 저장된 상태로 남습니다.
  • 패스스루 모델: 요청을 서드파티 제공업체로 전달하는 패스스루 모델은 기본적으로 허용되며, 해당 제공업체의 자체 데이터 정책을 따릅니다.
  • 호스팅되는 서드파티 모델: DeepSeek, Qwen, Mistral 같은 서드파티 개발사의 모델은 Together 자체 인프라에서 실행되며 모델 개발사로 호출을 보내지 않습니다.
  • 소유권과 컴플라이언스: 서비스 약관상 고객은 자신의 콘텐츠와 출력물을 독점적으로 소유합니다. Together AI는 SOC 2 Type II, HIPAA에 맞춘 옵션, 전송 중 및 저장 시 암호화를 제시합니다.

이 페이지를 위해 확인한 독립 매체와 리뷰 출처에서는 제품 수준의 장애나 보안 보고가 발견되지 않았고, 리뷰 표본은 20건 미만으로 품질을 판단하기에는 너무 적었습니다.

FAQ

Q1. Together AI에 무료 플랜이나 무료 체험이 있나요?

아니요. 이용하려면 최소 $5 크레딧을 구매해야 하며 무료 체험은 제공되지 않습니다. 액셀러레이터 프로그램에 선정된 스타트업은 대신 플랫폼 크레딧을 받을 수 있지만, 이 크레딧은 예약 GPU 클러스터에는 적용되지 않습니다.

Q2. Together AI에서 OpenAI SDK를 쓸 수 있나요?

네, 채팅, 완성, 비전, 이미지 생성, 텍스트 음성 변환, 임베딩에는 쓸 수 있습니다. OpenAI 클라이언트가 Together의 기본 URL을 가리키게 하고 Together의 네임스페이스 모델 ID로 바꾸면 됩니다. Assistants, Threads, Runs는 사용할 수 없으며, 배치 작업은 Together 자체 배치 API를 사용합니다.

Q3. Together AI가 제 프롬프트로 학습하나요?

기본적으로는 아닙니다. 학습 사용은 옵트인 설정으로, 활성화하지 않으면 꺼진 상태로 유지됩니다. 다만 제로 데이터 보존을 켜지 않으면 프롬프트와 응답은 여전히 기본적으로 저장됩니다.

Q4. 크레딧이 떨어지면 어떻게 되나요?

크레딧을 추가할 때까지 API 접근이 중단됩니다. 온디맨드 GPU 클러스터는 일시 중지되고 크레딧이 복구되지 않으면 이후 해제되며, 기존 GPU 클러스터 예약은 예정된 종료일까지 계속 유효합니다.

Q5. 파인튜닝한 모델을 다른 곳으로 가져갈 수 있나요?

네. 작업이 끝나면 모델을 Together 전용 엔드포인트에서 서빙하거나, 로컬 추론이나 다른 호스트에서 쓸 수 있도록 체크포인트로 다운로드할 수 있습니다.

비슷한 도구를 아시나요?
다른 훌륭한 AI 도구를 알고 계시다면 저희에게 제출해 주세요