Toolso.AI
Toolso.AI
모든 도구카테고리인기최신 도구가격블로그
Toolso.AI
Toolso.AI

💌AI 도구 위클리 구독

매주 선별된 최신 및 핫한 AI 도구와 트렌드를 받은편지함으로 받아보세요 구독

Toolso.AI
Toolso.AI

생산성을 높일 최고의 AI 도구 발견

GitHubGitHubTwitterX (Twitter)YouTubeYouTubeTikTokEmail

인기 카테고리

  • AI 글쓰기
  • AI 이미지
  • AI 비디오
  • AI 코딩
  • 더 많은 카테고리

탐색

  • 최신 도구
  • 인기 도구
  • 더 많은 도구
  • 도구 제출
  • 요금

회사 소개

  • 회사 소개
  • 문의하기
  • 블로그
  • 변경 로그

법률

  • 쿠키 정책
  • 개인정보 보호정책
  • 서비스 약관
  • 환불 정책
© 2026 Toolso.AI 모든 권리 보유
기간 한정기간 한정 프로모션추천 등록24시간 우선 심사 · 백링크 불필요 · 30일 추천 노출$29.90이후 $59.9010월 31일 이후 $59.90로 인상종료까지--:--:--지금 제출
  1. 홈
  2. 모든 도구
  3. AI 도구
  4. Fish Audio
Fish Audio 인터페이스 미리보기웹사이트 방문
Fish Audio 로고

Fish Audio

Fish Audio는 단어 단위 감정 제어를 중심으로 만들어진 음성 합성 및 음성 복제 플랫폼입니다. 10초 샘플로 목소리를 복제하고 300밀리초 미만의 스트리밍 지연을 제공하며 S2 모델 가중치를 공개합니다. 다만 라이선스는 연구와 비상업 용도로 한정됩니다. 운영사는 Hanabi AI Inc.입니다.

AI 도구오디오 생성오디오 도구#텍스트 음성 변환#오픈 소스#다국어
무료로 사용해보기
저장
방문 횟수
조회수
가격
무료
출시일
2026년 8월 25일
도메인
fish.audio
사용자 평점

이 도구를 사용해 보셨나요? 평점을 남겨 주세요

이 도구 평가하기

Fish Audio 제품 정보

무료로 사용해보기
도구 정보
저장
방문 횟수
조회수
가격
무료
출시일
2026년 8월 25일
도메인
fish.audio
사용자 평점

이 도구를 사용해 보셨나요? 평점을 남겨 주세요

이 도구 평가하기

추천 도구

관련 도구

무료로 사용해보기

Fish Audio란 무엇인가요?

Fish Audio는 하나의 핵심 판단 위에 세워진 음성 AI 플랫폼입니다. 단어를 정확히 읽는 것과 말을 잘 전달하는 것은 서로 다른 문제이며, 대부분의 음성 합성 시스템은 지금껏 앞의 문제만 풀어 왔다는 것입니다. 공식 홈페이지는 능력을 세 갈래로 정리합니다. 텍스트 음성 변환, 음성 복제, 그리고 음성 인식입니다. 세 갈래 모두 S2라는 이름의 모델 계열을 공유합니다.

이 제품을 규정하는 진짜 특징은 단어 단위의 표현 제어입니다. 시스템은 원고를 평평하게 한 번 읽어 내려가는 대신, 문장 안에 끼워 넣은 자연어 태그를 받아들이고 그 태그가 해당 대목을 어떻게 읽을지 지시합니다. 홈페이지 시연 영역은 감정 태그 세트를 그대로 드러내 보여 줍니다. 분노와 슬픔, 당황, 강조, 속삭임, 부드러움, 숨소리, 흥분 등이 포함되며, 별도의 특수 태그 묶음이 웃음과 실소, 헛기침, 흐느낌, 한숨, 가쁜 숨, 그리고 짧은 멈춤과 긴 멈춤까지 다룹니다. 프로젝트 자체 코드 저장소가 제시하는 기술 설명은 마케팅 문구보다 정확합니다. 자연어 태그를 사용해 하위 단어 수준에서 운율과 감정을 세밀하게 제어하며, 동시에 다중 화자와 여러 차례 오가는 대화 생성을 기본으로 지원한다는 내용입니다.

운영 회사는 익명이 아니지만 이름은 한 번 정리할 필요가 있습니다. 사이트 하단에는 Hanabi AI Inc.가 저작권을 보유한다고 적혀 있습니다. 반면 오픈 소스 라이선스 파일이 요구하는 저작권 표시는 다른 주체를 가리키며, 원문은 39 AI, INC.로 되어 있습니다. 이 글은 두 이름을 모두 그대로 기록하고 합치지 않습니다. 공식 사이트가 둘 사이의 관계를 설명하지 않기 때문입니다.

자금 조달과 규모는 회사 자신의 발표로 확인됩니다. Fish Audio는 창립 1주년에 5,200만 달러 규모의 시드 투자를 유치했습니다. 이번 라운드는 두 기관이 공동으로 주도했는데, 한 곳의 이름은 Coreline Ventures이고 다른 한 곳은 Capital Today입니다. 후속 투자자로는 359 Capital과 Play Time 등이 이름을 올렸고, HF0와 645 Ventures 등도 참여했습니다. 같은 글은 팀이 3명에서 22명으로 늘었고, 연간 반복 매출이 0에서 2,100만 달러가 되었으며, 플랫폼에 800만 명이 넘는 창작자와 개발자가 있고, 커뮤니티 음성 라이브러리에 200만 개가 넘는 음성 모델이 있다고 밝힙니다. 이 사업 지표들은 모두 회사가 스스로 밝힌 값이며 독립적인 감사를 거치지 않았으므로, 검증된 수치가 아니라 회사의 주장으로 읽어야 합니다. 이 글은 핵심 인력도 실명으로 공개합니다. 최고경영자 Rissa Cao는 아마존과 메타에서 여러 해 음성 AI를 다뤘다고 밝히고, 최고과학자 Shijia Liao는 엔비디아의 연구 엔지니어 출신으로 처음에는 자기 방에서 4090 그래픽카드 한 장으로 모델을 학습시켰습니다.

쓰기 전에 확인해 둘 가치가 있는 두 가지

이 제품에는 기능 목록보다 더 엄격한 검토가 필요한 두 가지가 있고, 이 글은 둘 다 아래에서 따로 다룹니다. 첫째는 다른 사람의 목소리를 복제할 때 플랫폼이 실제로 무엇을 요구하는가입니다. 둘째는 여기서 말하는 오픈 소스가 정확히 무슨 뜻인가입니다. 이 라이선스는 그 단어가 흔히 암시하는 관대한 종류가 아니기 때문입니다. 두 답 모두 이 제품을 쓰지 말아야 할 이유는 아니지만, 어떻게 써야 하는지는 바꿔 놓습니다.

핵심 기능

10초 샘플로 하는 음성 복제

복제 쪽 홍보는 구체적이며, 이 분야에서는 드물게 형용사가 아니라 숫자를 내놓습니다. 제품 페이지는 참조 오디오 10초면 충분하고, 종단 간 스트리밍 지연이 300밀리초 미만이며, 복제가 13개 언어에 걸쳐 제로샷 교차 언어 방식이라고 명시합니다. 한 번 복제하고 나면 같은 목소리가 지원되는 다른 언어를 말할 수 있으며, 재학습도 두 번째 녹음도 필요 없다는 뜻입니다.

마지막 항목이 작업 흐름을 가장 크게 바꿉니다. 전통적인 더빙은 이중 언어 연기자를 구하거나 언어마다 다른 사람을 쓰는 수밖에 없었고, 그 결과 같은 콘텐츠가 시장마다 다른 사람처럼 들렸습니다. 제로샷 교차 언어 복제는 한 번 녹음한 목소리의 정체성이 콘텐츠 전체를 관통할 수 있음을 뜻합니다.

연출할 수 있는 텍스트 음성 변환

텍스트 음성 변환 쪽이 바로 감정 태그 체계가 힘을 발휘하는 자리입니다. 고정된 스타일 목록에서 하나를 고르는 방식이 아니라, 원고 자체에 표시를 남기고 태그는 그것이 놓인 지점에서 작동합니다. 하위 단어 수준이라는 표현이 중요한 이유가 여기 있습니다. 문장 안 특정 단어에 강조를 얹는 것과 문장 전체에 하나의 분위기를 지정하는 것은 서로 다른 능력이며, 이것이 곧 원고를 읽는 것처럼 들리는 결과와 연기하는 것처럼 들리는 결과를 가르는 차이입니다.

음성 인식과 더 넓은 제품군

이 플랫폼은 음성 합성 하나짜리 서비스보다 훨씬 넓습니다. 제품 메뉴에는 여덟 가지 독립 도구가 있습니다. 텍스트 음성 변환, 음성 인식, 음성 복제, 음성 변조, Story Studio, 보컬 분리, 오디오 번역, 효과음 생성입니다. 음성 인식 쪽은 전사 결과에 다중 화자와 감정 태그, 자연어 설명이 포함된다고 홍보합니다. 즉 결과물이 평범한 텍스트 덩어리가 아니라 구조화된 전사라는 뜻입니다.

커뮤니티 음성 라이브러리

플랫폼은 사용자가 올린 방대한 음성 라이브러리를 운영하며, 공식 집계로는 200만 개가 넘고 창작 서사와 광고, 오디오북에 적합하다고 소개합니다. 폭이라는 면에서 이는 진짜 차별점입니다. 동시에 이 부분은 뒤에서 다룰 동의 문제와 가장 깊이 얽혀 있기도 합니다. 이 정도 규모의 라이브러리는 회사가 한 건씩 선별해 채운 것이 아니라 사용자가 채운 것이기 때문입니다.

공개된 모델 가중치와 자체 호스팅

S2의 오픈 소스 모델 가중치는 공개되어 있고, 공식 사이트도 자체 호스팅을 호스팅형 API와 나란히 선택지로 홍보합니다. 커뮤니티 지표로 보면 이 저장소는 가볍지 않습니다. 수집 시점에 별 3만 2,400개, 포크 2,800개, 기여자 101명, 릴리스 14개였고, 저장소는 스스로를 최고 수준의 오픈 소스 음성 합성 프로젝트라고 소개합니다. 다만 이 라이선스가 실제로 무엇을 허용하는지는 아래에 따로 절을 두었으며, 그 답은 오픈 소스라는 말이 흔히 암시하는 것보다 훨씬 좁습니다.

활용 사례

오디오북과 장편 내레이션. 회사 자신의 표현으로는 5초는 쉽고 5분이 시험대입니다. 음성 합성은 한 문장 수준에서는 십 년 전부터 쓸 만했지만 길이가 늘어나면 밑천이 드러납니다. 장편 내레이션이야말로 감정 태그와 호흡 제어가 값을 하는 자리입니다. 밋밋한 낭독은 2장에 이르기 훨씬 전에 견디기 어려워지기 때문입니다.

제작 속도에 맞춘 영상 더빙. 원고를 장면에 맞는 내레이션으로 바꾸면서 녹음실을 예약하지 않아도 되는 것이 이런 도구의 가장 큰 쓰임새입니다. 다시 녹음하지 않고도 어조를 바꾸고 감정을 얹을 수 있다는 점이 반복 수정을 값싸게 만듭니다.

게임과 애니메이션의 캐릭터 목소리. 플랫폼이 명확히 겨냥한 영역이고 실제로 잘 맞습니다. 인터랙티브 매체는 서로 다른 목소리를 아주 많이 필요로 하는데, 흔히 실제 성우를 그만큼 쓸 예산이 없고, 대사가 바뀔 때마다 다시 만들어야 하기 때문입니다.

대화형 에이전트와 고객 지원. 이 경우 300밀리초 미만의 스트리밍 지연은 허영 지표가 아닙니다. 응답할 때마다 눈에 띄게 멈칫하는 음성 에이전트는 목소리가 아무리 좋아도 고장 난 것처럼 느껴지므로, 지연은 부가 요소가 아니라 기능 요건입니다.

한 번의 녹음으로 하는 다국어 현지화. 교차 언어 제로샷 복제는 한 번 녹음해 지원 언어 전반에서 같은 목소리 정체성을 유지한다는 뜻입니다. 청중이 여러 지역에 걸친 창작자에게 유용하지만, 언어 개수에 관한 아래 절을 먼저 읽어 두는 편이 좋습니다.

지연이나 데이터 때문에 필요한 자체 호스팅. 가중치가 공개되어 있으므로 데이터 소재지 요건이 엄격하거나 자체 추론 인프라를 갖춘 팀은 오디오를 제삼자에게 보내지 않고 직접 모델을 돌릴 수 있습니다. 다만 당신의 구체적인 용도가 허용되는지는 라이선스가 결정하며, 그것이 아래 절의 핵심입니다.

Fish Audio 사용 방법

1단계 — 가입 전에 홈페이지 시연부터 써 보세요. 홈페이지에는 태그 체계를 보여 주는 원고가 미리 채워진 작동하는 입력창이 있고, 글자 수 상한은 3만이며 감정과 특수 태그 목록이 바로 보입니다. 이 표현 제어가 당신의 용도에서 실제로 유효한지 판단하는 가장 빠른 방법입니다.

2단계 — 무료 계정을 만드세요. 무료 등급은 신용카드가 필요 없고, 월 8,000 크레딧과 최대 7분 생성, 1회 최대 500자, 공개 음성 슬롯 3개를 제공합니다.

3단계 — 기존 라이브러리를 쓸지 직접 복제할지 먼저 정하세요. 많은 작업에서는 기존 라이브러리가 더 빠른 길이며, 동의 문제를 통째로 비켜 갑니다. 복제는 특정한 목소리 정체성이 정말 필요한 경우를 위한 것이고, 그 목소리는 당신 자신의 것이거나 문서화된 허락을 받은 것이어야 합니다.

4단계 — 깨끗한 10초 참조 음원을 녹음하거나 고르세요. 10초는 공식이 제시한 하한입니다. 참조 음원의 품질이 길이보다 중요합니다. 원본이 깨끗할수록 복제가 좋아지며, 제품 페이지도 표현이 아주 풍부한 목소리에는 더 긴 샘플이 도움이 된다고 인정합니다.

5단계 — 원고를 쓸 때 단어만이 아니라 태그도 함께 쓰세요. 신규 사용자가 가장 덜 활용하는 단계입니다. 문장의 의미를 실제로 떠받치는 그 한 단어에 강조를 얹거나, 사람이라면 숨을 쉴 자리에 긴 멈춤을 넣는 것이야말로 기계가 만든 것처럼 들리는 결과와 누군가 연기한 것처럼 들리는 결과를 가르는 경계입니다.

6단계 — 게시하기 전에 상업적 이용 권리를 확인하세요. 이는 선택적인 잡무가 아닙니다. 아래에 정리했듯 무료 등급의 상업적 이용 여부는 사이트 여러 곳에서 서로 다르게 서술되어 있고, 이를 잘못 판단하면 권리 없이 수익화 콘텐츠를 게시하게 됩니다.

7단계 — 물량이 늘면 API로 옮기세요. 개발자 문서와 API 레퍼런스는 문서 하위 도메인에서 제공되며, 유료 요금제는 사용량 기반 API 접근을 제공합니다.

사용 팁과 모범 사례

태그는 적게, 정확하게. 감정 태그는 연출 도구이지 장식이 아닙니다. 모든 절마다 태그를 붙이면 연기가 불안정하게 들립니다. 한 단락의 감정 무게를 실제로 짊어지는 두세 지점만 표시해야 의도된 것처럼 들립니다.

재생성 반복이 아니라 참조 녹음에 공을 들이세요. 복제는 원본 음원의 음향 특성을 그대로 물려받습니다. 조용한 방에서 쓸 만한 마이크로 녹음한 10초가 잡음 섞인 휴대폰 녹음 1분보다 낫고, 애초에 결함이 있는 참조 음원은 아무리 다시 생성해도 되살릴 수 없습니다.

분 단위가 아니라 크레딧 단위로 예산을 잡으세요. 공개된 환산은 생성 1분당 대략 600에서 625 크레딧입니다. 무료 등급의 월 8,000 크레딧에 대입하면 이 요금제가 내세우는 7분과 거의 정확히 맞아떨어집니다. 이 환산을 알고 나면 요금제 비교가 짐작이 아니라 계산이 됩니다.

크레딧은 이월되지 않는다는 점을 기억하세요. 월 할당량은 청구 주기가 시작될 때 초기화되고 남은 분은 다음 달로 넘어가지 않으므로, 성수기에 맞춰 고른 요금제는 한산한 달에는 낭비가 됩니다.

투입 전에 자신의 언어로 먼저 시험하세요. 아래에 정리했듯 이 플랫폼의 언어 지원은 자체 페이지들에서 네 가지로 다르게 서술되어 있고, 오픈 저장소에는 특정 문자에 관한 활성 버그 보고가 있습니다. 크레딧 몇 개로 목표 언어에서 대표 샘플을 만들어 보면 이 질문에 확실한 답이 나옵니다.

민감한 내용은 모두 비공개 음성 슬롯을 쓰세요. 공개 제출물의 라이선스 조건은 비공개 쪽보다 눈에 띄게 넓고, 공개 콘텐츠는 계정 삭제 뒤에도 남아 있을 수 있습니다. 슬롯 선택은 정리 습관이 아니라 권리에 관한 결정입니다.

어떤 사람에게 맞나요?

대량으로 제작하는 콘텐츠 창작자. 정기적으로 내레이션을 하는 영상 창작자, 팟캐스트 진행자, 강의 제작자가 가장 뚜렷한 이득을 봅니다. 절약되는 비용이 생산량에 비례해 커지기 때문입니다.

많은 목소리가 필요한 게임과 애니메이션 팀. 방대한 배역이 필요하거나 대사가 자주 바뀌는 프로젝트가 작고 고정된 대본의 프로젝트보다 이득이 큽니다.

음성 에이전트를 만드는 개발자. 문서가 갖춰진 API, 300밀리초 미만의 스트리밍, 공개된 가중치라는 세 가지가 호스팅형과 자체 호스팅이라는 두 설계 선택지를 모두 덮습니다.

현지화 팀. 교차 언어 복제는 다국가 콘텐츠에서 실제로 존재하고 비용이 큰 문제를 다룹니다.

연구자와 취미 사용자. 공개된 가중치는 연구와 비상업 작업에 진짜로 쓸 수 있으며, 바로 그 경우가 이 라이선스가 허용하려고 쓰인 상황입니다.

주의해야 할 사람. 상업적 자체 호스팅 배포를 계획하는 사람은 아래 라이선스 절부터 읽어야 합니다. 기본 답이 불허이기 때문입니다. 생체 정보 처리에 관해 공급자의 명시적 약속이 필요한 규정 준수 환경에 있다면, 개인정보처리방침이 무엇을 말하는지와 무엇을 말하지 않는지를 함께 살펴야 합니다. 그리고 자기 것이 아닌 목소리를 복제하려는 사람에게는 기능 목록보다 아래의 동의 관련 절이 더 필요합니다.

지원 플랫폼

Fish Audio는 주로 웹 애플리케이션이며, 최신 브라우저라면 설치 없이 쓸 수 있습니다. 개발자 통로는 문서가 갖춰진 REST 인터페이스와 SDK이고, 문서와 API 레퍼런스는 자사 문서 하위 도메인에 있습니다.

모바일 애플리케이션도 존재합니다. 서비스 약관에는 모바일 애플리케이션 조항이 있으며, 앱의 이용 가능 여부가 제삼자 스토어에 달려 있음을 인정하고 애플의 앱스토어와 안드로이드 앱 마켓을 지목하며, 사용자가 해당 스토어의 자체 약관도 함께 지켜야 한다고 요구합니다.

자체 호스팅은 공식이 홍보하는 세 번째 길입니다. 제품 페이지는 선택지를 그대로 늘어놓습니다. 모델을 직접 배포하거나, 300밀리초 미만의 스트리밍 엔드포인트를 호출하거나, 목소리를 당신의 에이전트와 애플리케이션에 실어 보내는 것입니다. 이 셋 중 어디까지가 당신에게 열려 있는지는 라이선스가 정합니다.

기업용 배포 선택지는 따로 제시되며 온프레미스 배포, 데이터 무보존, SOC2 준수를 포함하고, 가격은 물량에 따른 맞춤 견적을 연 단위로 청구하는 방식입니다.

접근 측면의 기록을 하나 덧붙이면, 사이트의 robots.txt는 구글과 애플, 빙의 크롤러에는 전면 허용이면서 일반 크롤러에는 인증 경로와 텍스트 음성 변환 경로 접근을 금지합니다.

가격과 요금제

가격은 요금제 페이지에서 직접 확인했습니다. 유의할 점은 수집 시점에 두 가지 할인이 겹쳐 있었다는 것입니다. 연 결제 3개월 무료와 창립 기념 50% 할인입니다. 따라서 아래 월 환산 금액은 할인가이며, 월 결제 정가를 함께 적어 둡니다.

무료 등급. 월 0달러, 신용카드 불필요. 월 8,000 크레딧, 최대 7분 생성, 1회 최대 500자, 공개 음성 슬롯 3개, 표준 생성 속도, 향상된 음성 복제를 포함합니다.

Plus. 월 환산 5.5달러, 연 66달러 청구, 월 결제 정가는 15달러. 월 25만 크레딧, 최대 200분 생성, 1회 최대 15,000자, 무제한 공개 슬롯과 비공개 슬롯 10개, 우선 생성과 Voice Design 기능 이용 권한, 그리고 전문 음성 슬롯 1개를 포함합니다.

Pro. 월 환산 37.5달러, 연 450달러 청구, 정가 100달러. 월 200만 크레딧, 최대 1,620분, 팀 좌석 3개, 1회 최대 30,000자, 무제한 음성 슬롯, 전문 음성 슬롯 5개, 7일 환불 보장을 포함합니다.

Max. 월 환산 749달러, 연 8,988달러 청구, 정가 999달러. 월 2,500만 크레딧, 최대 6,250분, 팀 좌석 10개, 전문 음성 슬롯 15개를 포함합니다.

엔터프라이즈. 맞춤 견적을 연 단위로 청구하며, 규정 준수 요구가 있는 조직을 대상으로 조직 단위 통제가 붙은 사용량 기반 과금, 데이터 무보존, 온프레미스 배포, SOC2 준수를 제시합니다.

크레딧은 어떻게 계산되나요

공개된 환산은 생성 1분당 대략 600에서 625 크레딧입니다. 월 할당량은 청구 주기가 시작될 때 초기화되며 남은 분은 이월되지 않습니다.

상업적 이용 권리의 모순

이 점은 분명히 짚어야 합니다. 생성물을 게시할 수 있는지를 직접 좌우하는데, 사이트가 같은 페이지 안에서 스스로 모순되기 때문입니다.

요금제 페이지의 무료 등급 기능 목록에는 상업적 이용이 항목으로 들어 있습니다. 그런데 같은 요금제 페이지 아래쪽 자주 묻는 질문은 반대로 말합니다. 유료 구독자는 자신이 소유한 검증된 음성을 상업적 목적으로 쓸 수 있고, 무료 등급 사용자는 생성 콘텐츠를 개인적이고 비상업적인 프로젝트에만 쓸 수 있다는 내용입니다. 홈페이지의 자주 묻는 질문도 이 제한적 해석과 일치하며 한층 더 분명합니다. 무료 등급은 개인 용도 전용이고, 수익화하거나 상업적으로 쓰려면 유료 요금제로 올려야 완전한 상업적 권리를 얻는다는 것입니다.

즉 두 곳의 공식 서술은 무료가 개인 용도 전용이라 말하고, 한 곳의 공식 기능 목록은 반대로 말합니다. 이 글은 두 해석을 모두 그대로 전하고 조정하지 않습니다. 조정하는 순간 추측이 되기 때문입니다. 안전한 길은 제한적 해석을 기준으로 삼고, 무료 등급 결과물을 수익화하기 전에 공급자에게 확인하는 것입니다. 잘못 판단했을 때의 손해는 전적으로 게시자가 집니다.

대안

이 분야에서 가장 자주 거론되는 비교 대상은 ElevenLabs이며, Fish Audio는 그 비교에 직접 참여합니다. 사이트에 전용 비교 영역이 있고, 자체 사이트맵에도 경쟁사 대안 페이지가 들어 있습니다. 이 기존 강자의 맞은편에 자신을 세우는 것은 의도된 선택이며, 잠재 사용자도 한 공급자가 경쟁사에 관해 펴낸 비교 페이지는 독립적인 벤치마크가 아니라 마케팅 자료라는 점을 염두에 두는 편이 좋습니다.

이 영역에서 회사가 내놓은 주장은 자체 보고이며 그렇게 읽어야 합니다. 자금 조달 발표문은 S2.1 Pro가 블라인드 청취 테스트에서 주요 경쟁 모델보다 청취자 66%의 선호를 받았다고 밝힙니다. 다만 그 발표문에는 방법론이나 표본 크기, 청취자 구성이 함께 제시되어 있지 않으므로 이 출처만으로는 독립적으로 검증할 수 없습니다.

그러나 진짜 대안의 축은 다른 호스팅 공급자가 아니라, 공개된 가중치가 열어 주는 직접 구축과 구매 사이의 선택입니다. 연구와 비상업 작업이라면 모델을 직접 돌리는 것은 대다수 경쟁 제품이 제공하지 않는 진짜 선택지입니다. 상업 작업이라면 이 선택지에는 별도 라이선스가 필요하고, 그 순간 비교는 다시 평범한 호스팅 서비스 평가로 되돌아갑니다.

제한 사항과 유의점

음성 복제의 동의: 플랫폼이 실제로 요구하는 것

이것이 가장 중요한 질문이며, 정직한 답은 이렇습니다. 책임은 거의 전적으로 사용자에게 있고, 플랫폼은 사전 확인을 전혀 하지 않습니다.

가장 분명한 서술은 음성 복제 페이지의 자주 묻는 질문에 있으며 그대로 옮길 값어치가 있습니다. 복제하려는 어떤 목소리에 대해서든 필요한 권리와 동의, 고지를 확보했는지 확인할 책임은 사용자에게 있으며, 자신이 속한 지역의 성명과 초상, AI 생성 콘텐츠에 관한 법을 포함해 적용 법률을 지켜야 한다는 내용입니다. 같은 답변은 집행 방식도 밝힙니다. 개별 사용 사례를 사전 승인하지 않으며, 약관이나 법률을 위반하는 콘텐츠나 계정을 사후에 삭제할 수 있다는 것입니다. 즉 장치는 복제 이전의 관문이 아니라 사후 삭제입니다.

눈에 띄는 것은 구속력 있는 법률 문서에 동의 요건이 오히려 없다는 점입니다. 서비스 약관의 허용과 제한을 다루는 절은 (a)부터 (q)까지 열일곱 가지 금지 행위를 열거하는데, 그중 음성 복제 동의를 구체적으로 다루는 조항은 하나도 없습니다. 가장 가까운 것은 타인의 지식재산권이나 그 밖의 권리를 침해하는 어떤 것도 제공하지 못하게 하는 포괄 조항 (a)입니다. 사용자 제출물 보증 조항도 마찬가지로 포괄적이어서, 제삼자의 저작권이나 상표, 프라이버시 권리 등을 침해하는 제출물을 금지할 뿐입니다. 어느 쪽도 복제 대상의 문서화된 동의를 보유하라는 구체적 의무를 부과하지 않습니다.

동의 문구와 같은 페이지의 마케팅 문구 사이에도 긴장이 있습니다. 음성 복제 페이지의 표제 문구는 그 동의 문구가 경고하는 바로 그 용법을 권합니다. 현직 대통령이 당신의 데이팅 앱을 내레이션하게 하고, 기술 억만장자의 어투로 당신의 최악의 아이디어를 발표하고, 가짜 패널이 나오는 팟캐스트를 만들라는 식입니다. 같은 페이지의 자주 묻는 질문은 공인의 클립이나 팟캐스트 편집본, 통화 품질 녹음이 대개 첫 시도에 잘 작동한다고 덧붙여 그 기대를 한층 강화합니다. 알아볼 수 있는 공인의 복제를 가장 눈에 띄는 자리에 내세워 놓고 그 옆에 상대의 동의를 받으라는 면책 문구를 적어 두는 것은 실제로 존재하는 불일치이며, 독자는 양쪽을 모두 저울에 올려야 합니다.

약관에는 관련 의무가 하나 있습니다. 콘텐츠를 오도하는 방식으로 배포해서는 안 되며, 여기에는 콘텐츠가 전적으로 사람이 만든 것이라고 표현하는 행위가 포함됩니다. 플랫폼은 AI 기술로 제작되었음을 자발적으로 알리도록 권장하지만, 이를 의무가 아니라 권장으로 씁니다. 하단에는 남용 신고 창구가 있습니다.

실제 결론은 분명합니다. 자기 목소리를 복제한다면 위 내용은 아무런 제약이 되지 않습니다. 다른 사람의 목소리를 복제한다면 플랫폼은 막지도 확인하지도 않지만, 동시에 자신의 책임을 면하고 법적 위험을 온전히 당신 쪽에 둡니다. 그리고 어떤 법역에서는 그 위험이 상당합니다.

여기서 오픈 소스가 뜻하는 것, 그리고 뜻하지 않는 것

공식 사이트는 개방성을 거듭 내세웁니다. 오픈 소스 S2 모델을 표제급 특징으로 삼고, 자체 호스팅을 지원되는 경로로 제시하며, 코드 저장소는 최고 수준의 오픈 소스 음성 합성 프로젝트를 자처하고 그 뒤에 별 3만 2,400개가 있습니다. 가중치가 공개된 것은 사실이고 그 점은 진짜입니다. 그러나 라이선스는 관대하지 않으며, 이 차이는 상업적으로 결정적입니다.

저장소는 분명히 밝힙니다. 이 코드베이스와 그에 딸린 모델 가중치는 FISH AUDIO RESEARCH LICENSE에 따라 배포되며, 위반 행위에는 조치를 취하겠다는 경고가 붙습니다. 2026년 3월 7일에 마지막으로 갱신된 이 라이선스는 서문에서 스스로의 의도를 밝힙니다. 본 계약은 연구와 비상업적 용도에 한해 자료를 무상으로 쓸 수 있게 하려는 것이며, 어떤 상업적 사용이든 Fish Audio의 별도 라이선스가 필요하다는 내용입니다.

제3절은 모호함을 완전히 없앱니다. 자료나 파생 저작물을 상업적 목적으로 사용하려면 Fish Audio와 별도의 서면 라이선스 계약이 필요하며, 본 계약은 어떤 상업적 권리도 부여하지 않는다는 것입니다. 상업 라이선스는 라이선스에 적힌 비즈니스 이메일로 문의합니다.

상업적 목적의 정의는 대부분의 기업 활동을 포괄할 만큼 넓습니다. 호스팅 서비스나 응용 프로그램 인터페이스를 통한 것을 포함해 당신의 제품이나 서비스를 만들고 수정하고 배포하는 것, 당신의 기업이나 조직의 내부 운영, 그리고 직접적이든 간접적이든 요금을 받거나 수익을 내는 제품 또는 서비스와 관련된 모든 사용이 여기 들어갑니다. 회사 내부에서 쓰는 것만으로도 이미 해당됩니다. 모델을 되팔 필요조차 없습니다.

관대한 라이선스와 다른 지점이 두 가지 더 있습니다. 연구 허락은 비독점적이고 전 세계적이며 양도 불가, 재허락 불가, 철회 가능하고 무상이라고 서술됩니다. 철회 가능이라는 말이 핵심이며, 통용되는 관대한 라이선스 조건에는 이에 해당하는 것이 없습니다. 그리고 배포에는 저작자 표시 의무가 따릅니다. 저작권이 39 AI, INC.에 있음을 적은 고지 파일과, 관련 웹사이트나 제품 문서의 눈에 띄는 자리에 Built with Fish Audio라는 문구를 표시해야 합니다. 이 라이선스는 또한 자료나 그 출력물을 사용해 어떤 기반 생성형 AI 모델을 만들거나 개선하는 것도 금지합니다.

기록해 둘 공백이 하나 있습니다. 이 라이선스는 허용 사용 정책을 인용으로 편입하고 그 준수를 라이선스 조건으로 삼습니다. 그런데 그 문서를 찾을 수 없었습니다. 여러 후보 경로가 모두 404를 반환했고, 사이트 자체의 정적 사이트맵에도 해당 항목이 없습니다. 그 사이트맵에는 홈, 디스커버리, AI 음성 생성기, 고객, 엔터프라이즈, 경쟁사 대안, 약관, 개인정보, 일본 법률 정보 페이지만 들어 있습니다. 구속력 있는 조건이 사용자가 찾을 수 없는 문서를 가리키는 것은, 이 라이선스에 기대기 전에 공급자에게 확인해 볼 만한 문서상의 문제입니다.

요약하면 이렇습니다. 공개된 가중치는 맞습니다. 관대한 의미의 오픈 소스는 아닙니다. 연구와 취미 사용은 무료이며 실제로 허용됩니다. 기업 내부 사용을 포함한 어떤 상업적 용도든, 마케팅 페이지가 무엇을 암시하든 관계없이 별도의 유료 계약이 필요합니다.

개인정보처리방침이 다루지 않는 것

이 개인정보처리방침에 적힌 시행일은 2024년 8월 28일입니다. 본문 전문을 검사한 결과 voice와 biometric, train이라는 세 단어의 출현 횟수는 모두 0이었습니다. 사람의 목소리를 수집하고 재현하는 것이 핵심 기능인 제품에서 음성 전용 조항이나 생체 정보 조항이 아예 없다는 것은 실질적인 공백입니다. 이는 또한 사용자 콘텐츠가 모델 학습이나 개선에 쓰이는지에 관해 이 방침이 아무런 언급도 하지 않는다는 뜻이기도 합니다. 확보한 근거에 비추어 정직한 서술은, 이 방침이 해당 사안에 침묵한다는 것이지 어떤 보호가 있다거나 없다고 말하는 것이 아닙니다.

업로드된 오디오는 포괄적인 사용자 콘텐츠 범주에 들어가며, 방침은 이를 사용자가 서비스에 제공하는 입력이나 파일 업로드, 피드백에 포함된 개인정보로 정의합니다. 그 범주와 함께 나열된 제삼자에는 서비스 제공자, 광고 파트너, 분석 파트너, 사업 파트너가 있습니다.

업로드에 대해 당신이 부여하는 라이선스

약관은 당신이 보유하는 권리보다 당신이 내주는 권리를 훨씬 구체적으로 적어 두었습니다. 사용자 제출물에 대해 플랫폼에 부여되는 라이선스는 무상이고 영구적이며 재허락 가능하고 철회 불가하며 전 세계적입니다.

삭제도 그에 맞춰 한계가 있습니다. 계정을 삭제하면 플랫폼은 당신의 제출물을 다른 사용자에게 더 이상 보여 주지 않지만, 공개 제출물은 명시적으로 예외이며 계속 완전히 이용 가능할 수 있고, 약관은 자사 기록에서 그 콘텐츠를 완전히 삭제하는 것이 불가능할 수 있음을 인정합니다.

공개 제출물이 지는 조건은 모든 범주 가운데 가장 넓습니다. 마케팅과 홍보 목적으로 공개 제출물을 사용하고 표시하고 실연하고 배포할 권리, 그리고 다른 모든 사용자에게 그에 접근하고 권리를 행사할 수 있는 라이선스가 포함됩니다. 비공개 슬롯과 공개 슬롯 사이의 선택이 권리에 관한 결정인 구체적 이유가 여기 있습니다. 200만 개 규모의 커뮤니티 음성 라이브러리를 이해하는 배경으로도 유용합니다. 그 라이브러리가 존재하는 것은 공개 업로드가 이런 조건을 지고 있기 때문입니다.

언어 지원은 네 가지로 다르게 서술됩니다

공식 페이지들이 서로 어긋나는 네 개의 숫자를 제시하며, 이 글은 평균을 내지 않고 넷을 모두 적습니다. 음성 복제 페이지는 13개 언어에 걸친 제로샷 교차 언어라고 말합니다. 홈페이지의 인터페이스 영역은 30개 이상 언어를 말합니다. 텍스트 음성 변환 페이지의 자주 묻는 질문은 영어와 일본어, 한국어, 중국어, 프랑스어, 독일어, 아랍어, 스페인어 여덟 가지만 열거하고, 별도로 여덟 개 언어의 원어민 억양 자동 지원을 내세웁니다. 자금 조달 발표문은 원어민 같은 호흡과 함께 83개 이상 언어를 주장합니다.

이 서술들은 서로 다른 것을 가리킬 수도 있습니다. 복제와 합성의 차이일 수도, 완전 지원과 최선 지원의 차이일 수도 있습니다. 그러나 사이트가 그 구분을 설명하지 않으므로, 어느 한 숫자를 믿기보다 자신의 언어를 직접 시험해 확인하시기 바랍니다.

커뮤니티 보고도 이 신중함을 뒷받침합니다. 오픈 저장소에는 펀자브어 구르무키 문자 입력이 중자음 표시와 비음화 표시를 잘못 처리한다는 활성 이슈가 있고, 부호를 고려한 로마자 전사나 자소 대 음소 변환으로 펀자브어 발음을 개선하자는 관련 요청도 있습니다. 수집 시점에 저장소는 열린 이슈 7개와 닫힌 이슈 684개를 보여 주었습니다. 유지 보수 비율은 건강하지만, 언어별 품질이 고르지 않다는 증거이기도 합니다.

그 밖의 고려 사항

게시 전 콘텐츠 검사가 없습니다. 저장소 자체의 법적 고지는 이렇게 적습니다. 코드베이스의 어떤 불법적 사용에도 책임을 지지 않으며, 디지털 밀레니엄 저작권법 등 해당 지역의 관련 법률을 직접 참조하라는 내용입니다. 사전 승인을 하지 않는다는 입장과 합쳐 보면 책임은 일관되게 하류로 밀려 있습니다.

역공학과 경쟁 모델은 금지됩니다. 약관은 소스 코드나 모델의 기저 구성 요소, 알고리즘을 얻으려는 시도를 금지하고, 서비스 출력물로 경쟁 모델을 개발하는 것도 별도로 금지합니다.

연령 요건. 사용자는 만 13세 이상이어야 하고, 18세 미만은 부모의 허락이 필요하며, 플랫폼은 16세 미만 아동의 식별 가능한 개인정보를 알면서 수집하지 않는다고 밝힙니다.

디렉터리 메타데이터는 빨리 낡습니다. 이 수록 항목의 저장된 분류는 패션이었고 태그에도 패션과 템플릿이 들어 있었습니다. 음성 합성 제품에는 명백히 잘못된 것입니다. 저장된 설명은 1,000개가 넘는 음성을 언급하지만 사이트는 이제 200만 개 이상을 말합니다. 빠르게 바뀌는 제품은 자신의 디렉터리 항목을 앞질러 갑니다. 현재 수치는 사이트에서 확인하십시오.

자주 묻는 질문(FAQ)

Q1. Fish Audio는 무료로 쓸 수 있나요?

신용카드가 필요 없는 진짜 무료 등급이 있으며 월 8,000 크레딧, 최대 7분 생성, 1회 500자 상한, 공개 음성 슬롯 3개를 제공합니다. 다만 그 결과물을 상업적으로 쓸 수 있는지는 사이트만 봐서는 정말 불분명합니다. 요금제 페이지의 무료 등급 기능 목록에는 상업적 이용이 들어 있는데, 같은 페이지의 자주 묻는 질문과 홈페이지의 자주 묻는 질문은 모두 무료 등급 결과물이 개인적이고 비상업적인 용도에 한정된다고 적습니다. 제한적 해석을 기준으로 삼고, 무료 등급 결과물을 수익화하기 전에 공급자에게 확인하십시오.

Q2. 다른 사람의 목소리를 복제하려면 동의가 필요한가요?

플랫폼은 그 책임을 전적으로 사용자에게 두며 사전 확인을 하지 않습니다. 복제 페이지의 자주 묻는 질문은 복제하려는 어떤 목소리에 대해서든 필요한 권리와 동의, 고지를 확보했는지 확인할 책임이 사용자에게 있으며, 자신이 속한 지역의 성명과 초상, AI 생성 콘텐츠 관련 법을 지켜야 한다고 밝힙니다. 또한 개별 사용 사례를 사전 승인하지 않으며 사후에 콘텐츠나 계정을 삭제할 수 있다고 말합니다. 유의할 점은 구속력 있는 서비스 약관에 음성 복제 동의를 구체적으로 요구하는 조항이 없다는 것입니다. 타인의 권리를 침해하지 말라는 포괄적 금지만 있을 뿐이며, 같은 제품 페이지의 마케팅은 오히려 공인 복제를 적극적으로 권합니다. 법적으로 위험은 당신 몫입니다.

Q3. 이 모델은 정말 오픈 소스인가요?

가중치는 실제로 공개되어 있지만 라이선스는 관대하지 않습니다. 코드베이스와 모델 가중치 모두 Fish Audio 연구 라이선스로 배포되며, 이 라이선스는 서문에서 연구와 비상업 용도를 무상으로 허용하려는 것이고 어떤 상업적 사용이든 별도 라이선스가 필요하다고 밝힙니다. 제3절은 어떤 상업적 권리도 부여하지 않습니다. 연구와 학습, 취미 사용은 무료이고, 그 밖의 용도는 별도의 유료 계약이 필요합니다.

Q4. 제 회사에서 자체 호스팅해도 되나요?

공개 라이선스로는 안 됩니다. 이 라이선스의 상업적 목적 정의에는 호스팅 서비스나 인터페이스를 통해 제품이나 서비스를 만들고 수정하고 배포하는 것, 조직의 내부 운영, 직접적이든 간접적이든 수익을 내는 제품이나 서비스와 관련된 모든 사용이 명시적으로 들어갑니다. 기업 내부 사용만으로도 해당됩니다. 별도의 서면 계약이 필요하며, 라이선스에 적힌 비즈니스 연락처로 문의할 수 있습니다. 연구 허락이 철회 가능하다는 점도 통용되는 관대한 라이선스와 다릅니다.

Q5. 목소리 하나를 복제하려면 오디오가 얼마나 필요하고 품질은 어떤가요?

공식이 제시하는 최소치는 깨끗한 음성 10초이며, 제품 페이지는 표현이 아주 풍부한 목소리에는 더 긴 샘플이 도움이 된다고 밝힙니다. 참조 음원의 품질이 길이보다 중요합니다. 깨끗한 짧은 샘플이 길고 잡음 섞인 녹음보다 낫습니다. 플랫폼은 복제가 13개 언어에 걸친 제로샷 교차 언어라고도 밝히므로, 한 번의 녹음이 재학습 없이 지원되는 다른 언어로 이어집니다.

Q6. 실제로 몇 개 언어를 지원하나요?

사이트가 네 가지 다른 답을 내놓으며, 이 글은 대신 하나를 고르지 않습니다. 복제 페이지는 교차 언어 복제 13개, 홈페이지는 30개 이상, 텍스트 음성 변환 페이지의 자주 묻는 질문은 여덟 개 언어를 열거하며 여덟 개 언어의 원어민 억양 자동 지원을 내세우고, 자금 조달 발표문은 83개 이상이라 말합니다. 서로 다른 능력을 가리킬 가능성이 높지만 사이트는 어느 것이 어느 것인지 설명하지 않습니다. 투입 전에 목표 언어로 시험 샘플을 만들어 보십시오. 오픈 저장소에는 펀자브어 구르무키 문자의 중자음 표시와 비음화 표시 처리를 비롯해 특정 문자에 관한 활성 버그 보고가 있습니다.

Q7. 무료 등급 외에는 비용이 얼마나 드나요?

수집 시점에 네 개의 유료 등급이 있었고 할인이 겹쳐 있었습니다. Plus는 월 환산 5.5달러로 연 66달러 청구, 정가는 15달러이며 월 25만 크레딧을 줍니다. Pro는 월 환산 37.5달러로 연 450달러 청구, 정가 100달러이며 200만 크레딧과 팀 좌석 3개를 포함합니다. Max는 월 환산 749달러로 연 8,988달러 청구, 정가 999달러이며 2,500만 크레딧과 팀 좌석 10개를 포함합니다. 엔터프라이즈는 맞춤 견적을 연 단위로 청구합니다. 대략 600에서 625 크레딧이 생성 1분에 해당하며, 남은 크레딧은 이월되지 않습니다.

Q8. 제가 올린 목소리가 모델 학습에 쓰이나요?

개인정보처리방침은 말하지 않습니다. 본문 전문을 검사했지만 train과 voice, biometric 어느 단어도 나타나지 않았고, 이 방침의 시행일은 2024년 8월 28일입니다. 이는 이 사안에 어떤 공개된 약속도 없다는 뜻이며, 문서에 없는 보호를 있다고 주장하는 것은 옳지 않습니다. 업로드된 오디오는 포괄적인 사용자 콘텐츠 범주에 들어가고, 그 범주에 함께 나열된 공유 대상에는 서비스 제공자와 광고, 분석, 사업 파트너가 있습니다. 이 점이 규정 준수에 중요하다면 공급자에게 직접 문의하십시오. 엔터프라이즈 등급이 데이터 무보존을 별도 기능으로 내세운다는 점도 함께 유의하십시오.

Q9. 계정을 삭제하면 제 목소리는 어떻게 되나요?

삭제는 완전하지 않고 부분적입니다. 약관은 계정을 삭제하면 플랫폼이 당신의 제출물을 다른 사용자에게 더 이상 보여 주지 않는다고 하면서도 공개 제출물은 명시적으로 예외로 두어 계속 완전히 이용 가능할 수 있다고 하며, 자사 기록에서 완전히 삭제하는 것이 불가능할 수 있음을 인정합니다. 부여되는 라이선스가 영구적이고 재허락 가능하며 철회 불가인 데다, 공개 제출물은 마케팅 권리와 다른 모든 사용자의 접근 권한까지 추가로 부여하므로, 공개가 아닌 비공개 음성 슬롯을 고르는 것은 정리 습관이 아니라 실질적인 결정입니다.

Q10. Fish Audio는 누가 운영하며 회사는 어느 단계인가요?

사이트 하단은 Hanabi AI Inc.를 적고 있고, 오픈 소스 라이선스가 요구하는 저작자 표시는 39 AI, INC.를 가리킵니다. 이 글은 두 이름을 모두 기록하며, 사이트는 둘의 관계를 설명하지 않습니다. 회사는 창립 1주년에 5,200만 달러 시드 투자를 발표했고, 이번 라운드의 주도 투자자 한 곳은 Coreline Ventures이며 다른 주도 기관은 Capital Today입니다. 자체 발표문은 팀 22명, 연간 반복 매출 2,100만 달러, 플랫폼 사용자 800만 명 이상, 커뮤니티 음성 모델 200만 개 이상을 밝히고 최고경영자 Rissa Cao와 최고과학자 Shijia Liao를 실명으로 제시합니다. 이 사업 수치들은 자체 보고이며 독립적인 감사를 거치지 않았습니다.

비슷한 도구를 아시나요?
다른 훌륭한 AI 도구를 알고 계시다면 저희에게 제출해 주세요