무슨 변화인가
Vercel AI Gateway에서 Fish Audio의 음성 모델을 사용할 수 있게 됐다. 핵심은 텍스트를 음성으로 바꾸는 text-to-speech와 녹음 파일을 텍스트로 바꾸는 speech-to-text를 Vercel의 AI Gateway 경로에서 호출할 수 있다는 점이다. Vercel 공지 기준으로 Fish Audio 모델은 출시 기념으로 2026년 9월 18일까지 무료 제공된다.
개발자에게 중요한 지점은 “무료로 써볼 수 있다”는 문구 자체보다 무료 기간이 끝난 뒤 과금이 어떻게 이어지는지다. 표준 모델 이름, 예를 들어 fish-audio/s2.1-pro를 그대로 쓰면 무료 기간 종료 후 자동으로 과금이 시작될 수 있다. 무료 기간 이후 호출이 중단되길 원한다면 모델명에 -free 접미사를 붙이는 방식을 확인해야 한다. 예를 들면 fish-audio/s2.1-pro-free처럼 쓰는 식이다.
무료 기간에 먼저 볼 부분
이번 공지는 개인 프로젝트, 연구용 프로토타입, 학습용 앱, 내부 도구 실험에 특히 유용하다. 음성 합성이나 전사 기능은 품질 확인에 실제 샘플이 필요하고, 몇 번의 호출만으로는 비용 예측이 어렵다. 30일 무료 기간은 모델 품질, 지연 시간, 입력 데이터 형식, SDK 연동 방식을 확인하기에 적당한 구간이다.
| 기능 | 일반 요금 | 2026년 9월 18일까지 |
|---|---|---|
| Text-to-speech | 문자 100만 자당 15.00달러 | 무료 |
| Speech-to-text | 오디오 1시간당 0.36달러 | 무료 |
이 가격은 원문 공지에 제시된 기준이다. 실제 적용 전에는 Vercel 계정의 플랜, AI Gateway 사용 조건, 팀 청구 설정, 지역별 제공 여부, 무료 기간 종료 후 정책을 다시 확인해야 한다. 특히 팀 프로젝트에서는 개인 계정에서 무료로 보이는 조건이 팀 청구 환경에서도 동일하게 적용되는지 따로 확인하는 편이 안전하다.
사용 가능한 Fish Audio 모델
공지에 따르면 AI Gateway에서 사용할 수 있는 Fish Audio 모델은 네 가지다. 각 모델은 같은 “음성” 범주에 있지만 쓰임새가 다르다. 단순히 최신 모델을 고르기보다 입력 형태, 필요한 응답, 운영 환경을 기준으로 나눠 봐야 한다.
- fish-audio/s2.1-pro: 텍스트를 음성으로 바꾸는 모델이다. 낮은 지연 시간의 스트리밍에 맞춰졌고, 참조 녹음을 바탕으로 목소리를 복제하는 기능이 언급돼 있다.
- fish-audio/transcribe-1: 녹음 파일을 텍스트로 전사하는 모델이다. 텍스트뿐 아니라 오디오 길이와 시간 정보가 붙은 세그먼트를 반환하며, 단어 단위 타임스탬프까지 다룰 수 있다.
- fish-audio/s2-pro: 텍스트를 음성으로 바꾸는 모델이다. 약 80개 언어를 지원한다고 소개되어 있으며, 텍스트 안에 자연어 지시나 인라인 태그를 넣어 특정 단어나 문구의 전달 방식을 조정할 수 있다.
- fish-audio/s1: 텍스트를 음성으로 읽는 모델이다. 감정, 톤, 효과음을 나타내는 마커를 텍스트에 포함할 수 있다.
어떤 프로젝트에서 먼저 시험할 만한가
개인 사용자는 블로그 글 읽어주기, 학습 노트 음성화, 외국어 문장 듣기, 짧은 데모 영상용 내레이션 생성 같은 작업부터 확인할 수 있다. 이 경우에는 음질보다 반복 사용 시 비용과 사용 편의성이 더 중요할 수 있다. 무료 기간 동안 여러 샘플을 만들어 보고, 수정에 걸리는 시간과 원하는 톤을 얻기까지 필요한 재시도 횟수를 기록해두면 이후 유료 사용 여부를 판단하기 쉽다.
학생과 연구자는 인터뷰 녹음, 강의 녹음, 실험 참여자 발화 자료를 전사하는 흐름을 검토할 수 있다. 다만 연구 자료에는 개인정보, 민감한 발화, 동의 범위 문제가 들어갈 수 있다. 모델 품질을 보기 전에 데이터 업로드가 연구윤리, 기관 규정, 참여자 동의 조건과 맞는지 확인해야 한다. 공개 가능한 샘플이나 비식별화된 짧은 오디오로 먼저 시험하는 방식이 적절하다.
개발자는 기존 애플리케이션에 음성 기능을 붙이는 비용을 낮춰볼 수 있다. 예를 들어 고객지원 앱의 통화 요약 전 단계, 회의록 도구의 전사 단계, 교육 앱의 문장 읽기 기능, 접근성을 위한 읽어주기 기능 등이 후보가 된다. 다만 전체 기능을 한 번에 이전하기보다 한 화면, 한 API 경로, 한 종류의 파일 형식으로 범위를 좁혀 검증해야 한다.
AI SDK 7 기준으로 확인할 것
Vercel 공지는 speech와 transcription 기능이 현재 AI SDK 7 릴리스에 포함된다고 안내한다. 패키지는 ai@latest와 @ai-sdk/gateway@latest를 설치하는 방식으로 제시되어 있다. 이미 AI SDK를 쓰는 프로젝트라면 버전 충돌, 실험적 API 사용 여부, 빌드 환경에서의 Node.js 파일 처리 방식을 먼저 확인해야 한다.
텍스트를 음성으로 바꾸는 경우에는 experimental_generateSpeech를 사용하고, 결과의 오디오 데이터를 파일로 쓸 수 있다. 전사의 경우에는 experimental_transcribe를 사용하며 오디오는 버퍼, base64 문자열, URL 형태로 전달할 수 있다고 안내되어 있다. “experimental” 접두사가 붙은 API이므로 장기 운영 기능에 바로 고정하기보다 변경 가능성을 염두에 두는 편이 낫다.
모델명 선택이 비용 제어와 연결된다
이번 무료 제공에서 가장 실무적인 부분은 모델명이다. 표준 모델명을 쓰면 무료 기간 동안은 비용 없이 사용할 수 있지만, 무료 기간이 끝난 뒤 자동으로 청구가 시작될 수 있다. 반대로 -free 접미사를 붙인 모델명은 무료 기간이 끝나면 제공이 중단되는 방식으로 안내되어 있다.
따라서 실험 코드, 튜토리얼, 학생 프로젝트, 해커톤 데모처럼 무료 기간 안에서만 쓰려는 목적이라면 -free 접미사를 붙이는 편이 비용 예측에 유리하다. 반대로 출시 예정 서비스에서 무료 기간 이후에도 같은 모델을 계속 쓰려면 표준 모델명을 쓰되, 팀의 청구 알림과 사용량 제한을 먼저 설정해야 한다.
품질 평가는 샘플을 나눠서 해야 한다
음성 합성 모델은 짧은 영어 문장 하나만으로 판단하기 어렵다. 실제 서비스에 들어갈 문장을 기준으로 길이, 언어, 숫자 읽기, 고유명사, 전문 용어, 감정 표현을 나눠 시험해야 한다. 한국어를 주로 쓴다면 한국어 문장, 영어가 섞인 문장, 숫자와 약어가 많은 문장을 별도로 넣어 들어봐야 한다.
전사 모델은 더 조심해서 봐야 한다. 깨끗한 녹음 파일에서는 잘 작동해도 회의실 잡음, 원격 통화 압축음, 여러 명이 겹쳐 말하는 상황, 전문 용어가 많은 대화에서는 결과가 달라질 수 있다. Fish Audio의 전사 모델은 단어 단위 타임스탬프가 언급되어 있으므로, 단순 텍스트 정확도뿐 아니라 세그먼트 시간 정보가 자막, 검색, 편집 도구에서 쓸 만큼 안정적인지도 함께 봐야 한다.
기존 도구와 비교할 기준
이미 다른 음성 합성 또는 전사 API를 쓰고 있다면 바로 바꿀 이유는 없다. 비교 기준은 명확해야 한다. 같은 입력으로 결과 품질이 좋아지는지, 지연 시간이 줄어드는지, 호출 코드가 단순해지는지, Vercel 배포 환경과 권한 관리가 쉬워지는지, 무료 기간 이후 비용이 예측 가능한지를 봐야 한다.
- 품질: 실제 서비스 문장과 실제 녹음 파일에서 결과를 비교한다.
- 지연 시간: 스트리밍 음성 합성이 필요한 화면에서는 첫 소리가 나오기까지의 시간을 본다.
- 비용: 문자 수, 오디오 길이, 재시도 횟수를 합쳐 월 단위로 계산한다.
- 개발 편의: AI Gateway와 AI SDK를 이미 쓰고 있다면 통합 비용이 낮아질 수 있다.
- 중단 가능성: 무료 모델명 사용 시 무료 기간 종료 후 호출이 멈추는 조건을 확인한다.
업무 자료를 넣기 전 확인할 기준
음성 데이터에는 민감한 정보가 섞이기 쉽다. 회의 녹음, 인터뷰, 상담, 강의, 고객 통화, 연구 참여자 발화는 단순한 텍스트보다 개인정보와 권리 문제가 커질 수 있다. Vercel AI Gateway와 Fish Audio 제공 조건에서 데이터 보존, 학습 사용 여부, 접근 권한, 로그 관리, 팀 권한 분리 조건을 확인한 뒤 적용해야 한다.
특히 참조 녹음을 이용한 목소리 복제 기능은 편리하지만 오용 가능성도 있다. 본인 또는 권한을 가진 음성만 사용해야 하며, 공개 배포물에 사용할 때는 동의 범위와 표시 기준을 분명히 해야 한다. 원문 공지는 기능을 소개하지만, 모든 사용 사례의 법적·윤리적 조건을 대신 판단해주지는 않는다.
작은 범위에서 검증하는 흐름
- 무료 기간 안에서만 쓸 실험이라면 -free 접미사가 붙은 모델명으로 시작한다.
- 텍스트 음성 변환은 짧은 문장, 긴 문장, 숫자와 고유명사가 섞인 문장을 나눠 테스트한다.
- 전사는 깨끗한 녹음, 잡음 있는 녹음, 여러 명이 말하는 녹음을 따로 비교한다.
- 결과 파일 크기, 처리 시간, 재시도 횟수, 사람이 수정한 시간을 함께 기록한다.
- 무료 기간 종료 전 표준 모델명으로 바꿀지, 기존 도구를 유지할지, 호출을 중단할지 결정한다.
결론
Fish Audio 모델의 Vercel AI Gateway 제공은 음성 기능을 빠르게 실험하려는 개발자에게 의미가 있다. 특히 AI SDK와 Vercel 배포 흐름을 이미 쓰고 있다면 별도 공급자 연동을 크게 늘리지 않고 텍스트 음성 변환과 전사를 시험해볼 수 있다.
다만 무료 제공은 2026년 9월 18일까지로 안내되어 있고, 표준 모델명 사용 시 이후 과금으로 이어질 수 있다는 점이 핵심이다. 개인 사용자와 학생은 -free 접미사로 비용 위험을 줄이고, 연구자와 팀 개발자는 데이터 정책과 권한 조건을 먼저 확인하는 편이 좋다. 실제 도입 여부는 무료 여부가 아니라 반복 작업을 줄이는지, 품질이 충분한지, 무료 기간 이후 비용을 감당할 수 있는지로 판단해야 한다.
출처와 검증
출처: Vercel Blog, 2026년 8월 19일 공개된 changelog 문서 Fish Audio models now available on Vercel AI Gateway for free
검증할 항목: 무료 제공 종료일, 모델별 실제 사용 가능 여부, AI SDK 7의 API 변경 가능성, Vercel 계정별 청구 조건, Fish Audio 및 Vercel의 데이터 처리 정책은 적용 전에 공식 문서와 대시보드에서 다시 확인해야 한다.