📘 Fish Audio是什么?
Fish Audio由前英伟达研究员Shijia Liao于2024年创立,最初只是他在卧室里用一张RTX 4090显卡训练的开源项目Fish Speech。没想到这个项目在GitHub上迅速走红,至今已获得超过3.2万个Star。
2025年,Fish Audio正式成立公司,总部设在帕洛阿尔托。到2026年,团队只有22人,却做到了年经常性收入(ARR)2100万美元,平台用户超过800万。2026年7月,公司完成了5200万美元的种子轮融资,由今日资本(徐新创办)和Coreline Ventures领投,连梅西的Play Time也参与了投资。
它的核心价值可以用一句话概括:让语音合成既有"质感"又有"控制感"——不仅声音像真人,还能精准控制语气、情感和节奏。

⚡ 核心功能与AI亮点
S2.1 Pro:当前最强语音模型
Fish Audio目前最先进的模型是S2.1 Pro,在盲测中,近67%的听众偏好它超过其他主流竞品。这个模型目前通过付费API提供,支持83种以上语言,能从5秒音频片段中快速克隆声音。
超15000种自然语言情感控制
这是Fish Audio最独特的地方。你不需要记住什么专业参数,直接用自然语言描述你想要的语气——比如"用兴奋的语气说""温柔一点""像在讲一个悲伤的故事"——模型就能理解并执行。这种控制粒度对内容创作者、游戏配音、有声书制作来说非常实用。
专业级语音克隆
Fish Audio的语音克隆支持两种方式:
- 持久克隆(Persistent Model):上传一段或多段音频训练一个可复用的声音模型,适合需要长期使用同一种声音的场景。
- 即时克隆(Instant Clone):每次生成时直接传入参考音频,不需要单独训练模型,适合一次性或临时用途。
克隆时建议使用干净、单声道、无背景音的音频,时长10秒到几分钟效果最佳。你还可以同时上传音频对应的文本,能进一步提升发音准确度。
多语言支持与本地化
支持83种以上语言,覆盖主流语种和小语种,适合出海业务、多语言配音等场景。
语音转文字(ASR)
除了TTS,Fish Audio也提供语音识别模型,支持将音频转成文本,适合需要语音转录的场景。
开源模型与社区生态
Fish Audio已经开源了3款语音模型,其中最知名的是Fish Speech S1-mini(0.5B参数),适合本地部署。社区在GitHub上贡献了大量代码,也积累了大量共享声音模型——平台上已有超过200万个社区声音模型。
🛠️ 如何安装与使用
Fish Audio提供两种主要使用方式:云端API和本地自托管。
方案一:云端API(推荐给大多数用户)
最快上手的方式,注册账号后直接调用API即可。
1. 注册账号并获取API Key
前往fish.audio注册账号,登录后在Dashboard的API Keys页面创建一个新Key,保存好。
2. 安装Python SDK
pip install fish-audio-sdk
3. 设置环境变量并生成语音
export FISH_API_KEY=你的API密钥
from fishaudio import FishAudio
from fishaudio.utils import save
client = FishAudio() # 自动读取FISH_API_KEY
# 基础TTS
audio = client.tts.convert(text="你好,欢迎使用Fish Audio。")
save(audio, "output.mp3")
4. 使用克隆声音
# 先创建一个声音模型
voice = client.voices.create(
title="我的声音",
voices=[open("my_voice.wav", "rb").read()],
description="克隆自录音",
visibility="private"
)
# 用这个声音生成语音
audio = client.tts.convert(
text="现在我用克隆的声音说话。",
reference_id=voice.id
)
对Node.js开发者,Fish Audio也提供了JavaScript SDK。
方案二:本地自托管(适合需要私有化部署的团队)
Fish Audio的开源模型支持本地部署,适合对数据隐私要求高的企业。
硬件要求:建议24GB以上显存的GPU(如RTX 4090或A100),系统推荐Linux或WSL。
安装步骤:
# 克隆仓库
git clone https://github.com/fishaudio/fish-speech.git
cd fish-speech
# 创建conda环境
conda create -n fish-speech python=3.12
conda activate fish-speech
# 安装依赖(以CUDA 12.9为例)
pip install -e .[cu129]
本地部署后可以通过命令行、HTTP API或WebUI进行推理。Fish Audio也提供了Docker镜像,支持一键部署。
移动端App
Fish Audio还提供iOS和Android移动应用,支持在手机上直接克隆声音、文本转语音、语音转文字和多角色故事创作,适合内容创作者在路上使用。
🧠 使用技巧与最佳实践
克隆声音的音频质量决定成败
声音克隆效果好坏,80%取决于参考音频。尽量用干净、单声道、只有一个人在说话的音频。避免背景音乐、混响或多人对话。10秒到2分钟的清晰语音效果最好,如果能同时提供音频对应的文本,发音会更精准。
善用"自然语言情感控制"
不用去调什么音调、语速参数,直接用日常语言描述你想要的语气就行。比如"用惊讶的语气说""语速慢一点,带点犹豫"。平台支持超过15000种自然语言控制词,多试几种描述方式,效果会不一样。
区分"持久克隆"和"即时克隆"
如果同一个声音要用很多次,走持久克隆流程——训练一次拿到voice.id,后面反复用。如果只用一次,比如给某个角色临时配一句话,用即时克隆更省事。
本地部署时善用--compile优化
如果你在RTX 4090这类显卡上本地跑模型,加上--compile参数能让推理速度提升约10倍。注意这个选项在Windows和macOS上暂不支持。
🌍 全球使用情况与数据
用户规模
截至2026年中,Fish Audio平台用户已超过800万。GitHub上Fish Speech主仓库获得超过3.2万Star。平台上社区共享的声音模型已超过200万个。
企业客户
HeyGen、Retell、LiveKit、OpenArt、Telnyx、Sanas等公司已在使用Fish Audio的API服务。
营收与融资
2026年7月,年经常性收入(ARR)达到2100万美元,相比2月的1000万美元翻了一倍。人均创造ARR接近95万美元,这个数字在AI初创公司里相当亮眼。同期完成5200万美元种子轮融资。
💰 收费模式
Fish Audio提供两种收费体系:面向个人创作者的订阅制,和面向开发者的API按量付费。
订阅套餐(个人创作者)
- 免费版:每月8000积分,约7分钟生成,单次500字符上限,3个公开音色槽位。
- Plus(5.5美元/月,年付66美元):每月25万积分,约200分钟生成,含10个私有音色槽位,可使用Voice Design功能。
- Pro(37.5美元/月,年付450美元):每月200万积分,约1620分钟生成,含3个团队席位,无限音色槽位,5个专业音色槽位。
- Max(749美元/月,年付8988美元):每月2500万积分,适合大规模生产团队。
每分钟生成约消耗600-625积分。
API按量付费(开发者/企业)
- TTS模型:15美元/百万UTF-8字节,约相当于18万英文单词或12小时语音。
- ASR语音识别:0.36美元/音频小时。
- Voice Design:0.01美元/成功请求。
API没有订阅费,用多少付多少。并发限制根据累计消费金额自动提升:消费100美元以下5并发,100美元以上15并发,1000美元以上50并发。
注意:网上流传的周订阅9.99美元等信息似乎是第三方App或不同市场的定价,建议以官方最新价格为准。
❓ 常见问题与排障
Fish Audio和ElevenLabs有什么区别?
两者都是AI语音领域的头部玩家。Fish Audio的差异化在于:一是更强的"自然语言情感控制"能力,超过15000种控制词,不需要调参数;二是开源策略,部分模型可以本地部署,适合对数据隐私有要求的团队。价格上,Fish Audio的15美元/百万字符在竞品中也属于有竞争力的区间。
免费版能用什么?
免费版每月有8000积分,大约能生成7分钟语音,单次上限500字符,只能使用公开音色槽位,不能商用。另外,新注册用户在API端通常会有5美元的试用额度。
声音克隆需要多少音频素材?
10秒以上的清晰音频即可生成可用克隆,1-2分钟效果更佳。如果音频质量很好,5秒也能出效果。关键是音频干净、无背景噪音。
本地部署需要什么配置?
推理至少需要12GB显存,推荐24GB(如RTX 4090)。系统建议Linux或WSL。如果只是测试,CPU模式也能跑,但速度会慢很多。
遇到CUDA显存不足怎么办?
可以尝试用--half参数启用FP16推理,减少显存占用。也可以关掉其他占用GPU的应用,或者调小批处理大小。
生成的语音有杂音或不够清晰?
首先检查参考音频的质量。如果参考音频本身有背景噪音或混响,克隆出来的声音也会有问题。平台默认开启了enhance_audio_quality参数,会帮你降噪和归一化,但如果原始素材太差,效果还是会打折扣。

评论