Stable Audio 是 Stability AI 公司在音频领域的核心产品,和它家大名鼎鼎的 Stable Diffusion(图像生成)师出同门。这个工具最早在2023年9月推出,到2026年5月已经迭代到了3.0版本。它做的事情其实挺直接的——你给它一段文字描述,它就能给你生成一段音乐或者音效。但和市面上大多数AI音乐工具不一样的是,Stable Audio走了一条完全不同的路线:开源 + 本地部署 + 全授权数据训练。3.0版本一共发布了四个模型,其中三个是开源权重,任何人都可以下载下来在自己电脑上跑。Stability AI 对Stable Audio的定位很清晰——它不是要做“最好听的AI音乐”,而是要做“你能放心用在商业项目里的AI音乐”。所有训练数据都来自授权和Creative Commons音频库。公司已经和华纳音乐、环球音乐签了合作协议。说到底,Stable Audio解决的最大痛点不是“能不能生成音乐”,而是“生成出来的音乐能不能用、敢不敢用”。

Stable Audio的功能体系在3.0版本迎来了一次全面重构,从架构到功能都和之前完全不同。核心功能我拆成几个部分来说:
文本生成音乐——这是最基础的功能。你输入一段描述性文本,比如风格、乐器、情绪、节奏,AI就能生成对应的音乐曲目。支持带人声和纯器乐两种模式。目前覆盖50+种音乐风格,流行、摇滚、古典、电子、爵士、氛围都能做。
四档模型任你选——3.0版本最大的变化是发布了四个针对不同场景的模型。Small SFX(4.59亿参数)专门做音效,能在手机和普通笔记本上本地跑。Small Music(4.59亿参数)做音乐创作,同样支持设备端运行,最长2分钟。Medium(14亿参数)是大多数人的主力选择,最长6分20秒,需要消费级GPU。Large(27亿参数)是旗舰款,只通过API和自托管提供。
设备端本地生成——这是Stable Audio和Suno、Udio最本质的区别。Small系列模型可以直接在你自己的电脑上跑,不需要联网,没有API费用,没有使用上限。Medium模型在MacBook Pro M4上只要几秒钟就能生成一段音频。
音频补全与Inpainting——支持对已有音频进行定向编辑和续写。你可以输入自己的音频,让模型根据上下文自动生成后续内容。
DAW插件——2026年8月,Stability AI推出了Stable Audio的DAW插件。支持macOS的AU和VST3格式,兼容Logic Pro和Ableton Live等主流DAW。可以直接在音轨上生成音频,和工程BPM同步,保存多个备选版本。
LoRA微调——用户可以在自己的音频库上对模型进行微调训练。
商用授权清晰——所有生成的作品,用户拥有输出内容的所有权。年收入低于100万美元的组织可免费商用。
Stable Audio的用户规模目前在50万以上。和Suno那种千万级用户量确实有差距,但Stable Audio的定位本身就不同——它更偏向专业用户和开发者,而不是大众消费者。在专业圈子里,Stable Audio的评价相当不错。ToolBrain给Stable Audio 3.0打了8.7/10分,在易用性、功能、文档方面都给了9分。Dubspot的评测认为这是Stability AI“第一个真正能在工作室里用的音频模型”。商业合作方面,Stability AI已经和华纳音乐、环球音乐签了合作协议,2026年4月又和独立音乐出版商Kobalt达成了授权协议。目前只有索尼音乐的诉讼还在进行中。在用户社区,Hugging Face上已经有不少开发者在基于Stable Audio的开源权重做二次开发。
Stable Audio有两条完全不同的使用路径——网页版和本地部署。我分别说一下:
路径一:网页版(最简单,适合大多数人)
第一步:打开 stableaudio.com,注册一个账号。免费版注册会送10积分。第二步:在输入框里写一段文字描述你想要的音乐。比如“后摇滚、吉他、鼓、贝斯、弦乐、欢欣、振奋、125BPM”。越具体效果越好。第三步:点击生成。免费版默认生成45秒左右的短曲目。第四步:试听。如果满意,可以直接下载。如果不满意,调整描述重新生成。第五步(进阶):如果你续费了付费版,可以用“Extend”功能续写,把一首曲子慢慢拉长到完整的长度。
路径二:本地部署(适合技术用户和开发者)
第一步:去Hugging Face下载Stable Audio 3.0的开源权重。Small SFX、Small Music和Medium三个模型都可以免费下载。第二步:安装依赖环境。Stable Audio 3.0支持通过stable_audio_3库进行推理,也支持ComfyUI节点。第三步:运行推理。可以用Python脚本调用模型,也可以用ComfyUI的可视化界面操作。第四步(可选):如果你用的是Apple Silicon Mac,还可以用MLX原生推理,一行命令就能跑起来。
1. 提示词要具体——别只写“一首好听的歌”。写清楚风格、乐器、情绪、节奏。实测“后摇滚、吉他、鼓、贝斯、弦乐、欢欣、振奋、125BPM”比“摇滚乐”效果好得多。
2. 搞清楚自己要什么模型——做视频配乐用Medium,做游戏音效用Small SFX,做背景氛围用Small Music。Large只有API和自托管才能用。
3. 商用项目优先考虑Stable Audio——如果你的音乐要进广告、客户项目、付费内容,Stable Audio的训练数据授权透明是最大的优势。Suno和Udio在这方面有争议。
4. 善用音频补全——如果你有一段现成的音频想续写,用音频补全功能可以让模型根据上下文自动生成后续内容。
5. DAW用户装插件——如果你用Logic Pro或Ableton Live,强烈建议装Stable Audio的DAW插件。直接在音轨上生成、同步BPM、保存多个版本,比网页版导出再导入方便太多了。
6. 免费版先试水——10积分虽然不多,但足够你试几次方向了。先确定Stable Audio的风格适合你的项目,再考虑付费。
Stable Audio的“安装”方式取决于你想怎么用:
网页版——不需要安装任何东西。打开 stableaudio.com 注册登录就能用。
DAW插件(macOS)——从Stable Audio官网下载插件安装包。支持AU和VST3格式。在Ableton里它在PlugIns的Instrument轨道下,在Logic里它在Instrument插槽中。目前只支持macOS,兼容Apple Silicon和Intel Mac。
本地模型部署——从Hugging Face下载模型权重。安装stable_audio_3库。或者用ComfyUI的可视化节点操作。Apple Silicon Mac用户可以用MLX原生推理。硬件要求:Small系列CPU就能跑。Medium需要约6.5GB显存的NVIDIA GPU。Large只能通过API或自托管使用。
Stable Audio的定价体系比较复杂,因为它既有SaaS订阅,又有开源免费选项。我分几个层面说:
开源模型(免费)——Small SFX、Small Music和Medium三个模型的权重完全免费,任何人都可以下载、使用、修改。你只需要自己承担硬件成本。
网页版免费套餐——注册送10积分试用。可以生成和下载45秒的短曲目。
网页版Pro版——约$11.99/月。更多积分、更长生成时长(最长3分钟)、商业项目使用权。
网页版Studio版——约$29.99/月。
网页版Max版——约$89.99/月。
API按量付费——Stable Audio 3.0 API每生成一次收费$0.26,最长6分钟。Stable Audio 2.5是$0.20一次。⚠️ 重要提醒:网页版订阅的月度积分不会累积到下个月。年收入超过100万美元的企业需要单独购买Enterprise License。本地部署虽然模型免费,但需要自己搞定GPU硬件。
Stable Audio最适合这几类人:
AI视频创作者——用Kling、Veo这些工具生成视频后,配乐是最大的痛点。Stable Audio能快速生成版权安全的背景音乐。
独立游戏开发者——需要原创音效和背景音乐但预算有限。Small SFX模型可以在普通电脑上本地生成音效。
广告和商业项目团队——最在意的是“能不能放心用在客户的付费项目里”。Stable Audio的训练数据授权透明是最大优势。
音乐制作人和声音设计师——DAW插件让Stable Audio能直接融入专业工作流。LoRA微调功能可以在自己的音频库上定制模型。
技术爱好者和开发者——开源权重、ComfyUI支持、MLX原生推理。想折腾的人可以玩出很多花样。
反过来说,如果你需要带人声的歌曲,Stable Audio目前还不支持。如果你追求“一键出歌、风格全面、上手极快”,Suno可能更合适。
Q:Stable Audio和Suno、Udio有什么区别?
最大的区别是开源和授权。Stable Audio走开源+本地部署路线,训练数据全部授权。Suno和Udio是闭源云服务,训练数据来源不透明。风格上,Stable Audio擅长器乐和音效,Suno和Udio在人声歌曲上更强。
Q:Stable Audio支持中文输入吗?
支持中文提示词输入。但模型训练数据以英文为主,英文提示词的效果通常更好。
Q:生成的音乐能商用吗?
能。按照Stability AI Community License,年收入低于100万美元的组织可免费商用。年收入超过100万美元需购买Enterprise License。
Q:本地部署需要什么配置?
Small系列CPU就能跑。Medium需要约6.5GB显存的NVIDIA GPU。Large只能通过API或自托管。MacBook Pro M4上Medium模型几秒钟就能生成一段音频。
Q:免费版够用吗?
10积分只够试几次。想认真做项目,至少得开Pro版。不想花钱的话,自己部署开源模型是另一条路。
Q:Stable Audio和Stable Diffusion是一家公司的吗?
对,都是Stability AI的产品。Stable Diffusion做图像,Stable Audio做音频。
训练数据全部授权,商用安心——这是Stable Audio和Suno、Udio最本质的区别。
开源权重免费下载——三个模型随便用、随便改。
本地部署不上传数据——没有隐私顾虑,没有API费用,没有使用上限。
设备端生成速度快——Medium在MacBook Pro M4上几秒钟就能生成。
DAW插件直接融入工作流——Logic Pro和Ableton Live用户可以直接在工程里生成音频。
LoRA微调支持定制——可以在自己的音频库上训练专属模型。
不支持人声和歌词——如果你需要带唱的歌曲,Stable Audio直接出局。
开源模型对硬件有要求——Medium需要GPU,不是每个人都能跑。
风格覆盖不如Suno全面——Stable Audio擅长氛围、配乐、器乐,流行人声类不如竞品。
网页版免费版限制严——10积分只够试几次。
文档和技术门槛偏高——本地部署需要一定的技术能力。
Large模型不开源——旗舰款只能通过API或自托管使用。

评论