Stable Audio Open
Stable Audio Open 1.0 是 Stability AI 发布的文字转音频模型,可通过 stable-audio-tools 或 Diffusers 在本地生成最长 47 秒、44.1 kHz 立体声;官方模型卡说明它对音效和现场录音的表现通常优于完整音乐。
推荐理由
选择它是因为团队能固定模型、提示词、种子和后处理版本,离线批量生成脚步变体、机器循环、环境层与抽象材质,并把推理接入自己的审核和资产命名管线;这比依赖网页额度更适合需要可重复实验、敏感素材不上云或一次生成大量候选的项目。
适用阶段
用美术、动画、音频、关卡和叙事,把玩法做成玩家能理解并相信的世界。
使用前留意
模型权重采用 Stability AI Community License,并非标准开源许可;商业使用必须注册,年营收超过 100 万美元时需另取企业许可,分发模型或衍生物还涉及 Notice、协议副本和 Powered by Stability AI 归因。工具代码虽为 MIT,也不能覆盖权重、AUP、训练数据与输出风险;本地运行还需要足够显存和人工响度、循环检查。