AudioLDM
AudioLDM 家族以潜空间扩散完成文字转音频、音频到音频、文字引导风格迁移、超分辨率和局部重绘,覆盖语音、环境、音乐与短音效;AudioLDM2 延续了这一研究路线并提供公开权重。
推荐理由
选择它是因为它不只生成一个完整片段,还能围绕现有声音做结构化实验:声音设计师可以保留事件类型再换质感、修补缺口、提高分辨率或比较不同随机种子,用低成本验证脚步材质、环境层和抽象技能声的方向,同时让研究人员直接检查模型与推理代码。
适用阶段
用美术、动画、音频、关卡和叙事,把玩法做成玩家能理解并相信的世界。
使用前留意
官方仓库和权重采用 CC BY-NC-SA 4.0,只允许非商业用途,改编材料还受相同方式共享要求;原版说明训练使用 AudioSet、Freesound 与 BBC Sound Effects,并以英国学术研究版权例外分享演示,不能据此为商业输出背书。项目偏研究且本地部署依赖旧版环境和 GPU,商用项目应换用许可明确的模型。