1.契机

今年一月末,我正折腾一个 AI 对话陪伴项目。看着屏幕上已经能够顺畅交流的文本,我总觉得少了点什么——没有声音的 AI,终究只是冰冷的字符跳动。
所以需要接入 TTS(Text-to-Speech)模块来实现语音回复。出于个人偏好,计划使用《ATRI -My Dear Moments-》中亚托莉(ATRI)的音色。
本以为在这个 AI 爆发的时代,找个开源的声音模型是件手到擒来的事。毕竟我记得前几年,网上到处都是 ATRI 的语音合成模型。然而在实际检索中发现,早期开源社区中流传的 VITS 或 RVC 架构的 ATRI 模型,目前普遍存在链接失效、版本过旧无法适配新框架等问题。考虑到当前大语言模型(LLM)对话的即时性和情绪多样性,传统的 TTS 模型在零样本/少样本(Zero-shot/Few-shot)的语气泛化上表现欠佳。

基于以上痛点,我决定利用本地算力,采用当前在情绪表达和跨语种合成上表现优异的 GPT-SoVITS-v2 架构,从零开始重炼一个 ATRI 的语音合成模型,即本文发布的 ATRI-GPT-SoVITS-v2ProPlus。
2. 硬件环境与技术选型
2.1 硬件平台
核心算力 (GPU): AMD Radeon RX 9070XT
架构优势: 虽然深度学习长期由 NVIDIA CUDA 主导,但随着 ROCm 及 DirectML 生态的推进,目前 AMD 高端显卡在本地推理和中小规模模型微调上已经具备了相当的可用性。9070XT 的大显存为音频切片批处理提供了充足的空间。
2.2 软件框架与工具链
核心算法: GPT-SoVITS (v2版本)。该架构分为 GPT(负责预测韵律和文本到音素的映射)和 SoVITS(负责声学特征到波形的生成)两部分,极大地降低了对大规模高质量数据集的依赖。
环境隔离: HLauncher(聚合启动器)。在 AMD 平台上配置 Python 虚拟环境及相关音频处理依赖(如 FFmpeg、PyTorch-DirectML 等)容易产生冲突,HLauncher 提供了高度封装的沙盒环境,实现了开箱即用。

3.学习资源与参考文档
对于同样持有 AMD 显卡,或希望了解数据处理底层逻辑的开发者,强烈建议查阅以下我测试跑通的参考资料:
- AMD 专属环境部署指南: AI 软件-AMD 显卡版下载与新手使用教程
- HLauncher 工具链文档: 聚合启动器下载与新手教程
- 全链路实操跑通教程 (核心推荐): 涵盖了上述提到的打标、切音到微调的所有工程细节。👉 B站教程:GPT-SoVITS 新手炼丹流程(本项目主要参考此视频跑通全流程)
4. 模型发布与下载说明

下面是模型生成出的样本,可以稍微听一下,看一下效果
主人,早上好!今天的高性能亚托莉也随时待命哦。有什么需要我帮忙的吗,哼哼!
ご主人様、おはようございます!今日も高性能アトリーがいつでも待機していますよ。何かお手伝いできることはありますか、ふふっ!
本次发布不仅包含我自己微调的 ATRI-GPT-SoVITS-v2ProPlus 权重,同时也整理了社区中其他开发者共享的几款 ATRI 历史模型,打包为一个合集,方便大家在具体工程中进行 A/B 测试。(当然也有训练数据)
资源获取:
- 文件名称: ATRI 模型合集
- 分发渠道: 百度网盘
- 下载链接: https://pan.baidu.com/s/1JlJ_3vrDXtat8qoHszvPhg?pwd=neko
- 提取码:
neko

Comments NOTHING