阿里通义团队最新开源的千问3-TTS语音克隆模型,堪称目前语音克隆工具的天花板,我实测半个月,整理出新手能直接用的全能懒人包,一键部署不用复杂操作。

图片

这款工具核心就3个实用功能,全是我实测后觉得落地性极强的:声音设计、语音克隆、自定义音色

图片

语音克隆功能很实用,上传一段参考音频和文本,就能完美复刻目标人物声音;

图片

自定义音色可选用官方预设说话人,还能控制愤怒、开心等多种情感,具体演示建议看官方文档,更详细。

图片

重点说下模型选择,避免大家踩坑——有0.6B和1.7B两个模型,按自己电脑显存选即可。

图片

文件夹里还有两个版本:通用版适配所有显卡,新手闭眼选;FA2加速版仅适合RTX30系及以上显卡,实测更快、占显存更少,30、40系显卡优先选这个。

图片

实操步骤超简单,下载后有3个压缩包,直接解压第一个就行,切记解压目录不能有中文,我之前踩过这个坑,会直接报错。

图片

解压后找到一键启动脚本,双击运行,稍等片刻会自动弹出浏览器页面,第一次打开会提示“你的连接不是专用连接”,点击高级、继续前往即可。

图片

图片

看到工具界面就可以正常使用了,实测下来无广告、不卡顿,新手也能快速上手。

链接:https://pan.quark.cn/s/aa86d1114e11

Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐