【音频模型】SeedAudio 1.0完整教程:从参考音色到有声剧
传统AI配音只能把文字读出来,SeedAudio 1.0则可以进一步控制人物音色、情绪、呼吸、环境音和多角色对话。这篇教程将通过五个案例,完成一段完整的AI有声剧。
内容预览
教程内容
传统AI配音只能把文字读出来,SeedAudio 1.0则可以进一步控制人物音色、情绪、呼吸、环境音和多角色对话。这篇教程将通过五个案例,完成一段完整的AI有声剧。
一起来看一下成品:
那么接下来,按照我的思路和步骤,你也可以做出这样的作品,一起来实操吧~
准备工具
seedaudio 1.0 https://jimeng.jianying.com/
ChatGPT/豆包/gemini(推导提示词) https://chatgpt.com/c/
如果不想各个网页跳转模型,可以使用flowpix平台,已接入所有热门模型
本次教程的链接如下
https://www.flowpix.club/bj/38528.html?token=905f5dcd47c6c3d4b9f66710dc08414c
SeedAudio 1.0能做什么?
传统TTS配音通常只能选择音色,再添加开心、悲伤、生气等简单情绪。
但真正的人物表演并不是固定情绪。
同一句话里,人物可能先保持平静,随后产生怀疑,接着提高语速,最后因为委屈而停顿。
SeedAudio 1.0的优势,是可以将人物状态、情绪变化、停顿、呼吸、环境声音和具体台词写在同一段提示词中。
它不只是让人物“读台词”,而是让人物在具体场景中完成表演。
这篇教程将分为五章:
第一章:创建参考音色;
第二章:人物情绪与状态表演;
第三章:生成完整环境音效;
第四章:多角色对话与角色分配;
第五章:制作一段完整有声剧。
第一章:创建参考音色
seedaudio在哪里可以使用呢?
我这里提供2个网址
1.火山方舟(可以免费体验生成几分钟) https://ark.volcengine.com/
2.flowpix https://www.flowpix.club/点击创建生成音频即可
在制作有声书、多角色短剧和视频配音之前,需要先建立稳定的人物声音。
参考音色不是简单生成一段好听的人声,而是建立一个可以反复使用的“声音角色”。
后面即使改变台词、情绪和录音环境,人物的年龄感、声线、声音厚度和辨识度也应该保持一致。
参考音色生成模板(修改后直接发给大语言模型就行)
只需要修改以下五项:
【性别】 【年龄】 【声线】 【音色气质】 【主要用途】
生成一段原创【性别】参考音色,不模仿任何现实人物。
人物约【年龄】岁,声线【声线特点】,音色【音色气质】,整体自然、好听、松弛,有真实的人声质感,适合用于【主要用途】。
请自动创作一段20至30秒的生活化独白。内容围绕一件日常发生的小事,台词自然、有画面感,不要像提前写好的文案。
人物最开始保持自然状态,中间因为回想起某个细节产生明显的情绪变化,最后逐渐放松。请自动将人物状态、停顿、呼吸、语速和情绪变化穿插在台词之间。
使用生活化普通话,咬字清楚但不要字正腔圆。语调需要有自然的轻重和快慢变化,允许出现轻微呼吸、犹豫和笑意,不要让每句话使用相同节奏。
录音环境安静,人物距离麦克风较近。不要背景音乐、环境音、明显混响和其他人物声音。
不要播音腔、朗诵腔、客服腔、短视频营销腔、情感电台腔和AI逐字朗读感。整段保持同一个年龄感、同一个声线和稳定的核心音色。
本次一共创建三个角色:
林夏:女性主角,声音清透、柔和,情绪细腻;
我的提示词如下:
&生成一段原创成年女性人声,不模仿任何现实人物。
人物约25岁,声线偏中低,音色清透、柔和、耐听,有适度的声音厚度和轻微明亮感。发声松弛自然,气息稳定,声音有亲和力,但不要过分甜美、刻意温柔或故意压低嗓音。
使用生活化普通话,咬字清楚但不字正腔圆。句子有自然的轻重、快慢和呼吸变化,不要每句话都使用相同的语调。整体像一个声音条件很好的人,在安静的房间里和熟悉的人分享今天发生的事情。
人物最开始有一点疲惫,随后因为想起一件小事而变得轻松,最后出现一点若有所思。情绪自然流动,不要明显表演,不要播音腔、朗诵腔、客服腔和AI逐字朗读感。
台词与状态:
【刚刚忙完一天,轻轻呼出一口气,声音有一点疲惫,但整体放松】
“我今天……其实过得有点乱。”
【短暂停顿,像是在回想白天发生的事情】
“一早出门的时候忘了带钥匙,走到楼下才突然想起来。”
【想到当时的画面,语气变得轻松一些,带一点无奈的笑意】
“然后我又拎着一大堆东西,重新跑上楼。”
【自然地笑一下,声音明亮一点,但不要真的大笑】
“当时真的觉得自己特别傻。”
【停顿0.5秒,情绪慢慢安静下来】
“不过后来想想……”
【语速放慢,语气变得柔和,像在认真分享自己的感受】
“好像每天都会发生一些不在计划里的事情。”
【轻微吸气,句尾自然变轻,带一点释然】
“也不一定是坏事,对吧?”
录音环境安静、干净,人物距离麦克风较近。不要背景音乐、环境音、明显混响和其他人物声音。
周沉:成年男性,声音沉稳、克制;
我的提示词如下:
生成一段原创成年男性人声,不模仿任何现实人物。
人物约28至32岁,声线偏中低,音色干净、沉稳,有适度厚度和轻微颗粒感,但不要沙哑、烟嗓或故意压低声音。声音听起来可靠、松弛,有成熟感,但不要显得年龄过大。
使用自然、生活化的普通话。咬字清楚但不刻意,语调有真实的轻重和快慢变化。说话时情绪比较克制,不使用播音腔、纪录片旁白腔、霸总腔或短视频配音腔。
人物刚结束一天的工作,开始有些疲惫。说