
选定官方音色后,在描述中直接写出角色(如「男生说…」「女生说…」),音色会按选择顺序自动对应,语气更稳定。
选择 1~3 段参考音频,在描述中用「@音频N」按选中顺序引用,模型将模仿其音色与风格。注意:需停留在此模式下点「开始生成」,参考音频才会生效。
点击上传参考音频(wav/mp3/ogg,每段≤30秒、≤10MB)
上传后保存到音库可反复选用;在描述中用「@音频N」按选中顺序引用
上传一张图片,模型理解画面内容并为其配上有情绪的声音。
点击选择图片
模型将根据图片内容为其配上合适的声音
页面底部有四种模式,点按对应图标即可切换:
第一次使用建议从「文字创作」开始,最易上手。
在输入框用通顺的中文写下你想要的画面与声音,描述越具体,成品越生动。建议包含:
台词加上引号、标注说话人,能让语气更自然、不串角色。
底层为火山引擎 seed-audio-1.0 大模型,支持 18 种语言。直接用对应语言书写对白,模型会以该语言的自然语调与发音演绎:
多语种混合时,在台词前标注说话人(如「英文旁白:…」),语言切换会更自然。
想控制某句台词什么时候开始、说多久,就在这句台词前加方括号时间戳,格式为 [开始秒:结束秒],系统会按秒精确安排该句的进场与时长:
时间戳只是该句的开始与结束点,前后留出的空档模型会自然填入背景音或环境声。
根据你选择的模式,按需补充素材,让声音更贴合预期:
素材一旦超过数量/大小上限会无法上传,请留意上述限制。
声音参考需在「声音参考」模式下点「开始生成」才会生效,切换到其他模式提交将不使用参考音频。
确认描述与素材后,点底部「生成」按钮即可。
首次生成建议先写 10~30 秒的短内容试听,满意后再加长。
生成完成后,页面下方会直接展示结果卡片,也可点底部「作品」随时回来查看:
字幕在生成时自动开启,无需额外设置;个别极短片段可能无字幕。
我们采用「先生成、后按实结算」的方式,透明可控:
生成前留意右上角余额,避免中途因金币不足只能听到片段。