熊猫宝库

熊猫宝库

新品内测
支持中文/英文/日文等,可直接写对白与背景音描述 0/2970
挑选音色

选定官方音色后,在描述中直接写出角色(如「男生说…」「女生说…」),音色会按选择顺序自动对应,语气更稳定。

声音参考 (已选 0/3)

选择 1~3 段参考音频,在描述中用「@音频N」按选中顺序引用,模型将模仿其音色与风格。注意:需停留在此模式下点「开始生成」,参考音频才会生效。

点击上传参考音频(wav/mp3/ogg,每段≤30秒、≤10MB)

上传后保存到音库可反复选用;在描述中用「@音频N」按选中顺序引用

参考图片 (jpg/png/webp,≤10MB)

上传一张图片,模型理解画面内容并为其配上有情绪的声音。

点击选择图片

模型将根据图片内容为其配上合适的声音

仅可上传 1 张

使用教程

页面底部有四种模式,点按对应图标即可切换:

  • 文字创作:最常用,仅靠文字描述生成声音,无需任何素材。
  • 预设音色:从官方音色库挑选喜欢的声线,让生成结果更贴近你的偏好。
  • 图片配声:上传一张图片(如风景、表情包),AI 根据画面氛围自动配声。
  • 声音参考:从音库选 1~3 段参考音频,生成的音频会模仿其语气与质感。

第一次使用建议从「文字创作」开始,最易上手。

在输入框用通顺的中文写下你想要的画面与声音,描述越具体,成品越生动。建议包含:

  • 角色与身份:如「年迈的爷爷」「活泼的小学生」「沉稳的新闻主播」。
  • 语气与情绪:温柔、激昂、紧张、慵懒、俏皮……
  • 台词 / 对白:直接写出要说的话,可多句分段。
  • 背景音与环境:如「钢琴声渐起」「窗外雨声」「人群喧闹」。
示例一位温柔的母亲在厨房里轻声哼着歌,对刚放学的孩子说:「宝贝回来啦,饭马上就好,先去洗手哦~」背景有轻微的炒菜声和锅碗碰撞声。

台词加上引号、标注说话人,能让语气更自然、不串角色。

底层为火山引擎 seed-audio-1.0 大模型,支持 18 种语言。直接用对应语言书写对白,模型会以该语言的自然语调与发音演绎:

  • 中文
  • 英文
  • 日语
  • 韩语
  • 西班牙语
  • 墨西哥-西班牙语
  • 德语
  • 法语
  • 巴西-葡萄牙语
  • 泰语
  • 越南语
  • 马来语
  • 菲律宾语
  • 意大利语
  • 俄语
  • 荷兰语
  • 波兰语
  • 土耳其语

多语种混合时,在台词前标注说话人(如「英文旁白:…」),语言切换会更自然。

想控制某句台词什么时候开始、说多久,就在这句台词前加方括号时间戳,格式为 [开始秒:结束秒],系统会按秒精确安排该句的进场与时长:

格式[开始秒s:结束秒s]「台词内容」
  • 时间戳紧跟在该句台词前面,秒数可带小数(支持 100ms 精度,如 22.1s)。
  • 想在整段中间插入某句,先写清前面的环境音,再写时间戳接台词。
  • 不写时间戳的台词由模型自动编排顺序,位置不固定。
示例前 3 秒是雨声和轻柔钢琴。[22.1s:24.3s]"Pocara,开启你的高光时刻。" 然后女声旁白继续:「欢迎收听从此刻开始。」

时间戳只是该句的开始与结束点,前后留出的空档模型会自然填入背景音或环境声。

根据你选择的模式,按需补充素材,让声音更贴合预期:

  • 预设音色:点「选择音色」,最多可勾选 3 个官方音色作为参考。
  • 图片配声:仅支持 1 张图片(jpg/png/webp,≤10MB),文字里可描述希望画面「如何被讲述」。
  • 声音参考:最多选 3 段音频(每条 ≤30 秒,wav/mp3/ogg),并在文字中用 @音频1、@音频2 引用它们。

素材一旦超过数量/大小上限会无法上传,请留意上述限制。

引用示例用 @音频1 的磁性男声念开场白,中间切换到 @音频2 的甜美女声念旁白。

声音参考需在「声音参考」模式下点「开始生成」才会生效,切换到其他模式提交将不使用参考音频。

确认描述与素材后,点底部「生成」按钮即可。

  • 账户金币需 ≥ 500 才能生成,否则按钮会提示「金币不足」。
  • 单次生成最长 120 秒(约 1~2 分钟出结果),更长内容请分段创作。
  • 生成过程中可离开页面,到「作品」里查看历史与状态。

首次生成建议先写 10~30 秒的短内容试听,满意后再加长。

生成完成后,页面下方会直接展示结果卡片,也可点底部「作品」随时回来查看:

  • 试听:结果卡片和「作品」页都能直接在线试听,确认效果。
  • 下载音频:试听满意后,一键下载 mp3/wav 音频文件。
  • 下载字幕:每个作品默认带字幕(.srt),含逐句时间轴,可配合视频剪辑、字幕压制使用。
  • 作品页:展示所有历史作品与状态,可随时再次试听、下载、解锁。
  • 离开页面:生成过程中可放心退出,到「作品」页查看进度与结果。

字幕在生成时自动开启,无需额外设置;个别极短片段可能无字幕。

我们采用「先生成、后按实结算」的方式,透明可控:

  • 完工后按 实际时长 结算,每秒约 16.67 金币,多少秒扣多少秒。
  • 余额充足:扣对应金币,音频直接解锁,可下载完整文件。
  • 余额不足:只解锁已支付部分秒数的试听片段,剩余部分锁定。
  • 充值金币后,到「作品」点击「解锁」,即可补足差价下载完整音频。
举例生成 30 秒音频需 500 金币;若余额仅 300,则先解锁 18 秒片段,充值后补 200 金币即可解锁剩余 12 秒。

生成前留意右上角余额,避免中途因金币不足只能听到片段。

Notification
发现
作品
配音
翻译
我的