浏览文档
媒体生成
生成音频
通过特定于模式的指导和审查来创建语音、对话、音乐、声音场景和效果。
最后审核日期:2026年9月24日
音频生成从选择您需要的声音类型开始。可用模式和声音取决于所选型号。

选择音频模式
- 演讲 将剧本变成一场口头表演。当语音可用时,在生成之前选择并预览一种语音。
- 对话 用于交流或多发言者表演。使发言者的变化和线路顺序明确。
- 声音场景 描述了由多个声音元素组成的环境,例如外面下雨的安静咖啡馆。
- 音乐 描述情绪、仪器、能量、结构和预期用途。
- 音效 目标是离散的声音,例如软接口确认或产品盖打开。
只有当前模型支持的模式才应被视为可用。
直接表现,不只是言语
对于语音和对话,包括发音敏感的名称、语气、语速、情绪强度和停顿。尽可能将脚本与指导分开,这样就不会大声说出表演笔记。
对于音乐和效果,通过有意义的时刻来描述持续时间或形状:温和的开头、克制的构建和干净的结尾比一长串形容词更具有可操作性。
审查合适的演讲者
检查清晰度、发音、节奏、剪辑、背景噪音、情感契合度以及开头和结尾。对于营销活动的使用,请在受众可能使用的设备上进行测试,包括手机扬声器。
在工作流程中使用音频
当与兼容的源视频配对时,生成的对话音频可以馈送到唇形同步节点。带音频的视频片段可以按顺序组合; Assembly 节点在有序输出中包含剪辑音频。
音频生成不同于用于转录提示的语音输入。创建可重复使用的音频资产;另一个帮助您输入说明。