Explorar la documentación
Generación de medios
generar audio
Cree discursos, diálogos, música, escenas de sonido y efectos con dirección y revisión específicas del modo.
Última revisión: 24 de septiembre de 2026
La generación de audio comienza eligiendo el tipo de sonido que necesitas. Los modos y voces disponibles dependen del modelo seleccionado.

Elige el modo de audio
- discurso convierte un guión en una actuación hablada. Cuando haya voces disponibles, seleccione y obtenga una vista previa de una antes de generarla.
- Diálogo es para un intercambio o una actuación con varios oradores. Haga que los cambios de oradores y el orden de las líneas sean inequívocos.
- escena sonora describe un entorno formado por varios elementos audibles, como un café tranquilo con lluvia afuera.
- musica describe el estado de ánimo, la instrumentación, la energía, la estructura y el uso previsto.
- efecto de sonido apunta a un sonido discreto, como una confirmación suave de la interfaz o la apertura de la tapa del producto.
Sólo los modos admitidos por el modelo actual deben considerarse como disponibles.
Actuación directa, no sólo palabras.
Para el habla y el diálogo, incluya nombres, tono, ritmo, intensidad emocional y pausas que tengan en cuenta la pronunciación. Mantenga el guión separado de la dirección cuando sea posible para que las notas de la interpretación no se digan en voz alta.
Para la música y los efectos, describe la duración o la forma a través de momentos significativos: una apertura suave, una construcción sobria y un final limpio son más prácticos que una larga lista de adjetivos.
Revisión sobre los oradores apropiados
Verifique la inteligibilidad, la pronunciación, el ritmo, el recorte, el ruido de fondo, el ajuste emocional y el principio y el final. Para uso en campaña, pruebe en los dispositivos que probablemente usará la audiencia, incluidos los parlantes del teléfono.
Usar audio en un flujo de trabajo
El audio de diálogo generado puede alimentar un nodo Sincronización labial cuando se combina con una fuente de vídeo compatible. Los videoclips con audio se pueden montar en secuencia; el nodo Ensamblaje incluye clip de audio en la salida ordenada.
La generación de audio es diferente de la entrada de voz utilizada para transcribir un mensaje. Uno crea un recurso de audio reutilizable; el otro le ayuda a ingresar instrucciones.