Dans cette réponse
Comment générer de la parole, de la musique ou du son ?
Générer du son
Créez des discours, des dialogues, de la musique, des scènes sonores et des effets avec une direction et une révision spécifiques au mode.
La génération audio commence par choisir le type de son dont vous avez besoin. Les modes et voix disponibles dépendent du modèle sélectionné.

Choisissez le mode audio
- Discours transforme un scénario en une seule performance orale. Lorsque des voix sont disponibles, sélectionnez-en une et prévisualisez-en une avant de la générer.
- Dialogues est destiné à un échange ou à une prestation multi-intervenants. Effectuez les changements d'enceintes et l'ordre des lignes sans ambiguïté.
- Scène sonore décrit un environnement composé de plusieurs éléments sonores, comme un café tranquille avec de la pluie dehors.
- Musique décrit l'ambiance, l'instrumentation, l'énergie, la structure et l'utilisation prévue.
- Effet sonore cible un son discret, tel qu'une confirmation d'interface logicielle ou l'ouverture d'un bouchon de produit.
Seuls les modes pris en charge par le modèle actuel doivent être traités comme disponibles.
Une performance directe, pas seulement des mots
Pour la parole et le dialogue, incluez les noms, le ton, le rythme, l'intensité émotionnelle et les pauses sensibles à la prononciation. Gardez le script séparé de la direction lorsque cela est possible afin que les notes de performance ne soient pas prononcées à haute voix.
Pour la musique et les effets, décrivez la durée ou la forme à travers des moments significatifs : une ouverture douce, une construction retenue et une fin nette sont plus exploitables qu'une longue liste d'adjectifs.
Examen des enceintes appropriées
Vérifiez l'intelligibilité, la prononciation, le rythme, le découpage, le bruit de fond, l'adéquation émotionnelle, ainsi que le début et la fin. Pour une utilisation dans le cadre d'une campagne, effectuez des tests sur les appareils que le public est susceptible d'utiliser, y compris les haut-parleurs du téléphone.
Utiliser l'audio dans un flux de travail
L'audio de dialogue généré peut alimenter un nœud Synchronisation labiale lorsqu'il est associé à une source vidéo compatible. Les clips vidéo avec audio peuvent être assemblés en séquence ; le nœud Assembly inclut l’audio du clip dans la sortie ordonnée.
La génération audio est différente de la saisie vocale utilisée pour transcrire une invite. L’une crée un actif audio réutilisable ; l'autre vous aide à saisir des instructions.
Cette réponse vous a-t-elle été utile ?