Voltar para Ajuda
Nesta resposta

Como posso gerar fala, música ou som?

Gerar áudio

Crie fala, diálogo, música, cenas sonoras e efeitos com direção e revisão específicas do modo.

A geração de áudio começa escolhendo o tipo de som que você precisa. Os modos e vozes disponíveis dependem do modelo selecionado.

Abra os seletores de voz e modelo de áudio ao vivo antes de gerar fala ou som.

Escolha o modo de áudio

  • Discurso transforma um roteiro em uma performance falada. Quando as vozes estiverem disponíveis, selecione e visualize uma antes de gerar.
  • Diálogo é para uma troca ou desempenho de vários alto-falantes. Faça alterações nos alto-falantes e na ordem das linhas de forma inequívoca.
  • Cena sonora descreve um ambiente composto por vários elementos sonoros, como um café tranquilo e com chuva lá fora.
  • Música descreve humor, instrumentação, energia, estrutura e uso pretendido.
  • Efeito sonoro visa um som discreto, como uma confirmação de interface suave ou uma abertura da tampa do produto.

Apenas os modos suportados pelo modelo atual devem ser tratados como disponíveis.

Desempenho direto, não apenas palavras

Para fala e diálogo, inclua nomes, tom, ritmo, intensidade emocional e pausas sensíveis à pronúncia. Mantenha o roteiro separado da direção quando possível, para que as notas de performance não sejam faladas em voz alta.

Para música e efeitos, descreva a duração ou a forma através de momentos significativos: uma abertura suave, uma construção contida e um final limpo são mais acionáveis do que uma longa lista de adjetivos.

Revise os alto-falantes apropriados

Verifique a inteligibilidade, a pronúncia, o ritmo, o recorte, o ruído de fundo, o ajuste emocional e o início e o fim. Para uso em campanha, teste nos dispositivos que o público provavelmente usará, incluindo alto-falantes telefônicos.

Use áudio em um fluxo de trabalho

O áudio de diálogo gerado pode alimentar um nó Sincronização labial quando emparelhado com um vídeo de origem compatível. Os videoclipes com áudio podem ser montados em sequência; o nó Assembly inclui clipe de áudio na saída ordenada.

A geração de áudio é diferente da entrada de voz usada para transcrever um prompt. Um deles cria um recurso de áudio reutilizável; o outro ajuda você a inserir instruções.

Esta resposta foi útil?