Configurar Voz & Áudio (TTS e transcrição)

3 min de leitura Visualizações: 1

A aba Voz & Áudio habilita o Parceiro IA a:

  • Responder em áudio (TTS – Text-to-Speech), enviando mensagens de voz pelo WhatsApp.
  • Entender áudios recebidos (transcrição via Whisper), tratando o áudio do cliente como se fosse texto.

Disponível em planos com Voz & Áudio.

parceiro ia voz

1. Configurar TTS (resposta em áudio)

  1. Acesse CRM > Parceiro IA > aba Voz & Áudio.
  2. Ligue o interruptor TTS habilitado.
  3. Escolha a voz. As opções padrão são:
    • alloy – neutra, balanceada.
    • echo – masculina, profissional.
    • nova – feminina, jovem.
    • shimmer – feminina, calorosa.
    • onyx – masculina, grave.
    • fable – narrativa, afetiva.
  4. Clique no botão ▶ Preview ao lado de cada voz para ouvir um exemplo (a frase é gerada na hora).
  5. Ajuste o Speed (velocidade) entre 0.5x e 2.0x. Recomendado: 1.0x ou 1.1x para WhatsApp.
  6. Escolha o Formato:
    • MP3 – universal, abre em qualquer player.
    • OPUS – otimizado para WhatsApp/voz.
  7. Salve.

Pronto: a partir desse momento, mensagens de até o limite de caracteres definido na Identidade do Parceiro viram um arquivo de áudio enviado ao cliente.

2. Configurar transcrição de áudio recebido

  1. Na mesma aba, ligue o interruptor Transcrever áudio recebido.
  2. Salve.

Quando o cliente mandar um áudio:

  • O sistema baixa o arquivo.
  • Faz transcrição automática (Whisper).
  • O texto entra no fluxo normal da IA, exatamente como se o cliente tivesse digitado.

Mesmo se a sua Identidade tiver Reagir a mídia desligado para áudio, ligar Transcrever áudio recebido ainda registra a transcrição na conversa para que um humano leia. Para a IA responder ao áudio, ative os dois.

3. Monitorar consumo

No topo da aba aparece um card com o uso TTS no mês em minutos (ex.: “Uso TTS no mês: 47 min”). Use para acompanhar o custo.

  • TTS é cobrado em minutos arredondados para cima por áudio gerado.
  • Transcrição é cobrada por minutos transcritos.
  • Áudios idênticos (mesmo texto, mesma voz, mesma velocidade) são cacheados por 30 dias – economiza tokens.

4. Boas práticas

  • Use TTS com moderação: áudios chamam atenção, mas se você mandar tudo em áudio, o cliente acha invasivo. Combine texto + áudio.
  • Voz consistente: escolha uma voz e mantenha. Mudar de voz no meio das conversas parece estranho.
  • Velocidade natural: 1.0x soa mais humano. Velocidades acima de 1.3x parecem robotizadas.
  • Mensagens curtas em áudio: ajuste o Máx. caracteres por mensagem (na Identidade) para algo entre 200 e 400 se for usar muito TTS – áudios longos cansam.
  • Sempre teste antes: mande para você mesmo no WhatsApp para conferir como soa.

5. Problemas comuns

Sintoma O que checar
Áudio não chega no cliente Sessão do WhatsApp online em Conversas > Sessões. Tente trocar o Formato de OPUS para MP3.
Voz aparece, mas dá erro ao gerar Plano com Voz & Áudio ativo? Quota mensal estourada?
Cliente manda áudio e a IA não responde Transcrever áudio recebido ligado e Reagir a mídia > áudio configurado para Transcrever e responder (na Identidade).

Permissões e plano

  • Configurar Voz & Áudio – necessária para alterar.
  • Plano: recurso Voz & Áudio ativo.

Próximo passo

Disponibilize o Parceiro IA também em um site externo com o widget de chat: veja “Configurar o Atendimento Web (widget)”.

Este artigo foi útil?