---
title: "Transcrição de áudio no WhatsApp com IA (Whisper)"
description: "Como baixar o áudio recebido no WhatsApp pela API, transcrever com IA (Whisper) e responder — o código completo, com o que quebra em produção."
url: "https://api-wa.me/blog/transcricao-audio-whatsapp-ia"
language: "pt-BR"
og:type: "article"
og:site_name: "WAME API"
---

[Início](https://api-wa.me/)/[Blog da API do WhatsApp](https://api-wa.me/blog)/Transcrição de áudio no WhatsApp com IA: responder mensagens de voz automaticamente

Raphael Serafim· Publicado em 16 de setembro de 2026· 7 min de leitura

Compartilhar

# Transcrição de áudio no WhatsApp com IA: responder mensagens de voz automaticamente

Como baixar o áudio recebido no WhatsApp pela API, transcrever com IA (Whisper) e responder — o código completo, com o que quebra em produção.

Copiar para LLM[Ver como Markdown](https://api-wa.me/blog/transcricao-audio-whatsapp-ia.md)

**Transcrever áudio do WhatsApp com IA são três passos: baixar o arquivo pelo identificador que chega no webhook, mandar para um modelo de transcrição como o Whisper, e tratar o texto resultante como se fosse uma mensagem de texto normal.** A dificuldade não está em nenhum desses passos isoladamente — está no que fica entre eles: o formato do áudio, o tempo de processamento e o que fazer quando a transcrição sai ruim.

## Passo 1: identificar e baixar o áudio

Quando chega uma mensagem de voz, o webhook entrega um evento do tipo `audio`, com um identificador de mensagem em vez do conteúdo direto — o áudio em si precisa ser baixado à parte:

javascript

Copiar

```
function extrairAudio(body) {
  const msg = body?.entry?.[0]?.changes?.[0]?.value?.messages?.[0];
  if (!msg || msg.type !== "audio") return null;

  return { messageId: msg.id, de: msg.from, canal: body.provider };
}

async function baixarAudio(messageId) {
  const r = await fetch(
    `https://us.api-wa.me/${process.env.WAME_KEY}/message/${messageId}/media?format=binary`
  );
  return Buffer.from(await r.arrayBuffer());
}
```

O parâmetro `format` decide o formato de retorno: `binary` devolve o arquivo direto, útil para mandar adiante para a API de transcrição sem conversão intermediária; `json` (o padrão) devolve em base64, útil se você precisa guardar ou logar antes de processar.

## Passo 2: transcrever

javascript

Copiar

```
import OpenAI from "openai";
import { toFile } from "openai/uploads";

const openai = new OpenAI({ apiKey: process.env.OPENAI_API_KEY });

async function transcrever(audioBuffer) {
  const arquivo = await toFile(audioBuffer, "audio.ogg");

  const r = await openai.audio.transcriptions.create({
    file: arquivo,
    model: "whisper-1",
    language: "pt",
  });

  return r.text.trim();
}
```

Passar `language: "pt"` evita que o Whisper gaste tempo detectando o idioma e reduz erro de transcrição em sotaques regionais — vale fixar quando você já sabe o idioma predominante da sua base de clientes.

## Passo 3: tratar como texto normal

A partir daqui, a transcrição segue o mesmo caminho de [qualquer chatbot de IA no WhatsApp](https://api-wa.me/blog/chatbot-ia-openai-whatsapp): vira a entrada do modelo, que responde normalmente.

javascript

Copiar

```
app.post("/webhook/wame", async (req, res) => {
  res.sendStatus(200); // responda antes de processar — a transcrição leva alguns segundos

  const audio = extrairAudio(req.body);
  if (!audio) return;

  try {
    const buffer = await baixarAudio(audio.messageId);
    const texto = await transcrever(buffer);

    const resposta = await responder(audio.de, texto); // mesma função de qualquer chatbot de texto
    await enviar(audio.de, resposta, audio.canal);
  } catch (e) {
    console.error("falha ao transcrever áudio", audio.de, e);
    await enviar(audio.de, "Não consegui entender o áudio, pode escrever a mensagem?", audio.canal);
  }
});
```

## O que quebra em produção

**Áudio curto demais ou só ruído.** Um "oi" gravado sem querer, ou um áudio de meio segundo, gera transcrição vazia ou sem sentido. Vale checar o tamanho do texto retornado antes de mandar para o modelo de resposta — abaixo de um limiar mínimo, peça para o cliente repetir.

**Formato incompatível.** O WhatsApp entrega áudio majoritariamente em OGG/Opus. A maioria dos provedores de transcrição aceita direto, mas se o seu não aceitar, uma conversão com `ffmpeg` antes de enviar resolve — é uma linha a mais, não um redesenho.

**Latência visível.** Transcrever e responder leva alguns segundos a mais do que responder texto direto. Mandar um `set_typing` ou uma confirmação rápida ("ouvindo seu áudio...") enquanto processa evita que o cliente pense que a mensagem não chegou.

**Sotaque e ruído de fundo.** Transcrição não é perfeita — em ambiente ruidoso ou sotaque forte, o texto pode sair incompleto ou trocado. Isso é motivo a mais para o system prompt do modelo de resposta admitir incerteza em vez de responder com confiança em cima de uma transcrição ruim, no mesmo espírito de [quando a IA deve parar de responder](https://api-wa.me/blog/quando-ia-deve-parar-responder-whatsapp).

## Respondendo em áudio (opcional)

Se o seu caso pede resposta em voz — acessibilidade, ou um público que prefere áudio a texto — o caminho é o inverso: gerar a fala com uma API de texto-para-voz e enviar como mensagem de áudio:

javascript

Copiar

```
async function gerarAudioResposta(texto) {
  const r = await openai.audio.speech.create({
    model: "tts-1",
    voice: "alloy",
    input: texto,
  });
  return Buffer.from(await r.arrayBuffer());
}
```

O envio segue o [endpoint de mensagem de áudio](https://api-wa.me/blog/como-enviar-mensagem-whatsapp-api) da API. Vale reservar isso para casos específicos — soma custo e latência a cada resposta, e a maioria dos atendimentos por texto continua mais rápida de ler do que de ouvir.

## Conclusão

Transcrição de áudio não é uma capacidade separada de um chatbot de IA — é uma etapa a mais antes do texto chegar ao modelo. O código de resposta, memória e escalonamento para humano continua o mesmo de um bot de texto; muda só o que acontece entre receber o evento `audio` no webhook e ter uma string pronta para processar. Feito isso, o resto da arquitetura — [RAG](https://api-wa.me/blog/rag-whatsapp-base-conhecimento-ia), function calling, regras de escalonamento — se aplica sem alteração.

### Pronto para automatizar seu WhatsApp?

Crie sua conta gratuita e comece a enviar mensagens pela API em minutos.

[Começar grátis](https://portal.api-wa.me/sign-up)

## Perguntas frequentes

Como baixar um áudio recebido no WhatsApp pela API?+

O webhook entrega a mensagem de áudio com um identificador (messageId); você usa esse ID para baixar o arquivo pelo endpoint de mídia da sua instância, que devolve o áudio em base64 ou em binário, dependendo do formato pedido.

Qual modelo de IA transcreve áudio do WhatsApp?+

O Whisper da OpenAI é a opção mais usada por custo e qualidade em português, mas qualquer API de speech-to-text que aceite o formato de áudio recebido (geralmente OGG/Opus no WhatsApp) funciona da mesma forma na integração — muda só a chamada, não a arquitetura.

O áudio do WhatsApp precisa de conversão antes de transcrever?+

Depende do provedor de transcrição. O Whisper aceita OGG diretamente na maioria dos casos; alguns serviços exigem MP3 ou WAV, o que pede uma conversão com ffmpeg antes de enviar. Vale testar com o formato original primeiro — economiza uma etapa se funcionar.

Dá para responder em áudio também, não só em texto?+

Sim, com um passo a mais: depois de gerar a resposta em texto, você chama uma API de texto-para-voz (como a TTS da própria OpenAI) e envia o resultado pelo endpoint de mensagem de áudio da API do WhatsApp. Isso soma latência e custo, então vale reservar para casos em que responder em áudio faz sentido — não como padrão.

Quanto tempo leva para transcrever e responder um áudio?+

Depende do tamanho do áudio e do provedor, mas geralmente de 2 a 6 segundos para um áudio de até um minuto. Isso é tempo suficiente para o cliente notar — vale mostrar 'digitando…' ou uma confirmação de recebimento enquanto processa, em vez de deixar a conversa parada.

## Continue lendo

[### Automatizar grupos de WhatsApp pela API: guia completo

Como automatizar grupos de WhatsApp pela API: criar, adicionar participante, moderar entrada e enviar aviso automático, com exemplos práticos em cURL.](https://api-wa.me/blog/automatizar-grupos-whatsapp-api)[### Catálogo com carrinho no WhatsApp: como vender sem sair da conversa via API

Veja como popular o catálogo de produtos via API do WhatsApp e montar um fluxo de carrinho nativo, sem redirecionar o cliente pra fora da conversa.](https://api-wa.me/blog/catalogo-carrinho-whatsapp-api-vendas)[### Checklist de compliance para WhatsApp API em 2026

Checklist prático de compliance para WhatsApp API: opt-in, LGPD, Quality Rating e política de template — o que auditar antes de escalar o envio em 2026.](https://api-wa.me/blog/checklist-compliance-whatsapp-api-2026)

[Voltar ao blog](https://api-wa.me/blog)

## Structured data

```json
{
  "@context": "https://schema.org",
  "@type": "WebSite",
  "name": "WAME API",
  "alternateName": "API Oficial e Não Oficial de WhatsApp, Instagram e Messenger",
  "url": "https://api-wa.me",
  "inLanguage": "pt-BR",
  "publisher": {
    "@id": "https://api-wa.me/#organization",
    "@type": "Organization",
    "name": "WAME API",
    "url": "https://api-wa.me"
  }
}
{
  "@context": "https://schema.org",
  "@type": "Organization",
  "@id": "https://api-wa.me/#organization",
  "name": "WAME API",
  "alternateName": [
    "WAME",
    "Wame API",
    "wame.api.br",
    "api-wa.me"
  ],
  "url": "https://api-wa.me",
  "logo": {
    "@type": "ImageObject",
    "url": "https://api-wa.me/images/web-app-manifest-512x512.png",
    "width": 512,
    "height": 512
  },
  "disambiguatingDescription": "WAME API é uma empresa brasileira de software, fundada em 2017 e parceira oficial da Meta (Meta Business Partner), que fornece APIs de WhatsApp, Instagram Direct e Messenger. Não tem relação com o wa.me, que é o encurtador de links operado pela WhatsApp LLC.",
  "identifier": {
    "@type": "PropertyValue",
    "propertyID": "INPI-BR",
    "name": "Pedido de registro de marca (INPI, classe NCL 42)",
    "value": "944724159"
  },
  "foundingDate": "2017",
  "slogan": "Parceira Oficial da Meta — WhatsApp, Instagram e Messenger numa instância só. Desde 2017.",
  "description": "Plataforma brasileira e Parceira Oficial da Meta (Meta Business Partner) para as APIs oficiais de WhatsApp (Cloud API), Instagram Direct e Messenger — os três numa única instância, com os mesmos endpoints e um único formato de webhook. Também oferece a API não oficial via QR Code, na mesma plataforma. No mercado desde 2017, com mais de 50 mil instâncias criadas, 99,9% de uptime e suporte humano 24/7 em português. SDKs oficiais para Node.js/TypeScript e PHP.",
  "knowsAbout": [
    "WhatsApp Cloud API oficial (Meta)",
    "API oficial de Instagram (Direct)",
    "API oficial de Messenger",
    "API multicanal Meta",
    "Meta Business Partner",
    "WhatsApp API",
    "API não oficial de WhatsApp",
    "automação de WhatsApp",
    "números virtuais",
    "webhooks"
  ],
  "sameAs": [
    "https://github.com/wame-api",
    "https://www.linkedin.com/company/wameapi",
    "https://www.instagram.com/wame.api/",
    "https://www.youtube.com/@wameapi"
  ],
  "contactPoint": {
    "@type": "ContactPoint",
    "contactType": "customer support",
    "url": "https://api-wa.me/contact",
    "availableLanguage": [
      "Portuguese"
    ]
  }
}
{
  "@context": "https://schema.org",
  "@type": "BlogPosting",
  "headline": "Transcrição de áudio no WhatsApp com IA: responder mensagens de voz automaticamente",
  "description": "Como baixar o áudio recebido no WhatsApp pela API, transcrever com IA (Whisper) e responder — o código completo, com o que quebra em produção.",
  "image": "https://api-wa.me/blog/transcricao-audio-whatsapp-ia/opengraph-image",
  "datePublished": "2026-09-16",
  "dateModified": "2026-09-16",
  "author": {
    "@type": "Person",
    "name": "Raphael Serafim",
    "url": "https://github.com/raphaelvserafim",
    "sameAs": [
      "https://github.com/raphaelvserafim"
    ]
  },
  "publisher": {
    "@type": "Organization",
    "name": "api-wa.me",
    "logo": {
      "@type": "ImageObject",
      "url": "https://api-wa.me/images/screenshot.png"
    }
  },
  "mainEntityOfPage": {
    "@type": "WebPage",
    "@id": "https://api-wa.me/blog/transcricao-audio-whatsapp-ia"
  },
  "keywords": "transcrever audio whatsapp, whisper whatsapp api, ia entender audio whatsapp, responder audio whatsapp automaticamente, transcricao de voz whatsapp, bot que ouve audio whatsapp, speech to text whatsapp api",
  "inLanguage": "pt-BR"
}
{
  "@context": "https://schema.org",
  "@type": "BreadcrumbList",
  "itemListElement": [
    {
      "@type": "ListItem",
      "position": 1,
      "name": "Home",
      "item": "https://api-wa.me"
    },
    {
      "@type": "ListItem",
      "position": 2,
      "name": "Blog da API do WhatsApp",
      "item": "https://api-wa.me/blog"
    },
    {
      "@type": "ListItem",
      "position": 3,
      "name": "Transcrição de áudio no WhatsApp com IA: responder mensagens de voz automaticamente",
      "item": "https://api-wa.me/blog/transcricao-audio-whatsapp-ia"
    }
  ]
}
{
  "@context": "https://schema.org",
  "@type": "FAQPage",
  "mainEntity": [
    {
      "@type": "Question",
      "name": "Como baixar um áudio recebido no WhatsApp pela API?",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "O webhook entrega a mensagem de áudio com um identificador (messageId); você usa esse ID para baixar o arquivo pelo endpoint de mídia da sua instância, que devolve o áudio em base64 ou em binário, dependendo do formato pedido."
      }
    },
    {
      "@type": "Question",
      "name": "Qual modelo de IA transcreve áudio do WhatsApp?",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "O Whisper da OpenAI é a opção mais usada por custo e qualidade em português, mas qualquer API de speech-to-text que aceite o formato de áudio recebido (geralmente OGG/Opus no WhatsApp) funciona da mesma forma na integração — muda só a chamada, não a arquitetura."
      }
    },
    {
      "@type": "Question",
      "name": "O áudio do WhatsApp precisa de conversão antes de transcrever?",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "Depende do provedor de transcrição. O Whisper aceita OGG diretamente na maioria dos casos; alguns serviços exigem MP3 ou WAV, o que pede uma conversão com ffmpeg antes de enviar. Vale testar com o formato original primeiro — economiza uma etapa se funcionar."
      }
    },
    {
      "@type": "Question",
      "name": "Dá para responder em áudio também, não só em texto?",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "Sim, com um passo a mais: depois de gerar a resposta em texto, você chama uma API de texto-para-voz (como a TTS da própria OpenAI) e envia o resultado pelo endpoint de mensagem de áudio da API do WhatsApp. Isso soma latência e custo, então vale reservar para casos em que responder em áudio faz sentido — não como padrão."
      }
    },
    {
      "@type": "Question",
      "name": "Quanto tempo leva para transcrever e responder um áudio?",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "Depende do tamanho do áudio e do provedor, mas geralmente de 2 a 6 segundos para um áudio de até um minuto. Isso é tempo suficiente para o cliente notar — vale mostrar 'digitando…' ou uma confirmação de recebimento enquanto processa, em vez de deixar a conversa parada."
      }
    }
  ]
}
```
