Como Criar um Chatbot no WhatsApp com Gemini API, Áudio e Razorpay para Micro-SaaS
Operar um Micro-SaaS diretamente no WhatsApp tornou-se uma das estratégias mais eficientes para reduzir o atrito de aquisição e retenção de usuários. No entanto, criar um assistente autônomo e comercialmente viável exige superar dois gargalos frequentes: a incapacidade de interpretar mensagens de voz naturais enviadas pelos usuários e a fricção no momento da cobrança.
Neste guia técnico, você entenderá como integrar a API multimodal do Google Gemini para processar texto e notas de voz nativas do WhatsApp, conectando essa esteira a um fluxo automatizado de pagamentos via Razorpay utilizando Python.
Arquitetura da Solução
Para garantir baixa latência e alta disponibilidade, a estrutura deve ser desacoplada em três pilares principais:
- Recepção e Normalização de Mensagens (FastAPI + WhatsApp Cloud API): O webhook processa eventos de entrada (texto e mídia em formato
.ogg/opus). - Motor de Raciocínio Multimodal (Gemini 1.5 Flash/Pro): Envio direto dos arquivos de áudio para transcrição e compreensão semântica contextual em uma única chamada de API.
- Camada Transacional (Razorpay SDK): Geração dinâmica de links de pagamento e verificação criptográfica de webhooks de status de pagamento.
1. Processamento de Áudio com Gemini API em Python
Tradicionalmente, desenvolvedores utilizavam modelos intermediários de Speech-to-Text (como Whisper) antes de alimentar o LLM. Com o Google Gemini, o pipeline foi simplificado: a API aceita arquivos de áudio diretamente, preservando entonações e reduzindo a latência operacional.
Veja um exemplo prático de manipulação do áudio recebido pelo WhatsApp Cloud API:
python
import google.generativeai as genai
import os
genai.configure(apikey=os.getenv(“GEMINIAPI_KEY”))
def processarmensagemvoz(caminhoarquivoaudio: str, promptcontexto: str) -> str:
“””
Faz o upload do áudio para a API do Gemini e obtém a resposta direta do assistente.
“””
# Upload do arquivo de áudio temporário
arquivogemini = genai.uploadfile(path=caminhoarquivo_audio)
modelo = genai.GenerativeModel(
model_name="gemini-1.5-flash",
system_instruction=(
"Você é o assistente virtual de um Micro-SaaS. "
"Responda dúvidas de suporte e guie o cliente até o checkout."
)
)
resposta = modelo.generate_content([prompt_contexto, arquivo_gemini])
# Limpeza do arquivo remoto após o processamento
arquivo_gemini.delete()
return resposta.text
2. Automação de Cobranças com Razorpay
Quando o usuário decide assinar um plano ou comprar créditos via WhatsApp, o bot deve gerar um link de pagamento instantâneo. O Razorpay disponibiliza a criação de Payment Links com webhooks seguros para confirmação.
python
import razorpay
client = razorpay.Client(auth=(os.getenv(“RAZORPAYKEYID”), os.getenv(“RAZORPAYKEYSECRET”)))
def criarlinkpagamento(telefonecliente: str, valorcentavos: int, descricao: str) -> str:
dadoscobranca = {
“amount”: valorcentavos,
“currency”: “INR”, # ou outra moeda suportada pela sua conta
“acceptpartial”: False,
“description”: descricao,
“customer”: {
“contact”: telefonecliente
},
“notify”: {
“sms”: False,
“email”: False
},
“reminder_enable”: True
}
cobranca = client.payment_link.create(dados_cobranca)
return cobranca.get("short_url")
Boas Práticas para Escalar o Bot
Como especialista em IA e arquiteturas distribuídas, recomendo seguir padrões rigorosos para evitar gargalos em produção:
- Assincronismo Obrigatório: O WhatsApp exige que seu webhook responda com status HTTP 200 em menos de 3 segundos. Utilize filas assíncronas (como Celery ou Redis Queue) para baixar o áudio e consultar o Gemini fora do ciclo de vida da requisição HTTP principal.
- Idempotência de Pagamentos: Sempre valide a assinatura HMAC (
X-Razorpay-Signature) nos webhooks de confirmação para prevenir fraudes e processamentos duplicados. - Gestão de Sessão Eficiente: Mantenha o histórico recente da conversa em um banco de memória como Redis, limitando os tokens para conter custos da API.
Transforme sua Solução em um Produto Estável
Construir um protótipo com Gemini e WhatsApp é o primeiro passo. Estruturar uma solução pronta para produção — com tolerância a falhas, concorrência otimizada e segurança de pagamentos — é o que viabiliza um Micro-SaaS lucrativo.
Se você busca acelerar o desenvolvimento do seu ecossistema de automação ou precisa de uma implementação robusta com Inteligência Artificial e Python, entre em contato para uma consultoria técnica especializada.


