Reduza os custos com agentes de Voz com IA

O que decide o custo de uma operação outbound com IA não é o preço do minuto, é quantos minutos a arquitetura deixa o agente gastar sem ninguém do outro lado.
A pergunta errada
Quem avalia plataformas de agente de voz começa comparando preço por minuto. É a comparação natural: Retell, Vapi, a próxima que aparecer, todas na mesma planilha, menor valor vence. Em inbound, onde toda chamada conectada tem uma pessoa pedindo algo, a comparação faz sentido. Em outbound, não.
Em outbound, a maior parte das chamadas conectadas não tem uma pessoa do outro lado. Tem caixa postal. Tem ocupado. Tem uma gravação de operadora dizendo que o número não existe. E a política de cobrança publicada por essas plataformas não distingue uma coisa da outra.
A documentação de preço da Retell, consultada em agosto de 2026, declara que a cobrança cobre a duração inteira da chamada conectada, incluindo caixa postal. O agente de IA fala, o STT transcreve o bipe de saudação, o LLM processa a transcrição, o TTS sintetiza uma resposta que ninguém ouve. O ciclo se repete até o timeout. E o minuto é cobrado pela duração inteira.
A Vapi, consultada no mesmo mês, cobra US$ 0,05 por minuto de hospedagem, com STT, LLM e TTS cobrados por fora, mais US$ 10 por linha simultânea ao mês. A Retell cobra de US$ 0,07 a US$ 0,31 por minuto, com componentes em separado: reconhecimento de fala a US$ 0,055/min, síntese a US$ 0,015/min, telefonia a US$ 0,015/min, modelo de linguagem variando por modelo, e remoção de PII a US$ 0,01/min adicional. Ambas cobram em dólar, de fora do Brasil.
A pergunta que decide a fatura não é qual plataforma cobra menos por minuto. É quantos minutos o agente passa conversando com uma gravação.
A aritmética
Exemplo ilustrativo. Uma campanha de 20 mil discagens por dia, com 25% de atendimento, produz 5 mil chamadas conectadas por dia. Se 70% dos atendimentos não têm uma pessoa do outro lado, são 3.500 chamadas por dia em que o agente de IA conversa com uma caixa postal ou uma gravação de operadora. A cerca de 25 segundos cada, dá aproximadamente 1.450 minutos de IA por dia cobrados para falar com caixa postal.
Esses 25 segundos são o tempo que o agente leva para tocar a saudação gravada, encontrar silêncio do outro lado e desistir por timeout. Em cada um desses segundos, o STT roda, o LLM gera tokens, o TTS sintetiza áudio. A pipeline inteira dispara para um interlocutor que não existe. O bipe da caixa postal entra como áudio, vira texto, vira decisão do modelo, vira fala sintetizada que se espraia no vazio. E cada etapa dessa pipeline tem preço.
Pegue o preço por minuto que você paga hoje e multiplique por 1.450. Compare com o que a operação fatura. O número não precisa de adjetivo.
Esses minutos não são falha do agente. São o resultado de uma arquitetura que entrega toda chamada conectada ao agente de IA sem filtrar o que não é conversa. A fatura nasce antes de o agente dizer a primeira palavra útil.
A conta não se resolve dentro da IA
O corte dos minutos improdutivos acontece em quatro camadas, e nenhuma delas é o agente.
O discador
O discador nativo do NIVA opera com prioridade de campanha, janela permitida de discagem, progresso acompanhado e lista de bloqueio alimentada pelo bloco Adicionar à DNC durante a conversa. A chamada nasce na campanha certa, no horário permitido, para o número certo. Quem pediu para não ser contatado sai da base durante a conversa em que pediu, não na próxima importação de lista.
A campanha que não respeita janela gera chamada conectada que o agente atende e o receptor desliga em dois segundos. Cada uma dessas é minuto cobrado. O progresso acompanhado significa que o discador sabe, em tempo real, quantas chamadas estão em andamento, quantas caíram, quantas foram atendidas, e usa isso para alimentar o relatório de campanha sem precisar de ferramenta externa de BI.
O classificador
O CPA, dentro do SipPulse SBC, decide pelo áudio se tem uma pessoa do outro lado. Quando não tem, encerra em cerca de 1 segundo, antes de o agente dizer a primeira palavra. No ponto de operação conservador, nenhuma chamada humana foi interrompida em auditoria manual.
Aqui está o corte que a aritmética acima mostrou: as 3.500 chamadas por dia de conversa com caixa postal deixam de existir. Os 1.450 minutos de IA que elas gerariam não nascem. A chamada é classificada e encerrada na camada de telefonia, não na camada de IA. O agente nunca recebe a chamada. O STT não transcreve, o LLM não processa, o TTS não sintetiza. O minuto de IA não nasce.
A diferença entre o classificador e um filtro de silêncio simples é que o classificador distingue padrão de áudio. Caixa postal tem assinatura acústica: bipe, mensagem gravada, silêncio longo. Ocupado tem tom característico. Número inexistente tem anúncio de operadora. O classificador aprende esses padrões e decide em menos de um segundo, sem esperar o agente descobrir sozinho que está falando com uma máquina.
Os blocos
No NIVA, o caminho determinístico não precisa de modelo de linguagem. Consultar uma API, decidir por condição, transferir para o ramal certo, enviar DTMF para uma URA de terceiro: tudo isso é bloco, não é conversa. O bloco Agente de IA entra só no trecho em que a conversa é o trabalho.
O LLM deixa de ser cobrado nos trechos em que ele não estava resolvendo nada. Uma chamada que começa com validação de CPF por DTMF, consulta saldo em API e só então transfere para o agente de IA se o cliente quiser renegociar tem os dois primeiros trechos resolvidos em bloco. O minuto de IA só começa quando a conversa começa. Se o cliente só quer o saldo, o agente de IA nunca entra na chamada.
A quarta camada é o modelo rodando em GPU própria do cliente, que troca custo variável por minuto por custo fixo de infraestrutura.
O que "local" significa de verdade, com o custo e o ônus
Local não é grátis, e fingir que é perde o leitor técnico na primeira frase.
O cliente disponibiliza as GPUs, no data center dele ou numa nuvem de infraestrutura como Amazon ou Oracle. Os modelos de voz consomem pouca memória: uma GPU de 16 GB já sustenta bom volume.
O modelo de linguagem também pode rodar local. Os modelos são de pesos abertos: Qwen3.8-27B e Qwen3.5-4B, ambos nos repositórios oficiais com esses nomes. Até o 4B entrega resultado utilizável nesse cenário, e é o que torna a execução local viável em hardware modesto. Não se trata de superar modelo fechado em benchmark genérico. Trata-se de resolver a tarefa do agente com custo fixo.
A troca real é a seguinte: custo por minuto vira custo fixo de infraestrutura, e a conta para de crescer com o volume de conversa. Em compensação, o cliente assume o dimensionamento e a operação da GPU, e paga antes de usar. Não há surpresa de fatura, mas há capex e há operação de infraestrutura.
E o áudio não sai da infraestrutura do cliente. Em setor regulado, isso costuma ser o critério que decide a arquitetura antes do preço. A LGPD não proíbe processamento de áudio em nuvem, mas o contrato de processamento de dados que ela exige é mais simples de fechar quando o dado não sai do domínio do cliente. Para uma operação que grava e transcreve milhares de chamadas por dia, a diferença entre o áudio crossing ou não a fronteira do data center é um item de governança, não um detalhe técnico.
A estrutura de preço é um incentivo, não uma acusação
Uma plataforma que cobra por minuto conectado fatura mais quando a chamada improdutiva dura mais. Uma licença por canal simultâneo e um modelo rodando em GPU própria não faturam nada a mais por isso. Não se trata de má-fé de ninguém. Trata-se de para onde o desenho comercial aponta.
Se o fornecedor cobra por minuto, o incentivo dele é que a chamada dure mais, não menos. Se ele licencia por canal, o incentivo dele é que o cliente use o canal com eficiência, porque o cliente que produz mais conversa útil por canal é o cliente que renova a licença e expande canais. O desenho comercial alinha o interesse do fornecedor com o interesse do cliente, ou não alinha.
A plataforma
O SipPulse AI entrega ferramentas de verdade para criar e executar o agente. Endpoint próprio chamado durante a conversa, com credenciais em cofre de secrets fora do prompt: a chave de API do sistema do cliente não entra no contexto do LLM. Base de conhecimento com os documentos do cliente. Catálogos inteiros conectados por MCP.
O agente se comporta como ponto SIP real: atende fila, origina ligação, transfere, recebe dígitos e envia dígitos para URAs de terceiros. Não é um endpoint HTTP que simula telefonia. É telefonia. O agente registra no SBC como um ramal, recebe chamada da fila do discador, negocia codecs, troca SDP, e quando transfere, faz um SIP REFER ou um re-INVITE conforme o destino exige. O trunk entre o agente e o SipPulse SBC é SIP sobre WebSocket ou SIP sobre UDP, conforme a topologia do cliente.
Ao encerrar, um webhook sai com o que foi coletado e o resultado da análise para o CRM ou BI. A pós-análise dispara sozinha, com o mesmo schema de qualidade declarado que avalia o agente humano. A monitoria não é um módulo separado comprado depois. É a mesma estrutura que já roda na operação.
O consumo é em créditos, em real, com impostos inclusos. O reconhecimento de fala é cobrado por minuto de áudio, a síntese por caractere, a geração de texto por token, com AI Budget definindo limite por sessão e cota semanal. O NIVA é licenciado por canal simultâneo, sem cobrança por minuto de contato.
O que decide entre dois fornecedores tecnicamente parecidos
Faturamento no Brasil, em real, com nota fiscal brasileira. Câmbio e tributação de serviço importado saem da conta. Suporte que responde no fuso horário do cliente. E um engenheiro em campo, um forward deployed engineer que estuda o caso do cliente e desenha a operação com ele, em vez de entregar documentação e desejar boa sorte.
A conta que importa
Trinta minutos com o relatório da sua campanha em mão. Você sai com o número de minutos de IA que a operação paga hoje sem ninguém do outro lado, e com o desenho das camadas que cortam isso.
sippulse.com · docs.sippulse.ai · info@sippulse.com · +55 48 3332-8540
Artigos Relacionados

De 110 segundos no menu para 27 de conversa: o que mudou no NIVA 2.0

Novo CPA, de um contêiner a cada 20 chamadas para mil análises em 8 vCPU
