Pesquise quanto custa um agente de IA e você encontra de tudo: assinatura de poucas dezenas de reais por mês, projeto de seis dígitos, "a partir de" sem número nenhum. As faixas raramente coincidem e quase nunca dizem de onde vieram.
Este artigo monta a conta de outro jeito: em três camadas, começando pelo único número que os fornecedores realmente publicam — o custo variável de cada atendimento. É a camada que quase nunca aparece na proposta e a que aparece na fatura no mês em que o agente começa a ser usado de verdade.
Quanto custa um agente de IA, afinal?
Depende menos da tecnologia escolhida e mais de três decisões: o que o agente precisa acessar, quantas conversas vai atender e quem cuida dele depois de pronto. Cada decisão alimenta uma camada diferente da conta.
- Implantação — paga uma vez: escopo, integrações com os sistemas da empresa, base de conhecimento, regras e testes.
- Consumo — pago todo mês, por uso: os tokens do modelo de IA e, se o canal for o WhatsApp oficial, as mensagens cobradas pela Meta.
- Manutenção — paga todo mês, por tempo de gente: atualizar a base, revisar conversas, ajustar integrações e trocar de modelo quando preciso.
A implantação é a que aparece na proposta. O consumo é a que aparece na fatura do fornecedor de IA e do provedor de WhatsApp. A manutenção é a que aparece na agenda de alguém, interno ou contratado.
Um orçamento que traz só a primeira camada não está errado. Está incompleto — e incompleto do jeito que mais surpreende, porque as duas camadas que faltam são justamente as que não acabam.
Por que os preços que circulam não batem entre si?
Porque misturam coisas que não se comparam. Uma assinatura de plataforma de chatbot com IA embutida é produto pronto, com limites de uso definidos pelo fornecedor. Um agente conectado ao CRM, ao ERP e ao WhatsApp oficial é desenvolvimento sob medida. Os dois são vendidos com o mesmo nome.
Há uma segunda razão: a maior parte das tabelas publicadas são faixas próprias de quem vende, sem indicação de base. Elas dão a ordem de grandeza da oferta daquele fornecedor, não do mercado — e quase todas tratam o agente como um custo de implantação que se paga e termina.
Antes de comparar preços, vale decidir se o problema pede mesmo um agente ou um fluxo automatizado, que é mais barato e mais previsível. Esse critério está em agente de IA ou fluxo automatizado. Aqui partimos do ponto em que a resposta já foi "agente" — e a pergunta passa a ser o orçamento.
Quais são as três camadas da conta?
Colocadas lado a lado ao longo de um ano, as três camadas têm formatos muito diferentes. A implantação é um bloco no começo. A manutenção é uma faixa estável. E o consumo é a linha que sobe — no ritmo em que o agente passa a atender mais gente.
Repare na camada do meio. É a única cujo valor cresce exatamente quando o projeto dá certo: mais clientes usando significa mais conversas, e mais conversas significam mais tokens e mais mensagens.
Um agente que ninguém usa custa quase nada por mês. Um agente que resolve custa em proporção ao que resolve. Isso não é defeito — é o modelo de cobrança. O problema é descobrir isso na fatura em vez de no orçamento.
Quanto custa a IA de cada atendimento?
Os fornecedores de modelo cobram por token: pedaços de texto que o modelo lê (entrada) e escreve (saída). É o número mais transparente de toda a conta, porque está publicado em tabela oficial e vale para qualquer cliente.
Traduzindo para orçamento: nesse perfil, cada mil atendimentos custam perto de US$ 3,70 em IA. É pouco — e é por ser pouco que a camada engana. O exemplo descreve uma conversa média de suporte com o modelo mais barato da linha atual; o seu agente pode não se parecer com ela.
A mesma tabela mostra quanto a escolha do modelo pesa. Refazendo a conta do exemplo só com a troca de modelo, e mantendo o mesmo perfil de conversa:
| Modelo | Entrada (US$ por milhão de tokens) | Saída (US$ por milhão de tokens) | Os mesmos 10 mil atendimentos |
|---|---|---|---|
| Claude Haiku 4.5 | 1 | 5 | cerca de US$ 37 (exemplo da própria Anthropic) |
| Claude Sonnet 5 | 2 | 10 | cerca de US$ 74, antes do ajuste do tokenizador |
| Claude Opus 5.5 | 4 | 20 | cerca de US$ 148, antes do ajuste do tokenizador |
Preços: documentação oficial da Anthropic, consultada em 23/09/2026. Última coluna: conta da Alliance, proporcional ao exemplo publicado — válida porque, nos três modelos, a saída custa cinco vezes a entrada.
O ajuste do tokenizador vem da mesma página: os modelos a partir do Claude 4.7 usam um tokenizador novo, que produz aproximadamente 30% mais tokens para o mesmo texto, com variação conforme o conteúdo. O Haiku 4.5 é anterior a essa mudança. Na prática, trocar Haiku por Sonnet 5 ou Opus 5.5 pode custar um pouco mais que o dobro ou o quádruplo.
Nada disso manda usar sempre o modelo mais barato. Manda escolher por tarefa — a própria Anthropic orienta Haiku para tarefas simples, Sonnet para a maior parte das cargas em produção e Opus para o raciocínio mais complexo. Triagem e dúvida frequente raramente pedem o modelo mais caro.
Um último detalhe que muda orçamento em real: a documentação informa que todos os pagamentos à Anthropic são em dólar. Numa proposta em reais, pergunte qual cotação foi usada e quem absorve a variação cambial.
O que faz o consumo crescer mais do que o previsto?
Os 3.700 tokens por conversa são uma média de suporte simples. Quatro fatores empurram o seu número para cima, e nenhum deles aparece na demonstração de um fornecedor.
1. A conversa inteira é relida a cada resposta
O modelo não guarda memória da conversa: a cada nova mensagem, o histórico é enviado de novo como entrada. Por isso uma conversa de vinte trocas custa bem mais que vinte respostas soltas — cada resposta carrega todas as anteriores. Atendimento que se arrasta é atendimento caro.
2. Instruções e base de conhecimento vão junto
As regras do agente, o tom de voz, a política de troca, o catálogo: tudo o que ele precisa saber entra como texto de entrada. É aqui que o cache faz diferença. Pela tabela da Anthropic, o trecho repetido lido do cache custa 10% do preço normal de entrada na maior parte dos modelos.
3. Cada ferramenta tem custo de entrada
Um agente consulta pedido, agenda horário, grava no CRM. Para isso recebe a descrição das ferramentas que pode usar — e descrição é texto cobrado. Só o prompt de sistema que habilita ferramentas soma 496 tokens por requisição no Haiku 4.5, antes da descrição de cada ferramenta e dos resultados que elas devolvem.
4. Recursos extras são cobrados à parte
A busca na web, por exemplo, custa US$ 10 a cada mil buscas na API da Anthropic, além dos tokens do conteúdo encontrado. Um agente que pesquisa a cada pergunta tem uma camada de custo que o agente que só consulta a base interna não tem.
A contrapartida está na mesma documentação: o processamento em lote, para o que não precisa de resposta imediata, tem 50% de desconto na entrada e na saída, e pode ser combinado com o cache. Resumos de conversas para o CRM, classificação de atendimentos antigos e relatórios noturnos cabem nesse modo.
Quanto o WhatsApp cobra pelas mensagens do agente?
Se o agente conversa pelo WhatsApp oficial, entra na conta uma segunda tabela de consumo — a da Meta —, com lógica própria e independente da do modelo de IA.
Duas consequências para o orçamento. A primeira: um agente que responde o cliente dentro da janela não gera custo de mensagem na Meta. A segunda: um agente que dispara — lembrete, oferta, reengajamento — paga a cada template entregue, e o de marketing paga sempre.
O detalhe que o quadro deixa claro: a gratuidade da Meta vale para a mensagem, não para a inteligência. A resposta grátis no WhatsApp continua consumindo tokens no modelo de IA. São duas faturas, com duas regras diferentes.
O valor por mensagem varia por país e por categoria e fica num documento à parte, as tabelas de preço que a Meta disponibiliza por moeda a partir da página oficial de preços. Não use centavos tirados de outro artigo: consulte a tabela vigente no dia do orçamento.
Para quem fatura no Brasil há outra mudança em curso. Desde 1º de julho de 2026, clientes elegíveis com país de faturamento Brasil podem criar contas do WhatsApp Business em real, e a Meta pede que todas as contas desses clientes estejam migradas para real até 30 de junho de 2027. A mecânica completa da cobrança por categoria está em o que a empresa paga de verdade no WhatsApp Business API.
O que entra no custo de criar um agente de IA?
A implantação é trabalho, não licença, e o preço acompanha a quantidade de trabalho. O que mais pesa:
- Integrações: cada sistema que o agente precisa ler ou escrever — CRM, ERP, agenda, loja virtual — é uma frente de desenvolvimento, teste e permissão de acesso.
- Base de conhecimento: organizar política, preço, catálogo e exceções num formato que o agente consiga usar. Em muitos projetos é a etapa mais longa, porque a informação não está escrita em lugar nenhum.
- Regras e limites: o que o agente decide sozinho, quando passa para uma pessoa, o que ele nunca pode prometer.
- Canal: o WhatsApp oficial exige número dedicado, conta comercial verificada e templates aprovados; um widget no site é mais simples.
- Testes com conversa real: rodar o agente sobre atendimentos antigos antes de soltá-lo com cliente.
Um agente que só responde dúvidas a partir de um documento é um projeto pequeno. Um agente que consulta estoque, cria pedido e atualiza o CRM é um projeto de integração de sistemas com uma camada de IA por cima — e a integração costuma ser a maior parte da conta.
É por isso que a pergunta "quanto custa criar um agente" só tem resposta séria depois de outra: o que ele precisa acessar para resolver o problema sem chamar ninguém.
O que encarece um agente de IA depois de pronto?
A manutenção não é suporte técnico eventual. É trabalho recorrente, e a razão é simples: o negócio muda e o agente não percebe sozinho.
- Preço, prazo, política de troca e catálogo mudam — e a base precisa mudar junto, no mesmo dia.
- Conversas precisam ser lidas por amostragem, para achar a resposta errada antes que o cliente ache.
- Modelos saem de linha: a própria tabela da Anthropic lista versões anteriores como aposentadas. Trocar de modelo exige testar de novo.
- Novos fluxos no WhatsApp pedem novos templates, e cada um passa por aprovação.
- Integrações quebram quando o sistema do outro lado é atualizado.
A mesma lógica aparece em plataformas no-code, em que a conta sobe com o uso sem ninguém mexer em nada, como mostramos em ferramentas no-code: a conta que chega depois. Com agente de IA, além da conta, sobe o risco: um agente desatualizado responde errado com toda a segurança.
Quanto custa um agente de IA SDR ou de atendimento?
O tipo de agente muda qual camada pesa mais. A tabela abaixo não traz valores; traz para onde vai o dinheiro em cada caso.
| Tipo de agente | Camada que mais pesa | Por quê |
|---|---|---|
| Atendimento de dúvidas frequentes | consumo | volume alto de conversas curtas; responde dentro da janela, então a tarifa de mensagem tende a ser baixa e os tokens dominam |
| SDR e qualificação de leads | implantação e consumo | precisa ler e gravar no CRM; parte das mensagens é iniciada pela empresa, via template pago |
| Agendamento e status de pedido | implantação | o valor está na integração com agenda ou ERP; muitas vezes um fluxo automatizado resolve sem agente |
| Agente interno, para a equipe | manutenção | a base de conhecimento envelhece rápido e precisa de dono; não há tarifa de WhatsApp |
Leitura da Alliance a partir das regras de cobrança documentadas pela Anthropic e pela Meta
O SDR merece nota à parte. Qualificar quem chegou pelo site ou por anúncio acontece dentro da janela, porque o lead escreveu primeiro. Fazer follow-up com quem sumiu é iniciar conversa — e, se o template for de marketing, ele é cobrado sempre que entregue.
Um agente SDR insistente em follow-up tem uma conta de mensagens que um agente de atendimento não tem. E há regras de uso de IA na própria plataforma que valem antes de qualquer conta, descritas em o que a Meta proíbe na IA do WhatsApp.
Quando a conta de um agente de IA fecha?
Quando três condições aparecem juntas: volume alto de conversas, perguntas que se repetem e regra clara para responder. Volume dilui a implantação. Repetição mantém as conversas curtas e baratas. Regra clara reduz a manutenção e o risco de erro.
A conta não fecha — ou fecha mal — quando o volume é baixo e a implantação nunca se paga; quando cada conversa é única e o agente passa quase tudo para uma pessoa, e a empresa paga os dois; ou quando a resposta depende de um julgamento que ninguém escreveu.
Um jeito honesto de comparar, em quatro linhas:
- Divida a implantação pelos meses de uso esperados: é o custo mensal amortizado.
- Some o consumo de IA: conversas por mês × tokens por conversa × preço do modelo.
- Some as mensagens pagas no WhatsApp: templates entregues × tarifa da categoria.
- Some a manutenção mensal e divida o total pelo número de conversas resolvidas sem pessoa. Compare com o custo de uma conversa atendida pela equipe.
Conversas que o agente passa adiante não contam a favor dele. É o número que separa o agente que economiza do agente que só adiciona uma etapa.
Quais erros mais aparecem no orçamento de um agente de IA?
- Orçar só a implantação e descobrir o consumo na primeira fatura cheia.
- Projetar o consumo com a demonstração do fornecedor, que usa conversas curtas e nenhuma ferramenta.
- Escolher o modelo mais capaz para tudo, inclusive para triagem.
- Tratar resposta grátis no WhatsApp como atendimento grátis — os tokens continuam sendo cobrados.
- Planejar follow-up ativo sem contar os templates de marketing, cobrados sempre que entregues.
- Esquecer a variação cambial numa conta faturada em dólar.
- Não nomear quem mantém a base de conhecimento depois da entrega.
Nenhum desses erros inviabiliza o projeto. Todos fazem o projeto parecer mais caro do que o prometido — e é isso, muito mais que a tecnologia, que costuma desligar um agente que funcionava.
Por onde começar hoje
- Levante o volume real: conversas por mês, quantas o cliente inicia e quantas a empresa inicia.
- Separe as perguntas que se repetem das que exigem julgamento. O agente começa pelas primeiras.
- Liste os sistemas que ele precisaria acessar. Essa lista é o tamanho da implantação.
- Faça a conta de consumo com a tabela oficial do modelo e a tabela de preços da Meta, e deixe folga para conversas longas e ferramentas.
- Peça propostas que separem as três camadas, com o modelo de IA e a cotação de câmbio nomeados.
- Defina, antes de contratar, quem mantém a base de conhecimento depois da entrega.
É o caminho do diagnóstico à ação: primeiro entender onde o atendimento trava, depois decidir a ferramenta. O diagnóstico gratuito de marketing avalia tecnologia e experiência do cliente junto com as demais dimensões. E quando a decisão já for construir, o desenho das três camadas — implantação, consumo projetado e manutenção na mesma proposta — é parte do trabalho de agentes de IA da Alliance.

