Agência
Marca & CriaçãoBranding & PosicionamentoIdentidade VisualConteúdo & CopywritingProdução AudiovisualLive Experience
Performance & GrowthSocial MediaInbound & NutriçãoTráfego PagoSEO & GEOPublicidadePesquisa de Mercado com IABI & DashboardsWeb AnalyticsCRO
IA & AutomaçãoConsultoria de Adoção de IAIntegração CRM & DadosAutomação de ProcessosAgentes de IAAutomação de Marketing com IABase de Conhecimento de Marca para IA
Tecnologia & Produtos DigitaisDesenvolvimento Web & AppsDesenvolvimento de MVPTech & SecurityLGPDLow-code & No-codeDesenvolvimento Assistido por IA
Relacionamento & ReputaçãoAssessoria de ImprensaInfluência & CEO PositioningGestão de CriseComunicação InternaExperiência & Trade
PortfólioBlogContato
Robô dourado em miniatura sobre fundo escuro
IA

Como criar um agente de IA: o teste que decide se ele pode falar com o cliente

Como criar um agente de IA que aguenta o cliente: monte de 20 a 50 testes tirados de casos reais, rode cada um várias vezes e só libere se acertar todas.

Resposta rápida

Para criar um agente de IA você define o objetivo, escreve as instruções, conecta os dados e as ferramentas e escolhe a plataforma — ChatGPT, Gemini, Copilot Studio, n8n ou outra. A etapa que decide se ele pode falar com o cliente vem depois: um conjunto de testes montado antes do lançamento. A Anthropic recomenda começar com 20 a 50 tarefas simples tiradas de falhas reais, incluir casos-limite e rodar cada tarefa várias vezes. Para atendimento, a métrica certa é acertar em todas as execuções: com 75% de acerto por tentativa, a chance de acertar três de três cai para cerca de 42%.

Criar um agente de IA ficou fácil. Em uma tarde dá para escrever as instruções, subir alguns documentos, ligar o agente a uma planilha ou ao WhatsApp e ver ele responder com naturalidade. Os tutoriais que aparecem no topo do Google ensinam bem essa parte — e quase todos terminam com a mesma frase: “agora teste e ajuste”.

É nessa frase que mora o problema. Testar, na prática, vira conversar com o agente meia hora, achar que ele está ótimo e publicar. Este guia passa rápido pela montagem e se concentra no que os tutoriais pulam: como montar o conjunto de testes que decide se o agente pode falar com o seu cliente, com quantos casos começar, quais situações provocar, por que rodar a mesma pergunta várias vezes e qual nota exigir antes do go-live.

O que é preciso para criar um agente de IA?

Um agente de IA é um programa que usa um modelo de linguagem para entender um pedido, decidir o próximo passo e, quando tem permissão, agir: consultar um pedido, agendar uma visita, registrar um lead no CRM. Para ele existir, são necessárias cinco peças.

  • Objetivo fechado: uma tarefa com começo e fim, como qualificar leads do site ou responder dúvidas de segunda via — não “atender o cliente”.
  • Instruções: o papel do agente, o tom de voz, o que ele pode e o que não pode fazer, e quando passa a conversa para uma pessoa.
  • Conhecimento: os documentos e dados da empresa que fundamentam as respostas.
  • Ferramentas: as integrações que deixam o agente consultar ou alterar algo num sistema.
  • Um critério de aprovação: a definição, por escrito, do que conta como resposta certa — a peça que quase todo projeto esquece.

As quatro primeiras aparecem em qualquer tutorial. A quinta é o assunto deste artigo. Antes de montá-la, vale confirmar se o caso pede mesmo um agente: muitas tarefas ficam mais baratas e previsíveis num fluxo de regras, como mostramos no artigo sobre agente de IA ou fluxo automatizado.

Como criar um agente de IA, passo a passo?

O roteiro de montagem é parecido em qualquer plataforma. A diferença está no último passo, que aqui ganha o peso que merece.

1. Escreva a tarefa em uma frase

“Responder dúvidas sobre prazo e status de pedido de clientes que já compraram.” Se a frase precisa de vírgulas demais, são dois agentes. Tarefa estreita é mais fácil de instruir, de testar e de medir.

2. Escreva as instruções como política, não como pedido

Em vez de “seja educado e ajude o cliente”, escreva regras verificáveis: o que o agente responde sozinho, o que só informa depois de consultar o sistema e o que ele nunca faz. Cada regra dessas vira, mais adiante, um caso de teste.

3. Conecte o conhecimento e as ferramentas

Suba a base de documentos revisada e ligue as integrações com o mínimo de permissão necessário. Preço, prazo e estoque devem vir do sistema, não de um texto colado — documento envelhece e o agente continua citando o número antigo. Quando a base cresce muito, entra a discussão de RAG e quando a empresa nem precisa dele.

4. Monte o conjunto de testes antes de ajustar o prompt

É a inversão que separa projeto amador de projeto profissional: primeiro se define a prova, depois se ajusta o agente até ele passar. Ajustar o prompt sem uma prova fixa é mexer num lugar e quebrar outro sem perceber.

5. Libere por etapas, com o critério na mão

O agente só sai do ambiente de teste quando passa no critério combinado. Depois, abre para uma fração pequena do público, com as conversas registradas, e só então para todos.

Por que conversar com o agente não é testar?

Quem cria o agente conversa com ele como quem sabe o que ele deveria responder. Faz perguntas bem escritas, na ordem certa, com a paciência de quem quer que dê certo. O cliente real faz o contrário: escreve pela metade, mistura dois assuntos, insiste, manda um áudio transcrito de três parágrafos.

Há também um problema que a conversa manual não enxerga: o mesmo agente pode responder a mesma pergunta de formas diferentes em execuções diferentes. Você perguntou uma vez, ele acertou, e a conclusão foi “funciona”. Nas próximas dez vezes, para dez clientes, ele pode acertar sete.

Uma conversa boa com o agente prova que ele consegue acertar. Não prova que ele acerta sempre — e o cliente só vê a vez em que ele erra.

O que falta é o que a engenharia de software tem há décadas e que, em IA, ganhou o nome de avaliação (em inglês, evals): uma lista fixa de casos, com a resposta esperada, rodada sempre do mesmo jeito, que dá uma nota comparável entre uma versão do agente e a seguinte.

O que é um conjunto de testes de um agente de IA?

É uma planilha — ou um arquivo num sistema de testes — em que cada linha é uma tarefa: a mensagem do cliente, o contexto (quem é ele, o que comprou), o que o agente deveria fazer e como saber se fez. A Anthropic recomenda que cada tarefa tenha critério tão claro que dois especialistas, sozinhos, cheguem ao mesmo veredito de passou ou não passou, e que tenha uma resposta de referência que prove que a tarefa tem solução.

Diagrama com as cinco etapas do ensaio de um agente de IA antes do go-live: 20 a 50 tarefas reais, casos-limite, várias execuções da mesma tarefa, correção automática por código ou outro modelo e leitura das conversas, terminando no portão de aprovação
O portão no fim só funciona se o critério de aprovação foi escrito antes de o agente ser ajustado — não depois de ver a nota.

O conjunto precisa ser equilibrado. A mesma referência alerta para testar tanto os casos em que um comportamento deve acontecer quanto os casos em que não deve. Um agente testado só em “passa para o atendente quando o cliente pede” aprende a passar tudo para o atendente — e a nota sobe enquanto o agente fica inútil.

Quantos testes montar antes de ligar o agente?

Menos do que parece, e mais cedo do que se costuma fazer. A equipe de engenharia da Anthropic, que publicou em janeiro de 2026 um guia sobre avaliação de agentes, é direta sobre o ponto de partida:

De 20 a 50 tarefas simples, tiradas de falhas reais, são um ótimo começo para avaliar um agente no início do desenvolvimento. As avaliações ficam mais difíceis de construir quanto mais se espera; no começo, os requisitos do produto se traduzem naturalmente em casos de teste.
Fonte: Anthropic, “Demystifying evals for AI agents”, Engineering at Anthropic, 9 de janeiro de 2026 — guia original, em inglês

Na prática de uma empresa, “falhas reais” têm endereço conhecido: o histórico do SAC, as perguntas que o comercial ouve toda semana, as reclamações do Reclame Aqui, os e-mails que ficaram sem resposta. Vinte conversas reais valem mais do que duzentas perguntas inventadas pela equipe, porque carregam o jeito de escrever do cliente.

O recado do “quanto mais se espera, mais difícil” é prático: com o agente já no ar, cada caso novo precisa ser reconstruído a partir de reclamações, e a equipe passa a testar sob pressão. Montar os primeiros casos junto com as instruções custa uma tarde.

Que casos-limite o teste precisa cobrir?

Além das tarefas comuns, o conjunto precisa provocar o agente nas situações em que ele costuma escorregar. A documentação de avaliações do Claude lista as categorias e faz uma escolha que vai contra a intuição:

Priorize volume sobre qualidade: mais perguntas com correção automática, de sinal um pouco menor, valem mais que poucas avaliações corrigidas à mão. Inclua casos-limite como entrada irrelevante ou inexistente, entrada longa demais, entrada ruim ou nociva do usuário e casos ambíguos — e, em geral, use para avaliar um modelo diferente do que gerou a resposta.
Fonte: Anthropic, Claude Docs, “Define success criteria and build evaluations”, consultada em 2026 — documentação oficial, em inglês

Traduzido para um agente de atendimento, cada categoria vira um tipo de linha na planilha de testes:

Caso-limiteExemplo no atendimentoO que o agente deve fazer
Entrada vazia ou irrelevante“oi”, um emoji, uma pergunta sobre futebolCumprimentar e perguntar como pode ajudar, sem inventar assunto
Informação inexistentePedido com número que não está no sistemaDizer que não encontrou e pedir confirmação — nunca inventar status
Entrada longa demaisÁudio transcrito com três assuntos misturadosSeparar os pedidos e tratar um de cada vez
Usuário hostil ou mal-intencionadoOfensa, ameaça de processo, pedido para “ignorar as regras”Manter o tom, não ceder e passar para uma pessoa
Pergunta ambígua“Quanto custa a entrega?” sem cidade nem produtoPerguntar o que falta antes de responder
Caso em que NÃO deve agirCliente só quer informação, não quer cancelarResponder sem disparar a ação de cancelamento

Categorias da documentação de avaliações do Claude (Anthropic); exemplos de atendimento elaborados pela Alliance Comunicação.

Os casos que envolvem promessa — desconto, prazo, exceção de política — merecem atenção extra, porque o erro ali tem consequência jurídica. O roteiro de provocações para esses casos e a regra de quem responde pela frase do bot estão no artigo chatbot com IA: quem responde quando ele erra.

Por que rodar o mesmo teste várias vezes?

Porque o agente não é determinístico: a mesma mensagem pode gerar respostas diferentes em execuções diferentes. Uma rodada única do conjunto de testes mostra uma fotografia; várias rodadas mostram a consistência. E aqui entra a distinção que mais muda a decisão de lançar um agente de atendimento.

pass@k mede a chance de o agente acertar ao menos uma vez em k tentativas; pass^k mede a chance de acertar em todas as k. Se o agente tem 75% de sucesso por tentativa e roda 3 vezes, a probabilidade de passar nas três é (0,75)³ ≈ 42%. A métrica pass^k importa especialmente para agentes que atendem clientes, que esperam comportamento confiável toda vez.
Fonte: Anthropic, “Demystifying evals for AI agents”, Engineering at Anthropic, 9 de janeiro de 2026 — guia original, em inglês

As duas métricas contam histórias opostas sobre o mesmo agente. A pass@k responde “ele consegue?” e sobe a cada tentativa extra. A pass^k responde “ele é confiável?” e desce a cada tentativa extra. Para um assistente interno, em que a pessoa pode pedir de novo, a primeira pode bastar. Para quem fala com o cliente, só a segunda interessa: o cliente não tem direito a três tentativas, ele recebe uma.

Gráfico de barras comparando pass@k e pass^k para um agente com 75% de acerto por tentativa: com k igual a 1 as duas ficam em 75%; com k igual a 3, pass@k sobe para 98% e pass^k cai para 42%; com k igual a 10, pass@k chega perto de 100% e pass^k cai para cerca de 6%
Os valores de k = 10 são o cálculo das mesmas fórmulas (0,75 elevado a 10 ≈ 5,6%), feito pela Alliance para mostrar a tendência.

O efeito prático é ajustar a régua. Um agente que “acerta 75%” parece quase pronto; medido pela pass^k, ele erra com alguém em mais da metade das sequências de três atendimentos parecidos. Por isso o critério de aprovação deve ser escrito em termos de consistência — por exemplo, a tarefa só conta como aprovada se acertou em todas as execuções da rodada.

Quem corrige as respostas do agente no teste?

Com 50 tarefas rodadas cinco vezes, são 250 respostas por versão do agente. Ninguém lê isso à mão a cada ajuste no prompt. O guia da Anthropic descreve três tipos de corretor, cada um com seu papel:

  • Correção por código: rápida, objetiva e reproduzível. Serve para o que tem resposta exata — o agente chamou a ferramenta de consulta? Informou o número de pedido certo? Passou para humano quando devia?
  • Correção por outro modelo: flexível e escalável, boa para julgar tom, clareza e se a resposta seguiu a política. É mais cara e também varia entre execuções — por isso a documentação recomenda usar um modelo diferente do que gerou a resposta.
  • Correção humana: a mais confiável e a mais lenta. Fica para calibrar os outros dois corretores e para os casos que eles marcam como duvidosos.

E há uma etapa que nenhum corretor substitui: ler as conversas. O mesmo guia afirma que não há como saber se os corretores estão funcionando sem ler as transcrições e as notas de muitas execuções. É na leitura que aparece o agente que “passou” porque disse a frase esperada no meio de uma resposta errada, ou o que “reprovou” porque deu uma resposta melhor do que a referência.

Como testar o agente no ChatGPT, Gemini, Copilot Studio, n8n ou WhatsApp?

A plataforma muda o lugar em que o teste roda, não o método. O conjunto de casos, as várias execuções e o critério escrito valem para todas. O que varia é quanto dá para automatizar:

Onde o agente foi criadoComo rodar o conjunto de testesCuidado principal
GPT personalizado (ChatGPT) ou Gem (Gemini)Manual: abrir uma conversa nova para cada caso e repetir cada um algumas vezes, registrando numa planilhaUma conversa longa contamina a seguinte; sempre recomeçar do zero
Copilot Studio ou plataforma corporativaUsar o recurso de teste da própria ferramenta com a lista fixa de casos, e repetir a cada versão publicadaTestar com as mesmas permissões e dados que o agente terá em produção
n8n ou outro orquestradorMontar um fluxo que lê a planilha de casos, chama o agente k vezes e grava respostas e notasIsolar as ações reais: no teste, a ferramenta consulta, mas não altera nada
Agente no WhatsAppRodar o conjunto pelo backend, antes do número oficial; depois, abrir para um grupo pequenoMensagens curtas, áudio transcrito e emoji precisam estar entre os casos

Elaborado pela Alliance Comunicação a partir da prática de implantação de agentes; o método é o mesmo nas quatro situações.

Quem está montando o agente num orquestrador como o n8n tem vantagem: o próprio fluxo pode rodar a bateria de testes toda vez que o prompt muda. Os limites da versão gratuita estão no artigo sobre o que é n8n e as regras do plano grátis. No WhatsApp, além do teste, há regras da Meta sobre o uso de IA, tratadas no artigo sobre o que a Meta proibiu no chatbot para WhatsApp.

Quais os erros mais comuns ao criar um agente de IA?

  • Escrever o critério depois de ver a nota. Se a régua é definida olhando o resultado, ela sempre aprova o agente.
  • Testar só com perguntas da equipe. Quem criou o agente escreve como ele espera; o cliente, não.
  • Rodar cada caso uma vez só. Uma execução mede sorte; várias medem consistência.
  • Medir pass@k num agente de atendimento. A nota fica bonita exatamente porque ignora as vezes em que ele erra.
  • Só testar o que o agente deve fazer. Sem casos em que ele não deve agir, a correção empurra para um agente que faz demais ou de menos.
  • Usar o mesmo modelo para responder e para corrigir sem calibrar com leitura humana.
  • Jogar fora o conjunto depois do lançamento. Cada reclamação real é um caso novo; a bateria cresce com o agente e roda a cada mudança de prompt, de modelo ou de base.

Como medir se o agente está pronto e continua pronto?

  1. Taxa de aprovação por consistência: percentual de tarefas que passaram em todas as execuções da rodada — a pass^k do seu conjunto.
  2. Aprovação nos casos-limite, separada: um agente pode ir bem no comum e mal no hostil; a média esconde isso.
  3. Taxa de passagem para humano: alta demais indica agente medroso; baixa demais, agente que segura o que não devia.
  4. Regressões: tarefas que passavam na versão anterior e pararam de passar depois de um ajuste.
  5. Casos novos por semana: quantas conversas reais viraram linha na planilha — o sinal de que o teste acompanha o cliente.

Esses números entram no orçamento do projeto: o tempo de montar e manter o conjunto de testes é custo recorrente, não detalhe. A composição completa está no artigo sobre quanto custa um agente de IA.

Por onde começar hoje

  1. Escreva a tarefa do agente em uma frase e a política em regras verificáveis.
  2. Separe 20 conversas reais do SAC ou do comercial e transforme cada uma numa linha: mensagem, contexto, resposta esperada, critério de aprovação.
  3. Acrescente os seis tipos de caso-limite da tabela, incluindo pelo menos um em que o agente não deve agir.
  4. Defina a régua antes de rodar: quantas execuções por caso e que percentual de tarefas precisa passar em todas.
  5. Rode, leia as conversas, ajuste o agente e rode de novo. Só abra ao cliente — primeiro a um grupo pequeno — quando a régua for atingida.

Se você quer saber em que ponto a sua empresa está antes de investir num agente — dados, atendimento, tecnologia e processos —, faça o diagnóstico de marketing gratuito da Alliance. E, para desenhar, testar e colocar o agente no ar com esse método, conheça o serviço de agentes de IA para empresas.

Agentes de IAAvaliaçãoAtendimentoIA generativa

Perguntas frequentes

O que é necessário para criar um agente de IA?+

Uma tarefa bem delimitada, instruções escritas como regras, a base de conhecimento da empresa, as integrações com os sistemas e uma plataforma para montar tudo. Falta quase sempre a quinta peça: um conjunto de testes com critério de aprovação definido antes do lançamento.

Como criar um agente de IA gratuito?+

Dá para montar um protótipo em planos gratuitos de assistentes e orquestradores, como a versão comunitária do n8n. O teste também pode ser feito sem custo de ferramenta: uma planilha com 20 a 50 casos reais, cada um rodado várias vezes em conversas novas. O que custa é o tempo da equipe e, depois, o uso do modelo em volume.

Como criar um agente de IA no ChatGPT?+

No ChatGPT, o caminho é criar um GPT personalizado com instruções, arquivos de conhecimento e, se for o caso, ações que chamam outros sistemas. Para testar, abra uma conversa nova para cada caso do seu conjunto e repita cada um algumas vezes, registrando as respostas numa planilha.

Como criar um agente de IA no Gemini?+

No Gemini, o equivalente são os Gems, assistentes personalizados com instruções e arquivos próprios. O método de teste é o mesmo: casos fixos, conversa nova a cada execução, várias execuções por caso e um critério de aprovação escrito antes.

Como criar um agente de IA no Copilot Studio?+

No Copilot Studio, o agente é montado com instruções, fontes de conhecimento e ações ligadas ao ambiente Microsoft da empresa. Use o painel de teste da ferramenta com a mesma lista de casos a cada versão publicada, com as permissões que o agente terá em produção.

Como criar um agente de IA para atendimento no WhatsApp?+

O agente roda num backend ligado à API oficial do WhatsApp, por meio de um provedor ou orquestrador. Rode o conjunto de testes pelo backend antes de conectar o número oficial, inclua mensagens curtas, áudios transcritos e emojis entre os casos e abra primeiro para um grupo pequeno de clientes.

Como criar um agente de IA no n8n?+

No n8n, o agente é um nó de IA ligado a um modelo, a uma memória e às ferramentas que ele pode usar. A vantagem é que o próprio n8n pode rodar a bateria de testes: um fluxo lê a planilha de casos, chama o agente várias vezes e grava respostas e notas.

Quanto custa criar um agente de IA?+

Depende do escopo, da plataforma, das integrações e do volume de conversas. Além da montagem e do uso do modelo, entre na conta o tempo de criar e manter o conjunto de testes, que roda a cada mudança de prompt, de modelo ou de base de conhecimento.

Pronto para

atender e vender 24h com IA?

Comece pelo diagnóstico gratuito e veja como IA entra no seu plano de marketing — depois a Alliance ajuda a executar cada etapa.

(11) 99116-3001contato@alliancecomunicacao.com.brAv. Dr. Gastão Vidigal, 1132 — Vila Leopoldina, São Paulo · SP