Quem tem um site comercial com algumas centenas de visitas por semana costuma ouvir a mesma recomendação: teste antes de mudar. O problema é que o teste A/B, o mais conhecido, precisa de milhares de visitantes por versão para separar efeito de acaso — e a maioria das páginas de empresa média nunca chega lá. Sobra a pergunta: como descobrir o que está errado sem tráfego para provar estatisticamente?
A resposta mais barata é sentar cinco pessoas na frente da página e assistir. Este guia explica o teste de usabilidade do ponto de vista de quem precisa que o site venda: o que a famosa regra dos cinco usuários diz de verdade, em que casos ela quebra, como conduzir as sessões e, principalmente, como transformar o que essas pessoas travaram em uma fila de correções ordenada por impacto na conversão.
O que é teste de usabilidade?
Teste de usabilidade é um método de pesquisa em que uma pessoa do público do site recebe uma tarefa realista — "encontre o plano que serve para uma empresa de dez funcionários e peça uma proposta" — e tenta cumpri-la enquanto alguém observa. Ela pensa em voz alta, o facilitador não ajuda, e a sessão é gravada. O que interessa não é a opinião da pessoa sobre o site, é o que ela faz: onde hesita, onde clica errado, onde desiste.
A diferença para uma pesquisa de satisfação é essa. Perguntar "o site é fácil de usar?" produz respostas educadas. Pedir que a pessoa peça um orçamento e ver que ela passa quarenta segundos procurando o botão produz um fato. Por isso o teste de usabilidade entrega o porquê de um número ruim no Analytics: a taxa de abandono mostra que as pessoas saem; a sessão mostra em qual campo, rótulo ou dúvida elas saíram.
Ele pode ser moderado (com facilitador ao vivo, presencial ou por videochamada) ou não moderado (a pessoa recebe as tarefas numa plataforma e grava a própria tela sozinha). Para site comercial, o moderado remoto costuma ser o melhor custo-benefício: dá para perguntar "o que você esperava encontrar aqui?" no momento exato da hesitação.
De onde vem a regra dos cinco usuários?
A regra é de Jakob Nielsen, cofundador da Nielsen Norman Group (NN/g), uma das referências mais citadas em usabilidade. No artigo de Jakob Nielsen sobre testar com cinco usuários, publicado em 18 de março de 2000, ele parte de uma fórmula: a proporção de problemas encontrados com n usuários é 1 − (1 − L)ⁿ, em que L é a fatia de problemas que um único usuário revela.
Na média dos projetos que a NN/g havia estudado, L ficava em 31%. Com esse valor, a curva sobe rápido no começo e achata logo depois — e é desse achatamento que vem a recomendação de parar em cinco. O ponto que se perde quando a regra vira frase de efeito é o que vem logo em seguida no mesmo texto: Nielsen não diz que cinco pessoas bastam para o projeto inteiro. Diz que cinco bastam por rodada.
Por que cinco pessoas encontram 85% dos problemas — e o que isso não quer dizer?
A lógica é de sobreposição. A primeira pessoa revela muita coisa nova. A segunda repete parte do que a primeira travou e acrescenta um pouco. A terceira já repete quase tudo. Quando chega a quinta, quase todo problema que ela encontra já apareceu antes — você está pagando para ver o mesmo erro de novo.
Três leituras erradas são comuns. A primeira: "85% dos problemas do site". Não — são 85% dos problemas que aquelas tarefas, com aquele perfil de pessoa, conseguem revelar. Se o roteiro não pede que ninguém compare planos, nenhum problema da página de planos vai aparecer, com cinco ou com cinquenta participantes.
A segunda: "31% vale para o meu site". O L é uma média de projetos estudados pela NN/g; o seu pode ser maior ou menor. Página simples, com uma tarefa só, tende a ter problemas que aparecem para quase todos. Sistema complexo, com muitos caminhos, esconde problemas que só uma minoria encontra.
A terceira, e a mais cara: "então testo cinco pessoas uma vez e pronto". É exatamente o oposto do que o artigo recomenda, como mostra a seção seguinte.
Por que três rodadas de cinco valem mais do que uma de quinze?
O raciocínio é de orçamento. Quinze pessoas num único estudo encontram quase todos os problemas daquela versão da página — mas a partir da sexta pessoa, cada sessão confirma o que já se sabia. As mesmas quinze, divididas em três ciclos, fazem trabalho diferente em cada um:
- Rodada 1 encontra os problemas grandes — os que travam quase todo mundo. Você corrige.
- Rodada 2 confere se a correção resolveu ou se criou um problema novo (acontece com frequência: o botão que ficou mais visível passou a competir com o formulário). E, com os bloqueios grandes fora do caminho, as pessoas chegam mais longe na tarefa e revelam o que estava atrás deles.
- Rodada 3 encontra o que sobrou — inclusive os problemas mais sutis, que só aparecem quando a navegação básica deixou de atrapalhar.
Para quem vende, essa é a parte que importa. Um estudo grande produz um relatório; três estudos pequenos produzem uma página melhor. O teste de usabilidade só vira conversão quando o achado vira correção, e a correção é testada de novo.
Quando a regra dos cinco não vale?
A própria NN/g documenta as exceções — e elas aparecem em sites comerciais com mais frequência do que se imagina. A primeira é o site que atende públicos muito diferentes entre si.
Pense numa distribuidora que vende para lojista e para consumidor final no mesmo site, ou numa escola com páginas para pais e para empresas que contratam cursos. Cinco pessoas misturadas podem render quatro de um perfil e uma do outro — e a jornada do segundo grupo fica praticamente sem teste.
As outras exceções têm a ver com o tipo de estudo. Na revisão da Nielsen Norman Group sobre quantos usuários testar, de 3 de junho de 2012, Nielsen separa o teste qualitativo — o que busca entender o que dá errado — dos estudos que precisam de número.
| Situação | Quantas pessoas | O que o estudo entrega |
|---|---|---|
| Teste qualitativo, um público | 5 por rodada, em 3 rodadas | Onde e por que as pessoas travam |
| Dois públicos distintos | 3 a 4 de cada grupo | Os problemas de cada jornada |
| Três ou mais públicos | 3 de cada grupo | Cobertura mínima por perfil |
| Estudo quantitativo (tempo, taxa de sucesso) | Ao menos 20 | Números com margem de erro aceitável |
| Card sorting (organizar menu e categorias) | Ao menos 15 por grupo | Como o público agrupa os assuntos |
| Eyetracking com mapa de calor | 39 | Mapa de calor do olhar estável |
Nielsen Norman Group: "Why You Only Need to Test with 5 Users" (2000) e "How Many Test Users in a Usability Study?" (2012). Organização da Alliance Comunicação.
Um alerta prático sobre a última linha: o mapa de calor de cliques e rolagem das ferramentas de gravação de sessão não é eyetracking. Ele mede onde o mouse foi, não onde o olho foi, e se apoia no tráfego real da página — outro tipo de evidência, útil, mas que não substitui ver uma pessoa tentando cumprir a tarefa.
Qual a diferença entre teste de usabilidade e teste A/B?
Os dois são complementares e respondem perguntas diferentes. O teste A/B mede qual versão converte mais, com o tráfego real; o teste de usabilidade mostra por que uma versão não converte, com poucas pessoas observadas. No guia sobre quanto tráfego e quanto tempo um teste A/B precisa, a recomendação para site de pouco tráfego é justamente trocar o experimento por evidência qualitativa — e o teste de usabilidade com cinco pessoas é a mais direta delas.
| Teste de usabilidade | Teste A/B | |
|---|---|---|
| Pergunta que responde | Por que as pessoas não concluem a tarefa? | Qual versão gera mais conversões? |
| Quantas pessoas | 5 por rodada (com as exceções da NN/g) | Milhares por versão, conforme conversão-base e efeito |
| Precisa de tráfego no site? | Não — os participantes são recrutados | Sim, e é o que define a duração |
| Quando rodar | Antes de lançar, antes de redesenhar, ou quando o A/B não fecha a conta | Quando há duas soluções plausíveis e tráfego suficiente |
| O que entrega | Lista de problemas com contexto e gravação | Diferença de conversão com significância estatística |
| Risco principal | Roteiro ruim gera achado irrelevante | Encerrar cedo e declarar vencedor por acaso |
Comparativo elaborado pela Alliance Comunicação.
Na prática, o caminho mais produtivo é usar os dois em sequência: o teste de usabilidade gera as hipóteses, o A/B decide entre elas quando há tráfego para isso. Quem pula a primeira etapa costuma testar a cor do botão enquanto o formulário pede CNPJ de quem ainda não decidiu comprar.
Como fazer um teste de usabilidade na prática?
O roteiro abaixo é o mínimo que funciona para um site comercial ou uma landing page. Ele cabe em uma semana de trabalho por rodada, sem laboratório.
1. Defina a tarefa que paga as contas
Comece pela conversão: pedir orçamento, agendar visita, comprar, baixar o material. Escreva de duas a quatro tarefas realistas, com contexto ("você precisa trocar o sistema de ponto da sua empresa de 40 funcionários até o mês que vem"), sem usar as palavras que aparecem nos botões — senão você testa a capacidade de achar uma palavra, não a de entender a página.
2. Recrute pelo perfil, não pela conveniência
Cinco pessoas que se parecem com quem compra. Colegas de trabalho e parentes conhecem a empresa demais e são gentis demais. Se o site atende dois públicos, aplique a regra da NN/g: três ou quatro de cada. Clientes recentes e leads que não fecharam são uma fonte barata e honesta.
3. Conduza sem ajudar
Peça que a pessoa pense em voz alta. Quando ela travar, o impulso é explicar — resista. Pergunte "o que você esperava que acontecesse?" e anote. Cada sessão leva de 30 a 45 minutos; grave a tela e a voz, com autorização por escrito.
4. Anote o que aconteceu, não o que a pessoa achou
Para cada tarefa, registre: concluiu ou não, quanto tempo levou, onde hesitou e o que disse no momento. "Achei bonito" não é dado. "Rolou a página três vezes procurando o preço e desistiu" é.
5. Consolide por problema, não por pessoa
Ao fim das cinco sessões, liste os problemas e marque quantas pessoas esbarraram em cada um. Problema que travou três ou mais é estrutural. Problema que apareceu uma vez merece nota, não pânico — pode ser o perfil daquela pessoa.
6. Corrija e marque a próxima rodada
A rodada só termina quando há data para a próxima. Sem isso, o teste vira um relatório que ninguém lê.
Quais perguntas fazer — e quais evitar?
As melhores perguntas acontecem durante a tarefa, no momento da hesitação, e são abertas: "o que você está procurando agora?", "o que esse botão vai fazer?", "o que te faria desistir aqui?". Depois da tarefa, vale pedir uma nota de dificuldade de 1 a 5 e perguntar o que faltou para a pessoa se sentir segura em seguir.
Evite três tipos de pergunta. As que induzem ("você achou o formulário simples, certo?"), as que pedem previsão de comportamento ("você compraria por aqui?") — as pessoas são péssimas em prever o que fariam — e as que pedem opinião de design ("prefere azul ou verde?"). Essas últimas são trabalho do teste A/B, quando houver tráfego, ou de quem desenha a página.
O participante não está sendo testado. A página está. Quando ele erra, o erro é dela.
Como transformar o que as cinco pessoas travaram em correção da página?
É aqui que a maioria dos testes morre. A rodada termina com uma lista de vinte problemas, todos parecem importantes, e nada é corrigido porque não há critério de ordem. Para site comercial, o critério é um só: impacto na conversão. Problema que impede a pessoa de pedir orçamento vem antes de problema que a deixa irritada com o menu.
Ordene a fila por três perguntas. Quantas das cinco pessoas esbarraram nisso? Em que etapa do caminho até a conversão — antes do formulário, no formulário, depois dele? Quanto custa corrigir? O cruzamento disso diz o destino de cada achado.
- Corrija direto quando o problema é óbvio e o conserto é barato: link quebrado, campo obrigatório que não precisava existir, rótulo que três pessoas leram errado, preço que ninguém achou. Não há o que testar — há o que consertar. Acompanhe a taxa de conversão no antes e depois, no mesmo período do mês, sabendo que essa comparação não isola a causa.
- Leve para teste A/B quando existem duas soluções plausíveis e ninguém sabe qual funciona melhor — página longa ou curta, formulário em uma ou duas etapas — e o tráfego da página cabe na amostra. Se não cabe, escolha a solução que o teste de usabilidade favoreceu e confira na próxima rodada.
- Faça nova rodada de cinco quando a correção mexe no fluxo principal ou no texto que explica a oferta. Mudança grande corrige um problema e pode criar outro; só outra rodada mostra.
O resultado é uma fila curta e ordenada, que a equipe consegue executar em semanas. É o mesmo raciocínio de encontrar em que etapa a conversão vaza antes de mexer na página: primeiro onde, depois por quê, por último o quê.
Quais os erros mais comuns no teste de usabilidade?
- Testar uma vez só. É a leitura errada da regra dos cinco. Uma rodada sem a segunda não confirma se a correção funcionou.
- Misturar públicos sem perceber. Cinco participantes de perfis diferentes viram cinco amostras de uma pessoa. Separe os grupos e use três ou quatro de cada.
- Usar a regra dos cinco para pedir número. "Quatro em cinco concluíram" não é taxa de sucesso de 80%. Para métrica com margem de erro, a NN/g pede ao menos 20 participantes.
- Ajudar o participante. Cada dica do facilitador apaga um problema que o cliente real vai encontrar sozinho.
- Testar só no computador. Se a maior parte do tráfego chega pelo celular, é no celular que o teste precisa acontecer.
- Terminar em relatório. Achado sem dono, prazo e próxima rodada marcada não melhora a página.
Vale também desconfiar do teste que só confirma o que a equipe já pensava. Se nenhuma das cinco sessões surpreendeu ninguém, provavelmente as tarefas foram fáceis demais ou o roteiro conduziu a pessoa pelo caminho certo.
O que muda em landing page, e-commerce e site institucional?
A regra das rodadas vale para todos, mas a tarefa e o que observar mudam. Na landing page de campanha, a tarefa é curta e a pergunta central é se a pessoa entende a oferta nos primeiros segundos e confia o bastante para deixar os dados. No e-commerce, o teste se concentra em busca, filtro, frete e checkout — e o público costuma ser mais homogêneo, o que favorece a regra dos cinco.
No site institucional B2B, a jornada é mais longa e quase sempre há mais de um público: quem pesquisa e quem decide, o comprador técnico e o financeiro. É o caso típico em que a NN/g manda dividir a amostra. E como o tráfego desses sites raramente sustenta um teste A/B, o teste de usabilidade em rodadas costuma ser a principal fonte de evidência sobre a página.
Por onde começar hoje?
- Escolha a página que mais pesa na receita — normalmente a de orçamento, a de contato ou a principal landing page de campanha.
- Escreva duas tarefas realistas que terminam na conversão, sem repetir as palavras dos botões.
- Recrute cinco pessoas do público (ou três e três, se houver dois perfis) e marque as sessões na mesma semana.
- Consolide por problema, ordene pelo impacto na conversão e aplique a régua: corrigir, testar A/B ou nova rodada.
- Marque a segunda rodada antes de terminar a primeira.
Se você quer saber antes em que ponto do funil o seu marketing mais perde gente, o diagnóstico de marketing gratuito da Alliance mostra em minutos onde estão as lacunas. E quando a página precisar de um programa contínuo de pesquisa, correção e teste, o trabalho de CRO e otimização de conversão organiza as rodadas, a fila de correções e os experimentos — do roteiro da primeira sessão ao teste A/B, quando houver tráfego para ele.

