Agência
Marca & CriaçãoBranding & PosicionamentoIdentidade VisualConteúdo & CopywritingProdução AudiovisualLive Experience
Performance & GrowthSocial MediaInbound & NutriçãoTráfego PagoSEO & GEOPublicidadePesquisa de Mercado com IABI & DashboardsWeb AnalyticsCRO
IA & AutomaçãoConsultoria de Adoção de IAIntegração CRM & DadosAutomação de ProcessosAgentes de IAAutomação de Marketing com IABase de Conhecimento de Marca para IA
Tecnologia & Produtos DigitaisDesenvolvimento Web & AppsDesenvolvimento de MVPTech & SecurityLGPDLow-code & No-codeDesenvolvimento Assistido por IA
Relacionamento & ReputaçãoAssessoria de ImprensaInfluência & CEO PositioningGestão de CriseComunicação InternaExperiência & Trade
PortfólioBlogContato
Mulher usando um aplicativo no smartphone
Performance

Teste de usabilidade: por que cinco pessoas só bastam em três rodadas

Teste de usabilidade com cinco pessoas: o que a regra de Nielsen diz de fato, quando ela quebra e como o achado vira correção da página que vende.

Resposta rápida

Teste de usabilidade é observar pessoas reais tentando fazer uma tarefa no seu site para ver onde elas travam. Cinco participantes bastam, mas não do jeito que a regra circula: pela conta de Jakob Nielsen, cinco pessoas encontram cerca de 85% dos problemas numa rodada, e a recomendação dele é fazer três rodadas de cinco, corrigindo a página entre uma e outra. A regra não vale para públicos muito diferentes nem para estudo estatístico. Com pouco tráfego para teste A/B, é a forma mais barata de descobrir por que a página não converte.

Quem tem um site comercial com algumas centenas de visitas por semana costuma ouvir a mesma recomendação: teste antes de mudar. O problema é que o teste A/B, o mais conhecido, precisa de milhares de visitantes por versão para separar efeito de acaso — e a maioria das páginas de empresa média nunca chega lá. Sobra a pergunta: como descobrir o que está errado sem tráfego para provar estatisticamente?

A resposta mais barata é sentar cinco pessoas na frente da página e assistir. Este guia explica o teste de usabilidade do ponto de vista de quem precisa que o site venda: o que a famosa regra dos cinco usuários diz de verdade, em que casos ela quebra, como conduzir as sessões e, principalmente, como transformar o que essas pessoas travaram em uma fila de correções ordenada por impacto na conversão.

O que é teste de usabilidade?

Teste de usabilidade é um método de pesquisa em que uma pessoa do público do site recebe uma tarefa realista — "encontre o plano que serve para uma empresa de dez funcionários e peça uma proposta" — e tenta cumpri-la enquanto alguém observa. Ela pensa em voz alta, o facilitador não ajuda, e a sessão é gravada. O que interessa não é a opinião da pessoa sobre o site, é o que ela faz: onde hesita, onde clica errado, onde desiste.

A diferença para uma pesquisa de satisfação é essa. Perguntar "o site é fácil de usar?" produz respostas educadas. Pedir que a pessoa peça um orçamento e ver que ela passa quarenta segundos procurando o botão produz um fato. Por isso o teste de usabilidade entrega o porquê de um número ruim no Analytics: a taxa de abandono mostra que as pessoas saem; a sessão mostra em qual campo, rótulo ou dúvida elas saíram.

Ele pode ser moderado (com facilitador ao vivo, presencial ou por videochamada) ou não moderado (a pessoa recebe as tarefas numa plataforma e grava a própria tela sozinha). Para site comercial, o moderado remoto costuma ser o melhor custo-benefício: dá para perguntar "o que você esperava encontrar aqui?" no momento exato da hesitação.

De onde vem a regra dos cinco usuários?

A regra é de Jakob Nielsen, cofundador da Nielsen Norman Group (NN/g), uma das referências mais citadas em usabilidade. No artigo de Jakob Nielsen sobre testar com cinco usuários, publicado em 18 de março de 2000, ele parte de uma fórmula: a proporção de problemas encontrados com n usuários é 1 − (1 − L)ⁿ, em que L é a fatia de problemas que um único usuário revela.

Na média dos projetos que a NN/g havia estudado, L ficava em 31%. Com esse valor, a curva sobe rápido no começo e achata logo depois — e é desse achatamento que vem a recomendação de parar em cinco. O ponto que se perde quando a regra vira frase de efeito é o que vem logo em seguida no mesmo texto: Nielsen não diz que cinco pessoas bastam para o projeto inteiro. Diz que cinco bastam por rodada.

Por que cinco pessoas encontram 85% dos problemas — e o que isso não quer dizer?

A lógica é de sobreposição. A primeira pessoa revela muita coisa nova. A segunda repete parte do que a primeira travou e acrescenta um pouco. A terceira já repete quase tudo. Quando chega a quinta, quase todo problema que ela encontra já apareceu antes — você está pagando para ver o mesmo erro de novo.

Gráfico da curva de problemas de usabilidade encontrados por número de usuários pela fórmula 1 menos (1 menos 0,31) elevado a n: uma pessoa revela 31%, cinco pessoas cerca de 85%, e a curva achata até quinze; ao lado, o esquema de três rodadas de cinco pessoas com correção da página entre elas
A curva achata depois da quinta pessoa. Em vez de insistir no mesmo teste, a NN/g recomenda corrigir e testar de novo — três vezes.

Três leituras erradas são comuns. A primeira: "85% dos problemas do site". Não — são 85% dos problemas que aquelas tarefas, com aquele perfil de pessoa, conseguem revelar. Se o roteiro não pede que ninguém compare planos, nenhum problema da página de planos vai aparecer, com cinco ou com cinquenta participantes.

A segunda: "31% vale para o meu site". O L é uma média de projetos estudados pela NN/g; o seu pode ser maior ou menor. Página simples, com uma tarefa só, tende a ter problemas que aparecem para quase todos. Sistema complexo, com muitos caminhos, esconde problemas que só uma minoria encontra.

A terceira, e a mais cara: "então testo cinco pessoas uma vez e pronto". É exatamente o oposto do que o artigo recomenda, como mostra a seção seguinte.

Por que três rodadas de cinco valem mais do que uma de quinze?

Jakob Nielsen calcula que o primeiro estudo com cinco participantes encontra 85% dos problemas de usabilidade, pela fórmula N(1−(1−L)ⁿ), em que L — a proporção de problemas que um único usuário revela — tem valor típico de 31% na média dos projetos estudados pela Nielsen Norman Group. Por isso ele recomenda gastar o orçamento em 3 estudos com 5 usuários cada, em vez de um único estudo com 15.
Fonte: Jakob Nielsen, "Why You Only Need to Test with 5 Users" (Nielsen Norman Group, 18/03/2000) — nngroup.com

O raciocínio é de orçamento. Quinze pessoas num único estudo encontram quase todos os problemas daquela versão da página — mas a partir da sexta pessoa, cada sessão confirma o que já se sabia. As mesmas quinze, divididas em três ciclos, fazem trabalho diferente em cada um:

  1. Rodada 1 encontra os problemas grandes — os que travam quase todo mundo. Você corrige.
  2. Rodada 2 confere se a correção resolveu ou se criou um problema novo (acontece com frequência: o botão que ficou mais visível passou a competir com o formulário). E, com os bloqueios grandes fora do caminho, as pessoas chegam mais longe na tarefa e revelam o que estava atrás deles.
  3. Rodada 3 encontra o que sobrou — inclusive os problemas mais sutis, que só aparecem quando a navegação básica deixou de atrapalhar.

Para quem vende, essa é a parte que importa. Um estudo grande produz um relatório; três estudos pequenos produzem uma página melhor. O teste de usabilidade só vira conversão quando o achado vira correção, e a correção é testada de novo.

Quando a regra dos cinco não vale?

A própria NN/g documenta as exceções — e elas aparecem em sites comerciais com mais frequência do que se imagina. A primeira é o site que atende públicos muito diferentes entre si.

Quando o site atende públicos diferentes, a recomendação da NN/g muda: 3 a 4 usuários de cada grupo se forem dois grupos, e 3 de cada se forem três ou mais — sempre ao menos 3 por grupo, para cobrir a diversidade de comportamento dentro dele.
Fonte: Jakob Nielsen, "Why You Only Need to Test with 5 Users" (Nielsen Norman Group, 2000) — nngroup.com

Pense numa distribuidora que vende para lojista e para consumidor final no mesmo site, ou numa escola com páginas para pais e para empresas que contratam cursos. Cinco pessoas misturadas podem render quatro de um perfil e uma do outro — e a jornada do segundo grupo fica praticamente sem teste.

As outras exceções têm a ver com o tipo de estudo. Na revisão da Nielsen Norman Group sobre quantos usuários testar, de 3 de junho de 2012, Nielsen separa o teste qualitativo — o que busca entender o que dá errado — dos estudos que precisam de número.

As exceções à regra dos cinco, segundo a NN/g: estudos quantitativos (que buscam estatística, não insight) pedem ao menos 20 usuários; card sorting, ao menos 15 por grupo; e eyetracking pede 39 usuários para gerar mapas de calor estáveis.
Fonte: Jakob Nielsen, "How Many Test Users in a Usability Study?" (Nielsen Norman Group, 03/06/2012) — nngroup.com
SituaçãoQuantas pessoasO que o estudo entrega
Teste qualitativo, um público5 por rodada, em 3 rodadasOnde e por que as pessoas travam
Dois públicos distintos3 a 4 de cada grupoOs problemas de cada jornada
Três ou mais públicos3 de cada grupoCobertura mínima por perfil
Estudo quantitativo (tempo, taxa de sucesso)Ao menos 20Números com margem de erro aceitável
Card sorting (organizar menu e categorias)Ao menos 15 por grupoComo o público agrupa os assuntos
Eyetracking com mapa de calor39Mapa de calor do olhar estável

Nielsen Norman Group: "Why You Only Need to Test with 5 Users" (2000) e "How Many Test Users in a Usability Study?" (2012). Organização da Alliance Comunicação.

Um alerta prático sobre a última linha: o mapa de calor de cliques e rolagem das ferramentas de gravação de sessão não é eyetracking. Ele mede onde o mouse foi, não onde o olho foi, e se apoia no tráfego real da página — outro tipo de evidência, útil, mas que não substitui ver uma pessoa tentando cumprir a tarefa.

Qual a diferença entre teste de usabilidade e teste A/B?

Os dois são complementares e respondem perguntas diferentes. O teste A/B mede qual versão converte mais, com o tráfego real; o teste de usabilidade mostra por que uma versão não converte, com poucas pessoas observadas. No guia sobre quanto tráfego e quanto tempo um teste A/B precisa, a recomendação para site de pouco tráfego é justamente trocar o experimento por evidência qualitativa — e o teste de usabilidade com cinco pessoas é a mais direta delas.

Teste de usabilidadeTeste A/B
Pergunta que respondePor que as pessoas não concluem a tarefa?Qual versão gera mais conversões?
Quantas pessoas5 por rodada (com as exceções da NN/g)Milhares por versão, conforme conversão-base e efeito
Precisa de tráfego no site?Não — os participantes são recrutadosSim, e é o que define a duração
Quando rodarAntes de lançar, antes de redesenhar, ou quando o A/B não fecha a contaQuando há duas soluções plausíveis e tráfego suficiente
O que entregaLista de problemas com contexto e gravaçãoDiferença de conversão com significância estatística
Risco principalRoteiro ruim gera achado irrelevanteEncerrar cedo e declarar vencedor por acaso

Comparativo elaborado pela Alliance Comunicação.

Na prática, o caminho mais produtivo é usar os dois em sequência: o teste de usabilidade gera as hipóteses, o A/B decide entre elas quando há tráfego para isso. Quem pula a primeira etapa costuma testar a cor do botão enquanto o formulário pede CNPJ de quem ainda não decidiu comprar.

Como fazer um teste de usabilidade na prática?

O roteiro abaixo é o mínimo que funciona para um site comercial ou uma landing page. Ele cabe em uma semana de trabalho por rodada, sem laboratório.

1. Defina a tarefa que paga as contas

Comece pela conversão: pedir orçamento, agendar visita, comprar, baixar o material. Escreva de duas a quatro tarefas realistas, com contexto ("você precisa trocar o sistema de ponto da sua empresa de 40 funcionários até o mês que vem"), sem usar as palavras que aparecem nos botões — senão você testa a capacidade de achar uma palavra, não a de entender a página.

2. Recrute pelo perfil, não pela conveniência

Cinco pessoas que se parecem com quem compra. Colegas de trabalho e parentes conhecem a empresa demais e são gentis demais. Se o site atende dois públicos, aplique a regra da NN/g: três ou quatro de cada. Clientes recentes e leads que não fecharam são uma fonte barata e honesta.

3. Conduza sem ajudar

Peça que a pessoa pense em voz alta. Quando ela travar, o impulso é explicar — resista. Pergunte "o que você esperava que acontecesse?" e anote. Cada sessão leva de 30 a 45 minutos; grave a tela e a voz, com autorização por escrito.

4. Anote o que aconteceu, não o que a pessoa achou

Para cada tarefa, registre: concluiu ou não, quanto tempo levou, onde hesitou e o que disse no momento. "Achei bonito" não é dado. "Rolou a página três vezes procurando o preço e desistiu" é.

5. Consolide por problema, não por pessoa

Ao fim das cinco sessões, liste os problemas e marque quantas pessoas esbarraram em cada um. Problema que travou três ou mais é estrutural. Problema que apareceu uma vez merece nota, não pânico — pode ser o perfil daquela pessoa.

6. Corrija e marque a próxima rodada

A rodada só termina quando há data para a próxima. Sem isso, o teste vira um relatório que ninguém lê.

Quais perguntas fazer — e quais evitar?

As melhores perguntas acontecem durante a tarefa, no momento da hesitação, e são abertas: "o que você está procurando agora?", "o que esse botão vai fazer?", "o que te faria desistir aqui?". Depois da tarefa, vale pedir uma nota de dificuldade de 1 a 5 e perguntar o que faltou para a pessoa se sentir segura em seguir.

Evite três tipos de pergunta. As que induzem ("você achou o formulário simples, certo?"), as que pedem previsão de comportamento ("você compraria por aqui?") — as pessoas são péssimas em prever o que fariam — e as que pedem opinião de design ("prefere azul ou verde?"). Essas últimas são trabalho do teste A/B, quando houver tráfego, ou de quem desenha a página.

O participante não está sendo testado. A página está. Quando ele erra, o erro é dela.

Como transformar o que as cinco pessoas travaram em correção da página?

É aqui que a maioria dos testes morre. A rodada termina com uma lista de vinte problemas, todos parecem importantes, e nada é corrigido porque não há critério de ordem. Para site comercial, o critério é um só: impacto na conversão. Problema que impede a pessoa de pedir orçamento vem antes de problema que a deixa irritada com o menu.

Ordene a fila por três perguntas. Quantas das cinco pessoas esbarraram nisso? Em que etapa do caminho até a conversão — antes do formulário, no formulário, depois dele? Quanto custa corrigir? O cruzamento disso diz o destino de cada achado.

Régua de decisão para o achado do teste de usabilidade em três caminhos: corrija direto quando três ou mais pessoas travaram no mesmo ponto e o conserto é barato; leve para teste A/B quando há duas soluções plausíveis e o tráfego cabe na amostra; faça nova rodada de cinco quando a correção mexe no fluxo ou ainda não se sabe o porquê do abandono
Nem todo achado precisa de experimento. A maioria dos bloqueios óbvios vai direto para produção; o A/B fica para a dúvida real entre duas soluções.
  • Corrija direto quando o problema é óbvio e o conserto é barato: link quebrado, campo obrigatório que não precisava existir, rótulo que três pessoas leram errado, preço que ninguém achou. Não há o que testar — há o que consertar. Acompanhe a taxa de conversão no antes e depois, no mesmo período do mês, sabendo que essa comparação não isola a causa.
  • Leve para teste A/B quando existem duas soluções plausíveis e ninguém sabe qual funciona melhor — página longa ou curta, formulário em uma ou duas etapas — e o tráfego da página cabe na amostra. Se não cabe, escolha a solução que o teste de usabilidade favoreceu e confira na próxima rodada.
  • Faça nova rodada de cinco quando a correção mexe no fluxo principal ou no texto que explica a oferta. Mudança grande corrige um problema e pode criar outro; só outra rodada mostra.

O resultado é uma fila curta e ordenada, que a equipe consegue executar em semanas. É o mesmo raciocínio de encontrar em que etapa a conversão vaza antes de mexer na página: primeiro onde, depois por quê, por último o quê.

Quais os erros mais comuns no teste de usabilidade?

  • Testar uma vez só. É a leitura errada da regra dos cinco. Uma rodada sem a segunda não confirma se a correção funcionou.
  • Misturar públicos sem perceber. Cinco participantes de perfis diferentes viram cinco amostras de uma pessoa. Separe os grupos e use três ou quatro de cada.
  • Usar a regra dos cinco para pedir número. "Quatro em cinco concluíram" não é taxa de sucesso de 80%. Para métrica com margem de erro, a NN/g pede ao menos 20 participantes.
  • Ajudar o participante. Cada dica do facilitador apaga um problema que o cliente real vai encontrar sozinho.
  • Testar só no computador. Se a maior parte do tráfego chega pelo celular, é no celular que o teste precisa acontecer.
  • Terminar em relatório. Achado sem dono, prazo e próxima rodada marcada não melhora a página.

Vale também desconfiar do teste que só confirma o que a equipe já pensava. Se nenhuma das cinco sessões surpreendeu ninguém, provavelmente as tarefas foram fáceis demais ou o roteiro conduziu a pessoa pelo caminho certo.

O que muda em landing page, e-commerce e site institucional?

A regra das rodadas vale para todos, mas a tarefa e o que observar mudam. Na landing page de campanha, a tarefa é curta e a pergunta central é se a pessoa entende a oferta nos primeiros segundos e confia o bastante para deixar os dados. No e-commerce, o teste se concentra em busca, filtro, frete e checkout — e o público costuma ser mais homogêneo, o que favorece a regra dos cinco.

No site institucional B2B, a jornada é mais longa e quase sempre há mais de um público: quem pesquisa e quem decide, o comprador técnico e o financeiro. É o caso típico em que a NN/g manda dividir a amostra. E como o tráfego desses sites raramente sustenta um teste A/B, o teste de usabilidade em rodadas costuma ser a principal fonte de evidência sobre a página.

Por onde começar hoje?

  1. Escolha a página que mais pesa na receita — normalmente a de orçamento, a de contato ou a principal landing page de campanha.
  2. Escreva duas tarefas realistas que terminam na conversão, sem repetir as palavras dos botões.
  3. Recrute cinco pessoas do público (ou três e três, se houver dois perfis) e marque as sessões na mesma semana.
  4. Consolide por problema, ordene pelo impacto na conversão e aplique a régua: corrigir, testar A/B ou nova rodada.
  5. Marque a segunda rodada antes de terminar a primeira.

Se você quer saber antes em que ponto do funil o seu marketing mais perde gente, o diagnóstico de marketing gratuito da Alliance mostra em minutos onde estão as lacunas. E quando a página precisar de um programa contínuo de pesquisa, correção e teste, o trabalho de CRO e otimização de conversão organiza as rodadas, a fila de correções e os experimentos — do roteiro da primeira sessão ao teste A/B, quando houver tráfego para ele.

UsabilidadeCROUXConversão

Foto: Woman using smartphone while preparing for workout in a bright living room setting, de nenadstojkovicart, sob licença CC BY 2.0.

Perguntas frequentes

Qual o objetivo do teste de usabilidade?+

Descobrir onde e por que as pessoas têm dificuldade para cumprir uma tarefa no site, observando o comportamento e não a opinião delas. Em site comercial, a tarefa observada é quase sempre a conversão — pedir orçamento, comprar, cadastrar-se. O resultado é uma lista de problemas com contexto, que orienta o que corrigir primeiro.

Teste de usabilidade: quantas pessoas são necessárias?+

Para um teste qualitativo com um único perfil de público, cinco pessoas por rodada, em três rodadas com correção entre elas, segundo Jakob Nielsen. Com dois públicos diferentes, a NN/g recomenda três a quatro de cada grupo. Estudos que precisam de número estatístico pedem ao menos 20 participantes.

Quais são os tipos de teste de usabilidade?+

Os mais usados são o moderado e o não moderado, e cada um pode ser presencial ou remoto. Também se distinguem o teste qualitativo, que busca entender os problemas, e o quantitativo, que mede tempo e taxa de sucesso. Card sorting e eyetracking são métodos vizinhos, com necessidades de amostra próprias.

Qual a diferença entre teste de usabilidade moderado e não moderado?+

No moderado, um facilitador acompanha a sessão ao vivo e pode perguntar no momento da hesitação. No não moderado, a pessoa recebe as tarefas numa plataforma e grava a própria tela sozinha. O moderado rende mais contexto por sessão; o não moderado é mais rápido de escalar, mas perde o porquê de muitas decisões.

Como fazer teste de usabilidade remoto?+

Uma chamada de vídeo com compartilhamento de tela resolve o teste moderado remoto: a pessoa abre o site no próprio computador ou celular e pensa em voz alta enquanto você observa e grava, com autorização. Prepare o link, as tarefas por escrito e um teste técnico de cinco minutos antes de começar. A vantagem é recrutar gente do público real, em qualquer cidade.

Teste de usabilidade qualitativo ou quantitativo: qual usar?+

Use o qualitativo quando a pergunta é "por que a página não converte?" — é o caso da regra dos cinco. Use o quantitativo quando precisa de um número comparável, como taxa de sucesso ou tempo de tarefa, para acompanhar ao longo do tempo ou comparar com concorrentes. O quantitativo pede pelo menos 20 participantes, segundo a NN/g.

Qual a diferença entre teste de usabilidade e avaliação heurística?+

Na avaliação heurística, especialistas revisam a interface contra um conjunto de princípios de usabilidade, sem usuários reais. No teste de usabilidade, pessoas do público tentam cumprir tarefas e você observa. A heurística é mais rápida e barata para achar falhas evidentes; o teste mostra o que o público de verdade não entende.

Quais ferramentas usar para teste de usabilidade?+

Para o teste moderado remoto, basta uma ferramenta de videochamada que grave tela e áudio. Para o não moderado, existem plataformas específicas que distribuem as tarefas e coletam as gravações. Ferramentas de gravação de sessão e mapa de calor complementam o teste com o comportamento do tráfego real, mas não substituem observar alguém cumprindo a tarefa.

Pronto para

converter mais com o mesmo tráfego?

Comece pelo diagnóstico gratuito e veja como Performance entra no seu plano de marketing — depois a Alliance ajuda a executar cada etapa.

(11) 99116-3001contato@alliancecomunicacao.com.brAv. Dr. Gastão Vidigal, 1132 — Vila Leopoldina, São Paulo · SP