SymDot

Teste A/B: o que é, como fazer e os erros que invalidam o resultado

Guia prático de teste A/B para marketing e produto: como montar a hipótese, calcular a amostra, ler o resultado e evitar os erros mais comuns.

Equipe SymDotPublicado em 8 min de leitura

Toda empresa já viveu esta reunião: duas versões de uma campanha, cinco opiniões fortes e nenhuma forma de saber quem está certo. O teste A/B existe para encerrar essa discussão com evidência. Em vez de escolher pela intuição de quem fala mais alto, você mostra cada versão a uma parte do público e mede qual gera mais resultado.

A ideia é simples. Fazer direito, nem tanto. Este guia mostra como montar um teste que produz uma resposta confiável, e quais armadilhas transformam um teste em uma opinião com cara de número.

O que é um teste A/B

Um teste A/B é um experimento controlado. Você pega o público, sorteia quem vê a versão A (normalmente a atual, chamada de controle) e quem vê a versão B (a mudança que você quer avaliar). Como o sorteio distribui as pessoas ao acaso, os dois grupos são parecidos em tudo, exceto na versão que viram. Se um grupo converte mais, a diferença vem da versão, e não de outra coisa.

Esse é o ponto que separa um teste de uma comparação comum. Comparar "o anúncio de março com o de abril" mistura a mudança com tudo o que também mudou entre os meses: sazonalidade, concorrência, verba, feriados. O sorteio isola o efeito.

Dá para testar quase tudo que chega ao cliente:

  • Marketing: título do anúncio, imagem, chamada para ação, oferta (desconto ou frete grátis), assunto do e-mail.
  • Produto: fluxo de cadastro, onboarding, posição de um botão, texto de um aviso.
  • Preço: valor, forma de apresentar (mensal ou anual), parcelamento, ancoragem.
  • Comunicação: como anunciar um reajuste, uma mudança de política ou uma notícia difícil.

Como fazer um teste A/B em 6 passos

  1. Escreva a hipótese. Não "testar um botão verde", mas "se deixarmos claro que o frete é grátis no primeiro anúncio, mais pessoas vão iniciar a compra, porque o custo do frete é a principal objeção". A hipótese diz o que muda, o que você espera e por quê.
  2. Escolha uma métrica principal. Uma só: taxa de compra, cliques, cadastros, cancelamentos. As outras métricas servem de contexto e de proteção (por exemplo, garantir que a receita por cliente não caiu).
  3. Calcule a amostra antes de começar. Quanto menor a diferença que você quer detectar, mais gente precisa entrar no teste. Veja a seção abaixo.
  4. Sorteie e rode as versões ao mesmo tempo. Nunca uma semana A e outra semana B. O sorteio deve ser por pessoa, para que ninguém veja as duas versões.
  5. Espere a amostra planejada. Defina a duração antes (em geral, ciclos completos de uma ou duas semanas, para cobrir dias úteis e fins de semana) e não pare porque "já está ganhando".
  6. Leia o resultado com intervalo, não só com o vencedor. A pergunta não é só "B ganhou?", mas "quanto B ganhou, e qual a margem de incerteza dessa diferença?".

Quanto tráfego um teste A/B precisa

Este é o passo que mais gente pula, e o motivo pelo qual tantos testes "não dão em nada". O tamanho da amostra depende de três coisas:

  1. A taxa atual da métrica (por exemplo, 3% de conversão).
  2. O menor efeito que vale a pena detectar (por exemplo, subir de 3% para 3,6%, um aumento relativo de 20%).
  3. O nível de confiança que você exige (o padrão de mercado é 95%, com poder estatístico de 80%).

Para dar uma ideia da ordem de grandeza, considere uma conversão de base de 3%, com 95% de confiança e 80% de poder:

Efeito que você quer detectar Conversão de B Pessoas por versão (aprox.)
+50% relativo 4,5% 2.500
+20% relativo 3,6% 14.000
+10% relativo 3,3% 53.000

Valores aproximados, calculados com a fórmula clássica para comparar duas proporções. Use uma calculadora de amostra para o seu caso.

A leitura é direta: efeitos pequenos exigem amostras enormes. Se a sua página recebe 2.000 visitas por semana, um teste que precisa de 53.000 pessoas por versão levaria mais de um ano. Nesse caso, o problema não é o teste: é a escolha do que testar. Mudanças maiores (uma oferta diferente, uma proposta de valor nova) têm efeitos maiores e cabem em amostras menores.

Como ler o resultado

Ao final, a ferramenta vai mostrar uma diferença e um indicador de confiança (o valor-p ou uma "probabilidade de ser melhor"). Três cuidados evitam a maior parte das leituras erradas:

  • Olhe o tamanho do efeito, não só a significância. Uma diferença de 0,1 ponto pode ser estatisticamente significativa com amostras gigantes e, ainda assim, irrelevante para o negócio.
  • Olhe o intervalo. "B converteu 12% a mais, com margem de 2% a 22%" é uma informação muito mais útil do que "B venceu".
  • Desconfie de vencedores em segmentos. Se a versão B perdeu no geral, mas "ganhou entre mulheres de 35 a 44 anos no celular", provavelmente você encontrou ruído. Segmentos devem ser definidos antes do teste, não descobertos depois.

Se quiser entender a estatística por trás sem fórmulas, leia o nosso guia sobre significância estatística para gestores.

Os erros que invalidam um teste A/B

Erro 2: testar muitas métricas e escolher a que ganhou. Se você acompanha 20 métricas, é provável que uma delas mostre diferença "significativa" por puro acaso. Escolha a métrica principal antes.

Erro 3: mudar várias coisas ao mesmo tempo sem saber. Se a versão B tem outro título, outra imagem e outro preço, você vai saber que B ganhou, mas não por quê. Às vezes isso é aceitável (testar dois conceitos completos), desde que a decisão seja consciente.

Erro 4: ignorar o efeito novidade. Uma mudança visual chama atenção nos primeiros dias só por ser diferente. Testes curtos demais confundem novidade com melhoria.

Erro 5: contaminação entre grupos. Se a mesma pessoa vê as duas versões (no celular e no computador, por exemplo), ou se as versões rodam em canais diferentes, o sorteio deixa de garantir grupos comparáveis.

Erro 6: amostra que não representa o público. Testar só com quem já é cliente fiel e aplicar o resultado à aquisição de novos clientes é extrapolar para quem não estava no teste.

Quando o teste A/B não é a melhor opção

O teste A/B é o padrão-ouro para medir o efeito de uma mudança, mas tem limites práticos:

  • Pouco tráfego: como vimos, efeitos realistas exigem muitas pessoas.
  • Custo de errar: testar um preço mais alto com clientes reais pode gerar cancelamentos que você não recupera.
  • Decisões únicas: não dá para fazer A/B de um lançamento, de uma marca nova ou de uma campanha de TV que vai ao ar uma vez.
  • Muitas opções: com dez variações de criativo, um teste A/B completo fica caro e lento.

Nesses casos, faz sentido usar uma etapa anterior para filtrar as opções: pesquisa qualitativa, painéis de opinião, testes de criativo e, mais recentemente, simulações com públicos sintéticos. A lógica é a de um funil: métodos mais rápidos e baratos eliminam as opções fracas, e o teste A/B no mundo real confirma a melhor.

Checklist do teste A/B

Antes de começar Durante Depois
Hipótese escrita com o "porquê" Versões rodando ao mesmo tempo Ler efeito e intervalo, não só "venceu"
Uma métrica principal definida Sorteio por pessoa Conferir as métricas de proteção
Amostra e duração calculadas Não encerrar antes do planejado Registrar o aprendizado, ganhando ou perdendo
Segmentos de interesse definidos Monitorar só erros técnicos Decidir: implementar, iterar ou descartar

Um teste que "perdeu" também é resultado: ele evitou que você implementasse uma mudança que não funcionava. Empresas que testam com frequência acumulam esse aprendizado e erram menos com o tempo, porque cada teste ensina algo sobre o cliente. Leia mais sobre isso em como tomar decisões baseadas em dados.

Qual a diferença entre teste A/B e teste multivariado?

O teste A/B compara versões completas (A contra B, ou A, B e C). O multivariado testa combinações de vários elementos ao mesmo tempo (título × imagem × botão) para descobrir o efeito de cada um. Ele exige muito mais tráfego, porque cada combinação precisa da própria amostra.

Quanto tempo deve durar um teste A/B?

O suficiente para atingir a amostra calculada e cobrir pelo menos um ciclo completo de comportamento, normalmente uma ou duas semanas. Testes com menos de uma semana tendem a refletir o dia da semana e o efeito novidade.

Posso fazer teste A/B com pouco tráfego?

Pode, desde que teste mudanças grandes, com efeito esperado alto. Para mudanças sutis, com pouco tráfego, o teste não terá amostra para detectar a diferença. Nesse caso, use pesquisa, testes de pré-lançamento ou simulação para escolher as opções mais promissoras.

O que fazer quando o teste A/B dá empate?

Um empate significa que, com aquela amostra, não foi possível distinguir as versões. Se a mudança não tem custo, você pode manter qualquer uma; se tem custo, mantenha a atual. Registre o aprendizado: a variável testada provavelmente não é a que move o resultado.

teste A/Bexperimentaçãoconversãoestatística

Teste a ideia antes de investir nela.

O SymDot simula milhares de pessoas do seu público decidindo, uma a uma, e mostra o que funciona, para quem e até onde confiar.

Começar agora