Teste A/B: o que é, como fazer e os erros que invalidam o resultado
Guia prático de teste A/B para marketing e produto: como montar a hipótese, calcular a amostra, ler o resultado e evitar os erros mais comuns.
Toda empresa já viveu esta reunião: duas versões de uma campanha, cinco opiniões fortes e nenhuma forma de saber quem está certo. O teste A/B existe para encerrar essa discussão com evidência. Em vez de escolher pela intuição de quem fala mais alto, você mostra cada versão a uma parte do público e mede qual gera mais resultado.
A ideia é simples. Fazer direito, nem tanto. Este guia mostra como montar um teste que produz uma resposta confiável, e quais armadilhas transformam um teste em uma opinião com cara de número.
O que é um teste A/B
Um teste A/B é um experimento controlado. Você pega o público, sorteia quem vê a versão A (normalmente a atual, chamada de controle) e quem vê a versão B (a mudança que você quer avaliar). Como o sorteio distribui as pessoas ao acaso, os dois grupos são parecidos em tudo, exceto na versão que viram. Se um grupo converte mais, a diferença vem da versão, e não de outra coisa.
Esse é o ponto que separa um teste de uma comparação comum. Comparar "o anúncio de março com o de abril" mistura a mudança com tudo o que também mudou entre os meses: sazonalidade, concorrência, verba, feriados. O sorteio isola o efeito.
Dá para testar quase tudo que chega ao cliente:
- Marketing: título do anúncio, imagem, chamada para ação, oferta (desconto ou frete grátis), assunto do e-mail.
- Produto: fluxo de cadastro, onboarding, posição de um botão, texto de um aviso.
- Preço: valor, forma de apresentar (mensal ou anual), parcelamento, ancoragem.
- Comunicação: como anunciar um reajuste, uma mudança de política ou uma notícia difícil.
Como fazer um teste A/B em 6 passos
- Escreva a hipótese. Não "testar um botão verde", mas "se deixarmos claro que o frete é grátis no primeiro anúncio, mais pessoas vão iniciar a compra, porque o custo do frete é a principal objeção". A hipótese diz o que muda, o que você espera e por quê.
- Escolha uma métrica principal. Uma só: taxa de compra, cliques, cadastros, cancelamentos. As outras métricas servem de contexto e de proteção (por exemplo, garantir que a receita por cliente não caiu).
- Calcule a amostra antes de começar. Quanto menor a diferença que você quer detectar, mais gente precisa entrar no teste. Veja a seção abaixo.
- Sorteie e rode as versões ao mesmo tempo. Nunca uma semana A e outra semana B. O sorteio deve ser por pessoa, para que ninguém veja as duas versões.
- Espere a amostra planejada. Defina a duração antes (em geral, ciclos completos de uma ou duas semanas, para cobrir dias úteis e fins de semana) e não pare porque "já está ganhando".
- Leia o resultado com intervalo, não só com o vencedor. A pergunta não é só "B ganhou?", mas "quanto B ganhou, e qual a margem de incerteza dessa diferença?".
Quanto tráfego um teste A/B precisa
Este é o passo que mais gente pula, e o motivo pelo qual tantos testes "não dão em nada". O tamanho da amostra depende de três coisas:
- A taxa atual da métrica (por exemplo, 3% de conversão).
- O menor efeito que vale a pena detectar (por exemplo, subir de 3% para 3,6%, um aumento relativo de 20%).
- O nível de confiança que você exige (o padrão de mercado é 95%, com poder estatístico de 80%).
Para dar uma ideia da ordem de grandeza, considere uma conversão de base de 3%, com 95% de confiança e 80% de poder:
| Efeito que você quer detectar | Conversão de B | Pessoas por versão (aprox.) |
|---|---|---|
| +50% relativo | 4,5% | 2.500 |
| +20% relativo | 3,6% | 14.000 |
| +10% relativo | 3,3% | 53.000 |
Valores aproximados, calculados com a fórmula clássica para comparar duas proporções. Use uma calculadora de amostra para o seu caso.
A leitura é direta: efeitos pequenos exigem amostras enormes. Se a sua página recebe 2.000 visitas por semana, um teste que precisa de 53.000 pessoas por versão levaria mais de um ano. Nesse caso, o problema não é o teste: é a escolha do que testar. Mudanças maiores (uma oferta diferente, uma proposta de valor nova) têm efeitos maiores e cabem em amostras menores.
Como ler o resultado
Ao final, a ferramenta vai mostrar uma diferença e um indicador de confiança (o valor-p ou uma "probabilidade de ser melhor"). Três cuidados evitam a maior parte das leituras erradas:
- Olhe o tamanho do efeito, não só a significância. Uma diferença de 0,1 ponto pode ser estatisticamente significativa com amostras gigantes e, ainda assim, irrelevante para o negócio.
- Olhe o intervalo. "B converteu 12% a mais, com margem de 2% a 22%" é uma informação muito mais útil do que "B venceu".
- Desconfie de vencedores em segmentos. Se a versão B perdeu no geral, mas "ganhou entre mulheres de 35 a 44 anos no celular", provavelmente você encontrou ruído. Segmentos devem ser definidos antes do teste, não descobertos depois.
Se quiser entender a estatística por trás sem fórmulas, leia o nosso guia sobre significância estatística para gestores.
Os erros que invalidam um teste A/B
Erro 2: testar muitas métricas e escolher a que ganhou. Se você acompanha 20 métricas, é provável que uma delas mostre diferença "significativa" por puro acaso. Escolha a métrica principal antes.
Erro 3: mudar várias coisas ao mesmo tempo sem saber. Se a versão B tem outro título, outra imagem e outro preço, você vai saber que B ganhou, mas não por quê. Às vezes isso é aceitável (testar dois conceitos completos), desde que a decisão seja consciente.
Erro 4: ignorar o efeito novidade. Uma mudança visual chama atenção nos primeiros dias só por ser diferente. Testes curtos demais confundem novidade com melhoria.
Erro 5: contaminação entre grupos. Se a mesma pessoa vê as duas versões (no celular e no computador, por exemplo), ou se as versões rodam em canais diferentes, o sorteio deixa de garantir grupos comparáveis.
Erro 6: amostra que não representa o público. Testar só com quem já é cliente fiel e aplicar o resultado à aquisição de novos clientes é extrapolar para quem não estava no teste.
Quando o teste A/B não é a melhor opção
O teste A/B é o padrão-ouro para medir o efeito de uma mudança, mas tem limites práticos:
- Pouco tráfego: como vimos, efeitos realistas exigem muitas pessoas.
- Custo de errar: testar um preço mais alto com clientes reais pode gerar cancelamentos que você não recupera.
- Decisões únicas: não dá para fazer A/B de um lançamento, de uma marca nova ou de uma campanha de TV que vai ao ar uma vez.
- Muitas opções: com dez variações de criativo, um teste A/B completo fica caro e lento.
Nesses casos, faz sentido usar uma etapa anterior para filtrar as opções: pesquisa qualitativa, painéis de opinião, testes de criativo e, mais recentemente, simulações com públicos sintéticos. A lógica é a de um funil: métodos mais rápidos e baratos eliminam as opções fracas, e o teste A/B no mundo real confirma a melhor.
Checklist do teste A/B
| Antes de começar | Durante | Depois |
|---|---|---|
| Hipótese escrita com o "porquê" | Versões rodando ao mesmo tempo | Ler efeito e intervalo, não só "venceu" |
| Uma métrica principal definida | Sorteio por pessoa | Conferir as métricas de proteção |
| Amostra e duração calculadas | Não encerrar antes do planejado | Registrar o aprendizado, ganhando ou perdendo |
| Segmentos de interesse definidos | Monitorar só erros técnicos | Decidir: implementar, iterar ou descartar |
Um teste que "perdeu" também é resultado: ele evitou que você implementasse uma mudança que não funcionava. Empresas que testam com frequência acumulam esse aprendizado e erram menos com o tempo, porque cada teste ensina algo sobre o cliente. Leia mais sobre isso em como tomar decisões baseadas em dados.
Qual a diferença entre teste A/B e teste multivariado?
O teste A/B compara versões completas (A contra B, ou A, B e C). O multivariado testa combinações de vários elementos ao mesmo tempo (título × imagem × botão) para descobrir o efeito de cada um. Ele exige muito mais tráfego, porque cada combinação precisa da própria amostra.
Quanto tempo deve durar um teste A/B?
O suficiente para atingir a amostra calculada e cobrir pelo menos um ciclo completo de comportamento, normalmente uma ou duas semanas. Testes com menos de uma semana tendem a refletir o dia da semana e o efeito novidade.
Posso fazer teste A/B com pouco tráfego?
Pode, desde que teste mudanças grandes, com efeito esperado alto. Para mudanças sutis, com pouco tráfego, o teste não terá amostra para detectar a diferença. Nesse caso, use pesquisa, testes de pré-lançamento ou simulação para escolher as opções mais promissoras.
O que fazer quando o teste A/B dá empate?
Um empate significa que, com aquela amostra, não foi possível distinguir as versões. Se a mudança não tem custo, você pode manter qualquer uma; se tem custo, mantenha a atual. Registre o aprendizado: a variável testada provavelmente não é a que move o resultado.