SymDot

Significância estatística explicada para gestores (sem fórmulas)

Significância estatística sem fórmulas: o que o valor-p diz e não diz, intervalo de confiança e tamanho de efeito para quem decide com testes.

Equipe SymDotPublicado em 5 min de leitura

Em algum momento, todo gestor recebe um relatório dizendo que "a versão B venceu com 95% de significância". A frase soa como certeza, mas significa algo bem mais específico, e entender essa diferença evita decisões ruins. Este artigo explica significância estatística sem fórmulas, com foco no que importa para decidir.

A pergunta que a significância responde

Imagine que você jogou uma moeda dez vezes e deu sete caras. A moeda está viciada? Provavelmente não: sete em dez acontece com frequência por puro acaso. Agora imagine 700 caras em 1.000 jogadas. Aí o acaso fica muito difícil de sustentar.

A significância estatística faz essa conta para os seus testes. Ela pergunta: se não houvesse diferença real entre A e B, qual a chance de eu ver uma diferença tão grande quanto a que vi? Se essa chance é pequena, dizemos que o resultado é significativo.

O que é o valor-p (e o que ele não é)

O valor-p é aquela chance calculada. Um valor-p de 0,03 quer dizer: "se não houvesse diferença real, veríamos uma diferença tão grande quanto esta em cerca de 3% das vezes".

Por convenção, muitas áreas usam o limite de 0,05 (os "95%" dos relatórios). Abaixo disso, o resultado é chamado de significativo.

O que o valor-p não é, apesar de ser frequentemente lido assim:

Leitura comum Por que está errada
"Há 97% de chance de B ser melhor" O valor-p não é a probabilidade de a hipótese ser verdadeira
"A diferença é grande" Um efeito minúsculo pode ser significativo com amostra grande
"Não significativo = não há diferença" Pode haver diferença que a amostra não teve tamanho para detectar
"0,049 é muito diferente de 0,051" O limite de 0,05 é uma convenção, não uma fronteira natural

Tamanho do efeito: a pergunta do negócio

Para decidir, você precisa saber quanto B é melhor. "B aumentou a conversão de 3,0% para 3,6%" é um efeito de 20% relativo. Se isso vale a pena depende do custo de implementar B e do valor de cada conversão.

Um efeito significativo e pequeno pode não compensar. Um efeito grande e ainda não significativo pode valer um teste maior. A significância é um filtro de ruído; a decisão vem do tamanho do efeito.

Intervalo de confiança: a margem de erro honesta

O intervalo de confiança mostra a faixa plausível para o efeito real. Compare:

  • "B converte 20% a mais (significativo)."
  • "B converte 20% a mais, com intervalo de 5% a 35%."

A segunda frase diz muito mais. Mostra que B quase certamente é melhor, mas que o ganho real pode ser modesto ou expressivo. Se o intervalo fosse de −2% a 42%, a leitura mudaria: B pode até ser pior.

Amostra: pequena demais ou grande demais

Amostra pequena produz resultados que oscilam muito. Com 100 pessoas por versão, diferenças enormes aparecem e desaparecem por acaso. Por isso testes encerrados cedo "descobrem" vencedores que não se repetem.

Amostra muito grande faz qualquer diferença ser significativa. Com milhões de usuários, uma diferença de 0,01 ponto pode passar no teste e ser irrelevante.

A saída é calcular a amostra antes, a partir do menor efeito que vale a pena detectar. O guia de teste A/B mostra uma tabela com ordens de grandeza.

Armadilhas comuns na leitura de testes

  • Comparações múltiplas: testar 20 segmentos ou 20 métricas e destacar a que deu significativa. Em média, uma em vinte dá "significativa" por acaso.
  • Achar o segmento vencedor depois: "perdeu no geral, mas ganhou entre homens de 25 a 34 no Android". Segmentos devem ser hipóteses prévias.
  • Ignorar a robustez: um resultado que só aparece com uma forma específica de medir, ou só em uma semana, é frágil.

Robustez: o vencedor se mantém?

Além do acaso da amostra, resultados podem depender de detalhes: a ordem em que as opções foram mostradas, a redação, o período. Um bom resultado é robusto: o vencedor continua vencendo quando você varia esses detalhes.

Simulações permitem medir isso de forma sistemática. Em vez de rodar o teste uma vez, você o repete com variações (ordem trocada, nova amostra) e verifica em quantas o vencedor se mantém. "B venceu em 9 de 10 variações" é uma evidência mais forte do que um único valor-p.

Um roteiro de leitura para gestores

  1. Qual foi o efeito? Em números de negócio: vendas, clientes, receita.
  2. Qual a margem? Peça o intervalo de confiança, não só o vencedor.
  3. A amostra era a planejada? Desconfie de testes encerrados antes.
  4. A métrica e os segmentos foram definidos antes? Se não, trate como exploração.
  5. O resultado é robusto? Ele se repete em outra semana, outra amostra, outra forma de medir?
  6. Compensa? Compare o ganho provável com o custo e o risco de implementar.
O que significa um resultado estatisticamente significativo?

Significa que a diferença observada seria improvável se não houvesse nenhuma diferença real, considerando o nível de exigência escolhido (geralmente 5%). Não significa que a diferença seja grande ou importante.

O que é um valor-p de 0,05?

É a chance de observar uma diferença tão grande quanto a vista, se na verdade não houvesse diferença. Um valor-p de 0,05 corresponde a 5% de chance, o limite convencional para chamar um resultado de significativo.

Qual a diferença entre significância e relevância?

Significância indica se a diferença provavelmente não é acaso. Relevância indica se a diferença é grande o bastante para importar ao negócio. Uma decisão boa considera as duas.

O que fazer quando o resultado não é significativo?

Verifique se a amostra tinha tamanho para detectar o efeito esperado. Se tinha, a diferença provavelmente é pequena ou inexistente. Se não tinha, o teste foi inconclusivo, e não prova que as versões são iguais.

significância estatísticavalor-pestatísticateste A/Bintervalo de confiança

Teste a ideia antes de investir nela.

O SymDot simula milhares de pessoas do seu público decidindo, uma a uma, e mostra o que funciona, para quem e até onde confiar.

Começar agora