CRBRASIL
CRO

Estatística de teste A/B: tamanho de amostra, MDE, duração e por que não parar o teste cedo

Por Redação CRO Brasil ·

Estatística de teste A/B: tamanho de amostra, MDE, duração e por que não parar o teste cedo

“Deu 95% de significância em três dias, vamos encerrar.” É a frase mais cara da experimentação. Veja os conceitos que definem quanto tempo um teste precisa rodar e como ler o resultado.

Índice do artigo

Para se aprofundar

Para se aprofundar, assista ao episódio do canal da Métricas Boss sobre o tema:

Os 4 números que definem um teste

Antes de lançar qualquer teste A/B, você precisa de quatro números:

  1. Taxa de conversão atual (baseline) da métrica principal.
  2. Nível de significância (normalmente 95% de confiança, ou 5% de risco de falso positivo).
  3. Poder estatístico (normalmente 80%).
  4. Efeito mínimo detectável (MDE): a menor melhoria que você quer ser capaz de detectar.

Com eles, uma calculadora de tamanho de amostra diz quantos usuários cada variante precisa.

Em uma frase: o tamanho de amostra é definido antes do teste começar, e não quando o resultado parece bom.

Significância: o controle do falso positivo

A significância controla o risco de declarar vencedora uma variante que, na verdade, não é melhor (falso positivo). Com 95% de confiança, você aceita 5% de chance de erro desse tipo, desde que respeite o tamanho de amostra planejado.

Poder estatístico: o controle do falso negativo

Poder é a probabilidade de detectar um efeito real quando ele existe. Com 80% de poder, você aceita 20% de chance de não perceber uma melhoria verdadeira (falso negativo). Testes com pouco poder “empatam” muitas ideias boas.

MDE: o menor efeito que vale detectar

O MDE (ou MEI, efeito mínimo de interesse, como chama a CXL) é a menor melhoria que seria valiosa o bastante para o negócio. Quanto menor o efeito que você quer detectar, maior a amostra necessária, e a relação não é linear: reduzir o MDE pela metade exige muito mais que o dobro de tráfego.

Na prática, o MDE é um trade-off entre ambição e realidade: se o seu tráfego só permite detectar efeitos de 10% ou mais em prazo razoável, testar mudanças pequenas não faz sentido. É por isso que programas com pouco tráfego devem testar mudanças maiores e mais ousadas.

Como calcular o tamanho de amostra e a duração

  1. Pegue o baseline da métrica no analytics, para o público que vai entrar no teste.
  2. Defina significância, poder e MDE.
  3. Use uma calculadora de tamanho de amostra (há várias gratuitas, inclusive a da CXL).
  4. Divida o total necessário pelo tráfego diário que entra no teste.
  5. Arredonde para semanas completas.

Se o resultado for inviável (por exemplo, meses de teste), as saídas são: aumentar o MDE (testar mudanças maiores), testar numa etapa com mais tráfego, usar uma métrica com taxa mais alta ou aceitar que aquela pergunta não se responde com teste A/B.

Ciclos de negócio: por que no mínimo duas semanas

O comportamento muda entre dias úteis e fim de semana, entre início e fim de mês, entre dias com e sem campanha. A recomendação comum é rodar o teste por pelo menos dois ciclos de negócio completos, o que para a maioria dos negócios significa duas semanas, mesmo que o tamanho de amostra seja atingido antes. Negócios com decisão longa (B2B, ticket alto) podem precisar de ciclos maiores.

Peeking: o erro que invalida testes

Peeking é olhar o resultado repetidamente e parar o teste assim que ele cruza a significância. O problema: a significância oscila ao longo do teste. Se você checa muitas vezes e para no primeiro “verde”, a chance real de falso positivo fica muito acima dos 5% prometidos. Em testes A/A (duas versões idênticas), é comum ver “vencedores” aparecerem e sumirem ao longo dos dias.

Regra prática: em teste de horizonte fixo, acompanhe para detectar bugs, mas só leia o resultado no fim.

E se eu precisar decidir antes? Testes sequenciais

Quando o negócio precisa da possibilidade de encerrar antes, a resposta não é “espiar com cuidado”: é usar um método feito para isso. Testes sequenciais (como o group sequential testing) planejam análises intermediárias com regras de parada que controlam o erro. A própria CXL orienta: em testes de horizonte fixo, não pare na primeira significância; em métodos sequenciais, siga as regras de parada do método.

Como ler o resultado

  • Olhe o intervalo de confiança, não só o p-valor. “Entre +1% e +9%” diz muito mais que “significativo”.
  • Confira as métricas de guardrail: ticket, margem, cancelamento, performance.
  • Cheque a qualidade do teste: a divisão de tráfego bate com a planejada? (Veja Sample Ratio Mismatch.)
  • Segmente com cautela: análises por segmento depois do fato geram falsos achados. Use-as para gerar novas hipóteses, não para declarar vitórias.
  • Resultado neutro também é resultado: aprendizado registrado e risco evitado.

Perguntas frequentes

Quanto tempo deve durar um teste A/B?

O tempo necessário para atingir o tamanho de amostra calculado, cobrindo pelo menos dois ciclos de negócio completos, em geral duas semanas ou mais.

O que é MDE em teste A/B?

O efeito mínimo detectável: a menor melhoria que o teste é desenhado para identificar com confiança.

O que é poder estatístico?

A probabilidade de o teste detectar um efeito real quando ele existe; o padrão é 80%.

Posso parar o teste quando atingir 95% de significância?

Em teste de horizonte fixo, não. Isso infla o falso positivo. Pare apenas ao atingir o tamanho de amostra planejado ou use um método sequencial.

O que fazer se meu site tem pouco tráfego?

Testar mudanças maiores, usar métricas mais frequentes, testar etapas com mais volume ou priorizar pesquisa qualitativa.

Teste A/A serve para quê?

Para validar a ferramenta e a implementação: duas versões iguais não devem mostrar diferença significativa além do esperado pelo acaso.

Precisa de uma consultoria de analytics? Conheça a Métricas Boss, que ajuda times a estruturar a mensuração, auditar os dados e transformar tracking em decisão. Peça um diagnóstico pelo site.