“Deu 95% de significância em três dias, vamos encerrar.” É a frase mais cara da experimentação. Veja os conceitos que definem quanto tempo um teste precisa rodar e como ler o resultado.
Índice do artigo
Para se aprofundar
Para se aprofundar, assista ao episódio do canal da Métricas Boss sobre o tema:
- Os 4 números que definem um teste
- Significância: o controle do falso positivo
- Poder estatístico: o controle do falso negativo
- MDE: o menor efeito que vale detectar
- Como calcular o tamanho de amostra e a duração
- Ciclos de negócio: por que no mínimo duas semanas
- Peeking: o erro que invalida testes
- E se eu precisar decidir antes? Testes sequenciais
- Como ler o resultado
- Perguntas frequentes
Os 4 números que definem um teste
Antes de lançar qualquer teste A/B, você precisa de quatro números:
- Taxa de conversão atual (baseline) da métrica principal.
- Nível de significância (normalmente 95% de confiança, ou 5% de risco de falso positivo).
- Poder estatístico (normalmente 80%).
- Efeito mínimo detectável (MDE): a menor melhoria que você quer ser capaz de detectar.
Com eles, uma calculadora de tamanho de amostra diz quantos usuários cada variante precisa.
Em uma frase: o tamanho de amostra é definido antes do teste começar, e não quando o resultado parece bom.
Significância: o controle do falso positivo
A significância controla o risco de declarar vencedora uma variante que, na verdade, não é melhor (falso positivo). Com 95% de confiança, você aceita 5% de chance de erro desse tipo, desde que respeite o tamanho de amostra planejado.
Poder estatístico: o controle do falso negativo
Poder é a probabilidade de detectar um efeito real quando ele existe. Com 80% de poder, você aceita 20% de chance de não perceber uma melhoria verdadeira (falso negativo). Testes com pouco poder “empatam” muitas ideias boas.
MDE: o menor efeito que vale detectar
O MDE (ou MEI, efeito mínimo de interesse, como chama a CXL) é a menor melhoria que seria valiosa o bastante para o negócio. Quanto menor o efeito que você quer detectar, maior a amostra necessária, e a relação não é linear: reduzir o MDE pela metade exige muito mais que o dobro de tráfego.
Na prática, o MDE é um trade-off entre ambição e realidade: se o seu tráfego só permite detectar efeitos de 10% ou mais em prazo razoável, testar mudanças pequenas não faz sentido. É por isso que programas com pouco tráfego devem testar mudanças maiores e mais ousadas.
Como calcular o tamanho de amostra e a duração
- Pegue o baseline da métrica no analytics, para o público que vai entrar no teste.
- Defina significância, poder e MDE.
- Use uma calculadora de tamanho de amostra (há várias gratuitas, inclusive a da CXL).
- Divida o total necessário pelo tráfego diário que entra no teste.
- Arredonde para semanas completas.
Se o resultado for inviável (por exemplo, meses de teste), as saídas são: aumentar o MDE (testar mudanças maiores), testar numa etapa com mais tráfego, usar uma métrica com taxa mais alta ou aceitar que aquela pergunta não se responde com teste A/B.
Ciclos de negócio: por que no mínimo duas semanas
O comportamento muda entre dias úteis e fim de semana, entre início e fim de mês, entre dias com e sem campanha. A recomendação comum é rodar o teste por pelo menos dois ciclos de negócio completos, o que para a maioria dos negócios significa duas semanas, mesmo que o tamanho de amostra seja atingido antes. Negócios com decisão longa (B2B, ticket alto) podem precisar de ciclos maiores.
Peeking: o erro que invalida testes
Peeking é olhar o resultado repetidamente e parar o teste assim que ele cruza a significância. O problema: a significância oscila ao longo do teste. Se você checa muitas vezes e para no primeiro “verde”, a chance real de falso positivo fica muito acima dos 5% prometidos. Em testes A/A (duas versões idênticas), é comum ver “vencedores” aparecerem e sumirem ao longo dos dias.
Regra prática: em teste de horizonte fixo, acompanhe para detectar bugs, mas só leia o resultado no fim.
E se eu precisar decidir antes? Testes sequenciais
Quando o negócio precisa da possibilidade de encerrar antes, a resposta não é “espiar com cuidado”: é usar um método feito para isso. Testes sequenciais (como o group sequential testing) planejam análises intermediárias com regras de parada que controlam o erro. A própria CXL orienta: em testes de horizonte fixo, não pare na primeira significância; em métodos sequenciais, siga as regras de parada do método.
Como ler o resultado
- Olhe o intervalo de confiança, não só o p-valor. “Entre +1% e +9%” diz muito mais que “significativo”.
- Confira as métricas de guardrail: ticket, margem, cancelamento, performance.
- Cheque a qualidade do teste: a divisão de tráfego bate com a planejada? (Veja Sample Ratio Mismatch.)
- Segmente com cautela: análises por segmento depois do fato geram falsos achados. Use-as para gerar novas hipóteses, não para declarar vitórias.
- Resultado neutro também é resultado: aprendizado registrado e risco evitado.
Perguntas frequentes
Quanto tempo deve durar um teste A/B?
O tempo necessário para atingir o tamanho de amostra calculado, cobrindo pelo menos dois ciclos de negócio completos, em geral duas semanas ou mais.
O que é MDE em teste A/B?
O efeito mínimo detectável: a menor melhoria que o teste é desenhado para identificar com confiança.
O que é poder estatístico?
A probabilidade de o teste detectar um efeito real quando ele existe; o padrão é 80%.
Posso parar o teste quando atingir 95% de significância?
Em teste de horizonte fixo, não. Isso infla o falso positivo. Pare apenas ao atingir o tamanho de amostra planejado ou use um método sequencial.
O que fazer se meu site tem pouco tráfego?
Testar mudanças maiores, usar métricas mais frequentes, testar etapas com mais volume ou priorizar pesquisa qualitativa.
Teste A/A serve para quê?
Para validar a ferramenta e a implementação: duas versões iguais não devem mostrar diferença significativa além do esperado pelo acaso.
Precisa de uma consultoria de analytics? Conheça a Métricas Boss, que ajuda times a estruturar a mensuração, auditar os dados e transformar tracking em decisão. Peça um diagnóstico pelo site.
