Aula 15 — Módulo 2: Inferência Estatística
Mover uma barreira do nível 30 para o nível 40 melhora a experiência dos jogadores?
Podemos medir retenção em 1 dia, retenção em 7 dias e número de rodadas. Qual resultado deve decidir?
gate_30 e gate_40;Fonte: Kaggle, matinmahmoudi/rounds-and-retention.
| Coluna | Significado |
|---|---|
userid |
jogador único |
version |
posição da primeira porta: 30 ou 40 |
sum_gamerounds |
rodadas nos primeiros 14 dias |
retention_1 |
retornou após 1 dia |
retention_7 |
retornou após 7 dias |
No jogo, uma porta interrompe o avanço até o jogador esperar ou realizar uma compra.
| Métrica | Porta 30 | Porta 40 | Diferença 30 − 40 |
|---|---|---|---|
| Retenção em 1 dia | 44,82% | 44,23% | +0,59 p.p. |
| Retenção em 7 dias | 19,02% | 18,20% | +0,82 p.p. |
| Média de rodadas | 52,46 | 51,30 | +1,16 |
Diferenças pequenas podem ser importantes — ou apenas ruído.
Usaremos retenção em 7 dias como métrica primária.
Motivos:
\[ \Delta=p_{30}-p_{40} \]
Estimativa observada:
\[ \widehat\Delta=0{,}1902-0{,}1820=0{,}0082 \]
A porta no nível 30 teve 0,82 p.p. a mais de retenção em 7 dias.
\[ H_0:\Delta=0 \qquad\text{e}\qquad H_A:\Delta\neq0 \]
Se a posição da porta não altera retenção, os rótulos gate_30 e gate_40 são trocáveis.
Embaralhar os rótulos:
Reamostrar separadamente dentro de cada grupo preserva:
gate_30;gate_40;Por isso, o bootstrap usual fica centrado em \(\widehat\Delta\), não em zero.
O intervalo percentil de 95% para \(\Delta\) é aproximadamente:
\[ [0{,}31;1{,}33]\text{ p.p.} \]
Ele responde melhor a:
Quais tamanhos de efeito são compatíveis com a amostra?
Bootstrap não pertence exclusivamente a \(H_A\).
Para simular \(H_0\), precisamos impor a igualdade antes de reamostrar. Uma forma é recentralizar os dois grupos para uma média comum.
Para uma variável contínua:
\[ Y^{0}_{ij}=Y_{ij}-\bar Y_j+\bar Y_{pool} \]
Cada grupo perde sua própria média e recebe a média combinada. Assim, a diferença entre as médias recentralizadas é zero.
Para Bernoulli, simulamos de uma proporção combinada comum.
Associe corretamente o uso do bootstrap à hipótese representada.
| Objetivo | Construção mais natural |
|---|---|
| testar ausência de associação com rótulos trocáveis | permutação |
| testar \(H_0\) sem permutabilidade, impondo um parâmetro | bootstrap recentralizado |
| estimar incerteza do efeito observado | bootstrap usual |
| simular poder para um efeito planejado | bootstrap/Monte Carlo sob alternativa definida |
Não existe “o poder do teste” sem dizer qual efeito é verdadeiro.
\[ \text{Poder}(\Delta^*)=P(\text{rejeitar }H_0\mid\Delta=\Delta^*) \]
Cada \(\Delta^*\) produz um poder diferente.
Aumentar o efeito não é uma opção estatística: ele pertence ao fenômeno e à intervenção.
Com muitos jogadores, podemos detectar diferenças minúsculas.
Planejamento exige definir o menor efeito de interesse:
\[ \Delta_{min}=\text{menor mudança que alteraria a decisão} \]
O tamanho amostral deve ser planejado em torno dele.
Cookie Cats oferece pelo menos três testes naturais:
Adicionar horas, segmentos ou cortes cria rapidamente dezenas de hipóteses.
Em uma família com \(m\) hipóteses:
| símbolo | significado |
|---|---|
| \(R\) | número total de rejeições — as “descobertas” |
| \(V\) | rejeições erradas — falsos positivos |
| \(R-V\) | rejeições corretas — descobertas verdadeiras |
\(V\) não é observado: não sabemos diretamente quais rejeições são falsas. Os procedimentos controlam propriedades de \(V\) ao longo de repetições do estudo.
FWER (family-wise error rate) é:
\[ \operatorname{FWER}=P(V\geq1). \]
Ela responde: “qual é a chance de cometer pelo menos um falso positivo nesta família?”
Se \(m\) testes independentes usam nível \(\alpha\), todos sob \(H_0\):
\[ \operatorname{FWER}=1-(1-\alpha)^m. \]
Com \(m=100\) e \(\alpha=0{,}05\), a FWER chega a aproximadamente 99,4%.
Bonferroni divide o “orçamento de erro” \(\alpha\) entre os \(m\) testes:
\[ \alpha^*=\frac{\alpha}{m} \]
Rejeite \(H_i\) quando \(p_i\leq\alpha/m\). Equivalentemente:
\[ p_i^{adj}=\min(mp_i,1). \]
Exemplo: com \(m=10\) e \(\alpha=0{,}05\), cada teste precisa de \(p_i\leq0{,}005\).
Se \(A_i\) é o evento “o teste \(i\) produz um falso positivo”, então:
\[ P\left(\bigcup_{i=1}^{m}A_i\right) \leq\sum_{i=1}^{m}P(A_i) \leq m\frac{\alpha}{m}=\alpha. \]
É a desigualdade da união: o controle vale mesmo sem independência entre os testes.
O preço dessa proteção é poder menor, especialmente quando \(m\) é grande ou os testes são muito correlacionados.
Holm é um procedimento step-down:
Ele controla FWER sob dependência arbitrária e nunca rejeita menos hipóteses que Bonferroni.
Para \(m=5\), \(\alpha=0{,}05\) e valores-p ordenados:
| \(i\) | \(p_{(i)}\) | Bonferroni | limiar de Holm | decisão de Holm |
|---|---|---|---|---|
| 1 | 0,003 | 0,010 | 0,0100 | rejeita |
| 2 | 0,011 | 0,010 | 0,0125 | rejeita |
| 3 | 0,018 | 0,010 | 0,0167 | para |
| 4 | 0,041 | 0,010 | — | não rejeita |
| 5 | 0,200 | 0,010 | — | não rejeita |
Bonferroni rejeita apenas a primeira; Holm rejeita as duas primeiras sem abandonar o controle de FWER.
FDR (false discovery rate) é a proporção esperada de falsos entre os resultados declarados significativos:
\[ \operatorname{FDR}=E\left[\frac{V}{\max(R,1)}\right]. \]
Ela responde: “entre as descobertas que eu anunciar, qual fração falsa aceito em média?”
Controlar FDR em 5% não significa que cada resultado tenha 5% de chance de ser falso, nem garante exatamente 5% de falsos em uma realização.
É apropriado quando buscamos várias descobertas e aceitamos algumas falsas em troca de maior poder.
Para controlar FDR no nível \(q\):
Não pare no primeiro valor-p que falha: BH procura o maior índice que satisfaz a desigualdade.
O controle clássico vale sob independência e certas formas de dependência positiva. Dependências arbitrárias exigem métodos mais conservadores, como Benjamini–Yekutieli.
Com \(q=0{,}05\):
| \(i\) | \(p_{(i)}\) | \((i/5)q\) | satisfaz? |
|---|---|---|---|
| 1 | 0,003 | 0,010 | sim |
| 2 | 0,011 | 0,020 | sim |
| 3 | 0,018 | 0,030 | sim — maior \(k\) |
| 4 | 0,041 | 0,040 | não |
| 5 | 0,200 | 0,050 | não |
BH rejeita as três primeiras hipóteses. Ele faz mais descobertas porque controla FDR, não a probabilidade de qualquer erro.
Selecione as associações corretas.
| método | controla | perfil |
|---|---|---|
| Bonferroni | FWER | simples e conservador |
| Holm | FWER | prefere-se a Bonferroni quando aplicável |
| BH | FDR | mais poder para muitas descobertas |
A família deve ser definida pela pergunta científica, não pelo arquivo de código.
Um plano claro para Cookie Cats poderia definir:
Não corrigimos uma hipótese que foi realmente definida como única antes do estudo.
Bonferroni ou BH não resolvem:
Registre:
Os dados favorecem manter a porta no nível 30 para retenção em 7 dias:
A decisão final ainda exige avaliar custo, receita e relevância prática.
Uma boa análise não busca apenas rejeitar \(H_0\): ela planeja quais efeitos consegue detectar e quantas oportunidades teve de se enganar.
ICD: Aula 15 — Poder e múltiplos testesvoltar para a Aula