Uma variável pode ser estatisticamente significativa quando analisada isoladamente, mas perder significância quando inserida em um modelo com outras variáveis altamente correlacionadas.
Em regressões múltiplas, a significância estatística de uma variável depende não apenas de sua relação com a variável resposta, mas também da informação compartilhada com as demais variáveis explicativas. Quando existe forte multicolinearidade, o modelo encontra dificuldades para separar os efeitos individuais dos preditores, aumentando os erros-padrão dos coeficientes e reduzindo sua significância estatística.
Revisão do passo a passo para a Regressão:
1. Entender os dados X, Y, correlação, scatterplot Correlação ≠ causalidade2. Definir o modelo Y = α + β₁X₁ + β₂X₂ + ... + βₖXₖ + u3. Interpretar α α = intercepto Valor esperado de Y quando X = 04. Interpretar β β = efeito marginal de X sobre Y Mantidas as demais variáveis constantes5. Estimar fitted values Ŷ = valores previstos pelo modelo6. Calcular resíduos uᵢ = Yᵢ - Ŷᵢ7. Aplicar OLS / MQO Minimiza Σuᵢ² Com intercepto: Σuᵢ = 08. Avaliar R² Quanto da variação de Y foi explicada R² alto ≠ modelo válido9. Teste F H₀: todos os β = 0 H₁: pelo menos 1 β ≠ 010. Teste t H₀: βⱼ = 0 H₁: βⱼ ≠ 0 Avalia cada variável preditora11. Intervalos de confiança IC do α e dos β Se contém zero, atenção à significância12. Verificar interpolação/extrapolação Previsão dentro da faixa dos dados = interpolação Fora da faixa dos dados = extrapolação13. Diagnóstico dos resíduos Resíduos aleatórios? Sem padrão? Sem curvatura? Sem funil?14. Normalidade dos resíduos Shapiro-Francia H₀: resíduos seguem normalidade15. Se houver problema Verificar: - não linearidade - multicolinearidade - heterocedasticidade - outliers - variável omitida16. Corrigir e reestimar Stepwise Box-Cox transformação de variáveis modelo não linear17. Validar novamente Teste F, teste t, R², resíduos e normalidade
statsmodels.summary()
================================================================================ OLS Regression Results================================================================================Dep. Variable: YModel: OLSMethod: Least SquaresR-squared: 0.842 ← ❶ R²Adj. R-squared: 0.831F-statistic: 52.31 ← ❷ TESTE FProb (F-statistic): 0.000001 ← p-value do Teste F================================================================================ coef std err t P>|t| [0.025 0.975]--------------------------------------------------------------------------------Intercept 10.52 2.11 4.98 0.000 6.22 14.82 ▲ ▲ ▲ ▲ ▲ ▲ ▲ │ │ │ │ │ │ │ │ │ │ │ │ └──────────┘ │ │ │ │ │ │ │ │ │ └──────── IC95% │ │ │ │ │ │ │ └──────── p-value │ │ │ │ │ └──────── Estatística t │ │ │ └──────── Erro-padrão │ └────────────────────── α (Intercepto)--------------------------------------------------------------------------------X1 2.31 0.42 5.50 0.000 ▲ │ └── Teste t do β₁X2 -0.75 0.31 -2.42 0.018 ▲ │ └── Teste t do β₂X3 0.12 0.09 1.20 0.235 ▲ │ └── β₃ não significativo================================================================================
❶ R²
Pergunta:
Quanto da variabilidade de Y foi explicada pelo modelo?
❷ Teste F
Pergunta:
O modelo como um todo possui capacidade explicativa?
Hipóteses:
Nesse exemplo:
Prob(F-statistic) = 0.000001
Logo:
✅ Rejeita H₀
✅ Pelo menos um β é significativo
α (Intercepto)
Linha:
Intercept
Coeficiente:
10.52
Interpretação:
Quando:
esperamos:
Teste t
Cada linha de variável possui um teste t próprio.
Exemplo:
X1coef = 2.31t = 5.50p-value = 0.000
Hipóteses:
Como:
p-value < 0,05
✅ X1 é significativa.
Resumo visual
SUMMARY│├── R²│ Quanto Y foi explicado?│├── Teste F│ Modelo funciona?│├── α (Intercept)│ Valor esperado de Y quando X=0│├── β│ Efeito de cada variável│├── Teste t│ β é significativo?│├── p-value│ Evidência estatística│└── IC95% Faixa plausível para o coeficiente
Teste F → avalia o modelo inteiro
Teste t → avalia cada β individualmente
α → é apenas mais um coeficiente, mas representa o intercepto da reta/plano de regressão.
Multicolinearidade
Um dos sintomas clássicos da multicolinearidade ocorre quando o teste F indica que o modelo é globalmente significativo, mas os testes t individuais não identificam coeficientes significativos. Nessa situação, as variáveis explicativas possuem forte correlação entre si, dificultando a separação de seus efeitos individuais sobre a variável resposta. Como consequência, os erros-padrão aumentam, as estatísticas t diminuem e os p-values tornam-se elevados, mesmo quando o conjunto de variáveis explica adequadamente Y.