Regressão não linear Múltipla

Uma variável pode ser estatisticamente significativa quando analisada isoladamente, mas perder significância quando inserida em um modelo com outras variáveis altamente correlacionadas.

Em regressões múltiplas, a significância estatística de uma variável depende não apenas de sua relação com a variável resposta, mas também da informação compartilhada com as demais variáveis explicativas. Quando existe forte multicolinearidade, o modelo encontra dificuldades para separar os efeitos individuais dos preditores, aumentando os erros-padrão dos coeficientes e reduzindo sua significância estatística.

Revisão do passo a passo para a Regressão:

1. Entender os dados
X, Y, correlação, scatterplot
Correlação ≠ causalidade
2. Definir o modelo
Y = α + β₁X₁ + β₂X₂ + ... + βₖXₖ + u
3. Interpretar α
α = intercepto
Valor esperado de Y quando X = 0
4. Interpretar β
β = efeito marginal de X sobre Y
Mantidas as demais variáveis constantes
5. Estimar fitted values
Ŷ = valores previstos pelo modelo
6. Calcular resíduos
uᵢ = Yᵢ - Ŷᵢ
7. Aplicar OLS / MQO
Minimiza Σuᵢ²
Com intercepto: Σuᵢ = 0
8. Avaliar R²
Quanto da variação de Y foi explicada
R² alto ≠ modelo válido
9. Teste F
H₀: todos os β = 0
H₁: pelo menos 1 β ≠ 0
10. Teste t
H₀: βⱼ = 0
H₁: βⱼ ≠ 0
Avalia cada variável preditora
11. Intervalos de confiança
IC do α e dos β
Se contém zero, atenção à significância
12. Verificar interpolação/extrapolação
Previsão dentro da faixa dos dados = interpolação
Fora da faixa dos dados = extrapolação
13. Diagnóstico dos resíduos
Resíduos aleatórios?
Sem padrão?
Sem curvatura?
Sem funil?
14. Normalidade dos resíduos
Shapiro-Francia
H₀: resíduos seguem normalidade
15. Se houver problema
Verificar:
- não linearidade
- multicolinearidade
- heterocedasticidade
- outliers
- variável omitida
16. Corrigir e reestimar
Stepwise
Box-Cox
transformação de variáveis
modelo não linear
17. Validar novamente
Teste F, teste t, R², resíduos e normalidade
statsmodels.summary()
================================================================================
OLS Regression Results
================================================================================
Dep. Variable: Y
Model: OLS
Method: Least Squares
R-squared: 0.842 ← ❶ R²
Adj. R-squared: 0.831
F-statistic: 52.31 ← ❷ TESTE F
Prob (F-statistic): 0.000001 ← p-value do Teste F
================================================================================
coef std err t P>|t| [0.025 0.975]
--------------------------------------------------------------------------------
Intercept 10.52 2.11 4.98 0.000 6.22 14.82
▲ ▲ ▲ ▲ ▲ ▲ ▲
│ │ │ │ │ │ │
│ │ │ │ │ └──────────┘
│ │ │ │ │
│ │ │ │ └──────── IC95%
│ │ │ │
│ │ │ └──────── p-value
│ │ │
│ │ └──────── Estatística t
│ │
│ └──────── Erro-padrão
└────────────────────── α (Intercepto)
--------------------------------------------------------------------------------
X1 2.31 0.42 5.50 0.000
└── Teste t do β₁
X2 -0.75 0.31 -2.42 0.018
└── Teste t do β₂
X3 0.12 0.09 1.20 0.235
└── β₃ não significativo
================================================================================

❶ R²

Pergunta:

Quanto da variabilidade de Y foi explicada pelo modelo?

R2=84,2%R^2 = 84,2\%


❷ Teste F

Pergunta:

O modelo como um todo possui capacidade explicativa?

Hipóteses:H0:β1=β2=β3=0H_0: \beta_1=\beta_2=\beta_3=0H1:Pelo menos um β0H_1: \text{Pelo menos um } \beta \neq 0

Nesse exemplo:

Prob(F-statistic) = 0.000001

Logo:

✅ Rejeita H₀

✅ Pelo menos um β é significativo


α (Intercepto)

Linha:

Intercept

Coeficiente:

10.52

Interpretação:α=10.52\alpha = 10.52

Quando:X1=X2=X3=0X_1=X_2=X_3=0

esperamos:Y=10.52Y=10.52


Teste t

Cada linha de variável possui um teste t próprio.

Exemplo:

X1coef = 2.31t = 5.50p-value = 0.000

Hipóteses:H0:β1=0H_0:\beta_1=0H1:β10H_1:\beta_1\neq0

Como:

p-value < 0,05

✅ X1 é significativa.


Resumo visual

SUMMARY
├── R²
│ Quanto Y foi explicado?
├── Teste F
│ Modelo funciona?
├── α (Intercept)
│ Valor esperado de Y quando X=0
├── β
│ Efeito de cada variável
├── Teste t
│ β é significativo?
├── p-value
│ Evidência estatística
└── IC95%
Faixa plausível para o coeficiente

Teste F → avalia o modelo inteiro

Teste t → avalia cada β individualmente

α → é apenas mais um coeficiente, mas representa o intercepto da reta/plano de regressão.

Multicolinearidade

Um dos sintomas clássicos da multicolinearidade ocorre quando o teste F indica que o modelo é globalmente significativo, mas os testes t individuais não identificam coeficientes significativos. Nessa situação, as variáveis explicativas possuem forte correlação entre si, dificultando a separação de seus efeitos individuais sobre a variável resposta. Como consequência, os erros-padrão aumentam, as estatísticas t diminuem e os p-values tornam-se elevados, mesmo quando o conjunto de variáveis explica adequadamente Y.

Deixe um comentário