이 p-value들은 전체 모형에서 특정변수 하나를 뺐을때 그 변수의 유의성을 평가해줍니다.
이런걸 type III라고 합니다.
> out=lm(bwt~age+lwt+factor(race),data=birthwt)
> summary(out)
Call:
lm(formula = bwt ~ age + lwt + factor(race), data = birthwt)
Residuals:
Min 1Q Median 3Q Max
-2103.50 -429.68 41.74 486.10 1902.20
Coefficients:
Estimate Std. Error t value Pr(>|t|)
(Intercept) 2461.147 314.722 7.820 3.97e-13 ***
age 1.299 10.108 0.128 0.89789
lwt 4.620 1.788 2.584 0.01054 *
factor(race)2 -447.615 161.369 -2.774 0.00611 **
factor(race)3 -239.357 115.189 -2.078 0.03910 *
---
Signif. codes: 0 ‘***’ 0.001 ‘**’ 0.01 ‘*’ 0.05 ‘.’ 0.1 ‘ ’ 1
Residual standard error: 704.9 on 184 degrees of freedom
Multiple R-squared: 0.08536, Adjusted R-squared: 0.06548
F-statistic: 4.293 on 4 and 184 DF, p-value: 0.00241
변수하나씩 빼고 돌려보죠.
> out1=lm(bwt~lwt+factor(race),data=birthwt)
> out2=lm(bwt~age+factor(race),data=birthwt)
> out3=lm(bwt~age+lwt,data=birthwt)
age를 뺀 모형과 있는 모형을 비교하면 p-value=0.8979로 summary(out)의 결과와 동일합니다.
> anova(out,out1)
Analysis of Variance Table
Model 1: bwt ~ age + lwt + factor(race)
Model 2: bwt ~ lwt + factor(race)
Res.Df RSS Df Sum of Sq F Pr(>F)
1 184 91436202
2 185 91444408 -1 -8205.4 0.0165 0.8979
lwt도 마찬가지입니다.
> anova(out,out2)
Analysis of Variance Table
Model 1: bwt ~ age + lwt + factor(race)
Model 2: bwt ~ age + factor(race)
Res.Df RSS Df Sum of Sq F Pr(>F)
1 184 91436202
2 185 94754346 -1 -3318144 6.6772 0.01054 *
---
Signif. codes: 0 ‘***’ 0.001 ‘**’ 0.01 ‘*’ 0.05 ‘.’ 0.1 ‘ ’ 1
race는 1,2,3으로 셋입니다. 1,2,3 차이가 없는지 본거고,
summary(out)에서는 1을 reference로 "2-1"의 차이와 "3-1"의 차이를 각각본겁니다.
> anova(out,out3)
Analysis of Variance Table
Model 1: bwt ~ age + lwt + factor(race)
Model 2: bwt ~ age + lwt
Res.Df RSS Df Sum of Sq F Pr(>F)
1 184 91436202
2 186 96186834 -2 -4750632 4.7799 0.009467 **
---
Signif. codes: 0 ‘***’ 0.001 ‘**’ 0.01 ‘*’ 0.05 ‘.’ 0.1 ‘ ’ 1
첫댓글 혹시 이런것을 Omnibus test라고도 하나요?
글쎄요^^ 그냥 full-model에서 한 변수의 중요성을 평가할때 사용됩니다. type III라고 기억하시면 됩니다.
오.. 그렇군요~ 거의 다 이해는 했는데 범주형자료 factor(race) 관련해선 아직도 아리까리 하네요; 그 변수가 빠졌을 때 그 영향의 유의수준인건데,,, 범주형 자료면 , factor(race)2 이면 2-1 의 차이, factor(race)3 이면 3-1의 차이를 보는 거라고 하신거 같은데.. 그럼 더미변수라고 생각해도 되는거 맞죠?... 값이 3개니까 더미변수는 2개가 되고,
[race=1 이면 factor(race)2=0, factor(race)3=0
/ race=2 이면 factor(race)2=1, factor(race)3=0
/ race=3 이면 factor(race)2=0, factor(race)3=1 ]
그것들의 p-value들은 더비변수 들이 빠졌을 때의 영향의 유의수준을 보는거 아닌가요?
그럴것같은데 한번 공부삼아 해보세요^^
그리고 anova 에서는 왜 안 쪼개지는지... 그건 그냥 통째로 보는건가요?
anova에서는 그 변수의 유의성을 보는거여서 한꺼번에 봅니다. one-way anova에서 overall test같은거죠. 두개를 한꺼번에 봐서 df=2이죠.