먼저 책을 잘 보고 있다는 말씀드리구요. 잘 정리된 책 감사히 보고 있습니다. ^^
아마 이 책을 조금만 더 빨리 접했더라도 두 집단 평균 비교를 위해 그렇게 헤메지는 않았을것 같습니다. 늦게나마 좋은 책을 알게되어 기쁩니다.
요즘 이 책을 읽다 한가지 의문점이 있어서 글을 올립니다.
1판 3쇄 페이지 118에 보면, lm(dist~I(speed^2) - 1, data=cars)를 구한뒤 p119에서 "R^2가 더 크므로 좋은 모형이라 할 수 있다"고 되어있습니다.
그런데 아시다시피 R에서는 intercept를 제외한 summary(lm(dist~I(speed^2) - 1, data=cars))의 null model 은 dist = mean + epsilon가 되는 것이 아니라 null model이 dist = epsilon이 됩니다. (http://www.bios.unc.edu/~truong/b663/pdf/noint.pdf, http://cran.r-project.org/doc/contrib/Faraway-PRA.pdf의 2.11절 참조)
그래서 제가 보기엔 이 R^2값을 유의미하게 봐서는 안될것 같은데 어떻게 보시는지요.
그래서 제가 한번 직접 R^2를 계산해보았습니다.
> library(MASS)
> data(cars)
> attach(cars)
> l_square = lm(dist ~ I(speed^2) - 1)
> summary(l_square)
Call:
lm(formula = dist ~ I(speed^2) - 1)
Residuals:
Min 1Q Median 3Q Max
-29.350 -7.988 1.325 8.080 49.939
Coefficients:
Estimate Std. Error t value Pr(>|t|)
I(speed^2) 0.153374 0.007122 21.54 <2e-16 ***
---
Signif. codes: 0 ‘***’ 0.001 ‘**’ 0.01 ‘*’ 0.05 ‘.’ 0.1 ‘ ’ 1
Residual standard error: 15.61 on 49 degrees of freedom
Multiple R-squared: 0.9044, Adjusted R-squared: 0.9025
F-statistic: 463.8 on 1 and 49 DF, p-value: < 2.2e-16
> 1 - deviance(l_square) / sum((dist-mean(dist))^2)
[1] 0.6331824
> 1 - deviance(l_square) / sum((dist - 0)^2)
[1] 0.9044389
저는 이 둘중 0.633이 더 맞는 R^2가 아닌가 생각하고 있습니다. 그리고 summary(l_square)는 뒤에 나온 dist = epsilon 형태와 비교하는 R^2를 보여준다고 생각하고 있습니다.
좋은 답변 부탁드립니다.
감사합니다.
첫댓글 y-절편이 있는 경우의 R^2 계산방식은 y-절편이 없는 경우와 다릅니다. 그래서 둘은 비교가 가능하지 않습니다. 그런데 119페이지의 경우 둘다 y-절편이 없어서 비교가 가능합니다.
절편이 없는 경우 모형이 y = beta*x + epsilon이니, null model은 beta=0인 y = epsilon이 맞습니다.
즉 두번째 계산방법이 맞습니다.
그렇군요! 미처 생각못한 내용이었네요. 좋은 설명 감사합니다~.