계량경제학 8 - Restricted OLS(ROLS), Chow test
규모에 따른 수익 모형을 예시로 들어 제약조건이 존재하는 상황에서 기존 모델의 추정치가 어떻게 되는지를 검정 통계량 관점에서 확인해보고 올바르게 추정치를 찾는 방법을 알아본다. 또, 연속적인 데이터 속에서 구조적인 변화의 존재 여부를 검정하는 chow test를 다룬다.
이번 포스트부터는 사실상 이전 내용을 모르면 이해가 어렵기 때문에 Prerequisite섹션 대신 Introduces섹션을 작성하겠습니다.
0. Introduction
Cobb-Douglas production function을 생각해보자.
\[Y_t=AK_t^aL_t^b\ \ \mathrm{where}\ A,\ a,\ b \ \mathrm{is\ parameter}\]이 모델은 선형 모델이 아니니 \(ln\)을 취하면,
\[\ln{Y_t}=\ln{A}+a\ln{K_t}+b\ln{L_t}\]이고, 알아보기 쉽게 변수변환 해주면
\[Y_t^*=\beta_0^*+\beta_1^*X_{t1}+\beta_2^*X_{t2}+\epsilon_t\]0-1. Returns to scale
규모에 따른 수익이란 장기적으로 생산요소 투입의 변화에 따른 생산량이 어떻게 변하느냐에 대한 이론이다.
총 세가지 경우가 있다.
- CRS(Constant Return to Scale) : 모든 생산요소의 비율적인 증가에 비례하는 것만큼 산출량이 증가하는 것
- DRS(Decrease Return to Scale) : 모든 생산요소의 비율적인 증가에 비례하는 것보다 적게 산출량이 증가하는 것
- IRS(Increase Return to Scale) : 모든 생산요소의 비율적인 증가에 비례하는 것보다 크게 산출량이 증가하는 것
위 Cobb-Douglas model는 CRS를 가정한다.
CRS가 성립하면,
결론적으로 \(a+b=1\)이라는 제약조건이 있는 regression이라고 할 수 있다.
이런경우 계수의 추정량을 다시 계산해봐야한다.
이번 포스트에서는 이 방법을 다뤄보겠다.
1. ROLS
Regression Model :
\[Y_t^*=\beta_0^*+\beta_1^*X_{t1}+\beta_2^*X_{t2}+\epsilon_t\]CRS Assumption(Restriction on coefficients) :
\[\beta_1^*+\beta_2^*=1\]이 제약조건을 행렬로 표현하기 위해 Restrict matrix \(R\)과 Restrict value matrix \(r\)에 대해서
\[\begin{bmatrix} 0 & 1 & 1 \\ \end{bmatrix} \begin{bmatrix} \beta_0^* \\ \beta_1^* \\ \beta_2^* \\ \end{bmatrix} = \begin{bmatrix} 1 \\ \end{bmatrix} \quad \rightarrow \quad R\beta^*=r\]이라 쓸 수 있으니 최소제곱법, 라그랑주 승수법을 사용하면
\[\underset{\beta}{\min}(Y-X\beta)'(Y-X\beta) \quad s.t.\ \ R\beta-r=0 \\\] \[\begin{align} \mathcal{L}&=(Y-X\beta)'(Y-X\beta)+(R\beta-r)\lambda \notag \\ \frac{\partial \mathcal{L}}{\partial \beta}&=-2X'Y+2X'X\beta+R'\lambda=0 \tag{1} \\ \frac{\partial \mathcal{L}}{\partial \lambda}&=R\beta-r=0 \tag{2} \\ \end{align}\] \[\begin{align} \mathrm{(1)에서\ }&-2X'Y+2X'X\beta +R'\lambda =0 \notag \\ &\Rightarrow \beta =\left(X'X\right)^{-1}X'Y-\frac{1}{2}\left(X'X\right)^{-1}R'\lambda \tag{3} \\ \notag \\ \mathrm{(2)에서\ }&R\beta -r=0 \notag \\ &\Rightarrow R\left(\left(X'X\right)^{-1}X'Y-\frac{1}{2}\left(X'X\right)^{-1}R'\lambda \right)-r=0 \notag \\ &\Rightarrow R\left(X'X\right)^{-1}X'Y-\frac{1}{2}R\left(X'X\right)^{-1}R'\lambda -r=0 \notag \\ &\Rightarrow \frac{1}{2}\lambda =\left(R\left(X'X\right)^{-1}R'\right)^{-1}R\left(X'X\right)^{-1}X'Y-\left(R\left(X'X\right)^{-1}R'\right)^{-1}r \tag{4}\\ \notag \\ \mathrm{(3), (4)에서\ }\Rightarrow \beta =&\left(X'X\right)^{-1}X'Y \notag \\ -&\left(X'X\right)^{-1}R'\left(\left(R\left(X'X\right)^{-1}R'\right)^{-1}R\left(X'X\right)^{-1}X'Y-\left(R\left(X'X\right)^{-1}R'\right)^{-1}r\right) \notag \\ =&\left(X'X\right)^{-1}X'Y-\left(X'X\right)^{-1}R'\left(R\left(X'X\right)^{-1}R'\right)^{-1}\left(R\left(X'X\right)^{-1}X'Y-r\right) \notag \end{align}\]OLS추정량을 \(\hat{\beta}\)라고 하고 ROLS추정량을 \(\tilde{\beta}\)라고 쓰면
\[\tilde{\beta }=\hat{\beta }-\left(X'X\right)^{-1}R'\left(R\left(X'X\right)^{-1}R'\right)^{-1}\left(R\hat{\beta }-r\right)\]이라 쓸 수 있다.
1-1. Unbiased
Unbiased estimator인지 expectation을 계산해보면
\[\begin{align} E\left(\tilde{\beta }\right)&=E\left(\hat{\beta }\right)-E\left(\left(X'X\right)^{-1}R'\left(R\left(X'X\right)^{-1}R'\right)^{-1}\left(R\hat{\beta }-r\right)\right) \notag \\ &=\beta \notag \end{align}\]인데, 이는 제약조건이 성립할 때 undiased임을 말해준다.
1-2. Efficient
Efficient를 알아보기 위해 variance를 계산해보면
\[\begin{align} V\left(\tilde{\beta }\right)=&V\left(\hat{\beta }-\left(X'X\right)^{-1}R'\left(R\left(X'X\right)^{-1}R'\right)^{-1}\left(R\hat{\beta }-r\right)\right) \notag \\ =&V\left(\hat{\beta }\right)+V\left(\left(X'X\right)^{-1}R'\left(R\left(X'X\right)^{-1}R'\right)^{-1}\left(R\hat{\beta }-r\right)\right) \notag \\ &-2Cov\left(\hat{\beta },\ \left(X'X\right)^{-1}R'\left(R\left(X'X\right)^{-1}R'\right)^{-1}\left(R\hat{\beta }-r\right)\right) \notag \\ \end{align}\]에서
\[\begin{align} &Cov\left(\hat{\beta },\ \left(X'X\right)^{-1}R'\left(R\left(X'X\right)^{-1}R'\right)^{-1}\left(R\hat{\beta }-r\right)\right) \notag \\ &=\left(X'X\right)^{-1}R'\left(R\left(X'X\right)^{-1}R'\right)^{-1}E\left[\left(\hat{\beta }-\beta ^*\right)\left(\left(R\hat{\beta }-r\right)-\left(R\beta ^*-r\right)\right)\right] \notag \\ &=\left(X'X\right)^{-1}R'\left(R\left(X'X\right)^{-1}R'\right)^{-1}R\cdot E\left[\left(\hat{\beta }-\beta ^*\right)\left(\hat{\beta }-\beta ^*\right)\right] \notag \\ &=\sigma ^2\left(X'X\right)^{-1}R'\left(R\left(X'X\right)^{-1}R'\right)^{-1}R\left(X'X\right)^{-1} \notag \\ \end{align}\]이고
\[\begin{align} V&\left(\left(X'X\right)^{-1}R'\left(R\left(X'X\right)^{-1}R'\right)^{-1}\left(R\hat{\beta }-r\right)\right) \notag \\ &=\left(X'X\right)^{-1}R'\left(R\left(X'X\right)^{-1}R'\right)^{-1}V\left(R\hat{\beta }-r\right)\left(R\left(X'X\right)^{-1}R'\right)^{-1}R\left(X'X\right)^{-1}\ 에서 \notag \\ V&\left(R\hat{\beta }-r\right)=V\left(R\hat{\beta }\right)+V\left(r\right)-2Cov\left(R\hat{\beta },\ r\right)=\sigma ^2R\left(X'X\right)^{-1}R'이니 \notag \\ \Rightarrow &\sigma ^2\left(X'X\right)^{-1}R'\left(R\left(X'X\right)^{-1}R'\right)^{-1}R\left(X'X\right)^{-1}R'\left(R\left(X'X\right)^{-1}R'\right)^{-1}R\left(X'X\right)^{-1} \notag \\ &=\sigma ^2\left(X'X\right)^{-1}R'\left(R\left(X'X\right)^{-1}R'\right)^{-1}R\left(X'X\right)^{-1} \notag \\ \end{align}\]따라서
\[\begin{align} V\left(\tilde{\beta }\right)&=V\left(\hat{\beta }\right)+\sigma ^2\left(X'X\right)^{-1}R'\left(R\left(X'X\right)^{-1}R'\right)^{-1}R\left(X'X\right)^{-1} \notag \\ &\quad \quad \quad \quad -2\sigma ^2\left(X'X\right)^{-1}R'\left(R\left(X'X\right)^{-1}R'\right)^{-1}R\left(X'X\right)^{-1} \notag \\ &=\sigma ^2\left(X'X\right)^{-1}-\sigma ^2\left(X'X\right)^{-1}R'\left(R\left(X'X\right)^{-1}R'\right)^{-1}R\left(X'X\right)^{-1} \notag \end{align}\]근데 \(\sigma ^2\left(X'X\right)^{-1}R'\left(R\left(X'X\right)^{-1}R'\right)^{-1}R\left(X'X\right)^{-1}\)식을 유심히 보면
\(X'X\)가 PD(Positive Definite)이니 \((X'X)^{-1}\)가 PD이고 양쪽에 \(R\)을 대칭적으로 곱한 \(R(X'X)^{-1}R'\) PD가 되고 … 이런식으로 이어나가다 보면
결국 \(\left(X'X\right)^{-1}R'\left(R\left(X'X\right)^{-1}R'\right)^{-1}R\left(X'X\right)^{-1}\)가 PD를 만족한다.
따라서, 제약조건이 성립한다면(실제로 그러하다면) \(\tilde{\beta}\)는 \(\hat{\beta}\)보다 더 efficient한 estimator가 된다.
\(X'X\)는 일반적으로 PD가 만족되도록 설계됨
2. Test
그럼!!! 제약조건이 진짜 맞는지(성립하는지)에 대해서 판단해볼 필요가 있다.
그래서 이번 섹션에서는 제약조건이 맞는지 검정하는 방법에 다뤄보겠다.
예를들어, 다음과 같은 모델을 가정해보자.
\[Y_t=\beta _0^*+\beta _1^*D_t+\beta _2^*Z_t+\beta _3^*\left(Z_tD_t\right)+\beta _4^*X_t+\epsilon _t\]여기서, \(Y_t\)는 임금, \(D_t\)는 dummy variable(성별 등), \(Z_t\)는 교육에 관한 변수, \(X_t\)는 통제변수이다.
우리는 이 모델에서 성별에 따른 임금차이, 교육수준에 따른 임금차이가 있을 것이라는 사실을 궁금해한다.
따라서,
이런 방식으로 가설들을 세울 수 있다.
2-1. Wald Statistic
이 가설을 accept하기 위해서 \(R\beta^*-r=0\)인지 검정해봐야 하고, 따라서 \(d(R\hat{\beta}-r, 0)\)의 null distribution을 찾아야한다.
\(\hat{\beta}\)가 \(N(\beta^*, \sigma^2(X'X)^{-1})\)를 따르기 때문에, \(R\hat{\beta}-r\sim N(R\beta^*-r, \sigma^2R(X'X)^{-1}R')\)
\(H_0\)하에서, 위 분포를 표준화 하여 제곱하면
\[(R\hat{\beta}-r)'(\sigma^2R(X'X)^{-1}R')^{-1}(R\hat{\beta}-r)\]이고, 이 값은 제약조건 \(q\)차원의 변수이기 때문에 카이제곱분포를 따르게 된다.
이 통계량을 계산해보면 다음과 같다.
\[w\equiv (R\hat{\beta}-r)'(\sigma^2R(X'X)^{-1}R')^{-1}(R\hat{\beta}-r)\sim \mathcal{X}^2(q)\]근데, 식을 잘 보면 \(\sigma\)가 사용된 것을 알 수 있다. 하지만, 실제 데이터에서 모수인 \(\sigma\)는 알려져 있지 않다. 따라서 우리는 \(\sigma\)도 동시에 추정하여 사용해야 한다.
우리는 이전에 \(\sigma^2\)의 추정량을 계산해내었다.
따라서,
\[w\sim \mathcal{X}^2(q),\quad \frac{e'e}{\sigma^2}\sim \mathcal{X}^2(T-k)\ and \quad w\perp \frac{e'e}{\sigma^2} \mathrm{이니}\] \[\frac{w/q}{\frac{e'e}{\sigma^2}/(T-k)}\sim F(q, T-k)\]이 통계량을 Wald 통계량이라고한다.
그리고 다른 계산식으로 해석될 수도 있다.
\[W_0=\frac{(USS_R-USS_U)/q}{USS_U/(T-k)}=\frac{(\tilde{e}'\tilde{e}-e'e)/q}{e'e/(T-k)}\]\(USS\)는 Unexplained Sum of Squares이고 아래 첨자는 restricted(R)와 unrestricted(U)이다.
증명)
\[\begin{align} \tilde{\beta }&=\hat{\beta }-\left(X'X\right)^{-1}R'\left(R\left(X'X\right)^{-1}R'\right)^{-1}\left(R\hat{\beta }-r\right) \notag \\ \tilde{e}&=Y-X\tilde{\beta }=Y-X\hat{\beta }+X\hat{\beta }-X\tilde{\beta }=\hat{e}+X\left(\hat{\beta }-\tilde{\beta }\right) \notag \\ \tilde{e}'\tilde{e}&=\hat{e}'\hat{e}+\left(\hat{\beta }-\tilde{\beta }\right)'X'X\left(\hat{\beta }-\tilde{\beta }\right) \notag \\ &=\hat{e}'\hat{e}+\left(\hat{\beta }-\tilde{\beta }\right)'X'X\left(X'X\right)^{-1}R'\left(R\left(X'X\right)^{-1}R'\right)^{-1}\left(R\hat{\beta }-r\right) \notag \\ &=\hat{e}'\hat{e}+\left(R\hat{\beta }-r\right)'\left(R\left(X'X\right)^{-1}R'\right)^{-1}\left(R\hat{\beta }-r\right) \notag \\ \Rightarrow \tilde{e}'\tilde{e}-\hat{e}'\hat{e}&=\left(R\hat{\beta }-r\right)'\left(R\left(X'X\right)^{-1}R'\right)^{-1}\left(R\hat{\beta }-r\right) \notag \end{align}\]이런 방법으로 설계한 모델이 적절한지 테스트를 해볼 수 있다.
\(Y=X\beta^*+\epsilon\)으로 설계해서 계수의 유효성을 보기 위해 가설을 세우면,
\[\begin{align} &H_0 : \beta_1^*=\beta_2^*=\cdots =\beta_k^*=0 &H_a : \exists i,\ \beta_i^*\ne 0\quad \mathrm{즉,\ }X_i \mathrm{가\ 유의미하다.} \notag \end{align}\]\(F(k, T-k)\)로 테스트 하면 된다.
3. Chow Test
Chow test란 서로 다른 데이터 셋으로 회귀분석한 두 선형 모델이 같은 계수값을 갖는지 검사하는 것이다.
예를들어, 9.11, subprime mortage crisis라든지, covid-19같은 큰 사건에 의해 특정 점에서 구조적인 변화가 발생했는지를 검사할 때 사용된다.
이 분석을 할 때 중요한 가정 하나가 있는데 바로 구조적인 변화가 발생한 점을 알고 있어야 한다는 것이다.
두 가지 방법이 있다.
- 첫 번째 방법은 dummy variable(\(D\))을 추가하여 \(D\)에 결합된 계수의 값이 0인지 아닌지를 검정하는 방법이다.
\(Y=X\beta^*+XD\gamma^*+\epsilon\)로 모델을 세우면 된다.- 두 번째 방법은 실제로 구조적인 변화가 발생한 점을 기점으로 데이터를 두 덩어리로 나눠 각각 회귀분석한 뒤 계수가 같은지 검정하는 방법이다. \(Y=X\beta_1^*+\epsilon,\quad Y=X\beta_2^*+\eta\)로 모델을 세우면 된다.
참고로 전자의 경우 \(D\)를 추가했기 때문에 설명변수의 개수가 \(2k\)가 되고, 후자의 경우 회귀모델을 두 번하니 설명변수가 \(2k\)개가 된다. 즉, \(W_0\sim F(q, T-2k)\)여야 한다.
후기) 이번에는 중요한 chow test를 알아봤는데요… 알아두시면 데이터 분석할 때 좋습니다…
오타 혹은 잘못된 정보가 있다면 댓글 이메일 등등으로 알려주시면 감사하겠습니다. (꾸벅)