계량경제학 2 - 이산 확률 분포
계량경제학에서 주로 사용되는 이산 확률 분포인 베르누이 분포, 이항 분포, 푸이송 분포에 대해 다룬다.
이 포스트는 계량경제학에서 주로 사용되는 이산 확률 분포의 종류에 대해서 다룹니다.
필요한 내용만 다루기 때문에 각 분포에 대해서 심오한 분석을 하지 않습니다.
0. Prerequisite
확률 변수, 확률 분포에 대한 지식을 필요로 합니다.
이산 확률 변수란 확률 변수의 치역의 원소의 개수가 가산 개인 확률 변수이다.
이산 확률 분포란 이산 확률 변수의 확률 분포를 의미한다.
이때 이산 확률 분포를 나타내는 함수를 확률 질량 함수라고 말한다.
이전 포스트에서 확률 변수의 기댓값과 분산을 정의했는데 이산 확률 변수에 맞춰 표현하면,
기댓값은 \(E\left(X\right)=\sum _{i\ }^{\ }P\left(x_i\right)x_i\)
분산은 \(V\left(X\right)=\sum _{i\ }^{\ }P\left(x_i\right)\left(x_i-\mu \right)^2\)
로 표현할 수 있다. 이때 \(\mu=E(X)\)이다.
1. 베르누이 분포(Bernoulli Distribution)
어떤 임의 실험에서 성공 할 확률이 \(p\), 실패 할 확률이 \(1-p\)라고 할 때 이 실험을 베르누이 시행이라 하고 이 시행에서 성공을 \(1\), 실패를 \(0\)으로 사상하는 함수 \(Y\)를 베르누이 확률 변수라고 한다.
따라서 확률 분포함수는 \(P(Y)=p^{Y}(1-p)^{1-Y}\)로 표현된다.
기댓값과 분산을 계산해보면,
이다.
베르누이 분포는 \(p\)가 분포를 결정하는 성질이 있다.
2. 이항 분포(Binominal Distribution)
이항 확률 변수 \(X\)는 \(n\)회의 독립적인 베르누이 시행에서의 성공 횟수를 사상하는 확률 변수이다. 베르누이 확률 변수 \(Y\)를 사용하여 표현하면 \(X=\sum_{i}(Y_{i})\)정도가 되겠다.
2-1. 확률 분포함수 유도
\[\begin{aligned} &P({0})=(1-p)^{n} \quad\quad\quad\quad\quad //모두 실패 \\ &P({1})=\begin{pmatrix}n\\1\end{pmatrix}p(1-p)^{n-1} \quad\quad //1회\, 성공 \\ &P({2})=\begin{pmatrix}n\\2\end{pmatrix}p^{2}(1-p)^{n-2} \quad\quad //2회\, 성공 \\ &\quad \quad \vdots \\ &P({n})=p^{n} \quad\quad\quad\quad\quad\quad\quad //모두 성공 \\ \end{aligned}\]이니, \(P({x})=\begin{pmatrix}n\\x\end{pmatrix}p^{x}(1-p)^{n-x} \quad\quad for\; x = 0, 1, 2,...,n\)라고 할 수 있다.
2-2. 이항정리 (Binomial Theorem)
이항식 \((x+y)^{n}\)을 전개할 때 조합론을 이용하여 간단히 표현하는 정리이다. (사실 위 확률 분포함수를 유도할 때 사용하였다.) 수식으로 표현하면 다음과 같다.
\[\begin{aligned} (x+y)^n=\sum _{k=1\ }^{\ n}\begin{pmatrix}n\\k\end{pmatrix}x^{k}y^{n-k} \end{aligned}\]이 식에 \(x=p, y=1-p\)를 대입하면
\[(p+1-p)^n=\sum _{k=1\ }^{\ n}\begin{pmatrix}n\\k\end{pmatrix}p^{k}(1-p)^{n-k}\]인데 좌변이 \(1\)이니 확률의 정의에 맞게 \(\sum _{i\ }^{\ }P\left(x_i\right)=1\)을 만족함을 볼 수 있다.
2-3. 기댓값, 분산
어쩌다보니 섹션을 따로 빼게 되었는데 증명 난이도 자체는 낮으니 기술만 하겠다.
\[\begin{aligned} &E(X)=np \\ &V(X)=np(1-p) \\ \end{aligned}\]이항 분포는 \(n, p\)가 분포를 결정하는 성질이 있다.
베르누이 분포나 이항분포에서 확률 변수를 정의함에 있어 성공을 1로 사상했는데 실패를 1로 사상해도 결과는 크게 달라지지 않는다, 변수 표현만 달라지고 큰 틀에서는 동일하니 그냥 넘어가도 좋다.
3. 푸아송 분포(Poisson Distribution)
정해진 (시간 공간 등)구간 내에 성공 사건이 발생할 확률 변수를 푸아송 확률 변수라고 한다.
예를들어, 10분에 정비소에 도착하는 차량의 수, 10페이지에 문법 오류의 수 등이 있다.
3-1. 확률 분포함수 유도
푸이송 확률 분포의 동기로부터 유도가 되는데, 예시를 들어보겠다.
10000명의 사람 중 감염율이 0.01%인 바이러스에 감염된 사람의 수가 100명일 확률을 이항분포로 계산하면 \(P({100})=\begin{pmatrix}10000\\100\end{pmatrix}0.0001^{100}(0.9999)^{9900}\) 정도가 되는데 \(10000!\)의 경우 계산 불가라는 것이다.
그래서 큰 표본공간 내 낮은 확률이 발생하는 실험에서 구하고자 하는 목표가 달성될 확률 혹은 그 추정치의 신뢰도(구간) 등을 추정하기 위해서 도입되었다.
\(\lambda = np\)라고 하면 \(p= \frac{\lambda }{n}\)이니니, 이항분포함수에서
\[\begin{aligned} P({x})&=\begin{pmatrix}n\\x\end{pmatrix}p^{x}(1-p)^{n-x} \\ &=\frac{n\left(n-1\right)\cdots \left(n-k+1\right)}{k!}\left(\frac{\lambda }{n}\right)^k\left(1-\frac{\lambda }{n}\right)^{n-k} \\ &=\left(\frac{\lambda ^k}{k!}\right)\frac{n\left(n-1\right)\cdots \left(n-k+1\right)}{n^k}\left(1-\frac{\lambda }{n}\right)^n\left(1-\frac{\lambda }{n}\right)^{-k} \\ \end{aligned}\]이다. 여기서,
\[\begin{aligned} &n\to \infty 를\ 취하면 \\ &\lim _{n\to \infty }^{ }{p}=\lim _{n\to \infty }^{ }{\frac{\lambda }{n}}=0 \\ &\lim _{n\to \infty }^{ }{\frac{n\left(n-1\right)\cdots \left(n-k+1\right)}{n^k}}=1 \\ &\lim _{n\to \infty }^{ }{\left(1-\frac{\lambda }{n}\right)^n}=e^{-\lambda } \\ &\lim _{n\to \infty }^{ }{\left(1-\frac{\lambda }{n}\right)^{-k}}=1 \end{aligned}\]이니
\[\begin{aligned} P\left(X=x\right)=\frac{\lambda ^xe^{-\lambda }}{x!} \end{aligned}\]이다. 이게 푸아송분포의 확률 분포함수이다.
3-2. 기댓값, 분산 유도
\(\begin{aligned} E\left(X\right)&=\sum _{x=0}^{\infty }x\frac{e^{-\lambda }\lambda ^x}{x!}\\ &=\sum _{x=1}^{\infty }\frac{x\lambda }{x}\frac{e^{-\lambda }\lambda ^{x-1}}{\left(x-1\right)!}\\ &=\lambda \sum _{x=0}^{\infty }\frac{e^{-\lambda }\lambda ^x}{x!}\\ &=\lambda \end{aligned}\)
\(V(X)=E(X^2)-\mu^2\)이니,
\(\begin{aligned} E\left(X^2\right)&=\sum _{x=0}^{\infty }x^2\frac{e^{-\lambda }\lambda ^x}{x!}\\ &=\sum _{x=0}^{\infty }\frac{x\left(x-1\right)\lambda ^2}{x\left(x-1\right)}\frac{e^{-\lambda }\lambda ^{x-2}}{\left(x-2\right)!}+\sum _{x=0}^{\infty }\frac{x\lambda }{x}\frac{e^{-\lambda }\lambda ^{x-1}}{\left(x-1\right)!}\\ &=\lambda ^2\sum _{x=0}^{\infty }\frac{e^{-\lambda }\lambda ^x}{x!}+\lambda \sum _{x=0}^{\infty }\frac{e^{-\lambda }\lambda ^x}{x!}\\ &=\lambda ^2+\lambda \end{aligned}\)
\(\begin{aligned} V(X)=\lambda^2+\lambda-\lambda^2=\lambda \end{aligned}\)
푸아송 분포는 \(\lambda(=\mu)\)가 분포를 결정하는 성질이 있다.
후기) 이산 확률 분포에는 기하분포, 초기하분포, 음의 이항분포 등이 더 있지만 계량경제학을 함에 있어 구지구지여서 필요하면 공부하는 식으로 해도 늦지 않다 생각해서 안넣었습니다.
오타 혹은 잘못된 정보가 있다면 댓글 이메일 등등으로 알려주시면 감사하겠습니다. (꾸벅)