251209_BootCamp Day 37_기초 통계학 (1)

2025. 12. 9. 20:06TIL

1. 모집단과 표본

1) 모집단

통계학에서 알고자 하는 대상 전체

모집단의 조사 방법
전수조사 모집단에 포함된 모든 요소를 조사
가장 정확하지만 비용과 시간 문제로 사실상 불가능에 가까움.
표본조사 모집단의 일부인 표본을 분석해 모집단 전체의 성질을 추정(estimate)
표본크기 (n) : 한 표본에 포함된 샘플의 개수

https://medium.com/@fatmanurkutlu1/descriptive-and-inferential-statistics-7749de072f72

2) 기술통계 (Descriptive Statistics)

현재 관찰(습득)한 데이터를 요약하고 설명하는 통계

중심 경향치 : 평균, 중앙값, 최빈값

흩어진 정도 : 분산, 표준편차 (데이터가 중심에서 얼마나 퍼져 있는지 정도를 수치화한 것)

3) 추론통계 (Inferential Statistics)

포본을 바탕으로 전체 모집단을 추정하거나, 어떤 주장이 맞는지 검정하는 통계

예측의 범위이기 때문에 불확실성이 존재함 → 확률의 개념이 필요

4) 확률 (Probability)

발생 여부가 불확실한 사건의 가능성을 숫자로 표현한 것

확률은 0과 1 사이의 값을 가지며, 모든 사건의 확률을 더하면 1이 된다.

확률변수 : 가질 수 있는 확률이 달라지는 변수.

이산형 확률변수 : 하나씩 셀 수 있는 변수. (주사위 눈위 개수, 나이 등 범주형 or 정수 형태)

연속형 확률변수 : 무한히 정밀하게 쪼갤 수 있는 변수 (키, 연봉 등 실수 형태)

실현값 : 실제로 시행했을 때 확률변수가 가지는 값.

5) 확률분포

확률변수가 가질 수 있는 값과 그에 대한 발생 확률 간의 관계를 그래프로 나타낸 것

이산형 확률변수의 확률분포 → 막대그래프 형태

연속형 확률변수의 확률분포 → 곡선 형태

※ 연속형 확률변수의 확률분포의 y축은 확률이 아니다. 확률은 특정 구간에 대해 확률밀도함수를 적분한 값

 

2. 추정과 가설검정

1) 추정 (Estimation)

모집단의 평균, 비율 등 모집단의 성질을 표본을 통해 예측하는 것

특정 값 하나로 설명한느 것은 추정의 가치는 높을 수 있으나, 불확실성이 커진다.

따라서 추정의 가치를 유지하면서도 불확실성을 줄일 수 있는, "범위"로 모집단의 성질을 표현한다.

2) 가설검정 (Hypothesis Test)

이떤 주장이 우연에 의해 발생했는지, 아니면 통계적으로 의미가 있는지 검증하는 과정

표본통계량이 정규분포 위에서 얼마나 멀리 떨어져 있는지를 보고 판단한다.

3) 정규분포 (Normal Distribution)

평균 μ를 중심으로 좌우 대칭을 이루며, 종 모양 형태를 띠는 분포

평균을 통해 정규분포의 x축 상 위치가 정해지고, 표준편차 σ를 통해 분포의 퍼짐 정도가 결정된다.

μ - σ <= x <= μ + σ일 확률 = 약 68.3%

μ - 2σ <= x <= μ + 2σ일 확률 = 약 95.4%

μ - 3σ <= x <= μ + 3σ일 확률 = 약 99.7%

이처럼 정규분포는 평균에서 몇 표준편차나 떨어져있느냐를 알면, 그 구간의 확률을 계산할 수 있다.

4) 표준화 (Standardization)

원래의 평균이나 표준편차와 관계없이 분포 상에서 어느 정도 위치에 있는지 파악하기 위해 사용

범위가 다른 두 변수 (ex. 키와 연봉)를 비교할 때 기준을 일치시키고 상대적인 위치를 통해 비교할 수 있다.

5) 중심극한정리 (Central Limit Theorem, CLT)

https://www.geeksforgeeks.org/maths/central-limit-theorem/

모집단의 크기와 상관 없이, 표본크기 n이 충분히 크면 표본평균의 분포는 정규분포에 가까워진다.

n이 충분히 클 때 (n>=30) 표본평균 m의 분포는 평균 μ, 표준편차 \(\frac{ \sigma}{\sqrt{n}}\)인 정규분포의 형태를 따른다.

+ 내가 이해한 중심극한정리

표본평균 m은 중심극한정리에 의해, 모집단에서 추출한 표본평균으로 이루어진 정규분포 N1 (평균 μ, 표준편차 \(\frac{ \sigma}{\sqrt{n}}\) ) 상에 위치한다.

이때 N1 상에서, 표본평균 m이 \(-1.96\times \frac{\sigma}{\sqrt{n}}\leq \mu \leq 1.96\times \frac{\sigma}{\sqrt{n}}\)에 위치할 확률은 95%이다. (정규분포의 확률 계산)

그렇다면 역으로 m을 중심으로 표준편차 \(\frac{ \sigma}{\sqrt{n}}\)인 정규분포 N2를 그리면, 모평균 μ가 N2의 \(-1.96\times \frac{\sigma}{\sqrt{n}}\leq m \leq 1.96\times \frac{\sigma}{\sqrt{n}}\) 안에 위치할 확률도 95%이다.

따라서 표본평균 m에 대해 95% 확률로 μ는 \(m-1.96\times \frac{\sigma{\sqrt{n}}\leq \mu \leq m+1.96\times \frac{\sigma}{\sqrt{n}}\) 구간에 존재하고, 이를 95% 신뢰구간이라고 한다.

이때 표본크기 n이 커질수록 표준오차가 작아지게 되고, 동일한 신뢰도에 대해 더 좁은 신뢰구간을 갖게 되어 추정의 가치가 높아진다.

6) 표본오차 (sample error)

\(\overline{x}-\mu\)

표본평균과 모평균의 차이

7) 표준오차 (standard error, SE)

\(SE=\frac{ \sigma}{\sqrt{n}}\)

중심극한정리에 의해 정규분포를 따르는 표본평균의 표준편차

큰 수의 법칙 : 표본크기 n이 커질수록 표본평균은 모평균 μ에 한없이 가까워진다.

8) 신뢰구간 (Confidence Interval)

모수(모평균)가 실제로 포함될 것이라고 추정되는 범위

신뢰구간 하나는 μ를 포함하거나 (100%) 포함하지 않거나 (0%) 둘 중 하나이다.

95% 신뢰구간이라는 것은 100번 신뢰구간을 만들었을 때 95개는 μ를 포함할 것이라는 의미이다.

9) Z-분포 (Z-distribution)

표본평균 정규분포의 표준화 결과 : 평균 0, 표준편차 \(\frac{ \sigma}{\sqrt{n}}\)인 정규분포

10) t-분포 (t-distribution)

우리는 모집단의 성질인 μ와 σ를 알 수 없기 때문에 표본표준편차인 s를 이용해 분포를 그리게 된다.

이 때 발생할 수 있는 추가적인 불확실성을 반영하기 위해 t-분포를 사용한다.

\(t=\frac{\overline{x}-\mu}{s/\sqrt{n}}\)

s는 표본에서 계산한 값이므로 σ보다 불확실성이 크기 때문에, 꼬리가 두꺼운 분포를 사용해 예외적인 값이 나올 확률을 높인다.자유도 (degree of freedom, DF) = n - 1 (t분포의 모양을 결정하는 요소)+ 즉 t-분포와 Z-분포는 모두 표본평균의 분포를 나타내는 것인데, Z-분포는 μ와 σ를 알고 있을 때 표본평균을 표준정규분포로 만드는 것이고, t-분포는 s를 이용해 표준화하는데 표본크기 n이 커질 수록 중심극한정리에 의해 Z-분포에 가까워진다.

11) 가설검정 (Hypothesis Testing)

어떤 주장이 통계적으로 의미가 있는지, 우연에 의해 발생한 결과인지 검증하는 과정실험군(어떤 조치를 취한 집단) vs 대조군 (비교를 위해 아무 것도 수행하지 않은 집단)의 차이를 바탕으로 가설검정을 수행귀무가설 \(H_{0}\) : 밝히고자 하는 가설의 부정 명제 (ex. 신약은 효과가 없다)대립가설 \(H_{1}\) : 밝히고자 하는 가설 (ex. 신약은 효과가 있다)검정통계량 : 두 그룹의 차이를 표준오차로 나눈 값유의수준 (α) : 통계적 가설 검정에서 귀무가설이 참인데도 불구하고 잘못 기각할 확률의 최대값p-value : 두 그룹의 차이가 우연히 발생할 확률가설점정은 귀무가설이 옳다는 전제 하에 귀무가설이 틀렸음을 증명하는 과정으로 이루어진다.

12) p-value

귀무가설이 참일 대 지금과 같은 차이가 발생할 확률p-value가 작다는 것은 귀무가설이 맞을 때 우리가 가진 데이터가 나올 확률이 작다는 뜻유의수준은 귀무가설의 채택 기준. p-value가 α 보다 낮다면 귀무가설을 기각하고, α보다 높다면 귀무가설을 채택보통 p-value를 나누는 α는 0.05를 사용하나, 도메인이나 상황 별로 달라질 수 있다.※p-value는 귀무가설이 참일 확률이 아니다. 단지 귀무가설이 참일 때 지금 데이터가 얼마나 극단적인지를 보여주는 것.