표본 데이터에서 모집단의 상황을 추측하는 것이 통계학인가요?
실은 통계학은 두 종류가 있습니다. ‘추리통계학’과 ‘기술통계학’입니다. 앞에서 설명한 것은 추리통계학이에요.
그럼 기술통계학은 뭐죠?
추리한다는 발상이 없는 통계학입니다. 좀더 풀어서 말하자면 데이터를 정리함으로써 집단의 상황을 최대한 간결하게 표현하는 것이 목적인 통계학입니다.
그렇다면…?
총인구에서 차지하는 30세 미만 인구의 비율을 계산하거나 학교 교사가 반 평균을 계산하는 걸 예로 들 수 있겠네요.
아하! 그건 추리를 하려는 게 아니군요.
_<35쪽>에서

‘베이즈 통계학’이라고 들어본 적이 있나요
아뇨, 무슨 일인지 전혀 모르겠어요.
참고사항 정도로 조금만 설명할게요. 우리 수업에서 설명하는 통계학은 일반적인 것입니다. 평범한 통계학이라고 생각하면 됩니다. 그와 쌍을 이루는 것이 베이즈 통계학(Bayesian statistics)입니다.
쌍을 이룬다는 게 무슨 뜻일까요.
오른손과 왼손이라든지, 동쪽과 서쪽이라든지, 야구의 메이저리그와 마이너리그 같은 관계입니다. 어느 쪽이 더 훌륭하거나 대단하다는 뜻은 아닙니다.
학교에서는 무엇을 배우나요.
고등학교까지는 일반적인 통계학이죠. 대학에서도 원칙은 그쪽이지만 분야에 따라서는 달라질 수 있어요. 경제학이나 심리학, 기계학습 등에서는 베이즈 통계학을 배울 기회도 있습니다.
일반적인 통계학과 베이즈 통계학은 무엇이 다른가요.
_<36쪽>에서

연구자가 피험자를 온종일 모니터링하면서 식사 내용을 기록한다면 이야기는 달라집니다. 하지만 대면이나 전화로 ‘어제는 무엇을 먹었습니까?’ ‘쌀밥이요.’ ‘몇 그릇을 드셨나요?’ ‘작은 밥그릇으로 두 공기…어라? 세 그릇이었나?’ 이런 데이터가 몇백 명분 축적되었다고 합시다. ‘작은 밥그릇’이 구체적으로 어느 정도 크기인지도 잘 모르겠고, 애초에 정직하고 정확하게 답해야 할 의무도 없죠.
_<59쪽>에서

데이터 집계 결과를 시각화할 때는 왠지 모르지만 원형 차트로 표현하는 경우가 꽤 많더군요. 아래 그림은 어느 패밀리 레스토랑의 설문조사 결과입니다. 이렇게 질문의 선택지가 ‘3개 이상이고 순서성이 있을 때’는 원형 차트로 표현하는 게 좋습니다. 누적된 값을 파악하기 쉽거든요(원형 대신 가로띠 차트로도 가능). 그런데 질문의 선택지가 3개 이상이고 순서성이 없을 때 적절한 것은 원형이 아니라 가로 막대그래프입니다. 이유는 두 가지를 들 수 있어요. 하나는 누적된 값의 산출하는 게 별 의미가 없기 때문입니다. 즉 ‘그렇구나, 돼지고기 생강구이와 고등어 된장 조림으로 50% 정도인가’ 같은 발상을 하는 의미가 별로 없으니까요. 또 하나는 각 선택지 비율의 서열을 즉시 파악할 수 있기 때문입니다. 원형 차트로 나타내기 좋은 것은 질문의 선택지가 ‘3개 이상이고 순서성이 있는’ 경우이거나 질문의 선택지가 두 개인 경우입니다.
_<62쪽>에서

엽서를 보내는 사람은 추첨으로 뽑는 선물을 받고 싶거나 의견을 말하기 좋아하는 어르신이 대부분이어서 오늘 이야기를 들으니 편중되어 있다는 생각이 듭니다.
엽서를 보낸 사람들은 모집단인 ‘출판사가 독자라고 생각하는 사람’으로부터 무작위로 추출된 것이 아닙니다. 오히려 ‘출판사가 독자라고 생각하는 사람’에 포함되지 않은 사람들도 보냈을 것입니다. 그래서 보내온 독자 엽서의 집계 결과는 그 사람들의 의견을 모은 것에 불과하니까 아무 가치가 없습니다.
즉, 이런 말인가요? 모집단인 출판사가 독자라고 생각하는 사람 중에서 무작위로 추출된 사람들이 아니니까 독자 엽서를 보낸 사람들의 데이터 집계 결과를 보고 출판사의 높은 분이 ‘지난달보다 만족도가 떨어졌다’고 화를 내는 것은 잘못이라고요.
그렇죠. 잘못입니다.
_<74쪽>에서

- ‘확률 밀도 함수’는 히스토그램 계급폭을 좁혀나가 최종적으로 도달하는 곡선의 식이다.
- 확률 밀도 함수 그래프와 가로축 사이에 낀 부분의 면적은 1이다.
- 확률 밀도 함수의 그래프와 가로축 사이에 낀 부분의 면적은 비율 또는 확률과 동일시할 수 있다.
- 학술적으로 중시되는 확률 밀도 함수의 종류로는 ‘t분포’ ‘F분포’ ‘정규 분포’ 등이 있다.
- 정규 분포 그래프의 모양은 평균을 경계로 좌우대칭을 이루며 평균과 표준편차의 영향을 받는다.
- 평균이 0이고 표준편차가 1인 정규 분포를 ‘표준 정규 분포’라고 한다.
_<160쪽>에서