PSPP 강의 3편 — 기술통계와 교차표

이 편에서는 분석의 첫 단계인 빈도표, 기술통계량, 상자그림, 그리고 교차표와 카이제곱 검정을 돌린다. “실험군이 대조군보다 재수강 의향이 높은가”가 이 편의 질문이다.

데이터

2편에서 만든 data/training_survey.sav를 연다. 범주형 변수(gender, dept, edu, group, reenroll)는 빈도표로, 연속형 변수(age, pre_score, post_score, gain, sat_mean, salary)는 기술통계량으로 본다. 교차표는 group × reenroll이다.

GET FILE='data/training_survey.sav'.

메뉴로 하기

Analyze > Descriptive Statistics 아래에 Frequencies, Descriptives, Explore, Crosstabs가 있다. SPSS와 같은 이름, 같은 자리다.

Frequencies 대화상자는 왼쪽 변수 목록에서 고른 변수를 오른쪽으로 옮기고 OK를 누르면 끝이다. Statistics 버튼으로 평균·중앙값 같은 통계량을 추가할 수 있다.

PSPPIRE Frequencies 대화상자

Crosstabs 대화상자는 행 변수와 열 변수를 각각 넣고, Statistics 버튼에서 Chi-square를 켠다. Cells 버튼에서 기대빈도와 행 퍼센트를 켤 수 있다.

PSPPIRE Crosstabs 대화상자

대화상자 아래에 Paste 버튼이 있다. 누르면 그 설정에 해당하는 신택스가 신택스 편집기에 붙는다. 메뉴로 한 번 해 보고 Paste로 신택스를 얻어 두는 것이 신택스를 배우는 가장 빠른 길이다.

신택스로 하기

syntax/02_descriptives.spssyntax/03_crosstabs.sps다.

FREQUENCIES VARIABLES=gender dept edu group reenroll
  /STATISTICS=NONE.

DESCRIPTIVES VARIABLES=age pre_score post_score gain sat_mean salary
  /STATISTICS=MEAN STDDEV MIN MAX SKEWNESS KURTOSIS.

EXAMINE VARIABLES=gain BY group
  /PLOT=BOXPLOT
  /STATISTICS=DESCRIPTIVES.
CROSSTABS
  /TABLES=group BY reenroll
  /CELLS=COUNT ROW EXPECTED
  /STATISTICS=CHISQ PHI.

출력 읽기

빈도표는 SPSS와 같은 모양이다. 값 레이블이 있으면 숫자 대신 레이블이 찍힌다.

                              성별
+----------+---------+-------+-------------+------------------+
|          |Frequency|Percent|Valid Percent|Cumulative Percent|
+----------+---------+-------+-------------+------------------+
|Valid 남성|       99|  49.5%|        49.5%|             49.5%|
|      여성|      101|  50.5%|        50.5%|            100.0%|
+----------+---------+-------+-------------+------------------+
|Total     |      200| 100.0%|             |                  |
+----------+---------+-------+-------------+------------------+

기술통계량 표다. 향상분(gain)의 평균 4.72는 실험군 약 +8과 대조군 약 +1의 가중 평균이다.

                                      Descriptive Statistics
+----------------------+---+-------+-------+--------+---------+--------+---------+-------+-------+
|                      | N |  Mean |Std Dev|Kurtosis|S.E. Kurt|Skewness|S.E. Skew|Minimum|Maximum|
+----------------------+---+-------+-------+--------+---------+--------+---------+-------+-------+
|나이                  |200|  35.49|   7.30|    -.54|      .34|     .08|      .17|     22|     51|
|교육 전 평가 점수     |200|  60.30|  10.02|     .38|      .34|    -.13|      .17|   31.4|   92.5|
|교육 후 평가 점수     |200|  65.02|  12.27|     .04|      .34|    -.12|      .17|   30.0|   99.6|
|점수 향상분(사후-사전)|200|   4.72|   7.03|    -.45|      .34|    -.16|      .17|  -11.4|   19.5|
|만족도 평균           |200|   3.06|    .82|    -.31|      .34|    -.18|      .17|   1.00|   5.00|
|연봉(만원)            |200|3657.33| 573.38|    -.03|      .34|    -.01|      .17|   2212|   5268|
+----------------------+---+-------+-------+--------+---------+--------+---------+-------+-------+

EXAMINE은 집단별 기술통계와 상자그림을 낸다. 상자그림은 png 파일로 나온다. 배치 실행이면 출력 파일 옆에, GUI면 출력 뷰어 안에 그려진다.

PSPP EXAMINE 상자그림 — 집단별 점수 향상분

교차표와 카이제곱 검정이다. 실험군의 재수강 의향 비율이 대조군보다 높고, Pearson χ²=11.55, p=.001로 유의하다.

            실험 집단 × 재수강 의향
+-------------------------+------+-----+------+
|                         | 재수강 의향|      |
|                         +------+-----+      |
|                         |아니오|  예 | Total|
+-------------------------+------+-----+------+
|실험 집단 대조군 Count   |    65|   29|    94|
|                 Expected| 53.11|40.89|   .47|
|                 Row %   | 69.1%|30.9%|100.0%|
|          실험군 Count   |    48|   58|   106|
|                 Expected| 59.89|46.11|   .53|
|                 Row %   | 45.3%|54.7%|100.0%|
                                          Chi-Square Tests
+-------------------------+-----+--+------------------------+------------------+-------------------+
|                         |Value|df|   Asymptotic Sig. (2-  |  Exact Sig. (2-  |   Exact Sig. (1-  |
|                         |     |  |         tailed)        |      tailed)     |      tailed)      |
+-------------------------+-----+--+------------------------+------------------+-------------------+
|Pearson Chi-Square       |11.55| 1|                    .001|                  |                   |
|Likelihood Ratio         |11.70| 1|                    .001|                  |                   |
|Fisher's Exact Test      |     |  |                        |              .001|               .001|
|Continuity Correction    |10.60| 1|                    .001|                  |                   |

PHI를 요청했으니 대칭 측도 표에 파이와 Cramer’s V(.24)도 나온다.

SPSS와 대조

같은 신택스를 SPSS 32에서 돌린 값이다. PSPP는 소수 둘째 자리까지 인쇄하므로 그 자리까지 비교한다.

항목 PSPP 2.1.1 SPSS 32
성별 빈도 남/여 99 / 101 99 / 101
향상분 평균 / 표준편차 4.72 / 7.03 4.72 / 7.03
Pearson χ² / df / p 11.55 / 1 / .001 11.546 / 1 / <.001
우도비 11.70 11.701
연속성 수정 10.60 10.595
Fisher 정확검정 p (양측) .001 <.001
파이 / Cramer’s V .24 / .24 .240 / .240

전부 같다. SPSS 출력이 더 길어 보이는 것은 소수 자릿수와 표마다 붙는 해설 문단 때문이지 표가 더 있어서가 아니다.

함정과 메모

  • p값 표기가 다르다. PSPP는 .000, SPSS 32는 <.001이다. 같은 뜻이다.
  • 교차표의 Expected 행에서 Total 열의 .47, .53은 기대빈도가 아니라 행 비율이다. PSPP가 그 칸에 행 합계 비율을 넣는다. SPSS는 그 칸에 행 합계(94, 106)를 넣는다. 값을 옮겨 적을 때 헷갈리기 쉽다.

다음 편

4편에서 실험군과 대조군의 향상분을 t-검정으로, 부서별 연봉을 일원분산분석과 사후검정으로 비교한다.


시리즈 목차: 0편 총론 · 1편 · 2편 · 3편 기술통계와 교차표 · 4편 · 5편 · 6편 · 7편 · 8편 · 9편

댓글 남기기

이 사이트는 Akismet을 사용하여 스팸을 줄입니다. 댓글 데이터가 어떻게 처리되는지 알아보세요.