프라임 컨설팅 연구 로드맵

연구 로드맵

통계분석 5단계. 집단의 차이 분석: t-검정, 분산분석(ANOVA), 사후검정

작성자
프라임
등록일

두 집단의 평균을 비교할 때에는 t-검정(t-test)을 사용하며, 세 개 이상의 집단을 동시에 비교할 때에는 제1종 오류(Type I error)의 누적 증폭을 방지하기 위해 분산분석(ANOVA)과 사후검정(Post-hoc test)을 절차에 따라 수행해야 합니다. 아울러 집단의 평균을 비교하는 통계분석 기법은 모수 통계의 전제 조건인 등분산성(homogeneity of variance) 가정의 충족 여부에 따라 분석 옵션의 선택과 결과 값의 해석 기준이 달라집니다.

통계분석 5단계. 집단의 차이 분석
이 글의 순서 8개 항목
  1. 연재글 순서
  2. 연구가설에 적합한 차이 검증 기법을 선택하는 기준
  3. 독립표본 t-검정 결과 테이블의 2단 구조와 정확한 판독 방법
  4. 일원배치 분산분석(ANOVA)의 수행 목적과 한계
  5. 사후검정(post-hoc test)의 수행 원리와 기법 선택
  6. 학술 논문에서 평규의 차이 검증 결과를 기술하는 표준 양식
  7. 자주 묻는 질문 (FAQ)
  8. 결론

“성별(남성 vs. 여성)에 따라 직무만족 수준에 차이가 존재하는가?”, “연령대(20대 vs. 30대 vs. 40대 이상)에 따라 이직의도의 수준이 다르게 나타나는가?”와 같은 질문은 양적연구로 접근하는 학위논문에서 흔하게 볼 수 있는 집단 간의 차이를 검증하는 연구가설의 패턴입니다.

집단의 평균을 서로 비교하기 위해 사용하는 대표적인 통계분석 기법은 t-검정(t-test)과 분산분석(analysis of variance; ANOVA)입니다. 두 기법은 여느 기초 통계학 교재의 서두에서 다루어질 정도로 보편적인 분석 방법론으로 인식되고 있습니다. 하지만 분석을 수행하는 과정에서 연구자가 가지는 난관은 통계 패키지가 출력한 결과 테이블을 해석하고 이를 논문에 체계적으로 기술하는 과정에 있습니다.

통계 프로그램을 통해 출력된 독립표본 t-검정 결과표는 등분산성(homogeneity of variance) 가정의 충족 여부에 따라 두 개의 행으로 구분이 되어 나타납니다. 그리고 연구자는 이 가운데 어느 행의 유의확률(p-값)을 검증의 기준으로 선택해야 하는지를 정확하게 식별해야 합니다. 아울러 분산분석을 수행해서 집단 간에 유의한 차이가 확인된 이후에는, 구체적으로 어느 집단 간에 통계적으로 유의미한 차이가 존재하는지를 확인해야 합니다.

이 글은 집단 간 평균 차이 검증을 위한 통계 기법의 타당한 선정 기준을 소개하고, 모수적 검정기법이 삼는 핵심 전제인 등분산성 검정 결과의 판독과 사후검정의 수행 절차를 설명합니다. 나아가, 통계분석의 결과를 학술 논문 기준에 부합하도록 기술하는 서술 양식을 안내합니다.

연재글 순서

  1. 통계분석 기법의 선택 전략: 세 가지 조건을 확인하면 올바른 분석 방법이 정해진다
  2. 데이터 정제와 결측값 처리: 추론 통계를 위해 완료해야 하는 5단계 분석 절차
  3. 신뢰도와 타당도 검증: 크론바흐 알파(Cronbach’s alpha)와 요인분석의 수행결과를 해석하는 방법
  4. 기술통계 분석과 정규성 검정: 테이블 작성과 데이터의 분포 진단
  5. 집단의 차이 분석: t-검정, 분산분석(ANOVA), 사후검정
  6. 상관분석과 회귀분석의 정석: ‘관계’의 확인 vs. ‘영향력’의 추정
  7. 매개효과와 조절효과: PROCESS Macro를 활용한 경로와 조건의 검증
  8. 구조방정식 모형 분석: 측정모형과 구조모형의 평가
  9. 결과 테이블의 작성과 통계적 해석의 서술: 통계 출력물(output)의 학술적 변환과 APA 규격화

연구가설에 적합한 차이 검증 기법을 선택하는 기준

집단 간 평균의 차이를 검증하기 위해 통계 기법을 선택하기 위해서는 크게 두 가지 기준을 사용할 수 있습니다. 첫째, 비교 대상이 되는 집단의 수(범주의 개수)를 확인해야 합니다. 둘째, 비교 표본이 상호 배타적으로 구성된 독립 집단인지, 아니면 동일한 표본을 시점이나 처치 조건에 따라 반복 측정한 대응 표본인지에 대한 표본의 독립성 여부를 판별해야 합니다. 연구자는 이 두 가지 기준에 따라 통계분석 기법을 결정해야 합니다.

표 1.   비교 집단의 수와 표본의 독립성에 따른 차이검정 통계기법의 선택

비교 집단의 수 표본의 독립성 성격 선택해야 하는 통계 기법
2개 집단
(예., 남성 vs. 여성)
서로 완전히 다른 독립된 조사대상자 독립표본 t-검정
(Independent Samples t-test)
2개 집단
(예., 교육 전 vs. 교육 후)
동일한 조사대상자의 시점별 반복 측정 대응표본 t-검정
(Paired Samples t-test)
3개 이상의 집단
(예., 20대 vs. 30대 vs. 40대)
서로 완전히 다른 독립된 조사대상자 일원배치 분산분석
(One-way ANOVA)
3개 이상의 집단
(예., 투약 1주 vs. 2주 vs. 3주 후)
동일한 조사대상자들의 시점별 반복 측정 반복측정 분산분석
(Repeated Measures ANOVA)

구력(球歷)이 충분하지 않은 연구자들이 흔히 범하는 대표적인 오류 가운데 하나는 셋 이상의 집단(A, B, C)을 비교할 때 분산분석을 수행하지 않고, 독립표본 t-검정을 세 차례(A-B, B-C, A-C)에 걸쳐서 반복적으로 수행하는 분석 방식입니다. 단일한 가설의 검정에서는 실제로는 집단 간 차이가 존재하지 않음에도 차이가 있다고 잘못 판정할 확률인 제1종 오류(Type I error)의 허용 한계(유의수준)를 5%(alpha=.05)로 통제합니다. 그러나 t-검정을 세 차례 연속하여 수행할 경우에는 전체 분석 과정에서 발생하는 제1종 오류의 누적 확률은 약 14.3%(1-(1-.05)3)까지 팽창하여, 통계적 분석 결과의 신뢰성과 가설 검증의 타당성을 심각하게 훼손하게 됩니다. 따라서 세 개 이상의 집단을 비교할 때에는 제1종 오류의 증폭을 원천적으로 차단하기 위해 반드시 1회의 분산분석으로 집단 간 차이의 유의성을 검증해야 합니다. 또한, 집단 간에 유의미한 차이가 확인된 후에는 사후검정을 수행해서 구체적으로 어느 집단 쌍(pair) 간에 통계적인 차이가 존재하는지를 평가해야 합니다.

아울러, 각 비교 집단별 표본 크기(N)의 적정성을 확인해야 합니다. 가령 30대 응답자가 100명인 데 반해 50대 응답자가 5명에 그치는 경우처럼 집단 간 표본 크기의 불균형이 나타난다면, 검정력과 방법론적인 타당성은 심각하게 훼손될 수밖에 없습니다. 이 상황에서는 표본의 크기가 작은 집단(50대)을 인접한 범주인 40대와 통합하여 ‘40대 이상’으로 변수를 재코딩(re-coding)해야 합니다. 또는, 해당 집단을 분석의 대상에서 제외하는 등 집단 간 표본 분포의 균형을 확보하기 위해 데이터 정제 방안을 강구해야 합니다.

독립표본 t-검정 결과 테이블의 2단 구조와 정확한 판독 방법

SPSS 통계 패키지에서 독립표본 t-검정을 수행하는 실행 경로는 ‘분석(Analyze) -> 평균 비교(Compare Means) -> 독립표본 T 검정(Independent-Samples T Test)’입니다. 분석 대화상자가 활성화되면 검정변수(test variable) 영역에는 연속형 척도로 측정된 종속변수(예., 직무만족)를 투입하고, 집단변수(grouping variable) 영역에는 명목형 독립변수(예., 성별)를 지정합니다. 이어서 ‘집단 정의(define groups)’ 메뉴를 호출하여 데이터 세트 내에서 각 비교 집단(예., 남성, 여성)에 사전에 부여한 범주별 코딩 값(예., 1과 2)을 정확히 입력하여 분석 대상의 집단을 조작적으로 설정합니다.

분석을 실행하면 출력 창에 두 개의 테이블이 나타납니다. 첫 번째 테이블인 ‘집단 통계량(group statistics)’ 테이블은 각 비교 집단별 표본 크기와 평균, 표준편차를 비롯한 기술통계량을 출력합니다. 두 번째 테이블은 가설 검증의 판독 대상인 ‘독립표본 검정’ 결과 테이블입니다. 이 과정에서 연구자들이 흔히 혼선을 겪는 지점은, 단일 종속변수에 대하여 ‘등분산이 가정됨(equal variances assumed)’과 ‘등분산이 가정되지 않음(equal variances not assumed)’이라는 두 개의 분석 행이 상하로 분할되어 제시된다는 점입니다. 두 행 가운데 어느 행에 위치한 검정통계량(t)과 유의확률(p-값)을 논문에 보고해야 하는지는 ‘Levene의 등분산 검정(Levene’s Test for Equality of Variances)’ 결과에 의해서 판정됩니다.

  1. Levene의 등분산 검정 결과 유의확률(p-값)이 유의수준 .05 보다 큰 것으로 나타난다면(p>.05), 두 비교 집단 간 데이터의 분산이 동질적이라는 귀무가설을 기각하지 못하므로 등분산성 가정이 충족된 것으로 판정합니다. 따라서 연구자는 ‘등분산이 가정됨’ 행에서의 검정통계량(t)과 자유도(df), 그리고 유의확률(p-값)을 학술 논문에 기술해야 합니다.
  2. 반면, Levene의 등분산 검정 결과의 유의확률(p-값)이 .05 미만으로 계산된 경우(p<.05), 두 집단 간 분산이 통계적으로 서로 다르다고 판단해야 하며, 따라서 등분산성 가정이 충족되지 않은 것으로 해석합니다. 이처럼 모수 검정의 전제 조건이 충족되지 않는다면 자유도 조정을 거친 보수적인 통계 보정이 적용된 하단의 ‘등분산이 가정되지 않음(Welch-Satterthwaite 보정)’ 행에 나타난 통계량을 선택해야 합니다. 이때 제시되는 자유도(df)는 일반적인 정수가 아닌 소수점 형태의 추정치로 나타나는데, 논문에서 기술할 때에는 소수점으로 처리된 자유도의 값을 누락하지 않고 병기해야 합니다.

판독을 위해 삼아야 하는 기준 행이 결정되면, 해당 행이 나타내는 t-검정의 유의확률(p-값)이 통계적 유의수준 .05 미만인지를(p<.05)를 평가해야 합니다. 만약, 유의확률이 .05 미만인 것으로 나타난다면, 두 집단 간의 평균에는 통계적으로 유의미한 차이가 존재한다는 연구가설을 채택합니다. 이때 집단 간의 우열을 나타내는 차이의 방향성은 검정통계량 t-값의 부호(+/-)에 의존하기보다, 앞서 출력된 집단 통계량 테이블의 평균값을 직접 대조하여 기술하는 것이 표준 서술 방식입니다.

일원배치 분산분석(ANOVA)의 수행 목적과 한계

셋 이상의 독립된 집단 사이의 평균의 차이를 비교하는 일원배치 분산분석(One-way ANOVA)을 위한 SPSS 실행 경로는 ‘분석(Analyze) > 평균 비교(Compare Means) > 일원배치 분산분석(One-Way ANOVA)’입니다. 대화상자가 활성화되면 종속변수(Dependent List) 영역에는 분석 대상인 연속형 종속변수를 투입하고, 요인(Factor) 영역에는 셋 이상의 범주로 분할된 명목형 독립변수(예., 연령대)를 지정합니다. 아울러 우측의 ‘옵션(Options)’ 메뉴를 호출하여 ‘기술통계(Descriptive)’와 ‘분산 동질성 검정(Homogeneity of variance test)’ 항목을 지정해야 합니다. 여기서 분산 동질성 검정은 t-검정에서의 Levene 검정과 동일하게 모수 검정의 전제 조건인 등분산성 가정을 검증하는 절차입니다.

일원배치 분산분석의 결과 테이블은 집단 간(between groups), 집단 내(within groups), 전체(total)의 제곱합(sum of squares), 자유도(df), 그리고 평균제곱(mean square)으로 구성됩니다. 이 가운데 가설 검증의 판독 대상은 검정통계량인 F-값과 그에 따른 유의확률(p-값)입니다. F-값의 유의확률이 통계적 유의수준 .05 미만(p<.05)으로 나타난다면, 모든 집단의 평균이 동일하다는 귀무가설이 기각되어 적어도 어느 한 쌍 이상의 집단 간에 통계적으로 유의미한 평균 차이가 존재한다는 대립가설이 채택됩니다. 그러나 분산분석을 통한 F-검정(omnibus test)의 결과는 전체 집단 간 차이의 존재 여부만을 나타낼 뿐, 구체적으로 어느 집단의 쌍 사이(예., 20대 vs. 30대, 혹은 20대 vs. 40대 이상)에 통계적인 차이가 발생하는지를 나타내지 못합니다.

분산분석를 통해 계산된 유의확률(p-값)이 통계적 유의수준 .05 이상(p>.05)으로 나타난다면, 집단 간의 평균 차이에 대한 귀무가설을 기각하지 못하며, 따라서 분석 절차는 후속 검증 없이 종결됩니다. 반면, 유의확률이 .05 미만(p< .05)으로 나타나 집단 간의 평균의 차이에 대한 통계적 유의성이 관찰된다면, 구체적으로 어느 집단 쌍 간에 유의미한 격차가 발생하는지를 확인하기 위한 사후검정을 후속 단계에서 수행해야 합니다.

사후검정(post-hoc test)의 수행 원리와 기법 선택

분산분석의 대화상자에서 ‘사후분석(Post Hoc)’ 메뉴를 호출하면 다양한 통계학자의 이름을 빌린 검정 기법들이 나열되어 선택 과정에서 혼선을 겪기 쉽습니다. 이들 중에서 최적의 사후검정 기법을 선정하는 기준은 ‘분산 동질성 검정(Levene’s test of homogeneity of variance)’의 통계적 검증 결과입니다.

  • 분산 동질성을 검증한 결과를 통해 등분산성 가정이 충족된다면(p>.05), 상대적으로 보수적인 기준으로 접근하는 Scheffé-test나 통계적 검정력이 우수한 Tukey-test 중에서 하나의 기법을 본인의 연구 설계에 맞게 선택합니다. 다만, 사회과학 연구에서는 제1종 오류를 가장 엄격하게 통제하는 Scheffé-test를 널리 수용하고 있는 추세입니다.
  • 반면 등분산성 가정이 위배된다면(p<.05), 모수적 사후검정을 위한 전제가 성립되지 않습니다. 따라서 이분산성을 통계적으로 보정한 사후검정 기법을 선택해야 합니다. 분산의 비동질성을 통제하도록 설계된 Dunnett’s T3나 Games-Howell test를 선택해서 다중집단 비교를 수행하는 것이 정석적인 절차입니다.

사후검정을 수행하면 분석 결과가 모든 집단의 쌍을 1:1로 대조한 ‘다중비교(multiple comparisons)’ 테이블과 집단 간 평균의 동질성을 범주화하여 출력하는 ‘동질적 부분집단(homogeneous subsets)’ 테이블이라는 두 가지 형태로 출력합니다. 연구자의 판독 측면을 고려한다면, 후자인 동질적 부분집단 테이블을 살펴보는 것이 집단 간 차이의 위계와 군집 구조를 확인하는 데 직관적입니다. 해당 테이블은 통계적으로 유의미한 차이가 확인되지 않은 동질적인 집단들을 동일한 열(column)로 묶어 출력하는 방식을 취합니다. 가령 20대와 30대가 제1열에 함께 소속되고 40대 이상이 제2열에 독립적으로 분리 배치되었다면, 20대와 30대 간에는 통계적으로 유의미한 차이가 존재하지 않는 반면, 40대 이상은 선행 두 집단과 유의미한 평균 격차를 나타내는 별개의 집단군으로 판독할 수 있습니다.

논문의 결과 테이블에 사후검정을 통한 분석 결과를 기술할 때에는 알파벳 위첨자 표기법(alphabetical superscript notation)을 활용합니다. 이는 각 비교 집단의 평균값 우측 상단에 a, b 등의 기호로 병기하는 방식입니다. 동일한 위첨자를 공유하는 집단 간에는 통계적으로 유의미한 차이가 관찰되지 않은 반면, 서로 다른 기호가 표기된 집단내에서의 쌍 간에는 유의미한 평균 격차가 존재한다는 결과를 전달할 수 있습니다. 아울러 결과 테이블 하단의 주석(note)에는 ‘사후검정=Scheffé-test’로 기술하여 구체적인 다중비교 분석기법의 이름과 유의수준 기준(예., *p<.05; **p<0.01; ***논문의 결과 테이블에 사후검정을 통한 분석 결과를 기술할 때에는 알파벳 위첨자 표기법(alphabetical superscript notation)을 활용합니다. 이는 각 비교 집단의 평균값 우측 상단에 a, b 등의 기호로 병기하는 방식입니다. 동일한 위첨자를 공유하는 집단 간에는 통계적으로 유의미한 차이가 관찰되지 않은 반면, 서로 다른 기호가 표기된 집단내에서의 쌍 간에는 유의미한 평균 격차가 존재한다는 결과를 전달할 수 있습니다. 아울러 결과 테이블 하단의 주석(note)에는 ‘사후검정: Scheffé-test’로 기술하여 구체적인 다중비교 분석기법의 이름과 유의수준 기준(예., *p<.05; **p<0.01; ***p<0.001)을 명시해야 합니다.

학술 논문에서 평규의 차이 검증 결과를 기술하는 표준 양식

통계 패키지가 출력한 t-검정 또는 분산분석의 수행 결과는 테이블에 기술해야 합니다. 테이블에는 비교 집단의 범주와 집단별 표본의 크기, 평균, 표준편차를 포함하는 기술통계량과 함께 검정통계량(t 또는 F) 및 유의확률(p-값)을 병기해야 합니다. 아울러 사후검정이 수반된 일원배치 분산분석의 결과 테이블에서는 가장 우측에 ‘사후검정’ 열을 만들어서 다중집단비교를 통해 검증된 집단 간의 차이를 알파벳 기호나 부등호 형태로 기술하여 판독의 직관성을 확보해야 합니다.

표 2.   인구통계학적 특성에 따른 직무만족 및 이직의도의 차이 검증 결과

변수 집단 N M (S.D.) t / F p-value 사후검정 결과
직무만족 남성 118 3.52 (0.68) -2.45 .015* –
여성 153 3.73 (0.61)      
이직의도 20대 (a) 74 3.85 (0.55) 9.37 .000*** a > b
30대 (b) 112 3.12 (0.78)      
40대 이상 (b) 85 2.95 (0.81)      

*p < .05, ***p < .001

연구 결과를 본문에서 서술할 때에는 연구가설의 채택 또는 기각 여부와 함께, 집단 간 차이의 구체적인 양상을 검정 통계량으로 나타내야 합니다. 예를 들어서, 독립표본 t-검정의 수행결과에 대해서 “성별에 따른 직무만족 평균을 관찰한 결과, 여성(M=3.73)의 평균이 남성(M=3.52)의 평균보다 큰 것으로 나타났다. 관찰된 차이가 통계적으로 유의한지를 평가하기 위해서 독립표본 t-검정을 수행한 결과, 그 차이는 통계적으로 유의한 것으로 나타났다(t=2.45, p<.05)”로 서술합니다. 일원배치 분산분석을 수행한 결과에 대해서도 “일원배치 분산분석을 수행한 결과, 연령대에 따른 이직의도의 평균은 통계적으로 유의한 차이가 나타났다(F=5.67, p<.01). Scheffé 사후검정을 수행한 결과, 20대 집단의 이직의도 평균이 30대 및 40대 이상 집단의 평균에 비해 높은 것으로 나타났다.”로 서술해야 합니다.

통계적 유의확률(p-값)의 표기는 전통적인 임계치 기준 방식(*p<.05, **p<.01, ***p<.001)이 관행적으로 사용되어 왔습니다. 하지만 최근의 학술계(APA 제7판)에서는 계산된 값(예., p=.023)를 병기할 것을 권고하는 추세입니다. 따라서 연구자는 반드시 타겟 학술지의 집필 규정을 확인해야 합니다. 아울러 ‘연구의 결과’ 챕터에서는 통계 분석을 통해 얻어진 사실과 값만을 객관적이고 건조하게 서술해야 합니다. ‘여성의 직무만족도가 더 높게 나타난 이유는……’과 같은 연구결과의 해석과 인과 추론은 ‘연구의 결과’ 챕터에서 배제하고, ‘논의(Discussion)’ 챕터에서 선행 연구에서 나타난 연구결과와 서로 연계시키며 해석을 전개하는 것이 원칙입니다.

가상 사례: 경찰행정학 석사과정 학생의 반복 t-검정에 의한 통계적 오류와 기법의 전환 과정

경찰공무원의 직무소진(burnout) 수준이 소속 부서(수사과, 형사과, 생활안전과, 교통과)에 따라 서로 다른지를 검증하려고 하는 연구자 A씨의 사례입니다.

A씨는 4개 부서를 서로 두 개씩 짝지은 총 6회의 독립표본 t-검정을 반복해서 수행하였습니다. 그 중에서 2건의 비교 쌍에서 유의확률(p-값)이 .05 미만으로 나타난 결과를 통해 연구가설이 채택된 것으로 해석하고 논문을 집필하고 있었습니다.

그러나 A씨가 수행한 분할 검정 방식은 다중집단의 비교에 따른 제1종 오류의 누적 확률을 약 26.5%(1-(1-.05)6 )까지 팽창시킵니다. 이에 따라 A씨는 분석 기법을 일원배치 분산분석으로 전환하였습니다. 그리고 분산분석을 수행한 결과, 검정통계량(F)의 유의확률이 .002(p<.01)로 계산되어 직무소진의 수준은 부서에 따라 다른 것으로 나타났습니다. 이후에 수행한 Levene의 분산 동질성 검정을 통해 유의확률이 .120으로 나타나 등분산성 가정(p>.05)을 충족하였습니다. A씨는 제1종 오류를 엄격하게 통제하는 Scheffé 사후검정을 선택하였습니다.

(※ 본 사례는 학위논문을 집필하는 과정에서 흔하게 나타나는 통계적 기법의 교정 절차를 예시하기 위해 재구성된 가상의 시나리오입니다.)

자주 묻는 질문 (FAQ)

Q. 분산 동질성 검정(Levene’s test)의 결과에서 등분산성 가정이 충족되지 않았다면, 분석 자체가 무효가 되나요?

A. 그렇지 않습니다. SPSS 통계 패키지가 독립표본 t-검정의 결과 테이블에 ‘등분산이 가정됨’과 ‘등분산이 가정되지 않음’이라는 2개의 행을 출력하는 목적은 등분산성 가정의 위배 상황을 통계적으로 보정하기 위함입니다. 따라서 등분산성 가정이 충족되지 않는다면(p<.05) Welch-Satterthwaite 공식을 기반으로 자유도 조정이 반영된 ‘등분산이 가정되지 않음’의 검정통계량과 유의확률을 기준으로 가설을 검정하면 타당성을 내세울 수 있습니다. 일원배치 분산분석의 사후검정 단계에서도 Games-Howell test나 Dunnett’s T3와 같이 비동질적인 분산을 전제로 고안된 통계 보정 기법을 사용합니다.

Q. 일원배치 분산분석을 수행한 결과가 통계적으로 유의하지 않은 것으로 나타났습니다. 그런데 만약, 후속 사후검정에서 특정한 집단 쌍 간에 유의한 차이가 나타났다면 이 결과를 리포팅하는 것이 타당할까요?

A. 절대로 허용되지 않습니다. 분산분석의 F-검정(omnibus test)을 수행한 결과가 유의하지 않은 것으로 나타났다는 점은 집단 간 평균의 차이가 통계적으로 유의하지 않으며, 따라서 연구가설이 기각되었음을 의미합니다. 방법론적인 대전제가 성립하지 않은 상태에서 사후적으로 다중비교를 임의로 강행하여 특정 집단 간의 국소적(local) 차이를 보고한다면 다중 비교에 따른 제1종 오류를 제어하지 못할 뿐만 아니라 통계적 검증에서의 일관성을 훼손하는 오류입니다. 따라서 분산분석을 수행한 결과가 유의수준을 충족하지 않는다면(p>.05), 추가적인 사후검정을 거치지 않고 즉시 종결해야 합니다.

Q. 사후 다중평균비교를 위해서 Scheffé test vs. Tukey test의 방법론적인 차이와 선택 기준은 무엇인가요?

A. Scheffé test는 제1종 오류 통제에 가장 보수적인 기준을 적용하기 대문에 집단 간에 뚜렷한 차이가 나타나지 않으면 유의성을 인정하지 않는 편입니다. 반면, Tukey test는 Scheffé test와 비교해서 제1종 오류를 관대하게 통제합니다. 만약, 비교하려는 집단 간의 사례 수가 서로 크게 다르다면 Scheffé test로 접근하고, 사례 수가 유사하다면 Tukey test를 선택해도 무방합니다.

Q. 일원배치 분산분석을 수행할 때에 비교 집단의 표본 크기가 10명 내외로 작지만, 분석을 수행하도 무방한가요?

A. 방법론적으로 매우 취약합니다. 분산분석을 수행하기 위해서는 각 비교 집단간의 등분산성과 정규성이 충족되어야 합니다. 만약, 특정한 집단의 표본 크기가 작아서 극단적인 불균형 표본의 구조를 이룬다면 분산의 추정치가 왜곡되고 등분산성을 위배하게 되어 제1종 오류의 통제력을 상실합니다. 따라서 비교 집단 간의 표본 크기가 불균형을 이룬다면 데이터 정제 과정이 선행되어야 합니다. 예를 들어서, 표본 수가 극히 작은 소수 집단을 분석 모형에서 배제하거나, 개념적으로 연관성이 높은 인접한 범주와 병합하여 변수를 다시 코딩하는 것입니다. 예를 들어서, 50대 집단의 표본 크기가 매우 작다면, 인접한 범주인 40대 집단과 병합하여 ‘40대 이상’이라는 단일 범주로 구성할 수 있습니다.

Q. 독립표본 t-검정을 수행한 결과, 두 집단 간 평균의 차이는 유의하지 않은 것으로 나타났습니다(p>.05). 그렇다면 이 결과를 논문에서 “두 집단 간에 차이가 없음이 증명되었다”라고 기술해도 무방한가요?

A. 학술적으로 부적절한 기술입니다. 통계적 가설 검정은 관측한 표본 데이터를 기반으로 ‘차이가 없다’라는 귀무가설(mull hypothesis)을 기각할 만한 통계적 증거(statistical evidence)가 존재하는지의 여부를 판정하는 추론 절차입니다. 집단 간 차이가 존재하지 않는다는 ‘사실’을 수학적으로 입증하는 절차가 아닙니다. 다음의 예문으로 논문에 서술해야 합니다.

“이직의도의 수준에 대한 남성 집단과 여성집단의 평균은 각각 4.5 및 4.9로 나타났다. 관찰된 차이가 통계적으로 유의한지를 평가하기 위하여 두 집단에 대해 독립표본 t-검정을 수행하였다. t-검정을 수행한 결과, 그 차이는 통계적으로 유의하지 않은 것으로 나타났다(p>.05, t=-1.115). 따라서 연구가설 1은 유의수준에서 기각되었다.”

Q. 데이터의 왜도(skewness)와 첨도(kurtos)가 기준 값을 크게 벗어나 모수검정의 기본 전제인 정규성을 충족하지 못한다면 평균의 차이를 어떻게 검증하나요?

A. 정규성이 충족되지 않는다면, 비모수(non-parametric) 기법으로 분석 방법을 전환해야 합니다. 독립표본 t-검정은 Mann-Whitney U-test로 대체하고, 일원배치 분산분석은 Kruskal-Wallis test로 대체하여 분석합니다. 비모수 검정은 변수의 연속형 측정 값 대신 관측값의 상대적인 순위(rank) 정보에 기반하여 순위합 또는 평균 순위의 차이를 비교하므로, 데이터의 비대칭적인 왜곡이나 극단값(outlier)에 따른 추정 왜곡을 통제할 수 있는 기법입니다.

결론

집단 간 평균의 차이 검증은 집단의 수와 설계의 독립성에 의해서 결정됩니다. 서로 다른 두 독립 집단에는 독립표본 t-검정을, 동일한 집단의 반복 측정에는 대응표본 t-검정을, 셋 이상의 집단 비교에서는 일원배치 분산분석으로 접근합니다. 특히 셋 이상의 집단에 t-검정을 반복적으로 수행하면 제1종 오류가 누적됩니다.

독립표본 t-검정은 Levene의 등분산 검정 결과에 따라 등분산성이 성립하면 SPSS가 출력한 첫 번째 라인에서의 통계량을, 그리고 등분산성을 위배한다면 자유도가 보정된 Welch-Satterthwaite 통계량을 선택해야 합니다. 다만, 집단 간 평균의 차이 검증에서는 t-값이 가지는 부호가 아닌 각 집단의 평균값(M)을 서로 정밀하게 대조하고 그 결과를 기술해야 합니다. 한편 일원배치 분산분석을 수행한 후에 집단의 평균 차이가 유의한 것으로 나타난 결과만에 대해서 후속 사후검정을 수행해야 합니다. 등분산성의 충족 여부에 따라 Scheffé test, Games-Howell test, 또는 Dunnett’s T3 test를 선택해서 접근합니다.

함께 읽으면 좋은 글

빠른상담 TOP

빠른상담 신청

논문 컨설팅의 모든 곳, 프라임과 함께 하세요!

02-568-5964 카카오톡