기술통계(descriptive statistics)와 정규성(normality) 검정은 분석 대상의 기초적인 속성을 요약하여 제시하는 절차인 동시에, 후속 연구가설의 검증 단계에서 모수적(parametric) 통계분석 기법과 비모수적(non-parametric) 기법 중에서 타당한 분석 기법을 결정하는 방법론적인 기준을 제공합니다.
이 글의 순서 8개 항목
데이터 정제(purification)와 신뢰도 및 타당도의 평가 과정을 거쳤다면, 이제는 연구자가 수집한 데이터를 주분석(main analysis)(예., t-검정, 분산분석, 다중회귀분석, 구조방정식모형 분석)에 투입할 수 있는 무결성(integrity) 자격을 갖추었다고 판단할 수 있습니다. 하지만 이때 많은 연구자들은 바로 연구가설 검증단계에 진입하려고 하지만, 그 전에 반드시 거쳐야 하는 관문이 존재합니다. 이는 ‘기술통계(descriptive statistics)’ 분석과 ‘정규성(normality)’ 평가입니다.
해당 절차가 논문의 작성 과정에서 가지는 방법론적인 의의는 크게 두 가지입니다.
첫째, 양적 접근으로 얻은 결과의 기술(description) 측면입니다. ‘연구 결과(Results)’ 챕터에서 서두를 구성하는 필수적인 산출물인 ‘표 4-1. 연구 대상자의 인구통계학적 특성’과 ‘표 4-2. 주요 변수의 기술통계량’을 구축하는 기반이 됩니다. 둘째, 분석 기법의 선정을 위한 의사결정 측면입니다. 수집한 자료의 확률분포 형태(예., 정규분포)를 객관적으로 진단함으로써, 후속 연구가설의 검증 단계에서 모수 통계와 비모수 통계 중에서 적합한 분석 방법을 선택하기 위한 방법론적인 근거를 제공합니다.
이 글에서는 ‘연구의 결과’ 챕터의 기초를 다지는 기술통계 테이블의 작성 방법과 정규성 평가에 관한 학술적인 판단 기준을 안내합니다.
연재글 순서
- 통계분석 기법의 선택 전략: 세 가지 조건을 확인하면 올바른 분석 방법이 정해진다
- 데이터 정제와 결측값 처리: 추론 통계를 위해 완료해야 하는 5단계 분석 절차
- 신뢰도와 타당도 검증: 크론바흐 알파(Cronbach’s alpha)와 요인분석의 수행결과를 해석하는 방법
- 기술통계 분석과 정규성 검정: 테이블 작성과 데이터의 분포 진단
- 집단의 차이 분석: t-검정, 분산분석(ANOVA), 사후검정
- 상관분석과 회귀분석의 정석: ‘관계’의 확인 vs. ‘영향력’의 추정
- 매개효과와 조절효과: PROCESS Macro를 활용한 경로와 조건의 검증
- 구조방정식 모형 분석: 측정모형과 구조모형의 평가
- 결과 테이블의 작성과 통계적 해석의 서술: 통계 출력물(output)의 학술적 변환과 APA 규격화
기술통계 분석과 정규성 검정의 역할
기술통계 분석은 수집한 표본 자료의 인구통계학적인(demograhic) 특성을 요악하고 기술하는 과정입니다. 최종 분석에 투입한 표본의 크기와 성별, 연령, 최종학력, 소득수준 등의 빈도와 분포를 비롯하여 주요 변수(예., 직무만족, 조직몰입 등)에 대한 응답값의 수준을 나타냅니다. 학위논문을 작성하는 과정에서 기술통계와 정규성 검정이 가지는 역할은 다음의 두 가지로 요약할 수 있습니다.
첫째, 양적 연구로 수행한 학술 논문의 연구 결과(Results) 챕터에서는 서두에 기술통계 분석 결과를 테이블로 제시해야 합니다. 일반적으로 주요 변수의 기술통계량(예., 평균, 표준편차)과 변수들 사이의 상관관계를 정리한 테이블을 먼저 구성하는 것이 학술적인 관행입니다. 기술통계량 테이블은 논문 심사위원과 독자에게 표본의 대표성(representativeness)을 입증하는 객관적인 근거가 됩니다.
둘째, 후속 단계에서 연구가설을 검증하기 위해 통계분석 기법을 선택하는 방법론적인 근거를 제공합니다. 예를 들어서, 독립표본 t-검정, 분산분석(ANOVA), 선형 회귀분석 등의 모수적 통계기법은 분석 대상의 자료가 ‘정규분포(normal distribution)’를 따른다는 엄격한 통계적인 가정을 전제로 합니다. 만약, 자료의 분포가 과도하게 편중되거나(왜도), 또는 분포 모양의 중심부가 지나치게 뾰족하여(첨도) 정규성 가정을 충족하지 못함에도 불구하고 모수적 기법을 사용한다면, 분석 결과를 통해서 얻어진 유의확률(p-value)에 심각한 편향(bias)이 발생하여 연구 결과의 타당성을 상실하게 됩니다. 따라서 본격적인 가설 검증에 선행하여 자료의 분포 형태 진단한 후에, 정규성 가정을 위반한다고 판단된다면 순위(rank) 기반의 비모수적 통계기법으로 접근하거나, 자료의 값을 적절하게 변환(예., 로그값으로 변환)해야 합니다.
인구통계학적 특성(빈도분석)의 표준적인 정리와 리포팅 방법
양적 연구 논문에서 인구통계학적 특성에 대한 빈도분석 결과를 리포팅하는 절차는 다음과 같습니다.
성별과 연령대, 학력, 소득, 직급과 같이 명목 척도나 서열 척도에 의해 범주형 변수로 측정된 조사 대상자의 특성은 주로 빈도분석(frequency analysis)을 수행하여 요약합니다. 통계 분석 소프트웨어인 SPSS를 사용할 경우, ‘분석’ -> ‘기술통계량’ -> ‘빈도분석’을 선택한 후에 투입을 원하는 인구통계학적 변수들을 분석 대상 칸으로 이동시켜 실행합니다.
통계 프로그램의 출력물에는 유효 백분율과 누적 백분율 등의 정보를 담은 다양한 열(column)이 함께 산출됩니다. 하지만 이를 논문에 옮길 때에는 필요한 정보만을 선별하여 하나의 통일된 테이블로 구성하는 것이 원칙입니다(표 1. 참조).
표 1. 연구 대상자의 인구통계학적 특성
| 변수 | 범주 | 빈도(명) | 백분율 (%) |
|---|---|---|---|
| 성별 | 남성 | 118 | 43.5 |
| 여성 | 153 | 56.5 | |
| 연령대 | 20대 | 74 | 27.3 |
| 30대 | 112 | 41.3 | |
| 40대 이상 | 85 | 31.4 |
테이블을 구성할 때에는 다음의 두 가지 사항을 확인해야 합니다.
첫째, 각 변수 범주의 빈도를 합산한 값(예., 남성 118명과 여성 153명의 합)이 전체 표본의 크기(N=271)와 일치해야 합니다. 만약 빈도의 총합이 표본 수에 미치지 못한다면 무응답에 따른 결측값이 존재한다는 의미이며, 따라서 테이블의 하단에 주석(note)을 구성하여 결측값의 빈도와 발생한 이유를 명시해야 합니다.
둘째, 특정한 범주에 등장하는 응답자의 인원 수가 지나치게 적지 않은지를 체크해야 합니다(예., 50대 응답자의 인원이 3명에 불과한 경우). 만약, 연령에 따른 집단 간의 평균 차이 검정을 수행한다면(예., 20대 vs. 30대 vs. 40대 vs. 50대) 특정한 집단의 표본 크기가 작으면 통계적 검정력(power)이 저하됩니다. 이때에는 인접한 범주와 병합시켜 ’40대 이상’과 같이 범주를 다시 설계하는 변수 재코딩 과정을 거쳐야 합니다.
테이블에 기술된 모든 값들을 하나하나 설명하지 않고, 핵심적인 결과만을 선별하여 간결하게 서술하는 것이 학술논문 집필에서의 관행입니다. 서술하는 방식은 다음의 예와 같습니다.
“<표 1>은 본 연구의 최종분석에 투입된 표본 271명의 인구통계학적 특성을 나타내고 있다. 조사에 참여한 성별의 비율은 남성과 여성이 각각 43.5% 및 56.5%인 것으로 나타났다. 연령대는 30대가 전체 응답자 중에서 112명(41.3%)을 차지하고 있으며, 40대 이상이 85명(31.4%), 그리고 20대가 74명(27.3%)의 순서로 집계되었다.”
연속형 변수(continuous variable)의 기술통계량(평균, 표준편차) 리포팅
직무만족이나 조직몰입의 변수와 같이 연구가설의 검증에 투입하는 연속형 변수의 값은 평균(mean)과 표준편차(standard deviation)를 계산하여 대표값으로 요약합니다. 동일한 개념을 측정한 복수의 리커트 문항은 하나의 대표값으로 합산하거나 평균으로 변환해야 합니다.
- SPSS 실행 경로: ‘변환’ -> ‘변수 계산’ 메뉴에서 통계 함수 MEAN(문항1, 문항2, 문항3)을 입력하여 새로운 평균 변수를 생성합니다. 문항을 단순 합산하여 총점 변수를 구성할 수도 있으나, 변수마다 문항 수가 다르다면 점수의 범위가 상이해져 척도의 기준점을 유지하기 어렵습니다. 따라서 논문에서는 평균값 변환 방식이 일반적으로 권장됩니다.
통합 변수가 생성되었다면 다음 경로를 통해 통계량을 계산합니다.
- SPSS 실행 경로: ‘분석’ -> ‘기술통계량’ -> ‘기술통계’ 메뉴에서 새로 생성한 통합 변수들을 모두 투입합니다. 이때 우측의 ‘옵션’ 버튼을 클릭하여 평균, 표준편차, 최소값, 최대값 외에 왜도와 첨도를 추가로 선택합니다.
표 2.는 기술통계의 분석결과를 나타내는 테이블의 표준 양식을 나타내고 있습니다. 각 변수에 따른 문항의 수를 병기하면 척도의 신뢰성을 직관적으로 이해하는 데 도움이 됩니다.
표 2. 주요 연구 변수의 기술통계량
| 변수명 | 문항 수 | 평균 (M) | 표준편차 (SD) | 왜도 | 첨도 |
|---|---|---|---|---|---|
| 직무스트레스 | 6 | 3.42 | 0.71 | -0.18 | 0.24 |
| 직무만족 | 5 | 3.68 | 0.65 | -0.35 | 0.11 |
| 이직의도 | 4 | 2.87 | 0.89 | 0.42 | -0.27 |
평균 값을 해석할 때는 주의가 필요합니다. 예를 들어서, 5점 리커트 척도를 사용해서 측정한 직무만족의 평균이 3.68로 계산되었다면, 중간값인 3점(3=’보통이다’) 보다는 높습니다. 하지만 이를 단정적으로 “응답자들이 평가한 직무만족의 수준이 높다”라고 해석을 할 수는 없습니다. ‘높다’ 또는 ‘양호하다’라는 평가는 비교 대상의 집단이 존재하거나 동일한 측정도구를 사용한 선행연구에서 나타나는 평균값과의 대조가 이루어질 때에만 가능한 평가적인 기술입니다. 따라서 기술통계 단계의 본문 서술에서는 “직무만족의 평균이 3.68인 것으로 계산되었다”와 같이 객관적인 값만 제시하는 데 그쳐야 합니다. 그리고 그 값에 대한 긍정적, 부정적, 또는 상대적인 비교에 의한 평가는 논문의 논의(Discussion) 챕터에서 다루는 것이 적절합니다.
왜도와 첨도를 활용한 정규성의 판단 기준
정규성이란, 수집된 데이터가 평균을 중심으로 분포되어 있으며, 양극단으로 갈수록 좌우 대칭을 이루며 완만하게 감소하는 종 모양(bell-curve)의 분포를 가지는 특성을 의미합니다. 정규성을 판단하는 주요 기준은 왜도와 첨도입니다. 만약 자료의 왜도와 첨도의 값이 모두 0이라면, 그 자료는 표준 정규분포를 따르는 것으로 해석합니다.
- 왜도(skewness): 데이터 분포가 좌측이나 우측으로 치우친 비대칭의 정도를 나타냅니다.
- 첨도(kurtosis): 데이터 분포의 중심부가 얼마나 뾰족하게 형성되어 있는지 혹은 완만하게 퍼져 있는지를 나타내는 척도입니다.
사회과학이나 경영학 등의 영역에서 관행으로 여겨지는 정규성의 판단 기준은 ‘왜도와 첨도의 절대값이 각각 3.0 미만 및 10.0 미만’입니다. 표 2.가 나타내는 왜도와 첨도의 절대값은 모두 정규성을 위배하지 않는 것으로 판단하며, 따라서 모수적 통계기법으로 접근이 가능합니다.
SPSS의 ‘데이터 탐색’ 기능을 활용하여 Kolmogorov-Smirnov(K-S) 검정과 Shapiro-Wilk(S-W) 검정을 통해 정규성을 검증하기도 합니다. 그러나 이 검정 방법들은 표본 크기에 매우 민감하게 반응한다는 특징을 가집니다. 표본 수가 200-300명을 초과하는 데이터의 분포가 정규분포에 매우 근접하더라도 극소수의 이상값(outlier)이 존재함에 따라 정규성의 검증 결과가 통계적으로 유의하게(p<0.05) 나타날 가능성, 즉 정규성을 위배한다고 판단할 가능성을 배제하지 못합니다. 수백 명을 대상으로 수집한 자료의 정규성을 검증하는 과정에서는 왜도와 첨도의 기준을 적용해서 합리적이고 유연하게 판단하는 접근이 학계에서 보편적으로 활용되고 있습니다.
아래의 링크들은 데이터의 정규성을 검증하는 다양한 방법을 제공하고 있습니다.
다음의 예문으로 표 2.의 결과를 기반으로 정규성 검증의 결과를 서술할 수 있습니다.
“본 연구가 다루는 주요 연속형 변수를 대상으로 정규성을 평가하기 위해 계산한 왜도와 첨도의 절대값은 각각 0.18-0.42 및 0.11-0.27의 범위(range)를 가지는 것으로 나타났다. 이는 왜도와 첨도의 절대값이 각각 3.0 및 10.0 미만이라면 정규성을 위배하지 않는다고 제시한 Kline(2011)의 가이드라인을 충족시킨다. 따라서 본 연구가 수집한 자료는 정규성을 위반하지 않는다고 판단하였다.”
정규성 가정을 위배하였을 때의 대처 방안: 비모수 통계 기법으로의 전환
만약 특정 변수의 왜도나 첨도의 값이 충족 기준을 크게 초과하여 정규성의 가정을 충족하지 못하더라도, 그 변수를 즉시 삭제할 필요는 없습니다. 이 때에는 다음의 세 가지 절차를 거쳐야 합니다.
- 극단적인 이상값(outliers) 조사: 데이터의 분포가 심하게 왜곡되는 주요 원인 중의 하나는 극소수의 극단값(예., 근속연수 40년 이상)이나 입력 오류에서 비롯됩니다. 따라서 데이터의 정제 과정에서 미처 발견하지 못한 이상값이 존재하는지를 박스플롯(boxplot) 등을 활용해서 관찰해야 합니다.
- 변수 변환(data transformation): 측정값의 편차를 줄이기 위해 자연로그(ln)나 제곱근(square root) 값으로 처리하는 방법입니다. 이 과정을 거치면 데이터 분포가 정규분포에 근사하게 보정할 수 있습니다. 다만 변환한 값은 본래의 값과 단위를 상실하여 결과의 해석이 까다로울 수 있습니다.
- 비모수 통계 분석(non-parametric analysis)으로의 전환: 정규성 가정이 성립하지 않을 때 가장 안정적이며 권장되는 대안입니다. 관측값의 연속형 값이 아닌 표본 내에서의 상대적인 ‘순위(rank)’를 기반으로 분석을 수행합니다. 데이터 분포의 비대칭성이나 왜곡된 형태에 영향을 받지 않고 결과를 검증할 수 있다는 장점이 있습니다. 표 3.은 연구의 목적에 따라 접근할 수 있는 모수적 통계기법과 이에 상응하는 비모수적 통계 분석 기법을 나타내고 있습니다.
표 3. 연구목적과 분석모형의 구조에 따른 모수적 통계기법과 비모수적 통계기법의 비교
| 연구목적 및 분석모형의 구조 | 모수적 통계기법 | 비모수적 통계법 |
|---|---|---|
| 독립된 두 집단의 평균 차이 비교 | 독립표본 t-검정 | Mann-Whitney U 검정 |
| 동일 집단의 시점별(예., 사전 vs. 사후) 차이 비교 | 대응표본 t-검정 | Wilcoxon 부호순위 검정 |
| 세 집단 이상의 평균 차이 비교 | 일원배치 분산분석 (One-way ANOVA) | Kruskal-Wallis 검정 |
| 두 연속형 변수 간의 상관관계 분석 | 피어슨(Pearson) 상관분석 | 스피어만(Spearman) 서열상관분석 |
만약 통계분석 방법을 비모수적 통계기법으로 전환하였다면 그에 대한 학술적인 근거를 구체적으로 서술해야 합니다. 예를 들어서, “변수 X의 왜도는 4.5으로 계산되었으며, 이 값은 정규성 가정을 충족하지 못하는 것으로 해석된다. 이에 따라 변수 X의 수준(level)에 따른 집단 간의 차이 검증을 수행하기 위해서는 모수적 통계기법인 t–검정으로 접근할 수 없다. 본 연구는 비모수적 통계기법인 순위 기반의 Mann-Whitney U 검정을 수행하였다“와 같이 논문의 본문에 기술해야 합니다.
| 가상 사례: 노인복지학 석사과정생의 극단값 발견과 대응 과정 노인복지학을 전공하는 석사과정 학생 A씨는 ‘요양보호사의 직무 스트레스와 감정 노동이 서비스 질에 미치는 영향’이라는 연구주제로 학위논문을 준비 중이었습니다. 총 300명의 설문 데이터를 수집하여 기술통계량을 분석하는 과정에서, 변수 중의 하나인 ‘근속연수(월 단위)’의 왜도가 4.8인 것으로 나타났습니다. 이 왜도값은 정규성 가정을 위배합니다. 이에 따라 A씨는 스피어만 상관분석 등을 포함하는 비모수적 통계기법으로 접근하려고 하였습니다. 하지만 A씨의 지도교수는 분석기법을 전환하기 전에 왜도 값을 왜곡하는 극단값이 있는지의 여부를 체크하라는 의견을 주었습니다. A씨는 박스플롯을 통해서 근속연수의 분포를 시각화하였습니다. 그리고 대다수의 응답자의 분포 범위에서 크게 벗어난 ‘480개월(40년)’이라는 극단값이 존재한다는 것을 발견하였습니다. A씨는 설문지의 원본과 대조를 하였는데, 한 응답자가 근속 기간(개월 수)의 값을 응답하는 과정에서 40개월이어야 할 값이 480개월로 잘못 입력한 기입 오류에서 비롯되었다는 점을 확인하였습니다. A씨는 480의 값을 40으로 정정하고 왜도 값을 다시 계산하여 절대값 0.7로 낮아졌으며, 이는 정규성을 위배하지 않는다는 판정을 내릴 수 있었습니다. (본 사례는 논문통계 컨설팅 사례를 바탕으로 재구성한 가상의 시나리오입니다.) |
자주 묻는 질문 (FAQ)
Q. 변수의 문항 값들을 하나의 값으로 통합할 때, 합산(sum) vs. 평균(mean) 중에서 어떤 값을 취해야 하나요?
A. 사회과학의 영역에서는 평균을 사용합니다. 만약 문항의 값을 합산으로 통합한다면, 예를 들어서 직무만족(3문항)의 최대값은 15점인 반면 직무스트레스(5문항)의 최대값은 25점이 됩니다. 이처럼 변수마다 문항 수가 다르다면 총점의 범위와 중간값(예., 5점 리커트 척도를 기준으로 3점)이 서로 달라져 변수 간의 값을 비교하기 어렵습니다. 반면, 평균값으로 통합하면 모든 변수의 값이 본래의 리커트 척도 범위(예., 1-5점) 안으로 유지됩니다. 따라서 척도의 기준점을 유지하면서 여러 변수의 평균 수준을 직관적으로 비교하고 해석할 수 있다는 장점이 있습니다.
Q. SPSS에서 K-S 또는 S-W 정규성 가설 검정의 결과가 p<0.05의 수준에서 기각되었는데, 그렇다면 왜도와 첨도의 값을 기준으로 모수적 통계기법을 강행해도 되나요?
A. 가능합니다. K-S나 S-W 검정은 표본의 크기가 100-200명을 초과한 후에는 표본 크기에 민감하게 반응합니다. 더불어, 현대 통계학자들은 대규모 표본(N>200)을 확보한다면 중심극한정리(Central Limit Theorem)에 따라 가설 검정의 결과에 얽매이지 않고, 왜도와 첨도의 절대값을 기준으로 정규성의 여부를 판단하는 것이 학술적인 관행으로 인정되고 있습니다.
Q. 논문의 인구통계학적 특성(빈도분석)을 나타내는 테이블에는 조사 대상자의 모든 일반적인 특성을 포함해야 하나요?
A. 그렇지 않습니다. 조사한 문항을 모두 나열할 필요는 없으며, 연구의 주제와 관련이 깊거나, 또는 후속 분석에 투입하는 변수만을 중심으로 선별해야 합니다. 인구통계학적 특성을 나타내는 테이블은 표본의 대표적인 성격을 확인하는 목적 외에도, 집단 간의 차이 검증(t-검정, 분산분석)을 위한 구분 기준이나 회귀모형에 투입하는 통제변수의 분포 모양을 사전에 확인하는 역할을 합니다. 따라서 성별이나 연령 등 표본의 기본적인 특성을 나타내는 변수와 함께 연구 모형과 직접 관련성이 있는 변수를 중심으로 구성하는 것이 적절합니다.
Q. 리커트 5점 척도의 평균이 3.5로 계산되었는데, 이 결과를 본문에 ‘만족 수준이 상당히 높은 편이다’와 같이 평가하여 기술해도 될까요?
A. 논문의 결과(Results) 챕터에서는 주관적인 평가를 지양해야 합니다. 5점 리커트 척도의 중간값인 3점(=’보통이다’)보다 높은 값으로 나타났다고 해서 이를 근거로 대상 집단이 인식하는 수준이 우수하거나 긍정적이라고 단정할 수는 없기 때문입니다.
척도 값의 높고 낮음은 서로 비교할 수 있는 준거 기준이 마련되어 있을 때에만 성립합니다. 예를 들어서, 동일한 측정도구를 활용한 선행연구들에서 한 변수값의 평균이 4.2로 나타났다면, 본 연구에서 나타난 평균 3.5는 물론 척도의 중간값(=3.0)보다는 크지만, 선행연구의 결과와 대조하면 오히려 상대적으로 낮은 수준입니다. 따라서 비교 대상을 삼을 수 있는 집단이나 선행연구에서의 기준이 제시되지 않은 상태에서 연구자가 자의적으로 ‘상당히 높다’거나 ‘양호하다’라는 가치적인 판단을 부여하는 것은 논문의 객관성을 저해합니다.
Q. 비모수적 기법으로 접근하면 통계적 검정력이 약해서 연구가설이 기각될 가능성이 높아지지 않을까요?
A. 이론적으로 타당한 지적이며, 일정 부분은 사실입니다. 모수적 기법은 연속형 관측값이 가지는 값의 평균과 분산을 모수(parameter)로 활용합니다. 반면 비모수적 기법은 데이터의 값 대신에 관측값 간의 상대적인 서열(순위)만을 변환하여 분석에 투입합니다. 이 변환 과정에서 원시 데이터가 가지는 정보량이 일부 상실되며, 따라서 허위의 연구가설을 기각하는 능력을 의미하는 ‘통계적 검정력(statistical power)’이 모수적 접근과 비교하여 다소 낮아질 수 있습니다.
그러나 연구가설의 유의성을 확보하기 위해 정규성 가정을 심각하게 위배한 데이터를 무리하게 모수적으로 접근하는 것은 타당하지 않습니다. 정규성을 충족시키지 않은 자료를 분석한다면, 유의확률 수준(p-값)과 검정통계량이 왜곡될 가능성이 높아집니다. 이는 실제로 효과가 없음에도 유의한 차이가 존재하는 것으로 잘못 판단하는 제1종 오류(Type I Error)의 위험을 크게 증가시킵니다.
결론
인구통계학적 특성은 빈도분석을 거쳐 하나의 테이블로 기술합니다. 이때 문항의 빈도 합계가 총 표본의 크기와 일치하는지를 확인해야 합니다. 이 과정에서 결측값이나 입력에 의한 오류를 체크하고, 혹시 모를 빈도의 값이 과도하게 크거나 지나치게 작은 범주가 있는지를 살펴보아야 합니다.
주요 변수 값의 기술통계량을 기술하기 위해서는 하위 문항 값을 평균으로 계산하고 하나의 값으로 통합한 후에, 평균과 표준편차를 기술합니다. 더불어, 왜도와 첨도의 계산 결과를 정규성 검정에 활용해야 합니다. 정규성을 충족시키는 조건은 왜도와 첨도의 절대값이 각각 3.0 및 10.0 미만을 기준으로 판단합니다. 한편, Kolmogorov-Smirnov(K-S) 테스트와 Shapiro-Wilk(S-W) 테스트는 표본의 크기에 매우 민감하게 반응하며, 대규모 표본에 대한 정규성을 검증하기에는 적합한 기법이 아닙니다.
만약, 수집한 자료가 정규성 가정을 충족시키지 못한다면, 자료 내에서의 이상값 여부를 우선적으로 체크해야 합니다. 그리고 정규성을 위배하지 않는다는 판단이 이루어졌다면, 이때에는 Mann-Whitney U 검정, Kruskal-Wallis 검정, Spearman 서열 상관분석 등을 포함하는 순위 기반의 비모수적 기법으로 접근해야 합니다. 다만 회귀분석에 투입하는 자료의 정규성을 검증하기 위해서는 개별 변수의 값으로 다루어서는 안되고, 모형의 ‘잔차(residual)’가 정규성을 충족하는지를 검증해야 합니다.