통계 소프트웨어가 출력하는 결과물은 '분석의 전 과정'을 기계적으로 나타내는 반면, 학위논문에서 등장하는 통계분석 결과의 테이블은 '가설 검증에 관한 결과'만을 선별해서 전달해야 합니다. 연구자는 불필요한 연산과정과 수식을 철저하게 배제해야 하고, '연구의 결과' 챕터에서는 주관적인 추론이나 가치 판단을 내세우지 않고 가설의 채택 여부만을 무미건조하게 서술해야 합니다.
이 글의 순서 6개 항목
통계분석을 완료한 후에는 의례히 수십 개의 분석결과와 방대한 값들이 망라됩니다. 초심 연구자들은 통계 프로그램(예., SPSS, SAS, R 등)이 출력한 가공되지 않은 원시 자료들을 복사해서 워드프로세서에 그대로 붙여넣기를 합니다. 만약 이 방식으로 논문을 작성한다면, 심사 과정에서 “연구자가 통계라고 하는 방법론적인 의미를 전혀 이해하지 못하고 있다”라는 지적과 비판을 면하기 어렵습니다. 통계 프로그램이 출력한 결과물은 연산 과정의 기록(calculation log)과 시스템 차원에서의 부가적인 중간 지표를 소프트웨어의 관점에서 나열한 것에 불과합니다. 반면, 학술논문에서 등장하는 테이블은 심사위원과 독자가 연구가설의 채택이나 기각 여부를 판정할 수 있도록 증거(empirical evidence)만을 정제해서 제시되어야 합니다.
소프트웨어의 원시 출력물과 학술논문에서의 결과 테이블은 지향하는 목적과 정보 수용자의 관점에서 근본적으로 다릅니다. 연구자는 기계적인 출력 언어를 학술 논문이 추구하는 규격 언어로 번역하고 조판하는 ‘데이터 큐레이터(data curator)’로서의 역할을 수행해야 합니다. 이 글에서는 방대한 출력물로부터 통계량을 선별하고 테이블로 구성하는 방법과 테이블이 나타내는 통계적인 의미를 학술 문장으로 서술하는 방법을 살펴보도록 하겠습니다.
연재글 순서
- 통계분석 기법의 선택 전략: 세 가지 조건을 확인하면 올바른 분석 방법이 정해진다
- 데이터 정제와 결측값 처리: 추론 통계를 위해 완료해야 하는 5단계 분석 절차
- 신뢰도와 타당도 검증: 크론바흐 알파(Cronbach’s alpha)와 요인분석의 수행결과를 해석하는 방법
- 기술통계 분석과 정규성 검정: 테이블 작성과 데이터의 분포 진단
- 집단의 차이 분석: t-검정, 분산분석(ANOVA), 사후검정
- 상관분석과 회귀분석의 정석: ‘관계’의 확인 vs. ‘영향력’의 추정
- 매개효과와 조절효과: PROCESS Macro를 활용한 경로와 조건의 검증
- 구조방정식 모형 분석: 측정모형과 구조모형의 평가
- 결과 테이블의 작성과 통계적 해석의 서술: 통계 출력물(output)의 학술적 변환과 APA 규격화
주요 통계 분석 기법에 따른 결과 테이블의 구성 방법
테이블을 조판하는 작업은 ‘유지해야 하는 값’과 ‘버려야 하는 값’을 정확하게 분별하는 것입니다. 다행스럽게도 논문에서의 테이블에 반드시 담아야 하는 통계량과 그렇지 않은 제거 대상의 값은 통계분석의 기법에 따라 선명하게 정형화되어 있습니다.
표 1. 주요 통계분석 기법에 따른 테이블에서의 포함 vs. 제외해야 하는 값과 통계량
| 통계 분석 기법 | 테이블에 담아야 하는 값과 통계량 | 테이블에 담지 말아야 하는 값과 통계량 |
|---|---|---|
| 독립표본 t-검정 | 집단별 n, M, SD, t-값, 유의확률(p-값) | Levene 등분산 검정 통계량(F-값)과 유의확률(p-값) 전체, 평균차이의 표준오차 |
|
일원배치 분산분석 (ANOVA) |
집단별 n, M, SD, 모형 F-값, 유의확률(p-값), 사후검정(post-hoc)의 수행 결과 | 집단 간/집단 내 제곱합(sum of squares), 자유도(df), 평균제곱(mean square)의 값 |
|
상관분석 (Pearson Correlation) |
변수들의 M, SD, 피어슨 상관계수(r), 유의확률 수준을 나타내는 별표(*) | 사례의 수(N), 대각선을 기준으로 상단의 삼각 영역(중복 값) |
| 다중회귀분석 | 비표준화계수(B), 표준오차(SE), 표준화 베타계수(β), t-값, VIF, 모형의 설명력 R2, 수정된 R2, 모형 F-값 | 회귀모형에서의 분산분석(ANOVA) 테이블, 잔차 통계량(residuals statistics) 전체 |
테이블 작성에서의 서식과 기호 표기의 규칙
- 소수점 자릿수의 통일: 논문 전반에 걸쳐 일관성을 유지해야 합니다. 일반적으로 검정 통계량(t-값, F-값)은 소수점 둘째 자리까지 반올림 표기합니다. 반면에, 상관계수(r), 회귀계수(β), 결정계수(R2), 유의확률(p-값)은 소수점 셋째 자리까지 표기하는 것이 원칙입니다. 평균(M) 값은 측정한 원시자료 값의 소수점 자리에 +1을 더한 값이고, 표준편차(SD)의 소수점 자리는 원시값의 자리수에 +2를 더한 값입니다. 예를 들어서, 5점 리커트(Likert) 척도에 의해서 측정한 값들은 모두 1점, 2점,…5점으로 나타나는데, 따라서 평균은 2.5/표준편차는 1.05로 소수점 자리를 표기해야 합니다.
- 선행 영(leading zero)의 생략: 통계량이나 값이 수학적으로 ‘1’값을 절대로 초과할 수 없는 특징을 가진 경우(상관계수 r, 유의확률 p-값, 결정계수 R2 등)에서는 소수점 앞의 ‘0’을 생략하고 표기합니다. (예., r=0.42 → .42, p=0.003 → 003, R2=0.285 → .285). 반면에 평균이나 표준편차, t-값, F-값처럼 ‘1’값을 초과할 수 있는 통계량은 반드시 앞자리에 ‘0’을 기술합니다(예., t=0.85, M=3.50).
- 표의 제목과 각주(note) 서식: ‘분석결과 1’과 같은 모호한 명칭을 사용하지 않고, ‘<표 4-3> 성별에 따른 직무만족의 차이 검증’과 같이 독립변수와 종속변수 간의 관계가 선명하게 드러나도록 작성합니다. 표 아래의 각주에는 유의수준 임계값(*p<.05, **p<.01, ***p<.001)과 사후검정 방식(예., ‘주. Duncan 사후검정 결과: A>B=C’), 또는 결측값의 처리 기준을 표기합니다.
‘연구의 결과(Results)’ 챕터에서의 서술 템플릿
결과 테이블을 완성한 후에 본문에서 그 의미를 서술할 때에는 테이블에 적힌 모든 숫자를 문장으로 나열(narrating numbers)하지 말아야 합니다. 독자는 테이블을 살펴봄으로써 각 값들을 직접 확인할 수 있기 때문입니다. 본문에서 서술해야 하는 문장은 “이 테이블에서 어느 곳을 중점적으로 살펴보아야 하는지, 그리고 그것이 연구가설의 검증 결과에 대해 어떠한 통계적 결론으로 판정하고 있는가”의 내용을 집약해서 전달해야 합니다. 다음의 3단계 구조를 거치며 서술해야 합니다.
- 분석 기법과 목적을 제시: 어떤 변수를 대상으로 어떠한 분석을 수행하였는가
- 통계량과 검증을 위해 사용한 값을 제시: 통계적으로 유의미한 차이나 영향이 나타났는가 (통계 기호와 p-값을 제시)
- 연구가설의 채택 여부를 판정: 이를 통해 연구가설이 채택이 되었는가, 또는 기각이 되었는가
표 2. 주요 통계분석 기법에 관한 통계분석 기술을 위한 학술적 서술 문장의 템플릿
| 통계분석 기법 | 학술적 서술 문장의 템플릿 |
|---|---|
| 독립표본 t-검정 | 여성이 인식하는 직무만족의 수준(M=3.73, SD=0.58)은 남성의 수준(M=3.52, SD=0.62)보다 높은 것으로 나타났다. 관찰된 차이가 통계적으로 유의한지를 평가하기 위해 독립표본 t-검정을 수행한 결과, 두 집단에서의 차이는 유의한 것으로 나타났다(t=-2.45, p<.05). 따라서 연구가설 1은 유의수준에서 채택되었다. |
|
일원배치 분산분석 (ANOVA) |
연령대에 따른 이직의도의 차이를 분석한 결과, 연령 집단에서 유의미한 차이가 나타났다(F=9.37, p<.001). Scheffé 사후검정을 수행한 결과, 20대 집단(M=3.85)의 이직의도가 40대 이상의 집단(M=3.12)과 비교해서 유의하게 높은 것으로 나타났다. 따라서 연구가설 2는 통계적 유의수준에서 채택되었다. |
| 상관분석 | 변수들 간의 상관관계를 평가하기 위해 피어슨(Pearson) 상관분석을 수행한 결과, 직무스트레스와 직무만족은 통계적으로 유의한 부(-)의 상관관계를 가지는 것으로 나타났다(r=-.42, p<.001). 반면 조직몰입과는 통계적으로 유의한 정(+)의 상관을 가지는 것으로 나타났다(r=.38, p<.01). |
| 다중회귀분석 | 직무스트레스가 이직의도에 미치는 영향을 평가한 결과, 회귀모형은 통계적으로 유의하였으며(F=15.42, p<.001), 모형의 설명력(R2)은 약 28.5%인 것으로 나타났다. 그리고 독립변수인 직무스트레스는 이직의도에 유의한 정(+)의 영향을 미치는 것으로 나타났다(β=.41, t=4.88, p<.001). 따라서 연구가설 3은 통계적 유의수준에서 채택되었다. |
|
부트스트래핑 간접(매개)효과 |
직무스트레스가 직무소진을 경유해서 이직의도에 미치는 간접효과를 평가하기 위하여 N=5,000회의 부트스트래핑을 수행한 결과, 95% 편향교정 신뢰구간(CI)은 [.082, .245]로 계산되었으며, 이 구간은 ‘0’을 포함하지 않는다. 따라서 직무소진에 의한 매개효과는 통계적으로 유의한 것으로 나타났다(p<.001). |
- 유의확률(p-값) 표기 방식의 통일: 유의확률을 보고하는 방식은 크게 기준값 구간을 표기하는 방식(p<.05, p<.01, p<.001)과 계산된 값을 표기하는 방식(p=.003, p=.042)으로 구분됩니다. APA 7판 최신 지침은 검정력의 정밀한 확인을 위해 실제 계산값을 표기(p=.003)하도록 권장합니다. 반면, 국내 다수의 학위논문은 임계값 방식(p<.05)을 혼용합니다. 다만 중요한 것은 소속 대학원이 요구하는 방식을 논문의 모든 곳에서 일관되게 적용하는 것입니다.
- 서술 순서의 원칙: 서술의 전개 순서는 연구가설의 번호 순서(연구가설 1 → 연구가설 2 → 연구가설 3)를 따라야 합니다. 복수의 연구가설 결과를 하나의 문단에 병합해서 기술하면 가설의 검증 여부를 직관적으로 추적하기 어렵습니다.
‘연구의 결과(Results)’ 챕터에서 흔히 범하는 서술과 해석의 오류
연구결과(Results)의 챕터에서는 연구자의 주관적인 가치판단이나 자의적인 해석을 철저하게 배제하고 ‘분석결과가 나타내는 객관적인 사실’만을 지극히 무미건조하게 서술하는 곳입니다. 하지만 표 3.이 나타내는 바와 같이 서술한 문장에서 많은 오류가 관찰되기도 합니다.
표 3. 양적연구에서의 통계분석 결과를 기술할 때 나타나는 서술오류의 유형과 방법론적인 오류의 근거
| 오류의 유형 | 틀린 서술 | 올바른 서술 | 방법론적인 오류의 근거 |
|---|---|---|---|
| 1. 상관관계를 인과관계로 비약(jumping)해서 해석 | “직무스트레스가 높을수록 구성원의 이직의도를 증가시키는 것으로 나타났다.” | “직무스트레스와 이직의도는 통계적으로 유의한 정(+)의 상관관계가 나타났다(r=.42, p<.001).” | 상관분석은 두 변인 간의 공변(co-variation) 관계만을 입증할 뿐, 시간적인 선행성이나 외생변수를 통제하지 못하므로 인과적 영향력(‘증가시켰다’, ‘영향을 미쳤다’)을 표현할 수 없음 |
| 2. 대립가설의 기각결과를 ‘차이가 없음’으로 단정해서 해석 | “두 집단에서의 만족도 차이가 없다.” | “성별에 따른 만족도의 차이는 통계적으로 유의하지 않은 것으로 나타났다(t=1.12, p=.264>.05).” | 통계 검정은 차이가 존재한다는 대립가설을 뒷받침할 수 있는 ‘충분한 통계적인 증거를 찾지 못했음’을 의미할 뿐, 집단에서의 모수 차이가 완벽히 0임을 입증한 것이 아님 (표본의 크기, 통계적 검정력의 한계점으로 서술해야 함) |
| 3. 유의확률(p-값)의 크기를 영향력 크기로 혼동 | “p-값이 .000으로 매우 작게 나타났으며, 이에 따라 독립변수의 영향력이 큰 것으로 이해할 수 있다.” | “독립변수의 영향력은 유의수준 p<.001에서 통계적으로 유의한 것으로 나타났으며, 표준화 베타계수는 β=.41로 나타났다” | 유의확률(p-값)은 귀무가설이 사실이라는 가정에서 관측값이 귀무가설을 뒷받침하는 확률을 의미할 뿐, 영향력의 크기를 나타내지 않음. 영향력의 크기는 효과크기(effect size) 또는 표준화 계수(β)로 기술해야 함 |
| 4. ‘연구의 결과’ 챕터에 연구자의 주관적인 추론이 개입 | “여성의 만족도가 높게 나타난 이유는 조직 내에서 운영하는 복지제도가 여성친화적이기 때문으로 풀이된다.” | 결과(Results) 챕터에서는 통계분석 결과만을 무미건조하게 기술하고, 그 원인에 대한 이유는 ‘논의(Discussion)’ 챕터에서 선행연구에서의 결과와 서로 비교하며 학술적인 추론을 전개해야 함. | 통계량의 학술적인 맥락, 메커니즘 분석, 실무적인 시사점 도출은 전적으로 ‘논의(Discussion)’ 챕터의 고유 영역임 |
Wilkinson과 APA 통계추론특별위원회의 지침:
미국심리학회(APA)가 발표한 통계추론특별위원회 보고서에서 Wilkinson et al.(1999)은 통계적 유의수준(p-값)이 효과의 크기를 보장하지 못한다는 방법론적인 한계를 지적하였습니다. 만약 표본의 크기가 매우 크다면 관찰값의 차이가 매우 작거나 무의미한 값에서조차 분석 결과가 p<.001로 나타날 수 있기 때문입니다. 따라서 통계적 유의성(p-값)에만 매몰되어서는 안되고, 표준화 계수(β), 결정계수(R2), Cohen’s d, 에타제곱(η2) 등의 효과크기(effect size)를 함께 리포팅해서 영향력을 입증해야 합니다.
- Wilkinson, L., & Task Force on Statistical Inference. (1999). Statistical methods in psychology journals: Guidelines and explanations. American Psychologist, 54(8), 594-604. https://doi.org/10.1037/0003-066X.54.8.594
| 가상 사례: 특수교육학 박사과정 연구자의 결과 테이블 정비와 결과 챕터의 서술 특수교육학을 전공하는 박사과정 연구자인 J씨는 발달장애 아동 부모의 양육 스트레스와 사회적 지지가 심리적 안녕감에 미치는 영향을 다중회귀분석으로 평가한 후에 연구결과 챕터를 작성하였습니다. J씨가 작성한 논문의 드래프트를 살펴 본 지도교수는 다음의 세 가지 점을 지적하였습니다. 첫째, SPSS 출력 화면이 나타내는 회귀모형 요약표와 ANOVA 테이블, 그리고 회귀계수 테이블을 출력화면 그대로 옮겨적는 과정에서 세로선과 음영, 제곱합의 값이 그대로 노출되어 있다는 점이었습니다. 둘째, 본문에서의 테이블이 이미 나타내고 있는 비표준화계수와 표준오차, t-값, 다중공선성 통계량(VIF)에 대한 정보를 문장으로 다시 중복으로 서술하고 있으며, 연구가설의 채택 여부를 쉽게 확인하기 어렵다는 점이었습니다. 셋째, 연구의 결과 챕터에서 서술한 문장의 곳곳에서 “양육 스트레스가 안녕감을 낮춘 이유는 경제적 부담이 가중되었기 때문으로 추정된다”와 같이 전혀 검증되지 않은 연구자 개인의 자의적인 인과해석으로 이루어졌다는 점입니다. 이에 따라 연구자는 연구결과의 챕터를 다시 서술하였습니다. 회귀분석 결과를 나타내는 테이블은 APA 규격에 맞게 다시 작성하였고, 분산분석 결과를 나타내는 테이블은 본문에서 삭제를 하였으며, B, SE, β, t-값, p-값, R2, F-값 등의 통계량과 주요 값만을 집약해서 배치하였습니다. 그리고 ‘통계분석 기법 → 통계량과 주요 값 → 연구가설의 지지 여부’로 이루어지는 3단계 템플릿으로 수정하였습니다. 이와 함께, 연구자 자신의 주관적인 해석이 담긴 모든 문장들을 ‘제5장. 논의’로 이동시켰습니다. (※ 본 사례는 특수교육학 박사학위논문 컨설팅의 실무경험을 바탕으로 재구성한 가상의 시나리오입니다.) |
자주 묻는 질문 (FAQ)
Q. 통계분석 프로그램인 SPSS나 R의 출력 화면을 논문의 본문에서 이미지로 나타내면 안되나요?
A. 허용되지 않습니다. 출력결과의 캡쳐본 이미지를 논문의 본문에 나타내는 것은 학술논문으로서의 격식을 철저하게 훼손하는 행위입니다. 더욱이, 프로그램이 수행한 연산과정이 과다하게 노출되어 가독성을 심각하게 저해합니다. 반드시 한글(HWP)이나 Microsoft Word의 테이블 작성 기능을 사용해서 표준 양식으로 조판해야 합니다.
Q. 테이블이 제시하는 모든 통계량과 값을 본문의 문장에서 친절하게 다시 언급해야 하나요?
A. 그렇지 않습니다. 정보의 중복(redundancy)을 초래할 뿐입니다. 논문의 본문에서는 독자가 연구가설의 검증 결과를 이해하는 데 도움이 되는 통계량과 값(예., t-값, p-값, 표준화 베타계수 β, 설명력 R2)만을 간결하게 제시하면 충분합니다.
Q. 통계적 유의확률(p-값)을 기술할 때 p<.05의 유형과 p=.003의 형태 중에서 어느 것이 더 권장되나요?
A. 두 방식이 모두 유효합니다. 다만, 최근 APA 등의 국제 학술지 기준은 통계검정 결과를 투명하게 공개하기 위해 계산을 통해 얻은 값(예., p=.003)을 기술하는 방식을 권고합니다. 단, p-값이 .000으로 나타났다면 수학적으로는 확률값이 0이 될 수 없으므로 반드시 p<.001로 표기해야 합니다. 단, 소속 대학원의 규정을 확인해야 합니다.
Q. 연구가설이 기각되었다면, 이 연구의 결과을 담은 분석 테이블을 논문에서 삭제해도 되나요?
A. 절대로 삭제해서는 안 됩니다. 연구가설이 기각되었다는 연구결과도 또한 가치 있는 발견입니다. 분석모형에 투입된 모든 변수의 분석 결과는 통계적 유의성의 여부와는 무관하게 테이블과 본문에 보존되어야 합니다.
Q. 논문의 본문에서 그래프나 차트 등의 시각적인 그림(Figure)을 언제 나타내는 것이 효과적인가요?
A. 서술문장이나 테이블 단독으로는 정보를 직관적으로 전달하기가 어려울 때 제한적으로 사용해야 합니다. 예를 들어서, 조절효과를 검증한 결과에 대해 상호작용의 방향을 나타내는 단순 기울기 검증(simple slope plot) 그래프, 구조방정식 모형 분석의 결과를 나타내는 경로 다이어그램이 대표적입니다. 일반적인 빈도분석이나 t-검정, 회귀분석의 결과를 담은 테이블은 별도의 그래프나 차트로 전환해서 나타내어서는 안됩니다.
결론
통계 소프트웨어가 출력한 결과물과 학술논문에서 기술한 테이블의 고유한 목적은 서로 다릅니다. 소프트웨어의 원시 출력물을 가공하지 않고 논문에 기술해서는 안됩니다. 연구가설의 검증 결과를 나타낼 때 반드시 필요한 통계량과 값만을 엄선해서 테이블로 조판해야 합니다. 통계 기호는 이탤릭체로 기술하고, 생략 규칙과 소수점 자릿수 기준을 논문의 전체에 걸쳐 일관성을 가지고 작성해야 합니다.
본문에서 문장을 통해 서술한 내용은 테이블의 정보와 서로 중복이 되어서는 안됩니다. ‘분석 기법 → 통계량과 값 → 연구가설의 채택 여부’의 과정을 나타내는 3단계 템플릿에 따라 분석결과를 서술해야 합니다. 또한 상관관계를 인과관계로 비약해서 해석을 하거나, 대립가설이 기각된 결과를 ‘차이가 없다 또는 영향이 없다’로 단정해서 해석하지 말아야 합니다. ‘연구의 결과(Results)’ 챕터에서는 연구자의 자의적인 인과추론을 철저하게 배제하고, 통계분석 결과만을 무미건조하게 서술해야 합니다. 연구결과가 가지는 학술적인 의미와 메커니즘에 관한 해석은 ‘논의(Discussion)’ 챕터에서 다루어야 합니다.