프라임 컨설팅 연구 로드맵

연구 로드맵

통계분석 6단계. 상관분석과 회귀분석의 정석: ‘관계’의 확인 vs. ‘영향력’의 추정

작성자
프라임
등록일

상관분석이 두 변수가 함께 변화하는 공변 관계를 탐색하는 통계분석 기법이라면, 회귀분석은 모형 내에서의 다른 변수들을 통제한 조건에서 특정한 원인변수(독립변수)가 결과변수(종속변수)에 미치는 일방향적인 영향력을 검증하는 기법입니다. 두 기법의 본질적인 차이를 이해해야만 논문의 서술 과정에서 방법론적인 오류를 피하고 정확한 결론을 제시할 수 있습니다.

통계분석 6단계. 상관분석과 회귀분석
이 글의 순서 8개 항목
  1. 연재글 순서
  2. 상관분석 vs. 회귀분석의 차이는 무엇인가?
  3. 상관행렬 테이블 작성과 다중공선성의 사전 진단
  4. 다중회귀분석의 SPSS 실행 옵션과 더미(dummy) 변환
  5. 회귀분석 결과 테이블의 4단계 순차적 판독법
  6. 회귀분석 결과 테이블의 해석과 서술 방법
  7. 자주 묻는 질문 (FAQ)
  8. 결론

양적으로 접근한 학위논문의 ‘연구 결과(Results)’ 챕터를 살펴보면, 대다수의 논문에서 상관관계 행렬 테이블을 먼저 제시한 후에 다중회귀분석의 결과 테이블을 연이어 배치하는 구성을 쉽게 관찰할 수 있습니다. 이러한 배치가 학술적인 관행으로 정착된 데에는 분명한 통계학적인 근거가 존재합니다. 상관분석은 연구 모형에 투입한 모든 변수들이 상호 간에 어떠한 연계 양상을 띠고 있는지를 파악하는 기능을 수행합니다. 반면에 회귀분석은 상관관계의 구조 속에서 연구자가 가설로 설정한 특정한 독립변수가 종속변수에 미치는 고유한 영향력을 검증하는 역할을 담당합니다.

그러나 많은 연구자가 두 통계분석 기법이 다루려는 질문의 성격이 뚜렷하게 구별된다는 점을 간과하기 쉽습니다. 상관분석이 “두 변수가 대등한 관계 속에서 함께 공변하는가?”를 묻는 기법이라면, 회귀분석은 “원인(독립변수)이 결과(종속변수)에 일방향적인(one-directional) 변화를 유발하는가?”를 탐색하는 기법입니다. 이들의 차이를 간과한다면 상관계수의 유의성만을 근거로 인과관계를 단정하게 되는 매우 중대한 오류를 범할 위험이 있습니다. 나아가 학위논문의 심사 과정에서 연구 방법론적인 기초가 미흡하다는 지적을 받는 주된 요인으로 작용합니다.

연재글 순서

  1. 통계분석 기법의 선택 전략: 세 가지 조건을 확인하면 올바른 분석 방법이 정해진다
  2. 데이터 정제와 결측값 처리: 추론 통계를 위해 완료해야 하는 5단계 분석 절차
  3. 신뢰도와 타당도 검증: 크론바흐 알파(Cronbach’s alpha)와 요인분석의 수행결과를 해석하는 방법
  4. 기술통계 분석과 정규성 검정: 테이블 작성과 데이터의 분포 진단
  5. 집단의 차이 분석: t-검정, 분산분석(ANOVA), 사후검정
  6. 상관분석과 회귀분석의 정석: ‘관계’의 확인 vs. ‘영향력’의 추정
  7. 매개효과와 조절효과: PROCESS Macro를 활용한 경로와 조건의 검증
  8. 구조방정식 모형 분석: 측정모형과 구조모형의 평가
  9. 결과 테이블의 작성과 통계적 해석의 서술: 통계 출력물(output)의 학술적 변환과 APA 규격화

상관분석 vs. 회귀분석의 차이는 무엇인가?

두 기법 간의 구조적인 차이는 변수를 통계 모형 내에서 어떠한 위상이나 자격으로 설정하느냐에서 출발합니다.

상관분석(correlation analysis)에서는 두 변수 A와 B가 완전히 대등한 관계를 이룹니다. 변수 A-B의 상관계수는 B-A의 상관계수와 수학적으로 완전히 일치합니다. 따라서 상관계수에는 어떠한 변수가 원인이고 어떠한 변수가 결과인지에 관한 방향성(directionality) 정보가 전혀 반영되지 않습니다.

반면 회귀분석(regression analysis)은 이론적인 논거에 기반하여 두 변수의 자격을 명확하게 분리합니다. 즉, 원인으로 작용하는 독립변수(X)와 이에 수반되어 변화하는 종속변수(Y)의 위상을 구분합니다. 이처럼 회귀분석은 변수 간의 시간적, 논리적인 순서와 인과적인 흐름을 전제한 상태에서 분석을 전개하는 기법입니다.

상관분석 vs. 회귀분석의 차이는 학위논문의 본문에서 구사하는 서술어의 선택에도 영향을 미치게 됩니다. 예를 들어서, 상관분석을 수행한 결과를 기술할 때에는 반드시 “정(+)의 상관관계가 나타났다”, “부(-)의 상관관계가 확인되었다”, 혹은 “변수 A가 증가할수록 변수 B가 함께 증가하는 경향이 관찰되었다”와 같이 공변의 관점에서 객관적으로 서술해야 합니다. 이와는 반면에 회귀분석 결과는 “변수 A가 변수 B에 통계적으로 유의한 정(+)의 영향을 미치는 것으로 나타났다”라거나 “변수 A가 변수 B의 변동(variation)을 유의하게 설명하였다”와 같이 설명력(explanative power, R2)과 영향력(influence, beta)의 관점에서 서술할 수 있습니다. 만약 상관분석 결과의 테이블만을 근거로 “변수 A가 변수 B를 증가시켰다”와 같이 인과적인 결론을 내린다면, 이는 결과를 통해 뒷받침할 수 없는 허위 주장(spurious claim)을 내세우는 것입니다.

다만 회귀분석의 결과를 기술할 때에도 신중함을 기해야 합니다. 회귀분석이라는 통계분석 절차가 절대적인 인과관계(causality)를 완전하게 규명해 주는 기법이 아니기 때문입니다. 인과성을 객관적으로 증명하기 위해서는 시간적인 선후관계, 공변성(상관관계), 그리고 외생변수(제3의 변수)에 대한 통제라는 세 가지 전제 조건이 충족되어야 합니다. 그러나 특정한 시점에서 한꺼번에 수집한 횡단적 설문 자료(cross-sectional data)만으로는 변수 간의 시간적 선후관계를 명확하게 밝혀내기가 어렵습니다. 따라서 사회과학 연구에서는 “변수 A가 변수 B의 원인이다”라고 단정하기보다, “변수 A가 변수 B에 통계적으로 유의한 영향을 미치는 것으로 확인되었다” 혹은 “변수 A가 변수 B를 유의하게 예측하였다”와 같이 절제되고 신중한 어조로 서술하는 것이 일반적인 관행입니다.

상관행렬 테이블 작성과 다중공선성의 사전 진단

회귀분석에 진입하기 전에, 연구 모형에 포함된 모든 연속형 변수(예., 독립변수, 매개변수, 조절변수, 종속변수, 통제변수)를 투입하여 상관관계 행렬(correlation matrix)을 작성해야 합니다.

SPSS 실행 경로: [분석] -> [상관분석] -> [이변량 상관계수] 메뉴를 통해 대상 변수들을 모두 투입합니다. 기본 설정인 Pearson 상관계수를 적용합니다. 만약 수집한 자료가 정규성 가정을 위반하면 비모수 검정 계수인 Spearman 계수를 지정해야 합니다.

상관행렬표(correlation matrix)의 특징은 대칭적인 구조에 있습니다. 좌측 상단에서 우측 하단으로 이어지는 대각선은 변수 자기 자신과의 상관관계를 나타내므로 항상 1의 값을 지닙니다. 아울러 이 대각선을 경계로 상단 삼각형과 하단 삼각형의 계수 값이 서로 동일하게 나타납니다. 이에 따라 학위논문에서 결과 테이블을 기술할 때에는 중복되는 상단 삼각형의 값을 모두 삭제하고 공란으로 처리하여 가독성을 확보하는 것이 관례입니다.

표 1.   상관관계분석의 수행 결과 (Correlation Matrix)

변수 (Variables) 1 2 3 4
1. 직무스트레스 1      
2. 직무만족 -.42*** 1    
3. 조직몰입 -.31*** .58*** 1  
4. 이직의도 .47*** -.53*** -.49*** 1

Note. ***p < .001

상관계수는 절대값의 크기(관계의 강도)와 부호(관계의 방향)를 기준으로 해석합니다. 절대값이 0에 수렴할수록 두 변수 간의 연관성은 미약하며, 1.0에 근접할수록 밀접하게 연동되어 있음을 의미합니다. 가령 직무스트레스와 직무만족 간의 계산된 상관계수가 -.42로 나타났다면, 부호가 음수(-)이므로 한 변수의 수준이 증가할 때 다른 변수의 수준은 감소하는 음(-)의 공변 관계를 나타냅니다. 일반적으로 절대값 0.10-0.30 미만은 ‘낮은 상관’, ‘0.30-0.50’은 ‘보통 수준의 상관’, 그리고 ‘0.50 이상’은 ‘높은 상관’으로 분류합니다. 다만 이 판정 기준은 서로 다른 연구영역과 연구의 맥락에 따라 다르게 해석합니다.

상관분석을 수행하는 과정에서 연구자가 각별히 주의를 기울이며 식별해야 할 위험 지표가 존재합니다. 바로 상관계수의 값이 0.80을 초과하는 경우입니다. 만약 독립변수 A와 독립변수 B의 상관계수 값이 0.85로 나타났다면, 두 변수는 개념적인 이름만 서로 다를 뿐, 동일한 속성을 중복하여 그 값을 측정하였을 가능성이 매우 높습니다. 만약 중복성이 높은 변수들을 회귀모형에 투입한다면, 다중공선성(multi-collinearity)이라는 방법론적인 문제가 발생합니다.

다중회귀분석의 SPSS 실행 옵션과 더미(dummy) 변환

  • SPSS 실행 경로: 분석 -> 회귀분석 -> 선형 메뉴를 통해 수행합니다. 종속변수 입력란에 결과에 해당하는 변수를, 독립변수 입력란에 원인에 해당하는 변수들을 투입합니다. 변수 투입의 방법(method) 옵션에는 단계선택(stepwise) 등의 자동화 기능이 있습니다. 그러나 가설에 기반한 이론적 모형을 검증하는 연구에서는 연구자가 통제력을 갖는 기본값인 입력(enter) 방식을 유지하는 것이 원칙입니다.

회귀분석을 실행할 때 가장 중요한 것은 우측의 통계량 버튼을 눌러 다음 세 가지 필수 옵션을 선택하는 것입니다.

  1. 추정값, 모형 적합성: R2과 유의성 검정을 위해 반드시 선택합니다.
  2. 공선성 진단(collinearity diagnostics): 앞서 언급한 독립변수 간의 중복성을 수치화한 공차한계(tolerance)와 분산팽창지수(VIF, variance inflation factor)를 출력합니다.
  3. Durbin-Watson(더빈-왓슨): 오차항(잔차)들 간에 자기상관(auto-correlation)이 존재하지 않고 상호 독립적인지를 검증하는 지표를 출력합니다. 계산값이 2.0에 가까울수록 독립성 가정을 충족한 것으로 판정합니다.

회귀분석 모형을 설정할 때 자주 범하는 치명적인 오류가 있습니다. 성별(1=’남성’, 2=’여성’)이나 직급(1=’사원’, 2=’대리’, 3=’과장’)과 같은 명목척도나 서열척도의 범주형 변수를 독립변수 칸에 원래 숫자 그대로 투입하는 것입니다. 회귀방정식은 투입된 변수가 연속형 변수(continuous variable)라고 가정합니다. 따라서 범주형 변수는 반드시 0과 1로만 구성된 더미 변수(dummy variable)로 변환하여 투입해야 합니다.

예를 들어서, 범주가 세 개(예., 사원, 대리, 과장)인 직급 변수를 투입하려면 다음과 같이 처리합니다. 먼저 ‘사원’ 집단을 기준(reference) 집단으로 삼아 모형에서 제외합니다. 그리고 [대리 여부(0,1)]와 [과장 여부(0,1)]라는 두 개의 더미 변수만을 독립변수 칸에 투입합니다.

아울러 종속변수에 영향을 미칠 수는 있으나 연구의 주요 가설이 아닌 인구통계학적 특성(예., 성별, 연령 등)은 1단계 통제변수 블록으로 먼저 투입하고, 주요 연구 변수들을 2단계 블록으로 투입하는 위계적 회귀분석(hierarchical regression) 기법을 수행할 수 있습니다. 이 기법을 적용하면 설명력의 변화량(ΔR²)을 리포팅할 수 있습니다.

회귀분석 결과 테이블의 4단계 순차적 판독법

회귀분석을 실행하면 SPSS는 여러 개의 테이블을 출력합니다. 이 결과물은 반드시 다음의 4단계 순서에 따라 읽고 판정해야 합니다.

  1. [모형 요약 테이블]의 R² 점검: 모형 요약 테이블의 결정계수(R²)를 가장 먼저 확인합니다. 이 값은 회귀모형에 투입한 전체 독립변수들이 종속변수의 분산(변화량)을 몇 퍼센트 설명하는지를 나타내는 모형의 예측력 지표입니다. 예를 들어서, R²가 0.312로 나타났다면, 독립변수들이 종속변수의 총변동(total variation)을 약 31.2% 설명한다는 뜻입니다. 만약 여려 개의 독립변수가 투입된 다중회귀분석에서는 모형의 복잡성에 대한 페널티가 반영된 수정된 R²(adjusted R²) 값을 논문에 리포팅하는 것이 원칙입니다.
  2. [분산분석(ANOVA) 테이블]의 F-값 유의성 확인: 모형의 통계적 적합도를 판정하는 단계입니다. F-값의 유의확률(p-값)이 .05 미만으로 나타나야만 “회귀모형이 통계적으로 유의하다“라고 판단할 수 있습니다. 만약 유의확률이 .05 이상으로 계산되었다면 회뷔모형 자체가 성립하지 않은 것이므로, 변수들에 대해 계산된 베타(β) 값을 확인할 필요가 전혀 없습니다.
  3. [계수 테이블]의 다중공선성(VIF) 지표 진단: 계수 테이블 가장 우측의 VIF(분산팽창지수) 열을 확인합니다. VIF가 10.0을 초과하거나 공차한계(tolerance)가 0.1 미만인 변수가 하나라도 존재한다면, 독립변수들의 개념이 서로 과도하게 유사해서 회귀계수 추정값에 왜곡이 발생하였다는 신호입니다. 이 경우에는 두 가지 조치가 가능합니다. 문제가 되는 변수들 가운데 이론적인 측면에서 중요도가 상대적으로 낮은 변수를 회귀모형에서 제거하거나, 또는 두 변수를 하나의 변수로 통합하는 것입니다.
  4. [계수 테이블]의 표준화 계수(β)와 유의확률(p) 해석: 앞선 3단계를 모두 거쳤다면 비로소 연구가설을 검증할 차례입니다. 계수 테이블에서 각 독립변수의 β값과 유의확률(p)을 확인하며 영향력의 유의수준을 판정합니다.

비표준화 계수(B) vs. 표준화 계수(β)의 차이를 혼동해서는 안됩니다. 여러 독립변수들 중에서 어느 변수가 종속변수에 가장 강한 영향력을 미쳤는지를 비교하기 위해서는 표준화 계수(β)의 절대값을 기준으로 삼아야 합니다. 표준화 계수는 변수들의 측정 단위(예., 연봉은 ‘만원’ 단위)를 동일한 척도로 변환한 값이기 때문입니다.

회귀분석 결과 테이블의 해석과 서술 방법

SPSS가 출력하는 여러가지 테이블 중에서 필요한 통계량과 값을 선별해서 하나의 테이블로 요약해서 기술해야 합니다. 테이블에는 비표준화 계수(B)와 표준오차(SE), 표준화 계수(β), t-값 및 통계적 유의수준을 나타내는 별표(*), 그리고 다중공선성 진단 지표인 분산팽창지수(VIF)를 모두 기술해야 합니다. 그리고 테이블의 하단에는 회귀모형 전체의 적합도와 설명력을 나타내는 R²과 F-값을 함께 나타내야 합니다.

표 2.   다중회귀분석의 수행 결과

독립변수 B SE β t VIF
(상수) 4.18 0.31   13.48***  
직무스트레스 0.42 0.06 .41 7.02*** 1.28
직무만족 -0.35 0.07 -.29 -4.98*** 1.31
조직몰입 -0.11 0.08 -.09 -1.42 1.24

Note: F = 42.15***, R2 = 0.321, Adj. R2 = 0.312***

회귀분석의 수행 결과를 본문에서 기술할 때에는 회귀모형에서 각 변수로 이어지는 순서를 따라야 합니다. 예를 들어서, 회귀모형의 통계적 유의성(p-value)과 설명력(R2)을 기술하고, 이어서 연구가설에 관한 독립변수의 영향력을 검정 통계량으로 나타냅니다. 이에 관한 예문은 다음과 같습니다.

“다중회귀분석을 수행한 결과, 회귀모형은 통계적으로 유의한 것으로 나타났다(F=24.15, p<.001). 직무 스트레스와 직무만족, 조직몰입을 포함하는 3개의 독립변수들은 종속변수인 이직의도의 총변동(total variation)을 31.2%를 설명하는 것으로 나타났다(adj. R²=.312). 직무스트레스(β=.35, p<.001)는 이직의도에 유의한 정(+)의 영향을 미치며, 직무만족은 이직의도에 유의한 부(-)의 영향(β=-.35, p<.001)을 미치는 것으로 나타났다. 그러나 이직의도에 미치는 조직몰입의 영향력(β=-.11, p>.05)은 통계적로 유의하지 않은 것으로 나타났다. 따라서 연구가설 1과 연구가설 2는 유의수준에서 채택되었다. 반면에 연구가설 3은 기각되었다”

이때 각별한 주의가 필요한 데, 비록 통계적 유의성이 나타나지 않은 변수라도 테이블에서 그 β값과 p-값을 삭제하지 않고 투명하게 기술해야 합니다. 연구가설을 채택하지 못하였음에도 이에 관한 연구결과가 이론적 논의를 풍부하게 확장하는 데 많은 기여를 하기 때문입니다.

가상 사례: 스포츠경영학 박사과정 연구자의 다중공선성 해결 과정

스포츠경영학을 전공하는 박사과정 학생 A씨는 ‘생활체육 지도자의 직무환경 요인(상사 지원, 상사 관계, 급여 수준 등 5개 요인)이 조직몰입에 미치는 영향’을 평가하기 위해 다중회귀분석을 수행하였습니다. 회귀분석의 결과 테이블을 관찰한 결과, 2개의 독립변수인 ‘상사 지원’과 ‘상사 관계’에 대해 계산한 VIF 값이 각각 12.4와 11.8인 것으로 나타났습니다. 이는 최소만족 기준인 10.0 미만을 충족시키지 못하며, 따라서 다중공선성이 발생한 것으로 해석할 수 있습니다. 더불어, 이들 두 변수가 종속변수에 미치는 영향력이 모두 유의하지 않은 것으로 나타났습니다. A씨는 다중공선성이 분석결과를 왜곡한 것으로 판단하였습니다.

연구자 A씨는 5개의 독립변수에 대한 상관관계 분석 테이블을 다시 확인하였습니다. 그런데 문제로 여겨지는 두 변수들 사이의 피어슨(Pearson) 상관계수 값이 0.89라는 사실을 확인하였습니다. 이는 동일한 하나의 개념을 2개의 변수가 중복으로 측정하였음을 의미합니다. A씨는 설문 문항을 면밀하게 검토하였는데, 선행연구에서 차용한 두 척도가 개념적인 이름이 서로 다를 뿐, 응답자에게는 ‘직속 상사와의 정서적인 교감 수준’을 묻고 있는 유사한 문항으로 인식된 것에서 문제가 비롯되었다고 판단하였습니다.

지도교수와의 협의를 거친 후에 A씨는 두 변수를 ‘상사와의 유대감’이라는 하나의 상위 개념으로 통합하고, 문항들의 평균값에 대한 계산 과정을 거쳐 조정하였습니다. 중복 변수를 정비하고 통합 변수를 투입해서 다중회귀분석을 수행한 결과, 회귀모형에 투입한 모든 독립변수의 VIF 값은 2.0 미만으로 나타났습니다. 아울러, 새롭게 구성한 ‘상사와의 유대감’은 조직몰입에 통계적으로 유의한 정(+)의 영향(β=.42, p<.001)을 미치는 것으로 나타났습니다.

(본 사례는 스포츠 경영학 박사논문컨설팅 사례를 바탕으로 구성한 가상의 시나리오입니다.)

자주 묻는 질문 (FAQ)

Q. 상관분석 결과표에서 특정한 두 변수의 상관계수가 매우 높고 통계적 유의성(*)이 확인되었다면, 이를 바탕으로 “변수 A가 변수 B에 강한 영향을 미쳤다”라고 본문이나 결론에 기술해도 됩니까?

A. 적절하지 않습니다. 통계학에서의 중요한 원칙 중의 하나는 “상관관계가 인과관계를 의미하지는 않는다(correlation does not imply causation)”라는 점입니다. 가령, 아이스크림 판매량과 해수욕장에서의 익사자 수는 정(+)의 상관관계를 나타내지만, 아이스크림 소비가 익사 사고의 원인으로 작용하는 것은 아닙니다. 이들 두 변수의 공변은 ‘여름철 기온의 상승’이라는 제3의 외생변수가 개입한 결과에 불과합니다. 상관분석을 통해 계산되는 p-값은 두 변수가 함께 움직이는 경향성이 통계적으로 유의하다는 사실만을 나타냅니다. 따라서 “변수 A와 변수 B는 유의한 정(+)의 상관관계를 가지는 것으로 나타났다”와 같이 공변 관계에만 국한하여 서술의 범위를 제한해야 합니다.

Q. 회귀분석 결과를 나타내는 테이블에서 R²(설명력)의 값이 0.25(25.0%)로 나타났습니다. 이 정도의 값이라면 어느 정도의 수준으로 평가할 수 있나요?

A. 학계에서 공인된 R²의 절대적인 기준은 존재하지 않습니다. 인간의 심리와 태도, 여러 사회적 행위를 다루는 사회과학 연구에서는 통제되지 않은(그리고 통제할 수 없는) 다양한 외생변수가 작용하기 때문에, 0.20-0.40 수준의 R²값을 흔하게 관찰할 수 있습니다. R²값의 절대적인 크기보다 중요한 것은 회귀모형에 투입된 독립변수들이 선행연구에서의 주장과 관련한 이론을 근거로 하여 타당한 변수로서 투입이 되었는지의 여부입니다. 만약 R² 값이 다소 낮게 나타났다면 논의(Discussion) 챕터에서는 “본 연구가 다루는 회귀모형에 반영되지 않은 외생변수 또는 통제변수에 관하여 후속 연구가 필요하다”라는 한계점으로 기술하면 충분합니다.

Q. 분산팽창계수(VIF)가 10.0을 초과하면 다중공선성이 존재하는 것으로 판단하는데, 일부 문헌에서는 5.0를 기준으로 제시하기도 합니다. 어떠한 기준을 적용해야 하나요?

A. 학문의 영역에 따라 기준에 관한 보수성에서 차이가 나타납니다. 사회과학과 경영학 분야에서는 VIF<10.0(또는 tolerance>0.1)을 허용 기준으로 사용합니다. 반면에 의학이나 공학을 다루는 학술지에서는 VIF<5 또는 더욱 엄격한 판정 기준을 요구하기도 합니다. 따라서 타겟 학술지에 출판된 여러 선행연구가 사용하는 기준을 준용하는 것이 유리합니다.

Q. 연구의 주요 관심 대상은 독립변수 A에 의한 영향력입니다. 하지만 성별과 연령, 소득을 포함하는 인구통계학적 특성도 종속변수에 영향을 미칠 가능성이 있습니다. 이들의 변수를 회귀모형에 어떻게 투입해야 하나요?

A. 통제변수(control variables)로 설정해서 회귀모형에 투입해야 합니다. 인구통계학적 변수를 일반적인 독립변수와 함께 투입하지 않고, SPSS 화면에서 [다음(Next)] 블록 기능을 활용하여 위계적 회귀분석(hierarchical regression)을 수행하는 것이 바람직합니다. 구체적인 분석 과정은 다음과 같습니다. 먼저 제1단계 블록(Model 1)에 성별(더미변수)과 연령 등을 투입하여 외생적 요인의 영향력을 통제합니다. 이어서 제2단계 블록(Model 2)에는 연구의 관심 대상인 독립변수 A를 투입합니다. 이 절차를 거친다면 성별과 연령의 영향력이 통제된 조건에서, 독립변수 A가 종속변수의 변동에 순수하게 기여한 설명력의 증가분(ΔR²)과 고유한 영향력(β)을 계산할 수 있습니다. 다만, 통제변수를 투입할 때에는 세심한 주의가 필요합니다. 아래의 링크를 방문하면 통제변수의 투입에 대해 더욱 자세한 정보를 얻을 수 있습니다.

회귀분석 테이블의 함정: 통제변수(control variable)의 계수를 해석하면 안되는 학술적인 이유

통제변수(control variable)의 환상: 변수를 투입할수록 분석결과가 오염되는 역설

Q. 독립변수 중에서 하나는 명목척도로 측정된 ‘최종 학력(1=’고졸’, 2=’대졸’, 3=’대학원졸’)’입니다. 더미변수로 변환하지 않고 회귀분석 독립변수 입력란에 1, 2, 3 값을 그대로 투입해도 되나요?

A. 방법론적인 오류가 발생합니다. 회귀방정식의 계산은 모형에 투입하는 독립변수가 등간척도나 비율척도와 같은 연속형 변수의 속성을 가진다는 가정을 전제로 합니다. 만약 범주형 척도인 최종학력 변수를 측정한 값 그대로(1, 2, 3) 투입하게 된다면, 통계 프로그램은 “대졸(=2)의 수준이 고졸(=1)의 2배이며, 대학원졸(=3)은 고졸(=1)의 3배”라는 왜곡된 산술을 통해 회귀계수를 추정합니다. 따라서 ‘고졸’ 집단을 참조(base/reference) 집단으로 설정하여 회귀모형의 투입에서 제외하고, ‘대졸 여부(0, 1)’와 ‘대학원졸 여부(0, 1)’라는 두 개의 이항 더미변수를 생성해서 투입해야 합니다.

결론

상관분석에서는 두 변수가 대등한 관계를 형성하기 때문에, 어느 변수가 원인이고 결과인지에 관한 방향성을 제공하지 않습니다. 반면 회귀분석에서는 연구자가 사전에 설정한 이론적인 근거에 따라 독립변수와 종속변수의 위상을 서로 구분해서 분석모형을 구성합니다. 이에 따라 상관분석의 결과는 “정(+)의 상관관계가 존재하는 것으로 나타났다”와 같이 공변의 관점에서 기술합니다. 하지만 회귀분석의 결과를 서술할 때에는 “유의한 영향을 미치는 것으로 나타났다”와 같이 영향력의 관점에서 기술합니다..

다만 회귀분석의 결과 역시 인과관계를 100% 입증하는 것은 아닙니다. 특정한 시점에서 수행한 설문 조사를 통해 수집한 횡단적 자료는 시간의 선후관계를 입증하기가 어렵기 때문입니다. 따라서 논문에서 분석 결과를 서술할 때에는 “원인으로 작용한다”라고 단정하기보다는 “유의한 영향을 미치는 것으로 나타났다”와 같이 절제되고 신중한 어조를 유지하는 것이 바람직합니다.

회귀분석의 결과를 논문의 본문에서 보고할 때에는 회귀모형의 결정계수(R²), F-값, 표준화 계수(β), 그리고 유의확률(p-값)의 순서로 기술합니다. 독립변수들끼리의 상대적인 영향력을 비교할 때에는 비표준화 계수(B)가 아닌 표준화 계수(β)를 기준으로 평가해야 합니다. 다중공선성은 분산팽창계수(VIF)가 10.0 미만이라는 기준을 충족시킬 때 모형의 안정성을 확보한 것으로 판정합니다. 만약 기준을 만족시키지 않는다면, 개념적으로 중복성이 높은 변수를 회귀모형에서 제외하거나 인접한 변수들을 단일한 상위개념으로 통합해야 합니다. 아울러, 통계적으로 유의한 영향력을 갖지 못한 독립변수라고 하더라도 이 변수와 관련한 통계량을 테이블에서 임의로 삭제하거나 누락을 시켜서는 안됩니다.

함께 읽으면 좋은 글

빠른상담 TOP

빠른상담 신청

논문 컨설팅의 모든 곳, 프라임과 함께 하세요!

02-568-5964 카카오톡