질적자료의 분석은 전사본을 여러 번 읽고 요약하는 감상문 작성이 아닙니다. 연구 참여자의 발화 내용 중에서 파편화된 일상어(1차 개념)를 해체하고, 이를 추상화된 학술적인 범주(2차 개념)로 조립해서 체계화하는 고도로 엄격한 귀납적인 분류 알고리즘입니다.
이 글의 순서 8개 항목
수백 페이지에 달하는 전사(transcript) 자료를 질적으로 분석해야 하는 연구자는 때로 깊은 고립감에 빠집니다. SPSS나 R과 같은 통계 프로그램은 자료를 입력하고 명령어를 실행하면 유의확률(p)과 회귀계수(β)를 출력합니다. 하지만 질적연구에서는 간편한 조작만으로도 해답을 얻을 수 있는 알고리즘이 존재하지 않습니다.
전사 자료를 거듭 정독하더라도 연구 참여자들의 발화만 확인할 뿐, 이를 학술적인 구조로 전환하여 연구 결과로 구성하는 방법을 모색하기란 쉽지 않습니다. 이에 따라 초심 연구자들은 참여자의 발화를 시간순으로 요약하거나, 연구자가 가졌던 주관적인 인상을 수필 형식으로 서술하는 오류를 범하기도 합니다.
질적 자료 분석은 요약(summary)이 아닌 추상화(abstraction)의 과정입니다. 참여자의 발화를 의미 단위로 분절하고(해체), 유사한 속성별로 군집시켜 개념을 부여하며(범주화), 대상의 현상을 설명하는 주제를 식별하는 과정입니다. 이 과정의 절차가 바로 ‘코딩(coding)’입니다.
연재글 순서
- 질적연구를 위한 네 가지 방법론: 내 연구문제에 맞는 최적의 ‘해석 프레임워크’ 선택하기
- 질적연구를 위한 참여자 선정: 일반화를 거부하고 ‘이론적 포화’에 도달하는 심층 표집의 기술
- 질적연구 연구자의 위치성(positionality)과 연구윤리: 도구가 된 연구자, 자신을 어떻게 통제할 것인가 (IRB & 성찰 가이드)
- 질적연구 인터뷰의 설계: “왜?”라고 묻지 않고 진실을 수집하는 인터뷰 가이드의 기술
- 관찰과 문서 자료: 인터뷰의 사각지대를 밝히는 ‘삼각검증’과 데이터 수집의 기술
- 전사와 자료 정리: 연구 참여자의 구술 발화를 분석이 가능한 텍스트로 구축하는 기술
- 코딩과 주제 식별: 수백 페이지의 녹취록을 학술적 이론으로 전환하는 분석 절차
- 엄격성의 확보: 주관성 비판에 대응하는 학술적인 전략
- 질적 연구결과의 서술과 해석적 글쓰기: 참여자의 언어를 학술적인 텍스트로 변환하는 전략
코딩(coding)의 본질: 자료의 축약이 아닌 개념의 추상화
전사 자료를 분석하는 행위는 밑줄 긋기와는 구분됩니다. 코딩은 연구 참여자의 1차적인 경험을 연구자의 2차적 학술 언어로 전환하는 추상화의 과정(ladder of abstraction)입니다.
가령, 전사된 자료에서는 참여자 A가 “선배들의 시선이 부담스러웠습니다”라고 진술하고, 참여자 B는 “모르는 부분이 드러날까봐 염려되어 질문을 하지 못했습니다”라는 발화를 확인하였다고 가정하겠습니다. 두 참여자의 진술은 서로 다르지만, 연구자는 두 진술에서 내재된 공통 속성을 식별해서 ‘질문에 대한 심리적 비용의 지각‘이라는 1차 코드를 부여합니다. 이어서 그 1차 코드를 ‘동료 관계에서의 고립감‘이나 ‘사내에서의 소통 단절 경험‘이라는 2개의 다른 1차 코드와 함께 군집시켜 ‘조직 내 학습 기회의 비공식적인 차단‘이라는 상위 범주로 통합합니다.
이와 같이 개별적인 텍스트 자료에서 보편적인 학술 개념으로 연계되는 구조를 형성하는 것이 코딩의 주요한 목적입니다.

4단계 질적 분석 프로세스
연구자들(예., Strauss & Corbin, Colaizzi, Braun & Clarke)이 제안한 질적분석의 기법은 그 명칭에는 다소 차이가 있으나, 일반적으로 다음의 4단계 순환 과정으로 설명할 수 있습니다.
1단계: 몰입과 통독(immersion & reading)
코딩을 수행하기 전에 전사된 자료 전체를 2-3회 정독합니다. 연구 참여자의 경험과 진술 흐름을 전체적으로 파악하는 단계입니다. 각 참여자의 전사 자료를 확인한 후에는 참여자의 주요 진술 취지를 반 페이지 분량의 요약문으로 정리합니다.
2단계: 의미 단위의 분해와 개방형 코딩(open coding)
전사 자료를 문장 또는 문단 단위로 분절하면서, 연구 문제와 관련성이 깊은 의미 단위(meaning unit)를 식별하고 여백에는 코드를 부여합니다. 이때 참여자가 구사한 일상적인 표현을 그대로 활용하는 인비보 코드(In Vivo code)를 사용한다면 자료의 생동감을 유지할 수 있습니다(예., “물어보는 게 더 힘들다” → [In Vivo: ‘물어보는 게 더 힘듦’]).
3단계: 범주화(categorization): 통합과 분류
다수의 코드를 생성한 후에는 유사성(similarity)과 규칙성(regularity)을 기준으로 유목화(clustering)합니다. 이 단계에서는 중복된 코드를 통합하고 분류 기준에 부합하지 않는 코드를 정리하며, 각 군집에 하위 범주(sub-category)의 명칭을 부여합니다.
4단계: 주제 식별(thematic synthesis): 이론적 구조를 형성
정리된 범주 내에서의 상호작용과 인과적인 흐름, 역동적 관계를 종합해서 ‘제4장. 연구의 결과’에서의 주요 서브챕터를 구성할 3-5개의 중심 주제를 선정합니다. 만약 근거이론으로 접근하는 연구에서는 중심 주제들이 패러다임 모형을 이루며, 현상학 연구에서는 경험의 구조적인 특성을 기술하는 종합 서술문으로 구성됩니다.
코딩 실습 매트릭스: 텍스트 자료에서 학술적 주제로 발전하는 5단계 변환표
표 1.은 전사자료가 연구의 결과로 전환되는 과정을 보여주는 매트릭스입니다 (신규 간호사의 임상적응 실패에 관한 연구 사례를 기반으로 구성한 가상 매트릭스입니다.)
표 1. 질적연구 자료의 분석 단계에 따른 데이터의 형태와 연구자의 분석적 개입에 관한 논리
| 분석 단계 | 분석 단위의 데이터 형태 | 연구자의 분석적 개입과 변환 논리 |
|---|---|---|
|
0단계: 원시 텍스트 (Raw Transcript) |
“선배가 인계를 하고 있는데, 제가 잘 이해하지 못한 채 가만히 서 있으니까 차트를 나에게 던지면서 ‘너 대학에서 뭐 배웠니?’라고 하더라고요. 갑자기 앞이 캄캄해지고 쥐구멍에라도 숨고 싶었어요.” (참여자 P02, L.84-87) | 참여자의 발화 원문을 유지 |
|
1단계: 의미 단위 (Meaning Unit) |
선배 간호사가 업무 미숙을 이유로 차트를 던지며 공개적으로 면박을 주었고, 이에 따라 극심한 수치심과 공포를 느낌. | 연구문제(예., 조직 적응을 위한 고투)와는 전혀 무관한 잉여 텍스트를 제거하고 핵심적인 진술만을 별도로 분리 |
|
2단계: 개방 코드 (Open Code) |
공개적 모욕, 감정적 폭력, 인격비하, 극단적 인지 마비(패닉), 현장으로부터의 이탈 충동 | 참여자의 언어를 살린 1차 개념화 (In Vivo 코드와 병행) |
|
3단계: 하위 범주 (Sub-category) |
[실수를 용인하지 않는 징벌적인 피드백] (관련 코드: 공개적 모욕, 감정적 폭력, 인격 비하) |
유사한 행동 양식을 군집시켜 현상학적인 2차 개념으로 명명 |
|
4단계: 핵심 주제 (Core Theme) |
[주제 1: 전문가로서의 싹을 자르는 폭력적인 사회화의 세례] | 하위 범주들을 통합해서 참여자의 경험 세계를 나타내는 본질을 규명 |
이 매트릭스의 구조를 ‘제4장. 연구의 방법’ 챕터에서 ‘질적자료의 분석 절차의 예시’로 수록하는 것이 좋습니다. 연구자가 자의적인 추측으로 연구결과를 생성한 것이 아니라, 철저하게 텍스트에 근거해서(grounded) 이론을 식별하고 있음을 나타내기 때문입니다.
세 가지 질적연구의 전통에 따른 코딩 방식의 주요 차이
접근하는 질적연구의 전통에 따라 코딩의 절차와 최종 결과물이 지향하는 목적은 서로 다릅니다.
표 2. 주요 질적연구 방법론(근거이론, 현상학, 주제분석)의 특성과 분석 절차의 비교
| 비교 항목 | 근거이론 (Strauss & Corbin) | 현상학 (Colaizzi) | 주제분석 (Braun & Clarke) |
|---|---|---|---|
| 분석의 목표 | 사건과 행동의 동태적 ‘과정 모형(Theory)’을 구축 | 체험의 ‘본질적인 구조(Essence)’를 규명 | 자료 전반에 걸쳐 나타나는 패턴을 식별 |
| 코딩 단계의 명칭 | 개방코딩 → 축코딩 → 선택코딩 | 의미 있는 진술 → 구성된 의미 → 주제 군집 | 코드 생성 → 주제 탐색 → 주제 정의 |
| 분석 장치 | 패러다임 모형: 인과조건, 중심현상, 맥락, 중재조건, 작용과 상호작용, 결과의 6개 상자 조립 | 괄호 치기(Bracketing): 연구자의 선이해를 배제하고 고유한 의미 단위를 식별 | 반복적 주제 지도(Thematic Map): 주제 간 네트워크의 연결 |
| 최종 결과물의 형태 | 거대한 인과적 흐름도(화살표 모형) 및 스토리라인 | 경험의 본질을 묘사한 구조적인 진술문 | 범주에 따라 인용문이 명료하게 정리된 주제별 챕터 |
| 석사논문으로서의 권장 수준 | 분석절차가 매우 엄격하여 박사학위 논문에 적합 | 참여자의 경험을 탐색하기 위한 연구에서 활용이 가능 | 질적연구의 전통에 구애받지 않는 범용성 |
연구자가 근거이론을 적용함에도 불구하고 현상학적 분석에서와 같이 주제의 나열에 그치거나, 현상학을 적용함에도 불구하고 인과 모형을 도식화하는 것은 질적연구가 추구하는 고유한 방법론적인 전통을 혼동해서 발생하는 오류입니다. 따라서 연구자는 자신이 선택한 전통에 부합하는 분석과정을 논문의 제3장에 기술해야 합니다.
CAQDAS(NVivo, MAXQDA) 프로그램 vs. 엑셀/워드를 이용한 수작업 코딩의 선택 기준
질적 연구용 전문 소프트웨어(CAQDAS: Computer-Assisted Qualitative Data Analysis Software)에 대해 많은 연구자들이 오해를 가지고 있습니다. NVivo 등의 프로그램에 전사 자료를 입력하면, 소프트웨어가 자동으로 코딩을 수행한다고 기대하기 때문입니다.
그러나 CAQDAS는 연구자를 대신해 분석을 수행하는 도구가 아니라, 자료를 체계적으로 정리하고 검색하도록 돕는 보조 프로그램입니다. 코드의 명칭을 결정하고 특정한 발화를 어느 범주에 배치할지를 판단하는 주체는 전적으로 연구자입니다. 소프트웨어는 연구자가 수행하는 방대한 텍스트 분류 작업을 효율적으로 처리하도록 지원하는 역할을 수행합니다.
- CAQDAS(NVivo, MAXQDA) 활용이 적합한 경우
- 연구 참여자가 15-20인의 분석 대상 자료가 방대한 경우
- 인터뷰 전사 자료 외에 현장을 촬영한 사진, 동영상, 신문 기사 등 다양한 형태의 멀티미디어 자료를 함께 분석해야 하는 경우
- 특정한 핵심어의 출현 빈도를 분석하거나 매트릭스 질의(matrix query)를 활용한 교차 집계를 수행해야 하는 경우
- 한글/워드/엑셀 수작업 코딩만으로도 충분한 경우
- 연구 참여자가 6-10인 내외인 일반적인 석사, 박사학위 논문을 작성하는 경우
- 소프트웨어 사용법을 학습하는 데 2-3주의 기간을 투입하기 어려울 정도로 학사일정이 촉박한 경우
- 메모지를 활용해서 인쇄된 자료를 직접 분류하는 물리적인 작업 방식을 선호하는 경우
| 가상 사례: 노인복지학 박사과정 연구자의 190개 코드의 정제와 주제 식별을 위한 분석 과정 노인복지학을 전공하는 박사과정에 재학 중인 A씨는 ‘독거노인의 인공지능(AI) 기반 돌봄 로봇 수용과 애착 형성의 과정’을 연구주제로 삼아 석사학위 논문을 위한 연구를 수행하고 있었습니다. A씨는 질적연구로 접근하였는데, 10명의 독거노인을 섭외하고 심층 인터뷰를 수행하였습니다. 인터뷰 자료를 전사한 후에 150 페이지의 분량에 달하는 전사자료에 대해서 문장 단위로 코드를 부여하기 시작하였습니다. 분석을 시작한 후 3주 차에 이르러서는 엑셀 파일에 체계화되지 않은 190개의 코드가 누적되었습니다(예., 로봇의 알람에 따라 놀람, 기계로부터 차가운 속성을 인식, 손자와 유사한 느낌으로 쓰다듬음, 고장 우려로 인한 전원 차단, 야간 불안감을 완화, 이웃에 대한 자랑 등). 다수의 코드가 누적된 것을 확인한 연구자 A는 지도교수와의 논의를 거친 후에 다음의 3단계에 걸쳐 범주화와 요약 작업을 수행하였습니다. 유사 코드를 통합(190개 → 65개): ‘기계의 차가움’과 ‘기계에 대한 거부감’과 같이 표현의 방식은 다르지만 본질적으로 의미가 서로 동일한 125개의 코드를 통합해서 총 65개의 코드를 생성하였습니다. 속성에 따른 범주화(65개 → 8개 하위 범주): 65개의 코드를 시간 경과와 심리적인 태도 변화에 따라 유목화하였습니다. 이를 통해, [낯섦과 기계적인 경계], [외로움의 완화와 정서적 교감], [인격 부여와 유사 인간화] 등을 포함하는 8개의 하위 범주를 식별하였습니다. 주제 통합(8개의 하위 범주 → 3개의 주제): 마지막 단계에서는 인터뷰 참여자들이 경험한 내면적인 변화 과정을 나타내는 다음의 세 가지 핵심 주제를 식별하였습니다. 주제 1: 기계적 이물질에 대한 경계와 수동적인 순응 주제 2: 결핍된 인간관계의 공백을 보완하는 유사인격체로의 전이 주제 3: 돌봄 수혜자에서 정서적 돌봄 주체로 전환되는 자아의 회복 (본 사례는 노인복지학 박사학위 논문컨설팅의 실무 경험을 바탕으로 재구성한 가상의 시나리오입니다.) |
자주 묻는 질문 (FAQ)
Q. 1페이지 분량의 질적 전사 자료로부터는 몇 개 정도의 코딩을 식별하는 것이 적절하나요?
A. 학술적으로 절대적인 기준은 없으나, 일반적으로 A4 1페이지의 분량을 기준으로 3-6개의 개방형 코드를 식별합니다. 거의 모든 문장마다 무모하게 코드를 부여해서 1페이지의 전사본으로부터 20개 이상의 코드를 식별한다면, 후속 범주화 단계에서는 그 많은 코딩을 감당할 수 없습니다. 반대로, 1페이지 분량의 자료에서 코드 1개만을 식별한다면 자료가 가지는 내재적인 의미를 충분하게 부각하지 못하며, 나아가서는 연구자가 표면적인 독해만을 수행했다는 비판을 받을 수 있습니다.
Q. 선행연구의 목차나 이론적 프레임워크를 미리 코드로 셋팅한 후에, 전사 자료의 내용을 이에 대입해서 분류해도 됩니까?
A. 이 방식은 연역적 코딩(deductive coding)이며, 정책 평가나 프로그램 모니터링 연구 등에서는 활용될 수 있습니다. 그러나 일반적인 질적 연구(현상학, 근거이론 등)에서 선행연구의 틀을 미리 구성하고 전사 자료를 이에 대입해서 배치하는 것은, 질적 연구의 강점인 ‘발견 가능성(serendipity)’을 연구자 스스로 거부하는 모습이 됩니다. 논문심사 위원은 이를 두고 ‘자료를 객관적으로 분석하지 않고 기존의 이론을 확인하려고만 하는 편향된 접근’으로 평가할 수 있습니다. 따라서 전사 자료 자체에 근거해서 코드를 도출하는 귀납적 코딩(inductive coding)으로 접근해야 합니다.
Q. 연구자 1인 단독으로 코딩을 수행하였다면, “연구자가 자의적으로 해석한 것 아니냐”라는 심사위원의 지적에 어떻게 대응해야 하나요?
A. 질적 분석의 신뢰도를 입증하기 위해서는 평가자 간의 일치도(inter-rater agreement)를 제시하거나 동료 디브리핑(peer debriefing) 절차를 기술해야 합니다. 논문의 ‘제3장. 연구 방법론’에 다음과 같이 구체적인 절차를 기술하는 것이 효과적입니다.
“질적분석의 타당성을 확보하기 위해 본 연구는 모든 전사 자료 중에서 무작위로 추출한 20%를 질적 연구 경험이 풍부한 동료 연구자 1인과 독립적으로 교차 코딩을 수행하였다. 식별한 범주 체계를 상호 비교하여 85% 이상의 개념적 일치도를 확인하였다. 그리고 이견이 발생한 15%의 코드에 대해서는 지도교수의 자문을 거쳐 범주의 명칭과 범위를 확정하였다.”
Q. 식별된 코드가 선행연구의 이론이나 통념과는 정면으로 배치된다면, 코딩 과정에서 오류가 발생한 것이 아닐까요?
A. 오류라고 판단할 수 없으며, 오히려 연구의 독창성과 학술적인 기여를 드러낼 수 있는 기회입니다. 질적 연구의 가치는 기존의 통념이나 양적 연구에서 확인하기 어려웠던 현장에서 드러나는 역설적인 측면을 부각시키는 데 있습니다. 기존의 통념과 서로 배치되는 결과를 나타내는 코드를 임의로 삭제하지 말고, 이를 ‘반직관적인 주제’로 부각해야 합니다. 논문의 ‘제5장. 논의’에서 “기존 선행연구에서는 A로 설명하였으나, 본 연구가 다루었던 대상 현장에서는 B라는 새로운 역학이 작동하는 것으로 관찰되었다”와 같이 차별성을 제시하는 것이 바람직합니다.
결론
코딩은 연구자가 전사 자료에서 나타나는 특정한 구술 내용을 간결한 개념어로 명명하는 작업입니다. 코드를 부여하면 동일한 주제를 언급한 여러 진술들을 유목화할 수 있으며, 서로 다른 표현 속에서라도 공통적인 속성을 식별할 수 있습니다. 코딩의 절차는 자료 통독, 개방 코딩, 범주화, 주제 도출 단계로 이루어집니다. 만약 사전 통독을 생략한다면 특정한 진술에 매몰되어 자료 전체의 맥락을 놓치기 쉽습니다. 코딩을 위한 4단계는 범주화 과정에서 코드를 수정하거나 주제를 정리하는 과정에서 전사 자료를 다시 확인하는 순환적인 과정을 거칩니다.
초기에 부여한 코드는 참여자의 구술 표현에 가깝게 설정하고, 각 코드에는 참여자의 식별 기호와 전사자료의 라인 번호를 병기해야 합니다. 경우에 따라서는 하나의 의미 단위에 복수의 코드를 부여하는 동시 코딩(simultaneous coding)을 할 수도 있습니다.
범주는 동일한 현상이나 속성을 나타내는 코드들을 병합한 후에 식별한 정보를 의미합니다. 범주의 이름은 하위 코드를 모두 포괄할 수 있는 상위 개념어로 설정해야 합니다. 아울러 범주들끼리의 인과관계나 시간적인 선후 관계를 규명함으로써 분석의 틀을 구성합니다.
질적 연구의 전통에 따라 분석 절차와 방법은 서로 다릅니다. 예를 들어서, 근거이론으로 접근하면 범주끼리의 관계를 구조화해서 이론적 모형을 설계합니다. 반면, 현상학에 의한 접근에서는 경험의 본질적인 구조를 기술하며, 주제분석을 접근하는 연구에서는 연구자가 체계적인 분석 기준을 제시해야 합니다. 어떠한 형태의 전통을 추구하더라도 연구자가 수행한 분석 절차를 논문의 제3장에서 기술해야 합니다.
인터뷰 참여자가 10명 내외라면 워드 프로세스나 스프레드시트 프로그램을 사용해서 수작업으로도 코딩이 가능합니다. 그러나 만약, 분석 자료의 분량이 방대하다면 전문 소프트웨어의 활용을 고려할 수 있습니다. 다만, 질적 연구를 위한 전용 소프트웨어라도 자료 관리의 효율성을 높이는 보조적인 도구일 뿐, 연구자의 학술적인 해석과 판단(예., 코딩, 범주화)을 대신 수행하지는 않습니다.