프롬프트 엔지니어링과 파인튜닝을 활용한 대규모 언어 모델 기반 한국어 혐오 표현 다중 레이블 분류 연구
Multi-Label Classification of Korean Hate Speech Leveraging LLMs with Prompt Engineering and Fine-Tuning
- 발행
- 2025 등록KCI API에는 발행일 항목이 없어 원문 등록일을 쓰고 있습니다. 실측으로 발행보다 최대 6년 늦습니다 — 재수집하면 발행연월로 바뀝니다.
- 소속·발행
- 동국대학교 경영대학 경영정보학과
- 출처
- 국내 KCI
- 원문
- 원문 보기 ↗
개념
키워드
혐오 표현, 대규모 언어 모델, 프롬프트 엔지니어링, 파인튜닝, 디자인 사이언스 방법론, hate speech, large language model, prompt engineering, fine-tuning, design science methodology
초록
온라인 공간에서 혐오 표현 확산은 현대 사회가 직면한 심각한 사회 및 문화적 문제로, 빠른 전파 속도와 경제적 이해관계의 결합에 따라 지속적으로 재생산 및 확산되는 경향을 보인다. 그러나 기존 혐오 표현 탐지 연구는 전통적 기계학습기반의 키워드 필터링 또는 영어 데이터셋 중심의 딥러닝 모델에 의존함으로써, 한국어 환경에서의 정밀 탐지 성능이 저하되고 세부 유형별 분류에 한계가 존재하였다. 이에 본 연구는 한국어 혐오 표현의 복잡한 문맥과 의미적 함의를 정교하게 반영하기 위해 대규모 언어모델(Large Language Model) 기반 다중 레이블 분류 체계를 제안한다. 구체적으로, 공개 데이터셋인 Kor_Unsmile을 Chain-of-Thought(CoT) 프롬프트 구조에 맞추어 재구성한 후 이를 활용하여 대형 언어모델을파인튜닝하였다. 모델 개발 단계에서는 CoT 프롬프트 엔지니어링과 Low-Rank Adaptation(LoRA) 파인튜닝을 결합한LlamaGuard-3-8B 모델을 설계하였으며, 체계적인 하이퍼파라미터 최적화 과정을 통해 성능을 극대화하였다. 성능 평가결과, 제안 모델은 Macro F1 0.8623, Micro F1 0.8817을 기록하여 GPT-4.0 및 KoELECTRA 대비 우수한 성능을 보였으며, 인간 평가자와의 일치도 분석에서도 90.1%의 높은 일치율을 기록해 실제 적용 가능성을 입증하였다. 본 연구는 온라인 플랫폼에서 한국어 혐오 표현을 다중 레이블로 정밀 분류할 수 있는 실용적 모델을 제시함과 동시에, 디자인 사이언스방법론을 적용하여 대규모 언어 모델 기반 분류 모델의 체계적 개발 절차를 구체적으로 제시하였다는 점에서 학문적, 실무적 의의를 가진다.