SMARTACT연구소디지털미디어리터러시 아카이브스마택트 홈 ↗
← 논문 목록

KOCOH: 맥락 의존적 혐오 표현 탐지를 위한 데이터 세트

KOCOH: A Dataset for Detecting Context-Dependent Hate Speech

발행
2025 등록KCI API에는 발행일 항목이 없어 원문 등록일을 쓰고 있습니다. 실측으로 발행보다 최대 6년 늦습니다 — 재수집하면 발행연월로 바뀝니다.
소속·발행
고려대학교 언어학과
출처
국내 KCI
DOI
10.20405/kl.2025.02.106.251
원문
원문 보기
개념
키워드

맥락 의존적 혐오 표현, 언어 모델 안전성, 자연어 처리 윤리, 혐오 표현 탐지, Context-Dependent Hate Speech, Language Model Safety, Ethics in Natural Language Processing, Hate Speech Detection

초록

본 연구는 자연어 처리 분야에서 비교적 많이 연구되지 않은 맥락 의존적 혐오 표현에 주목하여, 이를 평가하기 위한 데이터 세트를 구축하고 생성형 언어 모델의 성능을 검증했다. 데이터는 한국의 대표적 온라인 커뮤니티 디시인사이드에서 수집되었으며, 맥락-댓글 총 2,005쌍으로 구성된 데이터 세트 KOCOH(KOrean COntext-Dependent Hate speech)가 구축되었다. 데이터의 유형은 실제 맥락과 맥락 의존적 혐오 표현, 만들어진 맥락과 맥락 의존적 비혐오 표현, 실제 맥락과 맥락 의존적 비혐오 표현의 세 가지로 구분되었다. 여섯 개의 최신 생성형 언어 모델(GPT-4o, GPT-4o-mini, Claude-3.5-sonnet, Claude-3.5-haiku, Bllossom, Ko-Gemma-2)에 대한 성능 평가 결과, F1 점수는 평균 60.73%로, 성능이 아직 만족스러운 수준에 도달하지 못했음을 확인했다. 특히, 언어 모델들은 고차원적 맥락이나 은어를 포함한 혐오 표현 탐지에 어려움을 겪었다. 본 연구는 한국어로 된 최초의 맥락 의존적 혐오 표현 데이터 세트를 구축했으며, 생성형 언어 모델의 한계를 실증하고 향후 지침이 될 수 있는 분석 결과를 제시했다.

같은 개념의 다른 논문
이 개념이 나오는 강연