SMARTACT연구소디지털미디어리터러시 아카이브스마택트 홈 ↗
← 논문 목록

생성형 AI 기반 한국어 가짜뉴스 데이터셋 구축 및 탐지 모델 비교 분석 연구

A Study on Constructing a Korean Fake News Dataset Using Generative AI and Comparing Detection Models

발행
2025 등록KCI API에는 발행일 항목이 없어 원문 등록일을 쓰고 있습니다. 실측으로 발행보다 최대 6년 늦습니다 — 재수집하면 발행연월로 바뀝니다.
소속·발행
국민대학교 경영정보학부
출처
국내 KCI
DOI
10.13088/jiis.2025.31.4.193
원문
원문 보기
개념
키워드

가짜뉴스 탐지, 생성형 AI, 한국어 가짜뉴스, 한국어 사전학습 언어모델, 텍스트 임베딩, Fake news detection, generative AI, Korean fake news, Korean pre-trained language model, text embedding

초록

생성형 인공지능(Generative AI)과 대규모 언어 모델(LLM)의 발전으로 인간이 작성한 기사와 거의 구분이 어려운 수준의 텍스트가 대량 생산되면서, 특히 정치 영역에서 선거 후보자나 특정 집단의 이미지를 의도적으로 훼손하는 가짜뉴스가한국 사회의 정보 신뢰성을 심각하게 위협하고 있다. 가짜뉴스는 의도성 여부에 따라 허위조작정보(disinformation)와 오정보(misinformation)로 구분되지만, 본 연구는 이 중에서도 사회적 파급력이 큰 허위조작정보, 즉 의도적 조작 유형에 집중한다. 지금까지의 가짜뉴스 탐지 연구는 정교하게 설계된 허위조작정보 앞에서 텍스트 내용만으로 진위를 판별하기 어렵고, 소셜 맥락과 확산 양상 등 외부 맥락도 충분히 활용하지 못한다는 한계가 지적되어 왔다. 특히 한국어 환경에서는영어권에 비해 검증된 데이터셋의 규모와 다양성이 크게 뒤처져 있고, 다수의 LLM이 영어 중심 말뭉치로 사전학습됨에 따라 한국어 텍스트에서는 성능 저하와 언어적 편향, 그리고 실제 한국어 뉴스 데이터셋을 활용한 LLM 기반 탐지 연구에서 보고된 논리 구조나 문법성 같은 콘텐츠 품질에 대한 편향이 확인된다. 이러한 연구 환경을 보완하기 위해 본 연구는한국어 정치 뉴스 데이터를 선별하여 새로운 데이터셋을 구축한다. 구체적으로, 생성형 AI를 활용하여 기존 뉴스의 핵심사실(kernel of truth)을 유지한 채 해석과 맥락을 왜곡하는 방식의 한국어 정치 가짜뉴스 텍스트를 생성한다. 이로써 진짜뉴스, 가짜 뉴스 쌍으로 구성된 데이터셋을 완성한다. 나아가 이 데이터셋을 토대로 한국어 특화 텍스트 임베딩 및 사전학습 언어모델 기반 탐지 모델의 가능성과 한계를 실증적으로 분석한다. 궁극적으로는 생성형 AI 시대에 고도화되는 한국어정치 가짜뉴스에 대응할 수 있는 한국어 특화 탐지 프레임워크의 필요성과 방향성을 제시하고자 한다.

같은 개념의 다른 논문
이 개념이 나오는 강연