SMARTACT연구소디지털미디어리터러시 아카이브스마택트 홈 ↗
← 논문 목록

눈·코·입 영역 강조 가중치를 활용한 ViT 기반 딥페이크 탐지 기법 연구

ViT-based Deepfake Detection via Regional Emphasis Weights on Eyes, Nose, and Mouth

발행
2025 등록KCI API에는 발행일 항목이 없어 원문 등록일을 쓰고 있습니다. 실측으로 발행보다 최대 6년 늦습니다 — 재수집하면 발행연월로 바뀝니다.
소속·발행
국립한밭대학교 컴퓨터공학과
출처
국내 KCI
DOI
10.22798/KDFS.2025.19.4.116
원문
원문 보기
개념
키워드

딥페이크 탐지, 비전트랜스포머 모델, 랜드마크, 패치 가중치, 디지털포렌식, Deepfake Detection, Vision Transformer (ViT) Model, Facial Landmark, Patch Weight, Digital Forensics

초록

딥페이크 기술이 빠르게 고도화됨에 따라, 이를 악용한 가짜뉴스 유포나 디지털 성범죄와 같은 사회적 문제가 심각해지 고 있다. 따라서 이러한 딥페이크 콘텐츠를 정확하게 탐지하고 대응하기 위한 기술이 중요한 과제로 떠오르고 있다. 기존 연구들은 CNN 혹은 ViT 기반의 모델을 사용해 딥페이크 탐지를 진행하였다. 하지만 CNN은 전역적인 정보, ViT는 국소적 인 정보를 상대적으로 탐지하지 못하는 문제점이 존재한다. 본 연구에서는 ViT 기반 모델의 한계점인 국소 정보 탐지를 보완하기 위해 MediaPipe를 이용해 얼굴 랜드마크를 추출하고, ViT의 패치 임베딩 단계에 눈·코·입 영역별 학습 가능한 가 중치를 부여하는 Region Weight 모듈 도입을 제안한다. 이를 통해 ViT 모델이 전역 정보 뿐 아니라 딥페이크 기법에서 주 로 발생하는 눈·코·입 주변의 미세한 변화를 효과적으로 학습하도록 한다. FaceForensics++ 데이터셋을 활용해 실험한 결 과, Region Weight Module 사용 전 ViT 대비 ACER는 7.94%, AUC는 약 3% 개선되었다. 본 논문의 제안 기법은 발전하는 딥페이크 생성 기법에서 발생하는 주요 특징을 효과적으로 포착하며, 향후 더욱 정교하고 은밀해지는 딥페이크 기법에 대 해서도 안정적으로 대응할 수 있는 기반 기술로 활용될 수 있을 것으로 기대된다.

같은 개념의 다른 논문
이 개념이 나오는 강연