딥페이크 음성 식별 성능 개선을 위한 전역 주파수/시간 연관관계 학습 강화 연구
Enhancing Global Frequency-Time Correlation Learning for Improved Deepfake Audio Detection
- 발행
- 2026 등록KCI API에는 발행일 항목이 없어 원문 등록일을 쓰고 있습니다. 실측으로 발행보다 최대 6년 늦습니다 — 재수집하면 발행연월로 바뀝니다.
- 소속·발행
- 덕성여자대학교
- 출처
- 국내 KCI
- 원문
- 원문 보기 ↗
개념
키워드
음성 딥페이크 감지, 멀티뷰 학습, 비전 트랜스포머, 음성 보안, 멜 스펙트로그램, Speech Deepfake Detection, Multi-View Learning, Vision Transformer, Audio Security, Mel-Spectrogram
초록
최근 음성 합성 및 변조 기술의 급속한 발전으로 인해 딥페이크 음성을 악용한 보이스 피싱, 사기, 신원 도용 등의 위협이 증가하고 있다. 이에 따라 기존 화자 검증 시스템을 보완할 수 있는 음성 딥페이크 탐지 기술의 중요성이 부각되고 있다. 본 연구에서는 기존 Multi-View Collaborative Learning(MVCLN)의 구조를 기초로, 스펙트로그램 인코더를 기존 CNN에서 Vision Transformer(ViT)로 변경한 음성 딥페이크 탐지 모델을 제안한다. 제안 모델은 waveform 기반 Transformer와 ViT 기반 spectrogram 인코더를 병렬로 구성하고, 두 표현 간의 상호 보완적 특성을 효과적으로 융합하기 위해 Waveform-Spectrogram Fusion Module(WSFM)을 적용하였다. 실험 결과, 제안한 모델은 seen 환경에서 AUC 0.9999, EER 0.38%를 기록하였으며, unseen 환경에서도 AUC 0.9653으로 기존 MVCLN 보다 성능이 향상되었다.