SMARTACT연구소디지털미디어리터러시 아카이브스마택트 홈 ↗
← 논문 목록

챗GPT 관련 논문 요약문에 나타난 다단어 표현과 두문자어의 분석 및 임베딩 연구

Analyzing and Embedding Multi-Word Expressions and Acronyms in ChatGPT-related Paper Abstracts

발행
2025
소속·발행
충남대학교
출처
국내 KCI
DOI
10.18627/jslg.41.2.202508.109
원문등록
2025-08-28
원문
원문 보기
개념
키워드

대규모언어모델, 다단어표현, 구 마이닝, 두문자어, 단어 임베딩, LLM, Multi-word Expression, Phrase Mining, Acronym, Word-embedding

초록

본 연구는 컴퓨터 언어학(Computational Linguistics) 분야에서, 텍스트 의미를 명확히 하고 논문의 내용을 효과적으로 전달하는 데 중요한 역할을 하는 다단어 표현(Multi-Word Expressions, MWEs)이 대규모 언어 모델(LLMs) 내에서 어떻게 워드 임베딩으로 표현되며, 문맥 속에서 어떻게 활용되는지를 탐구한다. 구체적으로는, 과학 논문에 대한 구 마이닝(phrase mining)을 통해 MWEs를 식별하고, 관련 약어(acronyms)를 추출하며, MWE 임베딩을 활용하여 기술 용어의 언어적·의미적 특성을 분석한다. 이를 위해 ChatGPT를 주제로 한 최신 국제 학술 논문 41,230편의 초록을 수집하여, 이 초록들에 포함된 MWEs를 추출하고 분석한다. 본 연구는 MWEs 임베딩의 자연어 처리(NLP) 과제에서의 활용 가능성을 확장하는 것을 목표로 한다. 궁극적으로는 자연어 처리 기술과 생성형 AI 시스템의 통합 과정을 심층적으로 이해하고자 한다.

같은 개념의 다른 논문
이 개념이 나오는 강연