SMARTACT연구소디지털미디어리터러시 아카이브스마택트 홈 ↗
← 논문 목록

생성형 AI모델의 요약 성능 평가 연구

Summary evaluation performance studies with generative AI models

발행
2024
소속·발행
연세대학교 언어정보학협동과정
출처
국내 KCI
DOI
10.20988/lfp.2024.62..203
원문등록
2024-05-30
원문
원문 보기
개념
키워드

생성형 AI, 요약 평가, 수동 평가, ChatGPT, BERTScore, Generative AI, Summary evaluation, Manual evaluation, ChatGPT, BERTScore

초록

인간에 의한 수작업 평가는 시간과 비용 소모, 주석자 간의 의견 불일치, 평가 결과의 품질 등 불가피한 한계가 있다. 본 연구에서는 생성 AI모델 중 문맥을 고려하고 긴 문장을 입출력할 수 있는 ChatGPT를 활용한 한국어 요약 평가가 사람의 평가를 대체하거나 보완할 수 있는지 살펴보았다. 이를 위해 정량적 지표로 BERTScore를, 정성적 지표로 ‘일관성, 관련성, 문법, 유창성’ 등을 사용하여 ChatGPT가 생성한 요약에 대한 정성 및 정량적 평가를 실시했다. 평가 결과 ChatGPT4는 사람의 수작업 평가를 보완할 수 있는 잠재력을 가지고 있는 것을 확인하였다. 영어에 대해 학습된 모델이라는 점을 감안하여 한국어 오류 요약문 평가를 통해 오류 탐지 성능을 추가로 평가하고, 생성형 AI를 이용한 평가의 타당성과 신뢰성을 검증하기 위해 문장과 비문에 대해 반복적으로 평가하여 ChatGPT4의 오류 요약문 평가 성능과 내부 신뢰도를 검증했다. 그 결과 ChatGPT3.5와 ChatGPT4의 오류 요약 평가 성능이 불안정하여 아직은 사람의 평가를 보조하는 데 어려움이 있음을 확인하였다.

같은 개념의 다른 논문
이 개념이 나오는 강연