Comprehensive Evaluation of LLMs’ Korean Language Proficiency
A multi-domain Korean benchmark evaluates six LLMs using quantitative and human assessment, verifying automated Korean proficiency evaluation.
Published Sep 30, 20241 citationPaper ↗
72%
OverallHighly rated
?
OverallHighly ratedVote to see the score
Readers
–
Only vote on papers you've read. Sign in with GitHub to vote.
AI panel8/20reviewers recommend it
lenient 5/5
medium 2/10
strict 1/5
AI panel?Vote to see what the 20 AI reviewers said
Abstract
자연어 처리에서 벤치마크 데이터셋은 거대 언어 모델의 평가에 중요한 역할을 한다. 그러나 비용과 자원의 제한으로 인해 대부분의 자연어 처리 벤치마크는 주로 영어와 중국어로 개발되어 왔다. 이 연구에서는 한국어 능력 평가를 위해 다양한 도메인을 포괄하는 벤치마크 데이터셋을 구축하고, 이를 바탕으로 6개의 한국어 및 다국어 언어 모델(LLM)의 성능을 평가하였다. 평가를 위해 여섯 가지 평가 도메인과 일곱 가지 평가 지표를 사용하여 모델의 종합적인 한국어 능력을 분석하였다. 평가 과정은 정량적 평가와 더불어 일곱 명의 평가자가 수행한 인간 평가를 포함하며, GPT-4를 활용한 자동 평가 방법을 적용하여 인간 평가와의 상관관계를 검토하였다. 연구 결과는 제한된 자원으로도 다양한 평가 방식을 통해 LLM의 한국어 능력을 종합적으로 진단할 수 있음을 보여주었고, 한국어 능력 평가의 자동화 가능성을 검증하였다. 이 연구에서 제안한 벤치마크가 한국어 능력 평가의 중요한 사례로 활용되기를 기대한다.