Yayın:
TR-MMLU Benchmark for Large Language Models: Performance Evaluation, Challenges, and Opportunities for Improvement

dc.contributor.authorBayram, M. Ali
dc.contributor.authorFincan, Ali Arda
dc.contributor.authorGumus, Ahmet Semih
dc.contributor.authorDiri, Banu
dc.contributor.authorYildirim, Savas
dc.contributor.authorAytas, Oner
dc.date.accessioned2026-06-27T15:32:21Z
dc.date.issued2025
dc.description.abstractLanguage models have made significant advancements in understanding and generating human language, achieving remarkable success in various applications. However, evaluating these models remains a challenge, particularly for resource-limited languages like Turkish. To address this issue, we introduce the Turkish MMLU (TR-MMLU) benchmark, a comprehensive evaluation framework designed to assess the linguistic and conceptual capabilities of large language models (LLMs) in Turkish. TR-MMLU is based on a meticulously curated dataset comprising 6,200 multiple-choice questions across 62 sections within the Turkish education system. This benchmark provides a standard framework for Turkish NLP research, enabling detailed analyses of LLMs' capabilities in processing Turkish text. In this study, we evaluated state-of-the-art LLMs on TR-MMLU, highlighting areas for improvement in model design. TR-MMLU sets a new standard for advancing Turkish NLP research and inspiring future innovations.en
dc.description.urihttps://doi.org/10.1109/siu66497.2025.11112154
dc.identifier.doi10.1109/siu66497.2025.11112154
dc.identifier.isbn979-8-3315-6656-2; 979-8-3315-6655-5
dc.identifier.issn2165-0608
dc.identifier.urihttps://hdl.handle.net/20.500.14981/71694
dc.identifier.wos001575462500215
dc.language.isotur
dc.publisherIEEE
dc.relation.conference33rd Conference on Signal Processing and Communications Applications-SIU-Annual
dc.relation.ispartof2025 33RD SIGNAL PROCESSING AND COMMUNICATIONS APPLICATIONS CONFERENCE, SIU
dc.rightsopenAccess
dc.subjectLarge Language Models (LLM)
dc.subjectNatural Language Processing (NLP)
dc.subjectArtificial Intelligence
dc.subjectTurkish NLP
dc.subjectComputer Science
dc.subjectEngineering
dc.subjectTelecommunications
dc.titleTR-MMLU Benchmark for Large Language Models: Performance Evaluation, Challenges, and Opportunities for Improvement
dc.typeProceedings Paper
dspace.entity.typePublication
local.import.sourceWOS

Dosyalar

Koleksiyonlar