Yayın:
A cyclical loss-based optimization algorithm for pretraining LLMs on noisy data

dc.contributor.authorKesgin, H. Toprak
dc.contributor.authorAmasyali, M. Fatih
dc.date.accessioned2026-06-27T15:19:33Z
dc.date.issued2025
dc.description.abstractLarge language models (LLMs) depend on vast web-scale datasets, which frequently include noisy or low-quality samples that degrade performance and fairness-despite conventional data cleaning. This paper introduces an in-training filtering approach that selectively ignores noisy data points based on real-time loss statistics during training. The approach combines deterministic and probabilistic selection mechanisms using robust loss-based metrics and cyclically adjusted thresholds to balance stability and diversity. Evaluations on Turkish-language datasets demonstrate that this strategy reduces validation loss and improves downstream task accuracy without any preprocessing. By integrating filtering directly into the training loop, the method maintains data diversity, requires minimal overhead, and improves learning efficiency-offering a scalable alternative for robust LLM pre-training in noisy or low-resource environments.en
dc.description.sponsorshipScientific and Technological Research Council of Turkey (TUBITAK) Grant [124E055]
dc.description.sponsorshipYildiz Technical University Scientific Research Projects Coordination Unit [FDK-2024-6422]
dc.description.urihttps://doi.org/10.1016/j.knosys.2025.114189
dc.identifier.doi10.1016/j.knosys.2025.114189
dc.identifier.eissn1872-7409
dc.identifier.issn0950-7051
dc.identifier.urihttps://hdl.handle.net/20.500.14981/69746
dc.identifier.volume328
dc.identifier.wos001554098100001
dc.language.isoeng
dc.publisherELSEVIER
dc.relation.ispartofKNOWLEDGE-BASED SYSTEMS
dc.subjectLarge language models
dc.subjectLLM pretraining
dc.subjectNoisy data
dc.subjectLoss-based filtering
dc.subjectCyclical scheduling
dc.subjectAdaptive optimization
dc.subjectIn-training filtering
dc.subjectData selection
dc.subjectWeb-scale datasets
dc.subjectLow-resource languages
dc.subjectComputer Science
dc.titleA cyclical loss-based optimization algorithm for pretraining LLMs on noisy data
dc.typeArticle
dspace.entity.typePublication
local.import.sourceWOS

Dosyalar

Koleksiyonlar