KyrgyzLLM-Bench:首个大规模吉尔吉斯语LLM评估基准发布
研究人员近日发布了KyrgyzLLM-Bench,这是首个系统评估大语言模型在吉尔吉斯语上理解能力的基准测试套件。该基准包含两个本地原创数据集(KyrgyzMMLU和KyrgyzRC)以及经过翻译和人工审核的WinoGrande、HellaSwag、BoolQ和TruthfulQA数据集。研究团队评估了26个开源和闭源模型,发现模型排名在英语和吉尔吉斯语之间在WinoGrande和BoolQ上迁移性较好,但HellaSwag任务上存在显著性能差距,这主要源于翻译导致的语义偏差。Few-shot提示在阅读理解上提升了部分开源模型表现,但对闭源模型效果不稳定。该基准的发布为低资源语言评估提供了重要参考,所有数据、代码及每模型结果均已开源。