RETRIEVAL ЭФФЕКТИВНЕЕ FINE-TUNING: АДАПТАЦИЯ МАЛОЙ ЯЗЫКОВОЙ МОДЕЛИ КАЗАХСКОГО ЯЗЫКА ДЛЯ ОТВЕТОВ НА ИСТОРИЧЕСКИЕ ВОПРОСЫ.

Авторы

  • Аскар Г. Институт умных систем и искусственного интеллекта (ISSAI), Астана, Казахстан; научный сотрудник, Казахский национальный университет имени аль-Фараби, Алматы, Казахстан, научный сотрудник https://orcid.org/0009-0001-6304-3003
  • Мутайхан А. Институт умных систем и искусственного интеллекта (ISSAI), Астана, Казахстан, научный сотрудник https://orcid.org/0009-0006-7093-074X
  • Айткожаева М. Институт умных систем и искусственного интеллекта (ISSAI), Астана, Казахстан, научный сотрудник https://orcid.org/0009-0003-5991-4982
  • Наурызбайкызы Г. преподаватель кафедры иностранных языков Актюбинского регионального университета имени К. Жубанова, Актобе, Казахстан; научный сотрудник, Институт умных систем и искусственного интеллекта (ISSAI), Астана, Казахстан; научный сотрудник, Казахский национальный университет имени аль-Фараби, Алматы, Казахстан, PhD https://orcid.org/0000-0001-9272-8952
  • Махатаева Ж. Институт умных систем и искусственного интеллекта (ISSAI), Астана, Казахстан; научный сотрудник, Казахский национальный университет имени аль-Фараби, Алматы, Казахстан, PhD, старший аналитик данных https://orcid.org/0000-0001-9366-7047

DOI:

https://doi.org/10.32014/2026.2518-1726.453

Ключевые слова:

малые языковые модели (SLM), поисково-дополненная генерация (RAG), дообучение с учителем (SFT), низкоресурсные языки, история Казахстана, обработка естественного языка (NLP)

Аннотация

Большие языковые модели (LLM) демонстрируют высокую эффективность при решении широкого спектра языковых задач, однако их применение в предметно-ориентированных областях, особенно для языков с ограниченными ресурсами, остается затруднительным. В исследовании рассматривается подход к адаптации малых языковых моделей (SLM) для решения задач, связанных с ответами на вопросы по истории. В качестве базовой модели использована малая визуально-языковая модель Qolda, разработанная Институтом умных систем и искусственного интеллекта (ISSAI). Сравниваются четыре архитектуры: 1) базовая модель Qolda; 2) Qolda с дообучением с учителем (SFT) на основе 48 000 пар инструкций, полученных из Википедии; 3) Qolda с механизмом поисково-дополненной генерации (RAG), основанным на 29 оцифрованных учебниках по истории, содержащих 2,25 млн индексированных токенов; 4) Qolda, объединяющая SFT и RAG. Для проверки применимости выявленных закономерностей к другим казахоязычным моделям дополнительно оценивались более крупные модели KazLLM и Sherkala-Chat. Все архитектуры тестировались на 1 081 вопросе с множественным выбором из Единого национального тестирования по истории Казахстана и на наборе из 500 открытых вопросов. Результаты показали, что Qolda+RAG обеспечивает точность 74,93 ± 0,43% и средний показатель качества 3,34 ± 1,64. В рассматриваемых условиях SFT преимущественно выполняет функцию форматирования ответа, сокращая его среднюю длину с 51,8 до 14,64 слова. Архитектура Qolda-SFT+RAG выполняет вывод примерно вдвое быстрее Qolda+RAG при сопоставимом уровне качества 3,10 ± 1,42. Полученные результаты формируют методологическую основу для дальнейшей разработки ИИ-агентов с поддержкой казахского языка для широкого спектра прикладных задач.

Биографии авторов

Мутайхан А., Институт умных систем и искусственного интеллекта (ISSAI), Астана, Казахстан, научный сотрудник

Мутайхан Алмубди ― Студент бакалавриата по специальности "Компьютерные Науки" Назарбаев Университета (НУ) и научный сотрудник Института Умных Систем и Искусственного Интеллекта (ISSAI), Астана, Казахстан, 

E-mail: almubdi.mutaikhan@nu.edu.kz, https://orcid.org/0009-0006-7093-074X;

Айткожаева М., Институт умных систем и искусственного интеллекта (ISSAI), Астана, Казахстан, научный сотрудник

Айткожаева Малика ―  Студент бакалавриата по специальности "Компьютерные Науки" Назарбаев Университета (НУ) и научный сотрудник Института Умных Систем и Искусственного Интеллекта (ISSAI), Астана, Казахстан, 

E-mail: malika.aitkozhayeva@nu.edu.kz, https://orcid.org/0009-0003-5991-4982; 

Загрузки

Опубликован

2026-10-01

Как цитировать

Askar, G., Mutaikhan, A., Aitkozhayeva, M., Nauryzbaikyzy, G., & Makhataeva, Z. (2026). RETRIEVAL ЭФФЕКТИВНЕЕ FINE-TUNING: АДАПТАЦИЯ МАЛОЙ ЯЗЫКОВОЙ МОДЕЛИ КАЗАХСКОГО ЯЗЫКА ДЛЯ ОТВЕТОВ НА ИСТОРИЧЕСКИЕ ВОПРОСЫ. Academic Scientific Journal of Computer Science, (3), 86–105. https://doi.org/10.32014/2026.2518-1726.453

Выпуск

Раздел

ИНФОРМАТИКА