ИССЛЕДОВАНИЕ МЕТОДОВ СНИЖЕНИЯ КОНФЛИКТОВ ЗНАНИЙ В БОЛЬШИХ ЯЗЫКОВЫХ МОДЕЛЯХ КАЗАХСКИХ ВОПРОСНО-ОТВЕТНЫХ СИСТЕМ

Авторы

  • Курметкан Т. Институт информационных и вычислительных технологий, Алматы, Казахстан; старший преподаватель, Казахский агротехнический исследовательский университет имени С. Сейфуллина, Астана, Казахстан, научный сотрудник https://orcid.org/0000-0003-1178-6400
  • Турысбек Ж. Институт информационных и вычислительных технологий, Алматы, Казахстан; докторант, Satbayev University, Алматы, Казахстан, научный сотрудник https://orcid.org/0009-0004-2311-6249
  • Мухитова А. заместитель заведующего кафедрой информационных систем по научно-инновационной работе и международным связям, Казахский национальный университет имени аль-Фараби, Алматы, Казахстан, старший преподаватель https://orcid.org/0000-0001-6004-103X
  • Наурызбаева А. Satbayev University, Алматы, Казахстан, старший преподаватель https://orcid.org/0009-0004-2311-6249

DOI:

https://doi.org/10.32014/2026.2518-1726.460

Ключевые слова:

большие языковые модели, конфликт знаний, галлюцинации, антифактические данные, вопросно-ответные системы, RAG, казахский язык

Аннотация

Большие языковые модели (LLM) активно применяются при разработке казахскоязычных вопросно-ответных систем (QA). Однако между знаниями, содержащимися во внутренних параметрах модели, и внешним контекстом могут возникать существенные противоречия, приводящие к генерации ложных или неподтвержденных ответов. Это явление, связанное с конфликтом знаний и «галлюцинациями», представляет серьезную проблему для надежности систем, работающих с малоресурсными агглютинативными языками, к которым относится казахский язык. В исследовании предложена комплексная методология снижения уровня галлюцинаций в казахскоязычных QA-системах посредством объединения контекстно-ориентированного расширения данных, специализированных антифактических наборов данных и генерации с дополнением поиском (RAG). Научная новизна заключается в адаптации указанных подходов к морфологическим и семантическим особенностям казахского языка, а также в их сочетании с параметрически эффективной настройкой (PEFT/LoRA) и совместной оптимизацией функции потерь. Для экспериментальной проверки разработан специализированный корпус KazHC, посвященный истории и культуре Казахстана и содержащий около 1 200 пар «вопрос–ответ», 4 200 контекстных фрагментов и 520 000 токенов. С использованием графического процессора NVIDIA A100 и 4-битного квантования выполнено дообучение экстрактивной модели mBERT и генеративной модели LLaMA-2-7B. Экспериментальная оценка по метрикам Exact Match (EM) и F1 продемонстрировала существенное повышение качества. Интеграция RAG и антифактического обучения позволила увеличить F1 модели LLaMA-2 с 65% до 78%, а EM — с 58% до 72%. Экспертная оценка тремя независимыми специалистами (Fleiss’ Kappa = 0,76) подтвердила снижение общего уровня галлюцинаций с 28% до 9%, то есть на 19 процентных пунктов. Качественный анализ ошибок показал, что сохраняющиеся галлюцинации преимущественно связаны с фактическими и логическими несоответствиями, обусловленными недостаточностью знаний, полученных на этапе предварительного обучения. Результаты подтверждают, что сочетание контекстного поиска и антифактической регуляризации позволяет модели отдавать приоритет фактическому контексту перед противоречащими ему внутренними знаниями и формирует основу для создания надежных казахскоязычных NLP-приложений.

Загрузки

Опубликован

2026-10-01

Как цитировать

Құрметқан, Т., Тұрысбек, Ж., Мұхитова, А., & Наурызбаева, А. (2026). ИССЛЕДОВАНИЕ МЕТОДОВ СНИЖЕНИЯ КОНФЛИКТОВ ЗНАНИЙ В БОЛЬШИХ ЯЗЫКОВЫХ МОДЕЛЯХ КАЗАХСКИХ ВОПРОСНО-ОТВЕТНЫХ СИСТЕМ. Academic Scientific Journal of Computer Science, (3), 214–232. https://doi.org/10.32014/2026.2518-1726.460

Выпуск

Раздел

ИНФОРМАТИКА