ОБНАРУЖЕНИЕ ФЕЙКОВЫХ НОВОСТЕЙ НА КАЗАХСКОМ ЯЗЫКЕ: ВРЕМЕННАЯ ОЦЕНКА ЛЕКСИЧЕСКИХ, ТРАНСФОРМЕРНЫХ И ГИБРИДНЫХ МОДЕЛЕЙ

Авторы

  • Тельман Д. Институт информационных и вычислительных технологий Комитета науки Министерства науки и высшего образования Республики Казахстан; PhD докторант, Казахский национальный исследовательский технический университет имени К.И. Сатпаева, Алматы, Казахстан, младший научный сотрудник https://orcid.org/0000-0003-1387-5351
  • Еримбетова А. Институт информационных и вычислительных технологий Комитета науки Министерства науки и высшего образования Республики Казахстан; PhD, кандидат технических наук, ассоциированный профессор, профессор-исследователь, META University, Алматы, Казахстан, ведущий научный сотрудник https://orcid.org/0000-0002-2013-1513
  • Дайырбаева Э. Институт информационных и вычислительных технологий Комитета науки Министерства науки и высшего образования Республики Казахстан, Алматы, Казахстан; магистр, старший преподаватель, Казахский национальный исследовательский технический университет имени К.И. Сатпаева, Алматы, Казахстан, научный сотрудник https://orcid.org/0000-0002-4255-5456

DOI:

https://doi.org/10.32014/2026.2518-1726.472

Ключевые слова:

фейковые новости, дезинформация, казахский язык, малоресурсная обработка естественного языка, метод опорных векторов, объединение моделей, утечка данных

Аннотация

В работе сравниваются лексическая, моноязычная Transformer-модель и экспериментальная модель объединения вероятностных оценок на очищенных казахскоязычных заголовках и кратких описаниях Factcheck.kz. После удаления явных формулировок вердиктов и шаблонных фраз источника 1 265 записей были хронологически разделены на 885 обучающих, 190 валидационных и 190 тестовых. Операциональный положительный класс объединяет категории «ложь», «фейк», «манипуляция», «полуправда» и «непроверено» и поэтому не представляет собой однородный класс полностью вымышленных сообщений. Модель TF-IDF + Linear SVM достигла macro-F1 = 0,6563 при широком 95%-ном bootstrap-доверительном интервале [0,5834; 0,7253]. Transformer-модель показала среднее значение macro-F1 = 0,6585 (SD = 0,0442) по пяти random seeds. Экспериментальная модель score fusion получила 0,6422 (SD = 0,0180) и не выполнила заранее установленный критерий превосходства над обоими компонентными моделями по среднему значению test macro-F1. Парные bootstrap-интервалы различий между тремя подходами включали ноль, поэтому статистически подтвержденное превосходство какой-либо модели не установлено. В дополнительном анализе положительный класс был ограничен категориями «фейк» и «манипуляция». Переобученная SVM достигла macro-F1 = 0,7153 на 123 тестовых записях, тогда как исходная модель с широким набором меток на той же подвыборке показала 0,7488. Следовательно, преимущество переобучения на более узком наборе категорий не подтверждено. Оценка ограничена одним редакционным источником: хронологическое разделение и очистка текста сами по себе не подтверждают переносимость результатов на другие публикационные источники или исходные утверждения. Полученные результаты указывают на необходимость осторожной интерпретации результатов классификации на малых выборках. Использование модели в качестве инструмента предварительного отбора материалов требует независимой внешней валидации и экспертного контроля.

Загрузки

Опубликован

2026-10-01

Как цитировать

Тельман, Д., Еримбетова, А., & Дайырбаева, Э. (2026). ОБНАРУЖЕНИЕ ФЕЙКОВЫХ НОВОСТЕЙ НА КАЗАХСКОМ ЯЗЫКЕ: ВРЕМЕННАЯ ОЦЕНКА ЛЕКСИЧЕСКИХ, ТРАНСФОРМЕРНЫХ И ГИБРИДНЫХ МОДЕЛЕЙ. Academic Scientific Journal of Computer Science, (3), 441–456. https://doi.org/10.32014/2026.2518-1726.472

Выпуск

Раздел

ИНФОРМАТИКА