ВЫЯВЛЕНИЕ ОСКОРБИТЕЛЬНЫХ КОММЕНТАРИЕВ НА КАЗАХСКОМ ЯЗЫКЕ В ОНЛАЙН-КОНТЕНТЕ С ПОМОЩЬЮ АЛГОРИТМОВ ГЛУБОКОГО ОБУЧЕНИЯ

Авторы

  • Алишева С. С. Южно-Казахстанский университет имени М. Ауэзова, Шымкент, Казахстан, PhD https://orcid.org/0000-0001-6887-9208
  • Оспанова А. О. Южно-Казахстанский университет имени М. Ауэзова, Шымкент, Казахстан, профессор https://orcid.org/0000-0001-8685-7125
  • Шаймерденова Г. С. Южно-Казахстанский университет имени М. Ауэзова, Шымкент, Казахстан, PhD, ассоциированный профессор https://orcid.org/0000-0001-8685-7125
  • Шаймерденова Л. Южно-Казахстанский университет имени М. Ауэзова, Шымкент, Казахстан, PhD https://orcid.org/0000-0002-5656-0918
  • Жидебаева А. Н. Университет дружбы народов имени академика А. Куатбекова, Шымкент, Казахстан, кандидат технических наук, старший преподаватель кафедры информатики и математики https://orcid.org/0000-0002-3768-4835

DOI:

https://doi.org/10.32014/2026.2518-1726.452

Ключевые слова:

выявление оскорбительной лексики, глубокое обучение, кибербуллинг, казахский язык, социальные сети, классификация текста, BiLSTM

Аннотация

Стремительное развитие социальных сетей и онлайн-платформ привело к значительному увеличению количества оскорбительных и агрессивных комментариев, что формирует психологические, социальные и связанные с безопасностью риски. Оскорбительная лексика, кибербуллинг и язык ненависти могут негативно влиять на психологическое состояние пользователей, способствовать тревожности, социальной изоляции и снижению качества онлайн-коммуникации. В исследовании предложен подход на основе глубокого обучения для выявления оскорбительных комментариев на казахском языке, объединяющий двунаправленную сеть долгой краткосрочной памяти (BiLSTM), разработанный для казахского языка алгоритм стемминга и методы лингвистической предварительной обработки. Для экспериментальной оценки была сформирована сбалансированная выборка из 40 000 вручную размеченных комментариев на казахском языке, включающая 20 000 оскорбительных и 20 000 нейтральных комментариев. Обработка данных осуществлялась с применением расширяемого словаря стемминга. Эффективность моделей оценивалась по показателям Accuracy, Precision, Recall и F1-score. Наилучшие результаты показала модель BiLSTM: Accuracy - 91,3%, Precision - 92,6%, Recall - 93,0%, F1-score - 92,7%. Наивный байесовский классификатор продемонстрировал наиболее низкие показатели: Accuracy - 60,2%, Precision - 52,4%, Recall - 58,5%, F1-score - 64,2%. Полученные результаты подтверждают эффективность методов глубокого обучения при обработке морфологически сложных текстов на казахском языке. Предложенный подход может быть интегрирован в социальные сети и онлайн-сервисы для автоматической модерации контента, профилактики кибербуллинга и формирования более безопасной цифровой среды для казахоязычных пользователей.

Загрузки

Опубликован

2026-10-01

Как цитировать

Alisheva, S. S., Ospanova, A. O., Shaimerdenova, G. S., Shaimerdenova, L., & Zhidebayeva, A. N. (2026). ВЫЯВЛЕНИЕ ОСКОРБИТЕЛЬНЫХ КОММЕНТАРИЕВ НА КАЗАХСКОМ ЯЗЫКЕ В ОНЛАЙН-КОНТЕНТЕ С ПОМОЩЬЮ АЛГОРИТМОВ ГЛУБОКОГО ОБУЧЕНИЯ. Academic Scientific Journal of Computer Science, (3), 68–85. https://doi.org/10.32014/2026.2518-1726.452

Выпуск

Раздел

ИНФОРМАТИКА