КЛАССИФИКАЦИЯ КИБЕРЭКСТРЕМИСТСКИХ ИДЕОЛОГИЙ НА КАЗАХСКОМ ЯЗЫКЕ С УЧЕТОМ РАЗНОГЛАСИЙ НЕСКОЛЬКИХ АННОТАТОРОВ
DOI:
https://doi.org/10.32014/2026.2518-1726.465Ключевые слова:
киберэкстремизм, идеологическая классификация, многоаннотаторная разметка, обучение с учетом разногласий, мягкие метки, ансамблевое обучение, Macro-F1, Cross-Entropy, Kullback–Leibler divergence, Jensen–Shannon divergenceАннотация
Распространение киберэкстремистского контента на цифровых платформах влияет на информационную безопасность и общественную стабильность, поэтому его автоматическое выявление и классификация по идеологическим направлениям являются актуальной научной задачей. При автоматической классификации киберэкстремистских текстов на казахском языке содержание одного текста может быть семантически близким к нескольким классам. Это проявляется в различиях между оценками нескольких аннотаторов при пересечении смысловых границ категорий пропаганды, рекрутмента и радикализации. Традиционный подход, основанный на большинстве голосов, сводит подобные расхождения к одной жесткой метке, что может приводить к потере информации о неопределенности аннотации. Цель исследования заключается в сравнении стратегий, сохраняющих многоаннотаторные оценки при классификации киберэкстремистских текстов на казахском языке и позволяющих комплексно оценивать качество их моделирования. В исследовании использован многоклассовый корпус текстов, собранных на открытых цифровых платформах VK, Telegram и YouTube. Корпус включает классы пропаганды, рекрутмента, радикализации и нейтрального содержания. Аннотирование проводилось на основе независимых оценок нескольких экспертов. Сравнивались четыре стратегии обработки многоаннотаторной информации: большинство голосов, вероятностная обработка, ансамблевое объединение и стратегия, основанная на инструкциях. Качество определения итогового класса оценивалось с помощью Macro-F1, а соответствие вероятностных распределений модели распределению меток аннотаторов - с использованием Cross-Entropy (CE), Kullback–Leibler divergence (KL), Jensen–Shannon divergence (JS) и Manhattan Distance (MD). Среди рассмотренных подходов стратегия ансамблевого объединения продемонстрировала наивысшее качество классификации. По метрикам CE, KL и JS она также обеспечила более высокое соответствие вероятностных распределений. Метод большинства голосов показал лучший результат по MD. По сравнению с большинством голосов ансамблевое объединение повысило качество классификации и обеспечило более низкие значения метрик вероятностного расхождения. В рамках DART комбинация LCE + LKL + LMD позволила сохранить качество классификации и приблизить прогнозы модели к распределению оценок аннотаторов. Полученные результаты показывают, что одной жесткой метки недостаточно для моделирования многоаннотаторных идеологических текстов, тогда как учет различий между мнениями аннотаторов является более эффективным и информативным подходом.




