СРАВНИТЕЛЬНЫЙ АНАЛИЗ МЕТОДОВ МАШИННОГО ОБУЧЕНИЯ ДЛЯ ВЫЯВЛЕНИЯ МОШЕННИЧЕСТВА В ТЕКСТОВЫХ СООБЩЕНИЯХ

Авторы

DOI:

https://doi.org/10.32014/2026.2518-1726.468

Ключевые слова:

выявление мошенничества, машинное обучение, проблема холодного старта, обучение на малых выборках, многоязычная классификация текстов

Аннотация

Стремительное перемещение финансового мошенничества на зашифрованные мессенджер-платформы, такие как WhatsApp и Telegram, обусловливает необходимость разработки легковесных средств обнаружения, способных работать с небольшими многоязычными наборами данных, характерными для реальных условий «холодного старта». В отличие от традиционного почтового спама, мошенничество в мессенджерах носит краткосрочный и диалоговый характер, активно использует смешение письменностей, языков и искусственно создаваемое ощущение срочности, что снижает эффективность статических фильтров на основе правил. Существующие решения машинного обучения преимущественно ориентированы на англоязычный SMS-спам и используют крупные размеченные корпуса, вследствие чего сохраняется существенный пробел для постсоветского и центральноазиатского пространства, где русский, казахский и английский языки часто встречаются в одном сообщении. Цель исследования - определить наиболее эффективную архитектуру классического машинного обучения для бинарной классификации многоязычных мошеннических текстовых сообщений в условиях острого дефицита данных. Был сформирован сбалансированный пилотный набор из 189 сообщений, включающий 95 легитимных и 94 мошеннических сообщения, вручную собранных из Telegram, WhatsApp, Reddit, Pikabu и проверенных новостных источников. Тексты векторизовались методом TF-IDF на основе униграмм и биграмм при максимальном количестве 100 признаков и min_df = 2 без морфологической предобработки, что позволило сохранить межъязыковую целостность токенов. Сравнивались пять классификаторов: Logistic Regression, Linear SVM, Multinomial Naive Bayes, Random Forest и XGBoost. Для снижения риска переобучения применялись L2-регуляризация, аддитивное сглаживание, структурные ограничения деревьев и балансировка весов классов. Оценка проводилась с использованием пятикратной стратифицированной кросс-валидации и независимой тестовой выборки. Основной метрикой безопасности являлся Recall для класса мошенничества; дополнительно оценивались Accuracy, F1-score и ROC-AUC. Logistic Regression и Linear SVM продемонстрировали наилучшие результаты: Accuracy = 0,97, Recall = 1,00, F1-score = 0,97, ROC-AUC = 0,957–0,962. Обе модели выявили все мошеннические сообщения, допустив лишь по одному ложноположительному срабатыванию. XGBoost также достиг Recall = 1,00, однако его Precision составил 0,88. Random Forest и Naive Bayes показали менее стабильные результаты с Accuracy 0,86 и 0,79 соответственно. Результаты показывают, что на небольших, разреженных и многоязычных наборах данных о мошенничестве строго регуляризованные линейные модели с компактным пространством признаков могут превосходить более сложные ансамблевые архитектуры. Такой подход формирует вычислительно эффективную основу для фильтрации мошеннических сообщений в реальном времени непосредственно на конечных устройствах.

Загрузки

Опубликован

2026-10-01

Как цитировать

Serek, A., Shoiynbek, A., Zheludkov, M., Kuanyshbay, D., & Meraliyev, B. (2026). СРАВНИТЕЛЬНЫЙ АНАЛИЗ МЕТОДОВ МАШИННОГО ОБУЧЕНИЯ ДЛЯ ВЫЯВЛЕНИЯ МОШЕННИЧЕСТВА В ТЕКСТОВЫХ СООБЩЕНИЯХ. Academic Scientific Journal of Computer Science, (3), 365–383. https://doi.org/10.32014/2026.2518-1726.468

Выпуск

Раздел

ИНФОРМАТИКА