МОДЕЛЬ ОБНАРУЖЕНИЯ ФИШИНГОВЫХ URL В ОНЛАЙН-СОЦИАЛЬНЫХ СЕТЯХ НА ОСНОВЕ МАШИННОГО ОБУЧЕНИЯ
DOI:
https://doi.org/10.32014/2026.2518-1726.461Ключевые слова:
фишинговые URL, обнаружение фишинга, машинное обучение, TF-IDF-векторизация, кибербезопасностьАннотация
Фишинговые веб-адреса (URL) остаются одной из наиболее распространенных угроз кибербезопасности в современной цифровой среде. Стремительное развитие онлайн-социальных сетей (ОСС) и веб-платформ способствует широкому распространению фишинговых атак, направленных на хищение конфиденциальных данных пользователей, распространение вредоносного контента и перенаправление пользователей на мошеннические веб-сайты. Традиционные методы обнаружения, основанные на регистрационных данных WHOIS, DNS-информации и черных списках, эффективны для выявления известных фишинговых доменов, однако зачастую демонстрируют ограниченную эффективность при обнаружении новых или быстро изменяющихся фишинговых URL. Кроме того, зависимость от внешних сервисов увеличивает задержку обнаружения и ограничивает масштабируемость системы. В исследовании предложена система обнаружения фишинговых URL в режиме реального времени, основанная на их лексических характеристиках. Для сравнительной оценки различных методов машинного обучения символьная TF-IDF-векторизация применялась совместно с моделями Logistic Regression, Naive Bayes, Support Vector Machine (SVM), Random Forest и Extreme Gradient Boosting (XGBoost). Эксперименты проводились на открытом наборе данных «Phishing and Legitimate URLs» с платформы Kaggle. После предварительной обработки для обучения и оценки моделей было сохранено 808 042 URL. URL преобразовывались в пространство признаков TF-IDF на основе символьных n-грамм длиной от 3 до 5 символов. Экспериментальные результаты показали, что наилучшее качество классификации обеспечивает SVM: Accuracy - 97,69%, Precision - 97,41%, Recall - 98,25%, F1-score - 97,83%, ROC-AUC - 99,66%. Среднее время обработки одного URL составило приблизительно 1,9 мс. Предложенный подход функционирует независимо от внешних сетевых сервисов и при этом обеспечивает высокую точность обнаружения фишинговых URL. Полученные результаты подтверждают возможность применения разработанного метода для автоматического выявления вредоносных ссылок в онлайн-социальных сетях, системах обмена сообщениями и корпоративных системах кибербезопасности.




