АУТЕНТИФИКАЦИЯ ЛИЧНОСТИ ПО ГОЛОСУ НА ОСНОВЕ ГЛУБОКОЙ НЕЙРОННОЙ СЕТИ ДЛЯ СИСТЕМ БЕЗОПАСНОГО УПРАВЛЕНИЯ ДОСТУПОМ

Авторы

  • Бейсенова Г. И. Южно-Казахстанский исследовательский университет имени М. Ауэзова, Шымкент, Казахстан, доцент https://orcid.org/0000-0003-0545-0652
  • Шынжигит Б. Б. Центрально-Азиатский инновационный университет, Шымкент, Казахстан, старший преподаватель https://orcid.org/0009-0001-2970-9967
  • Бейсебаева А. Ж. Южно-Казахстанский исследовательский университет имени М. Ауэзова, Шымкент, Казахстан, старший преподаватель https://orcid.org/0000-0003-4839-9156
  • Калдарова Б. С. Южно-Казахстанский педагогический университет имени Озбекали Жанибекова, Шымкент, Казахстан, доцент https://orcid.org/0009-0005-0863-7975
  • Лесбаев А. У. Южно-Казахстанский исследовательский университет имени М. Ауэзова, Шымкент, Казахстан, старший преподаватель https://orcid.org/0009-0004-8535-9369

DOI:

https://doi.org/10.32014/2026.2518-1726.454

Ключевые слова:

аутентификация диктора, глубокая нейронная сеть, MFCC, x-вектор, биометрическая аутентификация, безопасный контроль доступа

Аннотация

В цифровую эпоху значимость технологий биометрической идентификации возрастает в связи с растущим спросом на надежные, безопасные и удобные системы контроля доступа к электронным устройствам. Одним из перспективных направлений в этой области является аутентификация диктора, позволяющая подтверждать личность на основе уникальных голосовых характеристик человека. Однако традиционные методы не всегда обеспечивают требуемую устойчивость при различных акустических условиях, фоновом шуме и изменениях речевых характеристик. В исследовании предложен комплексный подход, объединяющий мел-частотные кепстральные коэффициенты (MFCC), x-векторные представления диктора и глубокие нейронные сети (DNN) для повышения точности и устойчивости аутентификации. Предложенная архитектура включает предварительную обработку речевых сигналов, извлечение признаков MFCC, формирование x-векторных представлений и классификацию дикторов с помощью DNN. Для оценки эффективности модели использован экспериментальный набор данных, включающий аудиозаписи голосов 100 дикторов. Модель продемонстрировала точность аутентификации 98,5%, Precision - 99,4%, Recall - 97,6% и F1-меру - 98,5%. Доля ложного принятия (FAR) составила 0,6%, доля ложного отказа (FRR) - 2,4%, а уровень равных ошибок (EER) - приблизительно 1,5%. Полученные результаты свидетельствуют о способности модели с высокой точностью различать авторизованных и неавторизованных пользователей. Предложенный подход показал более высокие результаты по сравнению с традиционными моделями машинного и глубокого обучения, что подтверждает эффективность объединения акустических признаков и глубоких векторных представлений голоса. Метод может быть использован в системах безопасного управления доступом к электронным устройствам, биометрической идентификации пользователей и голосовой аутентификации.

Загрузки

Опубликован

2026-10-01

Как цитировать

Beissenova, G. I., Shynzhigit, B. B., Beisebayeva, A. Z., Kaldarova, B. S., & Lesbayev, A. U. (2026). АУТЕНТИФИКАЦИЯ ЛИЧНОСТИ ПО ГОЛОСУ НА ОСНОВЕ ГЛУБОКОЙ НЕЙРОННОЙ СЕТИ ДЛЯ СИСТЕМ БЕЗОПАСНОГО УПРАВЛЕНИЯ ДОСТУПОМ. Academic Scientific Journal of Computer Science, (3), 106–122. https://doi.org/10.32014/2026.2518-1726.454

Выпуск

Раздел

ИНФОРМАТИКА