РАСПОЗНАВАНИЕ КАЗАХСКОЙ РЕЧИ С ПРИМЕНЕНИЕМ ИНТЕГРАЛЬНЫХ МОДЕЛЕЙ

Авторы

  • Оралбекова Д. О. Институт информационных и вычислительных технологий, Алматы, Казахстан, PhD, ведущий научный сотрудник https://orcid.org/0000-0003-4975-6493
  • Бекарыстанкызы А. ведущий научный сотрудник Института информационных и вычислительных технологий Комитета науки Министерства науки и высшего образования Республики Казахстан, Алматы, Казахстан, PhD https://orcid.org/0000-0003-3984-2718
  • Еримбетова А. С. META University; ведущий научный сотрудник Института информационных и вычислительных технологий Комитета науки Министерства науки и высшего образования Республики Казахстан, Алматы, Казахстан, PhD, кандидат технических наук, ассоциированный профессор https://orcid.org/0000-0002-2013-1513
  • Бержанова У. Г. докторант 2-го курса образовательной программы 8D06101 «Информационные системы» Казахского национального университета имени аль-Фараби; младший научный сотрудник Института информационных и вычислительных технологий Комитета науки Министерства науки и высшего образования Республики Казахстан, Алматы, Казахстан https://orcid.org/0009-0000-2467-5721

DOI:

https://doi.org/10.32014/2026.2518-1726.467

Ключевые слова:

распознавание речи, монотонное внимание по фрагментам, рекуррентный нейронный преобразователь, интегральные модели, нейронный преобразователь

Аннотация

В статье представлен обзор и сравнительный анализ архитектур потокового автоматического распознавания речи, использующих механизмы внимания, включая рекуррентный нейронный преобразователь (RNN-T), нейронный преобразователь (NT) и монотонное внимание по фрагментам (MoChA). Модели адаптированы для казахского языка и предназначены для работы в режиме реального времени. Обучение проводилось на корпусе, содержащем 200 часов размеченной казахской речи, объем которого был увеличен до 260 часов с помощью метода Voice Conversion. Для извлечения акустических признаков использовались мел-частотные кепстральные коэффициенты, а в архитектурах моделей применялись двунаправленные рекуррентные нейронные сети. Экспериментальные результаты показали, что модель Monotonic Chunkwise Attention достигла наилучшей точности при WER = 14,8%, превзойдя RNN-T и стандартный Neural Transducer, несмотря на более высокую сложность настройки. Все три модели продемонстрировали высокую эффективность даже в условиях ограниченных ресурсов. Экспериментальная оценка проводилась с использованием двух корпусов различного объема, при этом увеличение размера набора данных сопровождалось повышением точности распознавания речи. Сравнительный анализ показал, что MoChA снизила WER по сравнению с RNN-T и NT на 0,7 и 0,5 процентного пункта соответственно. Вместе с тем настройка MoChA требует дополнительного времени из-за большого числа параметров и более сложной процедуры оптимизации. Полученные результаты подтверждают эффективность рассмотренных подходов для разработки потоковых систем распознавания речи для языков с ограниченными ресурсами, включая казахский язык. Возможность работы в реальном времени без необходимости предварительной записи аудиофайлов создает предпосылки для интеграции таких моделей в различные технологические платформы и приложения.

Загрузки

Опубликован

2026-10-01

Как цитировать

Оралбекова, Д. О., Бекарыстанқызы, А., Еримбетова, А. С., & Бержанова, У. Г. (2026). РАСПОЗНАВАНИЕ КАЗАХСКОЙ РЕЧИ С ПРИМЕНЕНИЕМ ИНТЕГРАЛЬНЫХ МОДЕЛЕЙ. Academic Scientific Journal of Computer Science, (3), 346–364. https://doi.org/10.32014/2026.2518-1726.467

Выпуск

Раздел

ИНФОРМАТИКА