QOLDA-MATH: МАЛЕНЬКАЯ МУЛЬТИМОДАЛЬНАЯ МОДЕЛЬ ЗРЕНИЯ И ЯЗЫКА ДЛЯ МАТЕМАТИЧЕСКИХ РАССУЖДЕНИЙ НА КАЗАХСКОМ ЯЗЫКЕ
DOI:
https://doi.org/10.32014/2026.2518-1726.451Ключевые слова:
визуально-языковые модели (VLM), математические рассуждения, низкоресурсные языки, дообучение с учителем (SFT), развертывание на периферийных устройствахАннотация
Визуально-языковые модели (VLM) достигли значительных успехов в области математических рассуждений. Однако компактные VLM, поддерживающие казахский язык, способные решать математические задачи и работать на периферийных или пользовательских устройствах, пока остаются недостаточно развитыми. Цель исследования заключается в разработке и оценке компактной визуально-языковой модели, способной решать задачи школьного курса математики на казахском языке с пошаговым рассуждением и работать на пользовательском оборудовании. В работе представлена Qolda-Math — малая визуально-языковая модель с 4,3 млрд параметров, разработанная в Институте умных систем и искусственного интеллекта (ISSAI). Модель основана на Qolda VLM, в процесс обучения которой был добавлен дополнительный этап дообучения с учителем (SFT). Набор данных для SFT включает 395 309 обучающих примеров, в том числе математические задачи, соответствующие школьной программе, и решения в формате цепочек рассуждений (CoT), сгенерированные моделью Qwen3-235B. Кроме того, в набор данных включены материалы общего характера, инструкции «solve», «explain», «teach», «verify+/verify−» и подготовленная вручную обратная связь на казахском, русском и английском языках. В рамках единого протокола оценки Qolda-Math достигла 61,60% на адаптированном для казахского языка бенчмарке MathVista и 50,39% на MathVision-KK, что соответственно на 3,40 и 4,57 процентного пункта выше результатов исходной модели. Оба улучшения являются статистически значимыми, поскольку 95%-ные бутстрап-доверительные интервалы не включают ноль. Кроме того, Qolda-Math сохраняет конкурентоспособные показатели на общих текстовых и визуальных бенчмарках: средний результат по текстовым тестам увеличился с 72,09 до 72,68. Возможность развертывания модели на пользовательских устройствах создает основу для автономных инструментов обучения математике на казахском языке.




