Казахский язык адаптируют к эпохе искусственного интеллекта

4 Сентября, 2026

Казахский язык должен перейти из категории языков с ограниченным объемом цифровых ресурсов в число, полноценно представленных в цифровой среде. Для этого необходимы не только словари и академические исследования, но и большие массивы качественных языковых данных, Национальный корпус, NLP-инструменты и собственные языковые модели. Об этом на брифинге Региональной службы коммуникаций рассказала генеральный директор Института языкознания имени Ахмета Байтурсынова, кандидат филологических наук Анар Фазылжан.

По словам спикера, цифровая эпоха принципиально меняет задачи, стоящие перед лингвистами. Если раньше языкознание прежде всего описывало устройство языка, разрабатывало грамматики и словари, то сегодня язык необходимо еще и «научить» взаимодействовать с машиной - обеспечить его качественными цифровыми данными, без которых невозможно развитие искусственного интеллекта.

«Казахское языкознание больше не может ограничиваться только академическими описаниями, словарями и грамматиками. Сегодня необходимы языковые корпуса, базы данных, аннотированные тексты, цифровые словари, NLP-инструменты, языковые модели и продукты искусственного интеллекта. Нам необходимо ускорить переход казахского языка от уровня low-resource language к high-resource language и расширять сферу его использования в цифровой среде», - отметила Анар Фазылжан.

Одной из главных основ для такой работы становится Национальный корпус казахского языка. Сегодня его объем достиг 200 миллионов словоупотреблений. В его составе действуют 22 специализированных подкорпуса, охватывающих устную речь, диалекты, терминологию, учебные и научные тексты, современную поэзию, интернет-контент, тексты, созданные искусственным интеллектом, и другие языковые пласты.

Параллельно Институт переводит в цифровой формат и другие лингвистические ресурсы. Пользователям уже доступны более 30 продуктов: электронные словари, инструменты проверки орфографии, пунктуации и стилистики, OCR для распознавания текста, сервисы морфологического анализа, поиска синонимов и проверки орфоэпических норм. Оцифрован и картотечный фонд объемом 4,5 млн единиц, сформированный на основе достоверных языковых контекстов.

Особое значение эти ресурсы приобретают с развитием больших языковых моделей. Институт языкознания определен координирующей организацией по созданию и развитию Национального корпуса казахского языка и вместе с КазНУ имени аль-Фараби участвует в мегапроекте по разработке большой языковой модели для казахского языка.

«Эпоха больших языковых моделей ставит перед нами новую задачу: язык нужно не только исследовать, но и адаптировать к системам искусственного интеллекта. Казахский язык должен быть полноценно представлен в таких моделях. При этом для национальной безопасности особенно важно развивать собственные отечественные и отраслевые системы искусственного интеллекта», - подчеркнула руководитель Института.

В перспективе речь может идти не только об универсальных языковых моделях, но и о специализированных казахоязычных AI-системах. Одним из таких проектов, по мнению ученых, мог бы стать отечественный AI-лингвист. Он мог бы консультировать пользователей по вопросам казахского языка, помогать в подготовке филологов и лингвистов, а также подбирать индивидуальные программы изучения государственного языка для людей разного возраста. В дальнейшем на этой же языковой базе могут появиться специализированные модели - AI-врач, AI-инженер, AI-логопед, AI-провизор, AI-юрист и другие.

«Такие отраслевые модели могли бы помочь специалистам полноценно работать на государственном языке. Это одновременно повысит качество казахоязычной коммуникации и увеличит объем качественного контента. В эпоху искусственного интеллекта полноценное функционирование казахского языка в цифровом пространстве приобретает стратегическое значение для образования, науки, культуры, государственного управления и национальной безопасности», - сказала Анар Фазылжан.

Однако для развития таких технологий одного программного обеспечения недостаточно. Как отметила спикер, сегодня остается проблема нехватки большой и качественной эмпирической базы живого казахского языка. Для современных систем нужны значительные массивы художественной и научной литературы, официально-деловых документов, материалов СМИ, интернет-текстов, живой разговорной речи, диалектов и учебных материалов. Без них сложно развивать машинный перевод, автоматическую проверку текстов, распознавание устной и письменной речи, а также полноценные большие языковые модели.

Еще один вызов - подготовка нового поколения специалистов. Современному лингвисту, по словам Анар Фазылжан, уже недостаточно исключительно классического филологического образования. Необходимы знания в области NLP, корпусной и цифровой лингвистики, психолингвистики, нейролингвистики, обработки данных, основ программирования и академического письма.

Отдельным направлением работы Института станет развитие нейролингвистики и клинической лингвистики. Ученые планируют исследовать связь языка и работы человеческого мозга, развивать экспериментальную базу и сотрудничество с медицинскими и научными центрами. В дальнейшем результаты таких исследований могут применяться в нейрохирургии, неврологии, медицинской реабилитации и инклюзивном образовании.

В Институте уже появился айтрекер - видеоокулографический аппарат для психолингвистических исследований. Подобное оборудование, по данным спикера, сегодня имеется лишь в четырех научных центрах Казахстана. Также приобретены мобильная кабина для записи устной речи, цифровое аудиооборудование и сервер с тремя GPU для работы с масштабными языковыми ресурсами.

Конечной целью этой работы в Институте называют создание единой национальной лингвистической экосистемы, которая объединит Национальный корпус казахского языка, академические словари, терминологические базы и данные для обучения искусственного интеллекта. Это должно позволить казахскому языку полноценно функционировать не только в повседневной коммуникации, но и в науке, технологиях и системах искусственного интеллекта.

Поделиться: