Erzya symbolрусско-эрзянский словарьRUDEENПомочь
← Новости · Лингвистика · 2026-07-18

Говорит ли ИИ по-эрзянски: перевод уже есть, голоса ещё нет

Год назад, в июле 2025 года, эрзянский и мокшанский языки появились в Яндекс Переводчике — одиннадцатым и двенадцатым среди языков народов России. Параллельный корпус объёмом более 220 тысяч предложений подготовил филологический факультет Мордовского государственного университета им. Н. П. Огарёва. Годовщина — повод посмотреть на всю картину: где нейросети уже понимают эрзянский, а где для них его словно не существует.

Путь к Яндексу был длиннее, чем кажется. Вычислительная инфраструктура эрзянского строилась с 2000-х годов в Тромсё и Хельсинки: проект Giellatekno и финский лингвист Джек Рютер создали морфологический анализатор, электронные словари и корпуса, на которых стоят почти все позднейшие разработки. Первый нейросетевой переводчик для эрзянского сделал в 2022 году исследователь Дэвид Дале вместе с эрзянским языковым сообществом — тогда носители признали приемлемыми больше половины машинных переводов. В 2023-м эрзянский и мокшанский вошли в переводчик Тартуского университета Neurotõlge среди 23 финно-угорских языков, а в 2024-м та же команда энтузиастов — Исай Гордеев, Сергей Кулдин и Дэвид Дале — перевела на эрзянский международный эталонный тест FLORES+ и представила результаты на конференции WMT24: эрзянский впервые встроился в мировую систему оценки машинного перевода.

На этом фоне заметнее то, чего нет. Google Translate, добавивший в июне 2024 года сразу 110 языков — включая коми, удмуртский, марийский, чувашский и башкирский, — эрзянский и мокшанский обошёл; нет их и в модели NLLB-200 компании Meta, обещавшей «не оставить позади ни один язык». Двум языкам с сотнями тысяч носителей место в глобальных сервисах пока не нашлось — его заменяют дообученные сообществом открытые модели.

С речью разрыв ещё резче. Единственные общедоступные системы синтеза и распознавания эрзянской речи — открытые модели Meta MMS 2023 года, обученные в основном на записях Библии: один голос, церковная стилистика. Коммерческие сервисы эрзянский не слышат: его нет в распознавателе Whisper, в голосовых помощниках Алиса, Маруся и Siri, и даже Яндекс, добавив перевод, речевые функции для эрзянского не включил — к июлю 2026 года голосовой ввод и озвучка у него работают для татарского, чувашского, башкирского, марийского, удмуртского и якутского. Эрзянский текст нейросети уже читают; эрзянскую речь — по сути, ещё нет.

Универсальные чат-боты выучили эрзянский наполовину. Оценки WMT24 показали, что большие языковые модели понимают эрзянский лучше, чем пишут на нём: Claude перевёл эрзянский текст на русский точнее всех протестированных систем, но в обратном направлении уступил специализированной модели, дообученной энтузиастами. Исследование, представленное в декабре 2025 года на воркшопе по компьютерной уралистике IWCLUL, добавило штрих: модели GPT в 27% случаев вовсе отказывались переводить на эрзянский. Спросить нейросеть об эрзянском уже можно; получить от неё грамотный эрзянский ответ — пока едва ли.

Из этой картины следует простой вывод: язык существует для искусственного интеллекта ровно настолько, насколько для него собраны корпуса. Данные для Яндекса создал университет, эталонный тест — трое исследователей с сообществом, речевые модели держатся на переводе Библии. Каждый оцифрованный текст, каждый час записанной речи — например, в открытом проекте Common Voice, куда эрзянский принят ещё в 2022 году, — расширяет территорию, на которой язык виден машинам. И наоборот: чего нет в данных, того для нейросетей не существует.

Valks видит в этом прямое продолжение своей работы: открытый словарь, фразеология, тексты и аудиоматериалы — это и есть данные, из которых завтра вырастут эрзянские переводчики, синтезаторы и голосовые помощники. Мы будем следить за тем, как нейросети осваивают эрзянский, и напоминаем: научить машину говорить по-эрзянски могут только те, кто говорит на нём сам.