На севере Японии живет всего несколько человек, которые еще способны что-то сказать на языке айнов. Этот язык-изолят, не родственный никакому другому языку Земли, почти вымер. Однако для лингвистов айнский представляет исключительный интерес из-за редких грамматических особенностей. Рассказываем, какие цифровые инструменты для сохранения и изучения айнского существуют и находятся в разработке, что они умеют и с какими ограничениями сталкиваются
Иллюстрация: Светлана Нагаева
В Японии живет больше 120 млн человек, и примерно 98% из них [1] —– этнические японцы. В стране существуют крупные диаспоры народов-соседей и сравнительно новые сообщества мигрантов, однако есть и народы, живущие на архипелаге на протяжении тысячелетий. К ним относятся айну и рюкюсцы. Если рюкюские языки генетически близки японскому, то айнский язык занимает совершенно особое положение: это языковой изолят, не имеющий доказанных родственных связей ни с одним другим языком мира.
Сохранить айнский язык как средство живого общения уже практически невозможно: для всех носителей языком повседневного общения стал японский, язык не используется в реальной жизни и не передается детям.
Из-за крайне малого числа людей, способных поддержать даже базовый диалог, получать новые языковые данные на айнском сегодня почти невозможно. При этом доступ к уже существующим материалам часто затруднен. Особую сложность представляют аудиозаписи: многие из них не расшифрованы, хранятся в устаревших форматах и недоступны для анализа. Поэтому на первый план встает другая, не менее важная задача — сохранить возможность его изучения. Для этого требуется не столько архивировать материалы, сколько создавать специальные инструменты, которые позволят будущим исследователям работать с языком так, как если бы он все еще существовал в живой среде.
По меркам исчезающих языков айнский язык неплохо задокументирован, но сделано это неоднородно и фрагментарно.
Самые ранние записи с элементами айнского языка относятся к XVII веку. В них встречаются отдельные слова, фразы и краткие описания, зафиксированные японскими авторами. Томоми Сато в статье Major old documents of Ainu and some problems in the historical study of Ainu из коллективной монографии Handbook of the Ainu Language [2] показывает, как эти источники позволяют проследить изменения языка во времени и увидеть диалектное разнообразие, которое сегодня практически исчезло. Среди записей того периода встречается даже фрагмент героического эпоса айну, записанный с помощью японской азбуки (рис. 1).
К концу XIX — началу XX века, на фоне открытия Японии для Запада, интерес к айнскому языку возрос. Европейские и американские исследователи начали систематически изучать культуру и язык айну. Альфред Ф. Маевиц в Handbook of the Ainu Language предлагает условную классификацию этих работ [4]. Среди них можно выделить историко-лингвистические исследования, словари и глоссарии, описания фонетики и грамматики, тексты фольклора с переводами, записи топонимов, а также звуковые материалы. Особое место занимают аудиозаписи Бронислава Пилсудского, сделанные на фонограф Эдисона: это одни из самых ранних в мире полевых звукозаписей исчезающего языка.
На первый взгляд, документации айнского много. Однако с ней не все хорошо. Во-первых, проблема носителей данных. Значительная часть материалов до сих пор не оцифрована. Те же записи Пилсудского хранятся на восковых цилиндрах, физически хрупких и труднодоступных носителях, с которыми могут работать лишь специалисты.
Во-вторых, языковой барьер. Большинство исследований по айнскому языку существует внутри японоязычной академической традиции. Для исследователей, не владеющих японским, это создает дополнительное препятствие. Работы западных авторов, в свою очередь, написаны на ограниченном наборе европейских языков и нередко остаются непереведенными, что также затрудняет комплексный обзор.
Отдельного внимания заслуживают архивы аудиозаписей айнской речи, с которыми работает Кавахару Тацуя. С 1970-х годов в Японии было записано более 700 часов айнского устного народного творчества — прежде всего эпических песен юкар и сказок уэпэкэр. Однако до наших дней в состоянии, пригодном для систематического анализа, сохранилось лишь около 40 часов речи. Остальные записи либо утрачены, либо существуют в форматах, требующих сложной реставрации.
Проблема заключается не только в сохранности записей, но и в их доступности для исследования. Расшифровка и проверка транскрипций таких аудиоматериалов требуют высокой квалификации, и сегодня лишь несколько специалистов способны выполнять эту работу корректно. В результате значительная часть аудиоархивов остается фактически «немой»: формально записи существуют, но без текстового сопровождения и временной разметки они почти не используются в лингвистических исследованиях.
Одним из главных проектов по сохранению айнского языка является Цифровой корпус айнского языка, разработанный Каролом Новаковским [5]. В корпусной лингвистике обычно применяется жесткий отбор материалов: тексты должны быть однородными, хорошо размеченными и сопоставимыми. Но для айнского такой подход оказывается непозволительной роскошью. Данных слишком мало, а их значительная часть существует в разрозненном и не идеальном виде. Поэтому ключевой принцип этого проекта — максимальное использование: в корпус включаются практически все доступные материалы, независимо от жанра, времени записи и степени обработки.
На сегодняшний день в корпус уже включили немало источников. Среди них:
В корпус также входят специализированные ресурсы:
Все включенные материалы транскрибированы латиницей. Для значительной их части представлены параллельные переводы на японский язык, а для онлайн-словаря и глоссированного аудиокорпуса — также на английский. В перспективе перевод на английский планируется расширить и на другие разделы корпуса, включая Айну синъё:сю.
Проект продолжает активно развиваться. В будущем в корпус планируется включить материалы из Ainu Language Material Release Project [13], учебные пособия по айнскому языку, изданные Foundation for Research and Promotion of Ainu Culture [14], охватывающие восемь диалектов, материалы радио-курса айнского языка [15], выходившего в Саппоро с конца 1990-х годов, а также перевод Нового Завета на айнский язык, выполненный Джоном Батчелором в конце XIX века.
Кроме того, предполагается самостоятельная оцифровка и интеграция ряда важных, но пока труднодоступных источников. Среди них: Ку сукупу оруспэ — сборник дневников носителя диалекта Исикари, написанных на айнском и японском языках, а также Акор итак — первый опубликованный учебник айнского языка, изданный Ассоциацией айнов Хоккайдо в 1994 году.
Еще одна важная задача в сохранении айнского языка и расширении доступа к нему — автоматический перевод. Однако приступить к нему можно лишь после решения более базовой проблемы: научиться корректно разделять айнский текст на части. В большинстве записей на айнском языке слова не разделяются пробелами, а сами тексты часто зафиксированы по ритму устного исполнения, а не по лингвистическим правилам. В результате даже специалистам бывает сложно определить, где заканчивается одно слово и начинается другое.
Для решения этой задачи Ёсио Момоути и Михал Пташинский разработали первый специализированный инструмент автоматической обработки айнского текста — POST-AL (Part-of-Speech Tagger for the Ainu Language) [16]. Его основная цель — разделять сплошной текст на отдельные элементы и определять их грамматические функции. Система состоит из двух ключевых компонентов: механизма токенизации, который автоматически разбивает текст на минимальные смысловые единицы, и модуля морфологической разметки, определяющего часть речи каждого элемента. Это особенно важно для полисинтетического языка, где в одном слове может скрываться сложная грамматическая структура.
Помимо разметки, POST-AL предлагает вспомогательный переводческий функционал (рис. 2). Инструмент не является полноценным машинным переводчиком в привычном смысле, но он автоматически подбирает переводы отдельных элементов текста на японский язык с учетом контекста. Такой подход значительно упрощает работу исследователей и переводчиков: вместо ручного поиска каждого слова в словаре они получают предварительно размеченный и частично интерпретированный текст. В перспективе подобные инструменты могут стать основой для более сложных систем машинного перевода. Они также делают возможной масштабную работу с корпусами айнских текстов, которая ранее выполнялась почти исключительно вручную.
В последние годы исследования в этой области шагнули дальше, в сторону нейросетевого машинного перевода. В работе Рё Игараси и Со Миягава [17] показано, что для айнского языка важно учитывать не только сами слова, но и контекст их использования. Ранние модели обучались в основном на фольклорных текстах из ограниченного числа регионов, из-за чего они плохо справлялись с переводом повседневной речи. Авторы расширили корпус, добавили учебные материалы и разговорные тексты, а также научили модель различать, используется язык в эпическом повествовании или в обычном разговоре.
Следующая задача еще более амбициозна — научить компьютер говорить на айнском языке. Этой проблемой занимается исследовательская группа профессора Кавахару Тацуя, которая разрабатывает модель синтеза айнской речи на основе нейронных сетей.
Системы синтеза речи для распространенных языков давно вошли в повседневную жизнь, однако для айнского языка их разработка долгое время считалась практически невозможной. Для обучения подобных моделей обычно требуется огромное количество записей, чем не может похвастаться айнский. Тем не менее исследователям удалось обучить нейросетевую модель, использовав ограниченный массив данных из более 30 часов записей речи носителей.
Результаты оказались неожиданно убедительными. В демонстрациях синтезированная айнская речь практически неотличима от живой: сохраняются интонация, ритм и характерное звучание языка. Синтезированная речь может использоваться для обучения произношению, создания учебных материалов и цифровых архивов.
Айнский язык — пример того, как XXI век может стать временем «перехода» малых языков в новые формы существования. Ранее машина никогда не была единственным носителем языка, но сегодня такой путь кажется эффективным способом сохранения культурного наследия. При дальнейшем развитии цифровых инструментов и сохранении доступных языковых материалов айнский язык, возможно, не окажется для будущих поколений такой же загадкой прошлого, как шумерский.
В открытом письме к американским властям сотрудники ведущих ИИ-платформ призвали создать механизмы, которые позволят притормозить разработку ИИ
Новости о том, что искусственный интеллект скоро оставит людей без работы, появляются едва ли не каждую неделю. Особенно тревожно они…
Черное свадебное платье, корона вместо фаты и венок на шляпе жениха — свадебные традиции Швеции XIX века мало похожи на…