Читать нас в Telegram

Конечно, первая мысль, которая придет после такого вопроса, будет касаться каких-нибудь хитрых цифровых исследований литературы. И в этом есть своя правда: большие языковые модели серьезно снизили порог вхождения для таких научных подходов. То, чему раньше нужно было учиться (порой преодолевая психологическое сопротивление своей гуманитарной натуры): написать код, применить статистический тест, — теперь стало на порядки проще. Теперь ценностью в цифровом литературоведении будет не возможность что-то посчитать, а способность понять, что же значат полученные цифры. Хотя и с интерпретацией цифр ИИ тоже теперь справляется всё лучше. Так что главной научной ценностью станут данные и способность поставить для них оригинальный исследовательский вопрос. Тексты Тургенева есть в свободном доступе, но нужно остроумие и изобретательность, чтобы спросить у этих текстов то, чего пока никто не спрашивал. Легче придумать вопрос для небанальных данных, только где же их взять?

Но я всё же хотел обратить внимание не на Digital Humanities, а на более привычную рутину филологической жизни. Филологические практики состоят в том, чтобы читать тексты. Чем больше ты их прочтёшь, тем лучше будешь их понимать. Одни тексты дают ключи к пониманию других. В общем случае чем больше текстов ты прочтешь, тем лучше. Читать нужно всякие тексты — и хорошие, и плохие, но понятно, что приятнее делать свою работу тогда, когда тексты тебе нравятся, и мы даем себе поблажки: разрешаем себе читать те тексты, которые нам близки, и отворачиваемся от текстов, которые не кажутся нам нужными. Многие вполне себе начитанные филологи часто не ориентируются в текстах других эпох и традиций, не составляющих для них профессионального интереса.

Но курс истории литературы на филфаке не просто так начинается с древности. Литература существует внутри культуры в своей непрерывности уже несколько тысяч лет, и созерцать ее многообразное и величественное здание, в котором есть отсвет эстетики и Востока, и Запада, и традиционного аграрного общества, и индустриального, и постиндустриального способа думать и способа писать, — это отдельное удовольствие. Собственно, представление о том, что существует некоторая долгая, непрерывная со сложными внутренними переплетениями всемирная литература, не столь уж тривиально. Далеко не все и не везде его разделяют, но мне оно кажется в высшей степени исследовательски ценным и просто красивым само по себе. То, что египетская «Сказка о двух братьях» и романы Бальзака являются звеньями единой цепи, — мысль завораживающая (их разделяют тысячи лет) и абсолютно невалидная с точки зрения современной науки.

Папирус Д’Орбиней, содержащий «Повесть о двух братьях»

Настоящий учёный непременно скажет, что сравнивать их совершенно невозможно: слишком многое у них различно: язык, исторический и социальный контекст, стилистика, прагматика, институт авторства и способы распространения. Тем не менее, сравнивать их хочется, следуя за мечтой, которая всегда живёт где-то глубоко в душе настоящего учёного.

Мой первый студенческий доклад был посвящён древнеегипетскому «Поучению» Птаххотепа1 в сравнении с «Октавием» Минуция Феликса. Я не знал языков, на которых были написаны оригиналы этих произведений, всё было по-юношески наивно и неумело, но я следовал за мечтой и в конце концов вытащил себя за волосы из болота.

Есть книга, которая сильно повлияла на моё научное становление, называется «История всемирной литературы» (ИВЛ). В ней в кратком виде в хронологическом порядке собраны небольшие очерки о большинстве мировых литературных традиций. Я как-то написал статью о забавном эпизоде, связанном с историей создания этого академического труда:

Орехов Б. В. Недостоверность мистификации: Придумал ли Виктор Ерофеев канадскую литературу? // Могут ли тексты лгать? К проблеме работы с недостоверными источниками. Материалы Четвертых Лотмановских дней в Таллинском университете / Редактор-сост. Т. Д. Кузовкина. — Таллинн: Издательство ТЛУ, 2014. — С. 247–257.

Сначала я последовательно брал тома этого издания в библиотеке и конспектировал, потом папа подарил мне на день рождения полный набор этих книг, купленных у букиниста, а теперь все вышедшие тома есть в онлайне на сайте Фундаментальной электронной библиотеки.

Та самая. Для меня она важнее и дороже Гарри Поттера. И томов в ней на один больше


Это хорошая стартовая точка для филолога, который стремится к достойно широкому кругозору в области текстосложения. ИИ может помочь нам просканировать все статьи ИВЛ и выудить из них все достаточно важные литературные имена и названия, чтобы попасть на страницы этой обобщающей книги, найти соответствующие тексты в интернете и собрать их все в одну антологию мировой литературы.

Но, конечно, не только собрать. Большие языковые модели хорошо справляются и с переводом текстов. Не с древнеперсидского оригинала, конечно, но, допустим, с английского перевода они довольно неплохо могут перевести эти тексты на русский. Я уже никогда не выучу древнекитайский и шумерский. Так что мне прекрасно известно об искажениях при переводе, о том, как выветривается такая важная для художественной литературы форма, но придется с этим смириться. Лучше прочесть неправильную передачу текста, чем не прочесть никакой. Мысль абсолютно антифилологическая, но зато высказать её честно.

Зачем нужно переводить тексты с помощью ИИ, когда заметная часть шедевров мировой литературы уже переведена на русский? Над этим трудились многие поколения поэтов, писателей и филологов. Анна Ахматова переводила древнеегипетские произведения (умышленно не называю их поэзией, так как никто точно не знает, имели ли те тексты такой статус), Борис Пастернак — Шекспира, Фёдор Тютчев — Шиллера. И это сами по себе прекрасные памятники словесности. Но есть проблема: на них распространяются авторские права. Нельзя просто так взять и опубликовать в каком-либо виде переводы Иосифа Бродского, например, из Хаима Плуцика. А переводы, сделанные ИИ, авторским правом не охраняются, и их можно собрать на одном сайте, не опасаясь, что по твою душу однажды придут правообладатели. Олды помнят, как в конце нулевых суд взыскал с важного для филологической общественности сайта Рутения космическую по тем временам сумму за то, что там в электронном виде появились тексты А. Галича. Общественность возмущалась, все чувствовали несправедливость, но закон есть закон, истцы были в своём праве.


Итак, я начал проект свободной от притязаний правообладателей Антологии всемирной литературы. Общую композицию антологии я заимствовал у ИВЛ: 8 томов, каждый посвящён отдельной эпохе, внутри — чёткое распределение по регионам. Первый том охватывает литературы Древнего мира: от Египта, Двуречья и Малой Азии до античной Греции и Рима, а также включает литературы Древней Индии, Китая и Ирана. Второй том посвящён литературам Средних веков (III–XIII века) в Европе, Азии и Африке. Третий том — литературе Возрождения (XIII–XVI века), четвёртый — XVII веку, пятый — XVIII веку. Шестой и седьмой тома включают описание XIX века (первой и второй половины соответственно), а восьмой — рубеж XIX–XX веков.

В качестве основы для сбора коллекции я выбрал Obsidian. Это приложение для создания связанных заметок, которое идеально подходит для такой задачи. Каждая заметка в Obsidian — это отдельный текст в хранилище, и все они могут быть связаны друг с другом через внутренние ссылки. Это означает, что вы можете легко перемещаться между, скажем, «Поучением Птаххотепа» и характеристикой древнеегипетской литературы, а оттуда — к другим текстам этого периода. Obsidian автоматически строит граф связей между заметками, и вы видите свою коллекцию не как плоский список, а как сложную, развивающуюся сеть, где каждый текст связан с другими через общие темы, регионы, эпохи или жанры. Вот как выглядит граф для текстов древних литератур:

Связность текстов внутри антологии
Приблизим, чтобы почитать подписи

Это фактически уже база знаний, где каждый элемент обретает смысл в контексте других. Obsidian позволяет использовать теги, метаданные и плагины (например, Dataview) для автоматического создания списков и оглавлений — например, можно легко получить список всех текстов Древнего Египта, отсортированных по жанру. А решения вроде obsidian-publish-mkdocs позволяют опубликовать всё хранилище как полноценный веб-сайт с поиском, навигацией и если кому нужно, то тёмной темой.

Только не пользуйтесь obsidian-publish-mkdocs бесконтрольно, если решите пойти моим путём. В конфигурации этого решения была устаревшая ссылка, которая теперь ведёт не туда, куда вела раньше, и вообще не туда, куда нужно. В результате Гугл на сутки поместил мой сайт в бан-лист.

Что увидели первые посетители сайта Антологии из-за того, что я не отнёсся к чужому коду достаточно внимательно

Затем, собрав тексты, можно попробовать преобразить эту коллекцию в семантическое издание, как мы описывали его с коллегой М. Гронасом в соответствующей статье:

Gronas M., Orekhov B. Что такое семантическое издание и почему в будущем все издания станут семантическими? // A/Z: Essays in honor of Alexander Zholkovsky / edited by Dennis Ioffe, Marcus Levitt, Joe Peschio, and Igor Pilshchikov. — Boston: Academic Studies Press, 2018. — С. 246–268.

И тексты заговорят друг с другом уже не в головах увлеченных мечтателей, а напрямую. Граф на иллюстрации выше уже показывает, как они разговаривают, просто мы не всегда их слышим.

В антологию попадают не все упомянутые в ИВЛ тексты, а только такие, которые находятся в интернете в оригинале или в переводе на распространенный современный язык. Так отсекаются примерно 75 % упомянутых в ИВЛ2, но редких и малодоступных произведений. Конечно, жалко их терять, но приходится чем-то жертвовать.

Я работаю с ИИ так. Засылаю ему главу из ИВЛ и пишу приблизительно такой промпт:

Твоя роль - ученый, историк литературы. На основе статьи напиши краткую характеристику этого периода истории литературы, сопроводи ее таким заголовком: 
--- 
title: {{заголовок статьи}} 
period: Древний мир 
region: {{регион}} 
tags: [{{tags}}] 
ИВЛ: {{библиографическое описание главы из ИВЛ}} 
feb URL: {{Ссылка на главу на сайте Фундаментальной электронной библиотеки}} 
--- 

Метаданные на сайте не отображаются (но учитываются при поиске!), но они доступны в исходном хранилище текстов на GitHub.

Вот пример получившегося результата.

То же на скриншоте


Затем я прошу ИИ найти исходные тексты в интернете:

Твоя роль - ученый, историк литературы и опытный библиограф. Извлеки из статьи все названия значимых литературных текстов описываемого периода. Примени поиск в интернете. Добавь к каждому названию текста его англоязычное название. Найди англоязычные переводы всех упомянутых текстов. Представь результат в виде таблицы с такими полями: 1) название по-русски, 2) название по-английски, 3) примерная датировка, 4) ссылка на страницу в интернете с англоязычным переводом, только URL. Проверь, что по этому адресу действительно можно найти полный текст. Не включай в таблицу те тексты, переводы которых не нашлись в интернете. Указывай каждое произведение только один раз. 

Формируется вот такая таблица.

То же на скриншоте

Ну и наконец перевод:

Твоя роль: переводчик художественной литературы. Обратись к ссылкам в таблице, для каждого текста извлеки извлеки со страницы текст англоязычного перевода, переведи его на русский и выдай русский перевод в виде markdown файла с таким заголовком: 
--- 
title: {{русское название}} 
original_title: {{назваиние по-английски}} 
period: Древний мир 
region: {{регион}} 
genre: {{жанр по-русски}} 
century: {{век}} 
author: Неизвестен 
translator: DeepSeek 
source: {{URL исходного текста}} 
wikipedia: {{URL статьи в англоязычной Википедии, посвященной этому тексту}} 
tags: [{{tags}}] 
--- 

И переводы действительно появляются.

На этот раз в темной теме для её любителей

Конечно, в переводах не всё совершенно благополучно. Не во всем ИИ хорошо чувствует контекст. Вот пример неудачного перевода:

НАЧАЛО ПОУЧЕНИЯ, составленного Агентством Царя Верхнего и Нижнего Египта Сехетепибры…

Агентства и крупные корпорации в те времена еще не изобрели.

А еще мы можем нарисовать иллюстрации ко всем этим текстам (СБъ такое делал в виде теста с русской классикой), потому что книжки без картинок нам полюбить сложнее. Тут можно пока просто подивиться, какое визуальное воплощение приобретает содержание древних манускриптов:

ИИллюстрация к «моему» с первого курса Поучению Птаххотепа

Не все в этой работе легко автоматизируется, я не одолел первый том за один день. Но все же работа продвигается довольно быстро, а уж создание бесплатных свободных переводов — это просто космические технологии, которые не заменяют филолога на его посту, а дают ему делать свою работу, преодолевая бытовые, юридические и разные другие ограничения.

  1. Тогда ещё я не занимался Тютчевым, поэтому пропустил значимую параллель: в «Поучении» есть фраза: «Молчи, полезнее это, чем тефтеф», то есть почти «Silentium!» Но еще примечательнее пояснение к этой фразе в русском переводе: «Значение слова «тефтеф» неизвестно». ↩︎
  2. По поводу того, что «История всемирной литературы» имеет ту же аббревиатуру, что и искусственная вентиляция лёгких, я уже шутил в соцсетях, но после 2020 года эта шутка уже не такая забавная. ↩︎