корпуса

Языковые модели — это адронный коллайдер для языка: интервью с Татьяной Шавриной

Куда развивается искусственный интеллект и какие новые умения он приобретет в ближайшем будущем? Что делать с тем, что коммерческие продукты вроде ChatGPT созданы на основе украденной интеллектуальной собственности? Есть ли внутри современных нейросетевых моделей что-то вроде физической модели мира? (Спойлер: кажется, нет.) Об этом «Системный Блокъ» поговорил с Татьяной Шавриной, руководительницей исследовательской команды в проекте LLAMA.

Архивы, сети и шифры в дневниках и письмах: цифровые исследования эго-документов

Изучение дневников и писем — это возможность услышать голоса людей из прошлого и понять, как они воспринимали и оценивали мир вокруг. В новой подборке мы рассказываем, как цифровые методы помогают сохранять, исследовать и публиковать исторические эго-документы.

«Нас вообще все боятся»: Александра Архипова о том, зачем фольклористы и социальные антропологи собирают слухи и считают репосты

Как примирить сторонников количественных и качественных исследований культуры? Как исследователям фольклора помогают цифровые базы данных? О чём могут рассказать лозунги митингующих и народные рецепты лечения COVID-19? Почему конспирологические теории так привлекательны? Обо всём этом «Системный Блокъ» поговорил с антропологом Александрой Архиповой.

От корпусов до карты бомбардировок Хиросимы: Digital Humanities в Японии

Оцифровка данных о землетрясениях в Японии, эталонный корпус японского языка на DVD, интерактивная карта бомбардировки Хиросимы, изучение буддийских текстов. Посмотрим, чем сегодня занимаются цифровые гуманитарии в Японии и как они это делают.

Программирование для филологов и нейропоэзия: интервью с Борисом Ореховым

Для чего филологу учиться программировать? Зачем учить нейросети писать стихи? Как мы опираемся на корпусные методы исследования языка в повседневной жизни, даже не замечая этого? Системный Блокъ поговорил с цифровым филологом Борисом Ореховым — доцентом школы лингвистики НИУ ВШЭ и постоянным ведущим нашей рубрики «Нейростихи».

Ресурсы для цифровых стиховедов: поэтические корпуса

Корпус — это собрание текстов в электронной форме, в котором можно осуществлять поиск. Важное отличие корпуса от электронной библиотеки — в корпусе всегда присутствует разметка. Корпуса бывают самыми разными, и мы уже рассказывали про литературные корпуса отдельных авторов. Расскажем еще об одном специальном типе литературных корпусов — поэтических корпусах

Байрон, Данте и Марк Твен: рассказываем про хорошие литературные корпуса

Что общего между рефлексирующим Данте, загадочным Байроном и неутомимым Твеном? Правильный ответ: у каждого из них есть свой цифровой литературный веб-корпус! Небольшой спойлер: интересно будет не только исследователям

«Еще мужчинестее быть»: из чего сделаны поздравления с 23 февраля

Стихотворные поздравления на 23 февраля — не менее одиозный жанр, чем сексистские вирши на 8 марта или слащавые стишки на День святого Валентина. «Системный Блокъ» решил исследовать этот жанр количественными методами. А в качестве бонуса мы сделали собственный генератор абсурдных поздравлений с Днем защитника Отечества. Впрочем, порожденные генератором тексты оказались не более абсурдны, чем вся атмосфера 23 февраля, превратившегося из профессионального праздника военных — в офисный «день коллег мужского пола» с нелепыми рудиментами милитаризма.

Помедленнее, я записываю

Классифицируют ошибки, просят рассказать о грушах, считают частотность матерных слов… порой для исследования лингвистам нужны нестандартные коллекции текстов. Подборка из 5 неординарных корпусов русского языка в вашу лингвистическую копилку