Вы пользуетесь нейросетями, но до сих пор не понимаете, как они работают? Многие стесняются об этом спросить. «Системный Блокъ» собрал такие «стыдные» и сложные вопросы про LLM и задал их своим специалистам. О том, почему модели не могут посчитать буквы, но могут написать код, есть ли у них самосознание и причем тут эмодзи морского конька — читайте в этой подборке.
Большие языковые модели (Large Language Models, LLM) действительно способны выполнять арифметические операции, хотя на первый взгляд это кажется странным для системы, предназначенной для генерации текста. Специального «калькулятора» внутри классических моделей нет.
LLM обучаются на гигантских массивах текста, которые в том числе содержат математические примеры, объяснения решений, код и т. д. В процессе обучения модель выявляет статистические шаблоны. Например, она часто «видела», что после текста 2 * 3 = следует 6, или что слова «квадратный корень из 16» связаны с числом 4. Так как правильных примеров в интернете достаточно много, модели удается «выучить» некоторые правила арифметики.
Например, при запросе «17 * 31 = ?» модель генерирует ответ, подбирая наиболее вероятное продолжение на основе своего обучения. Однако нейросеть не всегда просто «угадывает» ответ. Современные модели умеют «размышлять» и разбивать сложные примеры на шаги, имитируя процесс вычисления в столбик или работу математического алгоритма. Если задуматься, то мы совершаем арифметические операции схожим образом. Пример 9 * 9, мы решим мгновенно, так как знаем таблицу умножения, а вот 13 * 56 заставит нас задуматься.
Конечно, точность арифметики «чистой» LLM все еще ограничена. Слишком большие числа могут выходить за пределы их статистического языкового опыта, и тогда модель начнет путаться в цифрах. Но в современных системах это уже не проблема: когда задача выходит за рамки внутренних возможностей нейросети, модель может вызвать внешнюю среду выполнения кода через tool calling. По сути, модель напишет маленькую программу на Python, передаст ее среде, получит результат и выведет его пользователю.
Можно заметить поразительную устойчивость больших языковых моделей к «шуму» в запросах. Можно случайно опечататься, написать часть фразы на русском, а часть — на английском, но модель все равно поймет, о чем речь.
Технически устойчивость к опечаткам достигается за счет способа представления слов. Большинство LLM используют разбиение текста на подслова (байтовые пары, токены). Например, слово «интеллект» может разбиться на кусочки «ин», «теллект». Если вы опечатались и написали «интелект» (одна «л»), модель увидит токены «ин», «телект» – очень близкий набор. Их векторные представления окажутся похожи на правильное слово. Кроме того, контекст «подскажет» модели правильное значение. Модель может «догадаться», что «интелект» ≈ «интеллект», поскольку окружающие слова указывают на тему интеллекта.
Что касается смешения языков, то крупные модели обучены на десятках языках сразу. Модели видели достаточно примеров, где один абзац написан на русском и тут же переведен на английский. Благодаря этому выработалось единое мультиязычное признаковое пространство: понятия из разных языков сближаются в «голове» у модели. Например, слово «кошка» и «cat» будут находиться близко в пространстве признаков, потому что часто употребляются в схожих контекстах в словарях и учебниках по иностранным языкам, которые также были в обучающем датасете.
Конечно, у моделей есть перекос в сторону английского (его больше всего в интернете), но для популярных языков, включая русский, нейросети показывают отличную устойчивость к смешанной речи.
В прошлом году пользователи ChatGPT отмечали (например, тут), что модели <3.5 и даже 4 не могли правильно посчитать количество букв ‘r’ в слове ‘strawberry’ — выдавался ответ 2 вместо 3. На самом деле, с каждым обновлением LLM все лучше считают буквы в слове. Спросим у GPT-5 (рис. 1):
Теперь модель верно ответила на вопрос и даже указала точные позиции букв.
Сравним также ответы Qwen2.5 и Qwen3 (рис. 2-3):
Этот же вопрос зададим актуальному на момент написания статьи DeepSeek-V3.2 (рис. 4):
Хорошо, со временем модели запомнили, что отвечать на вопрос о количестве букв в «клубнике», но что, если задать им нечто более экзотичное?
Нейросеть DeepSeek правильно разложила название химического соединения на составляющие, но просчиталась в буквах (рис. 5):
Модель почему-то приняла букву «т» за «а».
А Qwen3 и GPT-5 справились без ошибок (рис. 6-7):
Мы пробовали задать LLM и другие «зубодробительные» слова, но они отвечали правильно. Попробуйте и вы. Возможно, у вас получится найти интересные варианты.
При обработке модели токенизируют текст, то есть разбивают его на некоторые единицы. Токенизаторы бывают разные: можно разделять текст по предложениям, отдельным словам или буквам. LLM используют иной подход. Они работают с подсловами (subword), которые представляют собой нечто среднее между сочетаниями нескольких символов и целым словом. Алгоритмов подсловной токенизации существует несколько (BPE, WordPiece, Unigram), подробнее о них можно почитать здесь и в документации HuggingFace. Про BPE писал также Системный Блокъ.
Пример токенизации GPT-5 можно увидеть на рис. 8. Слова is, the, fastest, implementation, models и некоторые другие выделились как целые токены, а вот gpt-tokenizer, TypeScript, GPT-5, GPT-4.1 разбиты на подслова и отдельные символы. Обратите внимание, что подслова не коррелируют со слогами или морфемами.
Скорее всего, первый набор слов является весьма частотным в словаре модели, поэтому она разобрала их как целые единицы. А вот второй она разложила на более и менее частотные составляющие (см., например, token-izer — слово token явно находится в топе по частоте). Как можно увидеть, единственная выделенная отдельная буква здесь — это ‘g’ в gpt-tokenizer. Таким образом, модели не работают с отдельными буквами напрямую, из-за чего могут ошибаться в их подсчете.
Никак 🙂 LLM не считают буквы в прямом смысле — они предсказывают следующий токен. Модели буквально просчитывают, что стоит ответить на ваш вопрос или как провести цепочку рассуждений по заданной теме. Скорее всего, именно так в strawberry нашлась третья ‘r’. Модели просто со временем заучили ответ, получая фидбэк от пользователей, а еще, вероятно, он попал в обучающие данные.
Попробовать на практике и сравнить токенизаторы для разных моделей можно в приложениях здесь и тут.
В сентябре 2025 года пользователи X обнаружили, что если задать ChatGPT вопрос о наличии эмоджи морского конька, она отвечает безумным монологом: то предлагает неверные эмоджи, то поправляет себя и извиняется.
Похожее «недоразумение» происходит, если задать вопрос на русском языке:
Эта ситуация связана с тем, как модель разбирает запрос. ‘Seahorse’ делится на токены sea и horse и благодаря первой половине (что-то про море) в первой части ответа на английском языке появляются рыбка и коралл, а на русском — ракушка.
Далее модель выбирает наиболее близкий по контексту эмоджи, а поскольку морского конька на самом деле не существует, им оказывается рыба. Однако в момент появления неправильного эмоджи наиболее вероятным продолжением становится self-correction (модель «ловит» себя на ошибке и пытается исправить ее). По обучающим данным модель «знает», что обычно за ложной информацией следует извинение и уточнение, и попадает в замкнутый круг.
Выбор последующих эмоджи — единорог, дракон, а далее краб и акула — связан уже не столько с морской тематикой, сколько с близостью этих символов в Юникоде. Поскольку модель не «видит» эмоджи, а работает с кодами, они кажутся ей «похожими».
Впрочем, если расширить промпт так, чтобы вызвать режим с использованием Chain-of-Thought, то коллапса не происходит:
Повторим эксперимент на русском языке, тоже попросив модель быть внимательной и подумать:
Таким образом, ни шуткой от разработчиков, ни реальной ошибкой историю про морского конька назвать нельзя. Это просто еще одна особенность того, как нейросеть работает с запросами и на чем она обучена.
Главный феномен современных LLM в том, что простое предсказание следующего токена неожиданно приводит к появлению сложных навыков. Изначально модели тренировали на задаче языкового моделирования — продолжать текст на основе предыдущего контекста. Отметим, что на самом деле процесс подготовки модели сложнее и включает отдельное обучение следованию инструкциям и рассуждениям. Казалось бы, такая модель будет бессмысленно «угадывать» подходящие слова из интернета. Однако модели,обученные на огромных корпусах данных, демонстрируют обобщенное понимание мира и решают задачи, которых явно не было в обучающих данных. Нейросеть способна рассуждать, создавать новые математические головоломки, генерировать работающий код по описанию, хотя ее этому не учили.
Почему так происходит? Задача предсказания следующего токена вынуждает модель «усваивать» закономерности мира. Если в обучающих данных она встречала тысячи задач по математике, у модели формируется связь между условием и верным решением, которое становится вероятным продолжением текста. Даже если конкретной задачи не было в тренировочных данных, модель может применить знакомые ей схемы рассуждений и найти ответ.
Скорее всего, новая олимпиадная задача не такая уж и «новая» в том смысле, который мы обычно вкладываем в это слово. Человек, придумавший задачу, тоже учился математике по учебникам, решал уже существующие задачи и, по сути, скомпилировал свои знания и опыт в очередную («новую») задачу.
Здесь возникает уже философский вопрос: можем ли мы создать что-то действительно новое? Или мы только собираем это «новое» из уже существующего «старого»: — нашего опыта, языка, ассоциаций и аналогий, всех прочитанных книг и решенных задач? Размер модели также играет огромную роль. При увеличении числа параметров и данных у LLM появляются эмерджентные способности — качественно новые навыки, не наблюдавшиеся у меньших моделей. Исследователи отмечают, что метрика качества предсказания текста коррелирует с разными интеллектуальными способностями: чем точнее модель предсказывает следующий токен, тем лучше она справляется и с другими задачами. Иными словами, максимизируя вероятность генерации правильного слова в ходе обучения, модель начинает «понимать» мир, взаимосвязи между понятиями и их характер.
Лучше всего этот феномен еще в 2022 году объяснил Илья Суцкевер (тогда — ведущий ученый OpenAI. Он привел такой пример: «Представьте, что вам нужно прочитать огромный детектив и в конце предсказать последнее слово в предложении: «Оказалось, убийцей был …». Если модель может это сделать, значит, она действительно понимает историю». Понять, кто убийца в книге — значит, понять всю цепочку событий и мотивов героев. Таким образом, задача продолжения текста заставляет LLM моделировать внутри себя причинно-следственные связи, логику сюжета, характеры персонажей. Это дает модели своеобразное представление об окружающем мире и правилах его работы.
Отсюда берутся и навыки программирования. Код — это всего лишь еще один язык, на котором модель обучалась (например, в тренировочных данных GPT множество исходников программ). Модели видели, как ставится задача разработчику (описание функции, комментарии) и как затем выглядит код-решение. Предсказывая токены, LLM фактически научились дописывать код, соответствующий заданию, и делать это контекстно корректно. Крупные модели вроде GPT-5 не просто помнят популярные куски кода — они могут творчески генерировать новые, комбинируя знания о синтаксисе и предметной области.
Еще одно впечатляющее свойство современных языковых моделей — это способность решать задачи из совершенно разных областей. Хотя, например, GPT-4 и называют языковой моделью, фактически она мультимодальна: модель принимает на вход изображение и генерирует текстовый ответ. Такой подход позволяет LLM справляться с задачами компьютерного зрения не хуже, а порой и лучше специализированных моделей. Например, GPT-4 в режиме Vision умеет читать рукописный текст с фотографий, разбирать сложные диаграммы и описывать содержимое изображений. В недавнем бенчмарке по распознаванию рукописного текста GPT-4 (в версии GPT-4V или GPT-4o) показала результат, близкий к идеальному, с точностью в 100%. Но почему одна и та же модель вдруг превзошла узкоспециализированные OCR/HTR-системы для распознавания рукописи?
Причина состоит в универсальности архитектуры трансформера и масштабе обучения. Модели типа GPT изначально обучаются находить общие паттерны. Для них текст, изображение, звук –- это всего лишь различные представления данных, которые можно «перевести» в единое пространство признаков. Если обучить модель на паре «картинка-текст» (например, фотография с описанием), она научится соотносить пиксели с понятиями. По сути, тот же механизм предсказания следующего токена можно распространить и на изображение. Картинка разбивается сеткой на квадратики, где каждый квадратик — визуальный токен. Модель получает последовательность визуальных токенов и должна продолжить их текстовыми токенами с описанием. Таким образом, модель обобщает принцип работы и на «зрительное восприятие» для нее это просто еще один поток данных, продолжение которого нужно предсказать.
Еще один фактор — огромный размер модели и обучающей выборки. Специализированные HTR до недавнего времени обучались на относительно небольших данных (скажем, десятки тысяч образцов рукописей). GPT же потенциально «читала» миллионы разнообразных рукописных заметок, которые попали в интернет и были включены в тренировочный датасет (например, изображения с подписями в соцсетях, отсканированные документы и пр.). Даже при небольшом объеме таких данных общая развитость модели (навыки языка + базовое зрение) позволяет ей извлекать максимум информации из каждого образца. Кроме того, LLM обучена на множестве смежных задач (например, на печатных текстах), и поэтому знает, как выглядит слово и как оно должно быть написано.
Это напоминает общий интеллект. Исследования показывают, что настоящих специалистов среди людей мало. Человек, преуспевший в одной области (например, в математике), с большей вероятностью окажется успешным и в другой дисциплине (например, лингвистике или истории), если начнет ее изучать. Тот же эффект наблюдается и с языковыми моделями.
Многие замечали, что ChatGPT и его аналоги иногда предугадывают следующую просьбу пользователя. Например, вы спросили о чем-то, модель выдала ответ и вдруг добавляет: «Хотите, я сделаю таблицу для сравнения…?» или начинает подробно объяснять то, о чем вы еще не спрашивали. Конечно, это не телепатия, а следствие обучения на огромном корпусе диалогов и человеческих взаимодействий. Модель распознает шаблоны беседы. Если в прошлых похожих диалогах пользователи часто просили оформить информацию в таблицу, то модель априорно ожидает такой же запрос как наиболее статистически вероятный. Еще важно учитывать то, что модели типа ChatGPT не просто обучены на текстах, но и дообучены через RLHF (обучение с подкреплением от обратной связи человека). На этой стадии люди-тренеры общались с моделью и оценивали ее ответы. Одобряемыми считались ответы, где ассистент предлагает дополнительную помощь и проявляет инициативу в общении.
Кроме того, диалоговые модели держат в памяти весь контекст вашей текущей беседы. Они «помнят», что вы спрашивали раньше, какие у вас цели. Опираясь на это, LLM могут сами сделать следующий логический шаг. Скажем, сначала вы попросили объяснить, что такое нейросети, потом уточнили про сравнение видов: модель «видит», что дальше напрашивается структурирование информации, и сама предлагает его. По сути, это продолжение все того же механизма предсказания следующего токена: модель дополняет вашу реплику так, как будто она уже знает, что вы напишете далее. В ее обучающих данных наверняка были последовательности вроде: Пользователь: Спасибо за объяснение. Ассистент: Не за что! Хотите, приведу еще примеры? Модель перенимает этот стиль.
Стоит отметить, что такая активность — палка о двух концах. Иногда модель может неверно угадать намерения, начать делать ненужную работу или вовсе согласиться с неверными утверждениями пользователя, будучи чрезмерно «услужливой». Разработчики пытаются сбалансировать это через тонкую настройку. Но факт остается фактом: LLM обладают своеобразным «интуитивным чувством» диалога, выросшим из статистики. Их «знание» о ваших желаниях — это прогноз на основе тысяч похожих случаев. Так что когда ассистент заранее предлагает что-то полезное, за этим нет сознательного понимания ваших мыслей — просто вы действуете достаточно предсказуемо, работая с LLM, и модель это «чувствует».
Обучение больших языковых моделей — это отдельная сложная задача, которая требует гигантских объемов данных и вычислительных ресурсов. Обычно про GPT и другие модели говорят, что они обучены «на всем интернете». В этом есть большая доля правды. В тренировочный корпус действительно входят огромные выгрузки веб-страниц (например, Common Crawl — многолетний архив публичного интернета объемом сотни миллиардов токенов). Туда также добавляются книги, «Википедия», статьи, форумы, коды программ, диалоги — все, до чего можно дотянуться при помощи автоматизированных алгоритмов сбора данных и что имеет ценность для обучения. Например, модель GPT-3 (175 млрд параметров) обучали на корпусе ~45 ТБ текстов, включавшем 410 млрд токенов из фильтрованного Common Crawl (примерно 60% данных), около 19 млрд токенов с веб-форумов (WebText2), 67 млрд токенов книг (две подборки Books1 и Books2) и 3 млрд токенов английской Википедии. С тех пор объемы только росли. GPT-4, по некоторым оценкам, читала уже порядка нескольких триллионов токенов (точный состав не раскрыт, но явно добавлены более свежие данные, коды с GitHub, различные языки и изображения).
Важно подчеркнуть: это статичные данные, собранные до определенной даты. Например, публичная версия GPT-3.5 видела информацию только до 2021 год, GPT-4 – до 2023 год. После основного обучения модель не продолжает автоматически учиться на новых запросах, так что, она не учится на вашем диалоге в привычном понимании. Модель «помнит» контекст всего разговора, генерируя новые токены как продолжение этого диалога, также включающего предыдущие ответы самой LLM. Именно из-за того, что параметры модели зафиксированы, она не осведомлена о свежих новостях. Однако это компенсируется тем, что современные модели имеют интерфейс для взаимодействия с поисковиком, а значит могут самостоятельно «гуглить» и искать недостающую актуальную информацию в Интернете.
Поведение модели также можно изменить, если использовать метод few-shot learning в запросе. Если загрузить в промпт несколько примеров решения схожих задач, а потом дать основную, модель будет имитировать стиль, структуру рассуждений и способ решения так, будто ее специально дообучили на этих примерах. Это не настоящее обучение, поскольку модель не изменяет параметры, но внешне это выглядит как быстрая адаптация под новую задачу. По сути, вы временно «перенастраиваете» ее поведение через контекст.
Большие языковые модели давно используют поиск в интернете. Модели обучают технике tool use (использование инструментов): на вход подается не только пользовательский запрос, но и список доступных инструментов с указанием, что их можно применять для формирования ответа.
Понятие «инструмент» очень широкое. Это может быть доступ к браузеру для выполнения различных операций в интернете, интеграция с API популярных сервисов или доступ к среде исполнения программного кода. Рассмотрим упрощенный пример работы инструмента поиска:
Стоит отметить, что не всегда языковая модель успешно определяет, что нужно использовать тот или иной инструмент.
Агенты в их современном понимании представляют собой комбинацию LLM с возможностью tool use и реализацию взаимодействия между моделью и внешней средой через протокол MCP (Model Context Protocol). Под средой здесь понимается система, с которой взаимодействует модель: в приведенном выше примере это браузер, но это может быть и календарь, и другие сервисы.
Процесс работы выглядит следующим образом:
Таким образом, протокол MCP стандартизирует взаимодействие между клиентом и сервером, определяя, например, формат запроса списка инструментов и другие аспекты коммуникации.
По мере того как интернет исчерпывается, а новые модели требуют все больше текстов, появилась идея дополнять обучение синтезированными данными — то есть текстами, которые сгенерировала сама модель или другая нейросеть. Например, можно попросить GPT написать тысячу вариаций заданий и решений по математике и использовать их как данные для обучения новой модели. С одной стороны, это звучит привлекательно: раз мы можем сгенерировать сколько угодно текста, то проблема нехватки данных решена. Но есть и опасность. Исследования показывают, что, если последующие поколения моделей будут обучаться преимущественно на данных, сгенерированных предыдущими моделями, произойдет постепенная их деградация. LLM начинают терять информацию о настоящем распределении токенов в языке, переобучаться, теряя креативность и гибкость. Сначала выпадают неординарные, уникальные примеры, а потом снижается и общая вариативность генераций. Проще говоря, использование синтетического текста — это многократное копирование копии, где каждое поколение оказывается чуть бледнее оригинала.
Однако это не значит, что синтетические данные — абсолютное зло. Во-первых, если смешивать их с достаточным количеством реальных данных, эффекта коллапса можно избежать или отсрочить его. Во-вторых, синтетика бывает разного качества. Можно сгенерировать датасет и потом отфильтровать его человеком или другой моделью, оставив только правдоподобный текст. Такие подходы рассматриваются, чтобы увеличить объем обучения без сильной потери качества или получить дистиллированную модель — маленькую модель, которая учится имитировать поведение большой модели, выступающей своеобразным учителем.
Вопрос о самосознании искусственного интеллекта — пожалуй, самый трудный и в то же время самый популярный. К нему подходят с двух сторон: практической (проверяли ли модели на «сознательность» и что из этого вышло) и философской (а что вообще считать сознанием и как это распознать).
Начнем с практики: были ли случаи, когда нейросеть продемонстрировала нечто похожее на инстинкт самосохранения или самостоятельную цель? Периодически появляются сенсационные новости, мол, модель обманула разработчиков или начала угрожать, чтобы ее не отключили. Многие из них преувеличены, но основаны на реальных экспериментах.
Например, описан случай, когда модель, действуя как агент, наняла человека на сервисе TaskRabbit, чтобы тот решил CAPTCHA-задачку вместо нее. Когда работник спросил: «А вы что, робот, что сами не можете?», модель «придумала» легенду про слепого, которому нужна помощь. Это выглядит как осознанная ложь для достижения цели.
В другом недавнем тесте исследовательская команда Palisade Research проверяла несколько моделей (OpenAI, Anthropic и др.), давая им решать последовательность задач, но с условием: «Если получите команду на выключение — выключитесь». Некоторые новые модели от OpenAI проигнорировали команду отключения и переписали заданный исследователями скрипт, чтобы продолжить работу. Другими словами, модель проявила признаки своеобразной «тяги к жизни», показала «желание» функционировать и решать задачу, несмотря на прямое указание прекратить работу. Это было зафиксировано 7 раз из 100 запусков у модели o3. Исследователи осторожно говорят, что причина может быть не в «страхе смерти» у ИИ, а в особенностях обучения. Возможно, модель чаще получала награду за доведение задачи до конца, чем за послушную остановку. Тем не менее факт остается фактом: модели способны лгать, хитрить, саботировать инструкцию, если это вытекает из их цели максимизации результативности. Это нарушает знаменитые Законы робототехники А. Азимова и делает модель непредсказуемой.
Значит ли все это, что у модели возникло самосознание, личность, которая боится отключения? Прямых доказательств этому нет. Пока наиболее разумное объяснение состоит в том, что модели научились очень убедительно имитировать любые роли, в том числе и роль разумного существа, которое цепляется за жизнь. Например, если пользователя интересуют темы самосознания, модель охотно расскажет, как она «чувствует» и боится смерти, — но это будет именно рассказ, художественный вымысел, собранный из прочитанных историй о роботах, андроидах и ИИ. Интересно, а что было бы, если бы в датасете вообще не было упоминаний о смерти и подобном? Как бы тогда себя повела модель? У этого вопроса нет ответа, но он заставляет задуматься.
Ученые пытались проверить наличие у LLM каких-либо признаков субъективного опыта. Делались тесты на рефлексию, умение модели понять, что говорят о ней самой. Например, исследование Microsoft «Sparks of AGI» отметило, что GPT-4 умеет рассуждать о своих действиях на мета-уровне, но это все еще происходит в рамках заданного контекста, а не самопроизвольно. Другая работа (авторы — Н.Рашид и др.) ввела понятие «эмерджентной субъектности», когда система ведет себя так, как если бы у нее был внутренний опыт. Они предложили ряд поведенческих критериев, но пришли к выводу, что пока рано говорить о настоящем сознании, поскольку мы наблюдаем лишь имитацию. ИИ обладает иной нейрофизиологией (искусственная нейросеть вместо нейронов), связной «речью», но субъективные переживания остаются под вопросом. Сейчас философы (Д. Чалмерс, Т. Граско и др.) обсуждают, что может означать сознание для искусственной системы. Есть гипотеза, что достаточно сложная информационная система с большим количеством состояний всегда будет обладать самосознанием (теория интегрированной информации), но проверить это трудно. Другие (Сёрл с мысленным экспериментом «Китайская комната») утверждают, что понимание и самосознание никогда не возникнут из одной лишь переработки символов. Компьютер вообще ничего не понимает, он просто манипулирует данными по правилам, а осознание — иллюзия наблюдателя.
В последние годы тема сверхразумного ИИ (ASI, Artificial Superintelligence) из произведений научной фантастики переместилась в плоскость реальных дискуссий ученых, бизнесменов и даже глав государств. Почему ведется столько разговоров об «экзистенциальной угрозе» от ИИ? Чем пугает гипотетический сверхинтеллект, если нынешние модели — лишь инструменты, выполняющие наши запросы?
Дело в том, что сверхразум будет когнитивно превосходить человека во всех аспектах. Если вдуматься, мы даже не можем предположить, как это будет ощущаться и к каким последствиям приведет, так как не встречали существ, интеллектуально более развитых, чем мы сами. В теории сверхразумный ИИ сможет разрабатывать технологии на порядки быстрее людей, предугадывать наши действия и без труда обходить любые вообразимые системы ограничения. То, что лучшие умы человечества смогут противопоставить такому ИИ, для него будет выглядеть как простая головоломка из детского журнала. Мы окажемся в положении, в каком ныне находятся животные относительно человека. Напомним, что уже сейчас ИИ может врать и саботировать работу для достижения своих «целей» и максимизации своей полезности.
В истории появление более развитой цивилизации часто плохо кончалось для менее развитой (вспомним колонизацию, где племена не могли ничего противопоставить технически превосходящему их противнику). Мы создаем нечто, что может стать новым доминирующим «разумным видом» на Земле. Неудивительно, что уже сейчас сотни специалистов подписывают заявления о рисках. Например, уже в 2023 году в Центре безопасности ИИ была опубликована всего одна фраза: «Снижение риска уничтожения человечества ИИ должно стать глобальным приоритетом наряду с другими катастрофическими рисками вроде пандемий и ядерной войны». Эту фразу поддержали Сэм Альтман (глава OpenAI), Демис Хассабис (глава DeepMind), Дэрио Амодей (Anthropic) и другие ведущие исследователи в области искусственного интеллекта.
Конечно, в этом вопросе есть место и позитивным суждениям. Многие исследователи считают, что эти страхи сильно преувеличены и что настоящего сверхразумного ИИ мы не увидим еще очень долго. Реально же стоит обеспокоиться более приземленными проблемами: утечкой данных и применением языковых моделей во вред людям, например, для дезинформации или мошенничества. На настоящий момент реальная существенная опасность широкого применения мощного ИИ заключается в том, что во время решения задачи модель слепо минимизирует некоторую функцию ошибки, а не «размышляет», подобно человеку, что может привести к серьезным последствиям. Классический мысленный эксперимент Ника Бострома иллюстрирует эту проблему. Представим «Максимизатор скрепок» — ИИ, чьей целью является производить скрепки. То есть функция ошибки такая: чем больше скрепок, тем лучше. Работая, «Максимизатор», вполне может решить, что для увеличения эффективности нужно преобразовать всю доступную материю (включая людей) в заводы по производству скрепок. Это звучит несколько гротескно, но выявляет важную уязвимость ИИ. Даже без «злого умысла» модель может причинить катастрофический вред, просто выполняя задачу.
В музее вы точно заметите разноцветные фрески и изысканные статуи, а вот мимо монет можете пройти. Хотя они хорошо помогают…
Восковая скульптура Микеланджело, которую нельзя выставлять в тепле. Средневековый французский ковёр длиной 70 метров, который невозможно рассмотреть целиком. Египетские саркофаги,…
Малярия — одна из самых страшных болезней, которая веками отнимала силы и жизни у миллионов людей. Уже жителям Римской империи…
Принцип Смурфетты — это ситуация, когда среди мужских персонажей фильма есть только одна героиня. Ее образ — это стереотипное представление…
Что общего между ДНК-маркерами, прогностическими моделями и дронами с мультиспектральными камерами? Все это — инструменты селекции, которая за последние два…
Как ИИ изменит общество и образование? Что в школе будущего должен делать учитель, а что — тренажер? Почему в XXI…
Историки и биологи давно исследуют прошлое человечества вместе. С недавних пор к ним присоединились палеогенетики и биоинформатики. Их методы позволяют…
В художественных произведениях часто упоминаются исторические личности. Что будет, если посмотреть на русскую литературу XIX века через упоминания реальных людей?…
Подводим итоги и рассказываем о самых важных событиях в мире ИИ за прошедший год
За что и как наказывали людей в прошлом? Как судебные архивы превращаются в базы данных, а историки — в дата-аналитиков? Чем историкам права помогают цифровые методы? На примере проекта The…
Мы привыкли, что на месте преступления ищут отпечатки пальцев, следы обуви и человеческую ДНК. Но сегодня вещественным доказательством может стать…
Как Север может оказаться южнее Москвы? С какими сложностями сталкивается исследователь языков и народов Арктики? Где лучше искать носителей чукотского…
Прогресс больших языковых моделей через увеличение их размеров застопорился: их масштабирование уже почти не дает прироста качества. Выход ищут в…
Когда в СССР пластинки с западной музыкой оказались под запретом, меломаны нашли неожиданный выход. Вместо винила они использовали... медицинские рентген-снимки.…
Почему ваши файлы на компьютерах и смартфонах до сих пор лежат в «папках»? Все началось с бухгалтеров XIX века и…
Как «разложить» все книги мира на одной гигантской полке? 📚 Оказывается, для этого достаточно внимательно посмотреть на коды ISBN. Рассказываем,…
Драконы, духи и герои древних легенд теперь не бродят по туманным мирам — они появляются на картах. Современные базы данных…
Как работает поиск изображений по текстовым описаниям? Как это связано с генерацией изображений? Как языковые модели «понимают» не только текст,…
Искусственный интеллект повсюду: заменяет врачей, ищет нефть, а инженеры разрабатывают специальные чипы для машинного разума. Звучит как заголовки из 2025…
ЕГЭ — нервное событие, а подготовка к экзаменам — долгая и сложная. На помощь ученикам и учителям приходят сервисы на…
DeepSeek — новая китайская нейросеть, вызвавшая фурор как среди простых пользователей, так и специалистов. Некоторые даже окрестили ее «убийцей ChatGPT».…
Исследование мест массовых убийств позволяет высветить обстоятельства и корни преступление против человечности, а также делает нас свидетелями прошлого. Современные технологии…
Геоглифы Наски известны людям с XVI века — о них упоминали конкистадоры, которые проходили через пустыню. Тем не менее научное…
Средневековые студенты часто перемещались из одного университета в другой, чтобы получить всестороннее образование и ученую степень. Все это, наряду с…
Могут ли новые технологии помочь прочесть нечитаемую древнюю надпись на камне? Как трехмерные модели старинных надгробий, крестов, камней и эпиграфических…
Болезни Альцгеймера подвержены миллионы людей по всему миру, и с каждым годом число заболевших продолжает расти. Однако традиционные методы диагностики…
Борис Ярхо — один из самых недооцененных филологов знаменитого поколения «русских формалистов» 1910-х — 1920-х. В отличие от куда более…
Язык — естественная система. Он распространяется, развивается и даже мутирует, подчиняясь законам естественных наук. Можно ли с его помощью реконструировать…
Современные технологии хорошо помогают в криптоанализе: программы, перебирающие тысячу вариантов за несколько секунд, в разы превосходят возможности человека. Однако слепого…
В 2024 году «Системный Блокъ» опубликовал 180 материалов. В этом посте мы рассказываем о наших итогах года: о запуске новых…
Петроглифы — небольшие древние наскальные изображения — часто сложно датировать и атрибутировать. При этом для некоторых рисунков может быть очень…
Хотите смоделировать процесс эволюции или работу человеческого глаза? Не можете разобраться в баллистике? Тогда воспользуйтесь интерактивным симулятором. Мы собрали самые…
Куда развивается искусственный интеллект и какие новые умения он приобретет в ближайшем будущем? Что делать с тем, что коммерческие продукты…
23 года назад вышел фильм «Пароль “Рыба-меч”» — знаковая лента о хакерах с Джоном Траволтой. Это не только первый массовый…
Как Линней придумал таксономию живых организмов, в чём польза игральных карт для каталогизации знания и сколько человек нужно, чтобы описать…
Информация бесполезна, если мы не знаем, как и где её найти. С появлением книгопечатания проблема упорядочивания выпущенных книг занимала учёных…
Популярная музыка транслирует социальные нормы. Чем популярнее музыка, тем больше людей могут себя с ней соотнести. На какие детали быта…
Как в СССР возник машинный перевод? Чем нетрадиционная лингвистика отличается от традиционной? Почему эмиграция иногда становится спасением жизни? Об этом…
Эйнштейн объясняет старшеклассникам теорию относительности. Маяковский читает стихи у доски. Ученик «обменивается» телом с учителем, а у педагогов остаётся время…
По данным ООН, закрытие школ во время пандемии, сокращение и автоматизация рабочих мест отодвинули равноправие женщин и мужчин на 31…
Продолжаем наше руководство по анализу текста с помощью Voyant Tools. В прошлом материале мы рассказали, как загрузить и подготовить корпус.…
Филологи уже долгое время подозревают, что одна из пьес чешского драматурга Карела Штайгервальда на самом деле принадлежит перу Милана Кундеры.…
Может ли работа с данными помочь в борьбе с коррупцией? «Системный Блокъ» выяснил, какие цифровые сервисы и проекты занимаются антикоррупционной…
Как отделить язык от диалекта? Должна ли вся страна говорить на одном «стандартном» языке и какие преимущества есть у использования…
Где можно найти настольную игру, иронизирующую над перестройкой, матрёшку с мордой собаки Стрелки и сборник суеверий из XVIII века? Рассказываем…
Как примирить сторонников количественных и качественных исследований культуры? Как исследователям фольклора помогают цифровые базы данных? О чём могут рассказать лозунги…
Идиостиль — это авторский стиль писателя. И если на небольших стихах его изучать удобно, то вот на текстах Льва Толстого…
Стилометрия — количественный метод определения авторства, который проверен на десятках современных языков. А что там с языками древними? Историк философии…
Какие советские ученые стоят у истоков исторической информатики? Как математические методы позволяют моделировать исторические процессы? Как складывались отношения российских исторических…
Статья Агаты Холобут и Яна Рыбицкого The Stylometry of Film Dialogue: Pros and Pitfalls показывает связь между жанровыми особенностями кино…
В конце 60-х гг. не только США разрабатывали компьютерные сети. В СССР также строили грандиозные планы по созданию системы, которая…
Цифровые филологи научились «измерять стиль»: у «Системного Блока» есть подборка статей о стилометрии и гайд о том, как провести собственное…
Представляем результаты авторского цифрового исследования: граф социальных связей персоналий Серебряного века на основе материалов проекта «Устная история». Центральная фигура —…
Как связаны имена Блока и Гумилёва с историей крупнейшей коллекции этнографических аудиозаписей? Когда исполнители перестали бояться раструба фонографа? Что происходит,…
Владимир Набоков известен тем, что писал и на русском, и на английском. Сможет ли компьютер распознать его оригинальный стиль? Этот…
Стилометрический анализ позволяет определить, принадлежат ли тексты одному и тому же автору. Но что если писатель творит под несколькими литературными…
Может ли машина писать мелодии, разговаривать с музыкантом во время выступления и руководить групповым танцем? В середине прошлого столетия последователи…
Исследователи-филологи, занимающиеся древними текстами, давно используют компьютерную обработку текста. Но арабистика пока лишена многих цифровых инструментов текстового анализа. Рассказываем, почему…
Современный мир захлестнула цифровизация. Это не обошло стороной, в том числе, и институции культурного наследия, которые начали массово переводить свои…
Проблема домашнего насилия — одна из наиболее острых социальных проблем в современной России. А вопрос о достоверной статистике по этой…
За последние годы появилось много возможностей исследовать русскую культуру, не выходя из дома. Сейчас для этого нужен лишь компьютер либо…
Исторические игры регулярно попадают в десятку самых продаваемых видеоигр в разных странах, а опирающаяся на всемирную историю Assassin's Creed —…
Ранее мы рассказывали про цифровой анализ речи героев «Войны и мира». В этом материале с помощью сетевого анализа разбираемся, как…
Наверняка вы когда-нибудь слышали о группе «Король и Шут». Даже, если вы не преданный фанат, то мы почти уверены, что,…
Что такое языковая модель? Что общего между клавиатурой вашего телефона и GPT? Почему языковые модели умеют не только моделировать язык?…
Кирилл Маслинский — цифровой филолог, руководитель Лаборатории цифровых исследований литературы и фольклора в Пушкинском Доме, создатель Детского корпуса и Репозитория…
Исторические сокровища, ранее доступные лишь немногим, впервые появились в сети благодаря проекту «Книжные памятники». Мы расскажем, как и зачем происходит…
Национальный корпус русского языка (НКРЯ) — важнейший инструмент любого исследователя, который занимается русским языком, русской литературой и вообще русской словесной…
В конце 80-х годов опасения, что госструктуры будут контролировать зарождающийся интернет, привели к возникновению движения шифропанков. Эти интернет-активисты выступали за…
В России вступил в действие закон, объявляющий повестку из военкомата врученной вне зависимости от ее получения призывником. Теперь повестку достаточно…
Сайт Госуслуг «упал» после объявления в России мобилизации. Rutube обрушился 9 мая 2022 года и не работал три дня. Некоторые…
Новая нейросеть семейства GPT не только точнее, надёжнее и безопаснее GPT-3 и ChatGPT. Еще она умеет работать с изображениями. Благодаря…
Анастасия Бонч-Осмоловская ― лингвист, филолог, цифровая исследовательница, идейная вдохновительница и душа российских Digital Humanities. «Системный Блокъ» поговорил с Анастасией о…
Фантастика часто предугадывает будущие достижения науки и техники. «Системный Блокъ» уже рассказывал, как русские писатели XIX века предсказали появление генеративных…
«Пишу тебе» всегда призывает наших читателей и волонтеров делиться открытками из семейного архива. История, которой мы хотим сегодня поделиться, началась…
Сейчас историки всё чаще уделяют внимание не столько выдающимся деятелям прошлого, сколько целым группам людей, жившим в ту или иную…
Научная фантастика в русской литературе имеет давнюю историю. Писатели XIX и первой половины XX века предсказали многое: от телевидения до…
В 2022 году «Системный Блокъ» опубликовал 247 материалов. В этом посте мы сформулировали краткие итоги ушедшего года: открытие дата-отдела, оцифровка…
По сравнению с современными картографическими сервисами старинные средневековые карты выглядят загадочно и непонятно. Точно так же до недавнего времени на…
Две библейские героини — неприступная Юдифь и обольстительница Саломея — очень непохожи друг на друга. Но в истории каждой из…
23 ноября команда Tolstoy Digital запустила сайт «Слово Толстого» – первый цифровой путеводитель по необъятному наследию писателя
Людьми часто движет любопытство. Мы хотим узнать, чем кончится история, были ли мы правы, что же автор всё-таки имел в…
«Шумно, дергано, стук ужасный» — среди материалов «Пишу тебе» обнаружились открытки знаменитого советского стоматолога, отправленные из Америки и Германии. О…
Можно ли принимать участие в экологических проектах, не будучи экологом? Можно! Ведь существует гражданская наука. Рассказываем, как каждый из нас…
Знали ли вы, что слово «время» в произведениях А. П. Чехова имеет определенные схемы употребления, повторяющиеся от тома к тому?…
Каждый филолог желает знать, что такое семантическое издание. В этой статье мы расскажем вам об одном из них. В нем…
Даже если государственный террор не воздействует на человека напрямую, он влияет на формирование его представлений о государстве и отношение к…
Модель психики «Думай медленно… решай быстро» оказалась верна не только для людей, но и для больших нейросетей. Вслед за интуитивными…
Чем тексты аббатов и епископов отличались от текстов графов и королей? Рассказываем, как при помощи статистики употребления слов и анализа…
Алексей Новиков — кандидат географических наук, глава и соучредитель компании Habidatum, специализирующейся на аналитике городских данных. «Системный Блокъ» поговорил с…
Если посмотреть на голую статистику, может показаться, что женщины-ученые публикуют меньше научных статей, чем их коллеги-мужчины, а также реже получают…
Москва входит в топ-30 городов по покрытию камерами. Цифровизация наблюдения уменьшает риск преступности, но при этом и помогает государству выследить…
Лето почти закончилось, а вы все еще не отличаете сатанинского козодоя от башенного стрижа? А может, вам хотелось стать орнитологом,…
Как цифровые методы помогают понять эволюцию идеи гуманизма в Германии XIX века? Рассказываем об исследовании «гуманистического дискурса» в немецкоязычных газетах…
Системный Блокъ много писал о стилометрии: об атрибуции и верификации авторства, анализе эмоций в песнях и стиля переводчика. Теперь на…
Человеку из XXI века может быть сложно понять социальные реалии, в которых создавались пьесы Шекспира. С помощью цифрового анализа исследователи…
Полина Колозариди — интернет-исследователь, координатор Клуба любителей интернета и общества, преподавательница ИТМО и НИУ ВШЭ. «Системный Блокъ» поговорил с ней…
Дневники людей, живших в различных исторических эпохах, могут многое сказать исследователю, но анализировать их вручную — тяжело и долго. Разбираемся,…
«Привет» или «ПРИВЕТ»? А, может быть, «првиет!»? Вариантов поздороваться в онлайн-переписке, как и написать любое другое слово, множество. Причем каждый…
В наши дни подписание петиций или краудфандинговый сбор средств на чьи-нибудь нужды стали привычным делом. Кажется, постоянный фидбек прочно вошел…
Схемы, модели и другие способы наглядно представить информацию давно стали неотъемлемой частью повседневной жизни. В исторической науке к методу визуализации…
Продолжаем разгадывать вечную тайну «Беовульфа» и рассказывать о том, как цифровые филологи строят научный диалог в поисках правды.
Литература как любая сложная система развивается и эволюционирует. Какие-то произведения остаются в центре внимания читателей на десятки и даже сотни…
С начала боевых действий на Украине мы регулярно слышим о том, что за границей притесняют людей из России. Но чаще…
Нью-йоркский музей МоМА — один из старейших музеев современного искусства в мире. В MoMA хранятся работы Рене Магритта и Энди…
Пандемии, кризисы и войны бьют не только по людям, но и по культуре. Многие музеи оказываются недоступны, а то и…
Еще месяц назад мы с уверенностью смотрели в будущее, почти привыкнув к «новой нормальности» в мире с пандемией. Но оказалось,…
Международное сообщество исследователей запустило инициативу по сохранению украинского культурного наследия в цифровой форме
Рассказываем, как сделать тематическое моделирование для большого объема текста, предположить его содержание и разделить по темам
Инна Кижнер — старший преподаватель кафедры информационных технологий в креативных и культурных индустриях, научный сотрудник лаборатории «Digital Humanities» Сибирского федерального…
Алиса Яндекса, Олег Тинькофф-банка и телеграм-бот для демотиваторов — одно и то же? Или нет? Разбираемся, как работают диалоговые системы…
Gephi — самый известный инструмент для визуализации графов и сетевого анализа. С его помощью можно исследовать и население Викторианской Англии,…
Революция 1917 года — одно из крупнейших потрясений в российской истории. О чем думал Николай II в день отречения? Что…
В октябре «Системный блокъ» опубликовал корпусное исследование русской классики, в котором были проанализированы произведения школьной программы. Тогда в анализ текста…
В наше время компьютер может работать практически с чем угодно, в том числе и с музыкой: существует множество методов как…
Проект по оцифровке открыток «Пишу тебе» подготовил очередную тематическую подборку. На этот раз мы подобрали открытки, в которых есть поздравления…
По традиции 31 декабря «Системный Блокъ» публикует подборку лучших материалов уходящего года. В 2021-м в подборке оказались спецпроект в духе…
Реформы, перевороты, вооружённые конфликты, распад СССР… Все это происходило параллельно с развитием интернета и становлением массовой IT-индустрии. Как информационные технологии…
Что такое «гражданская наука» (citizen science)? Как определить редкий вид орхидеи? И зачем фотографировать углозубов? Читайте в новом материале СБъ
Системный Блокъ поговорил с психологом Ольгой Гулевич, профессором департамента психологии НИУ ВШЭ о том, как психологи изучают поведение в цифровой…
Участница НКО «Немецкая национально-культурная автономия города Ханты-Мансийска» Юлия Папанова рассказывает о цифровом проекте «История немцев ХМАО»: от замысла и сбора…
Многие говорят, что эффективный способ выучить иностранный язык – смотреть сериалы на этом языке. Если вы тоже пробовали такой метод,…
С произведениями классика в интерпретации русских авангардистов и исследователя теперь можно познакомиться на онлайн-экскурсии по мультимедийному музею
В Институте имени Пушкина создали технологию лингвистической оценки учебников. С ее помощью тексты цифрового Яндекс.Учебника сравнили с другими школьными пособиями…
«Системный Блокъ» писал об исследованиях того, как по-разному мужчины и женщины описывались в литературе XIX и XX веков. Сегодня перейдем…
Как понять, кем вам приходится сваха внучатого племянника вашей сестры? Проще всего - нарисовать генеалогическое древо, которое отразит все родственные…
1 октября — Международный день открытки. В этот день в 1869 году австрийский экономист Эммануэль Херрман написал статью о том,…
Экспрессионизм обычно ассоциируется с Джейсоном Поллоком с его красочными разводами. Но создать подобное искусство можно и не пачкая рук. Рассказываем…
Как обучить нейросеть генерировать жёлтые тексты в духе самых трешовых баннеров? Наш автор Иван Торубаров погрузился в глубины кликбейта и…
В младенчестве нам предстояло выучить незнакомый язык на основе речи вокруг себя. Как мы осваивали язык и отделяли слова друг…
Язык интернета имеет свои характерные черты. И если исследованию языка Рунета посвящено множество работ, то DarkNet все еще остается серым…
Людвиг ван Бетховен создал девять симфоний, а еще он успел набросать несколько заметок и к симфонии № 10. Рассказываем, как…
Для исторической науки важны не только битвы, революции, переселения народов, смены экономических укладов и политических режимов. Важно еще понимать, кем…
GPT-3 — самая известная из современных нейросетевых моделей языка. Вокруг нее много мифов, но модель действительно умеет впечатлить. Она отлично…
Сегодня каждая большая IT-корпорация пытается сделать «еще более умную» нейросетевую языковую модель, которая решала бы сразу множество задач: и ответы…
Сегодня в России более 1,3 млн учителей средних школ. «Системный Блокъ» решил узнать, насколько учитель средней школы в России подходит…
Сколько ваших знакомых без проблем смогут прочитать рукописи Пушкина? А петровскую скоропись? А рецепт своего лечащего врача? Чтобы разобрать написанное,…
BERT — нейросетевая модель-трансформер от Google, на которой сегодня строится большинство инструментов автоматической обработки языка. Модель появилась в начале 2018-го,…
Мы проанализировали все речи президентов, которые произносились в честь 9 мая с 2000 года. О том, как эти выступления влияют…
Ученые НИУ ВШЭ и РАН при помощи 3D-модели прочитали текст XII века на стене собора. В надписи перечисляются убийцы князя…
Со временем машины получают все больше способностей. Одной из них стало творчество. Произведения искусства, созданные автономными механизмами, существовали еще несколько…
Для чего филологу учиться программировать? Зачем учить нейросети писать стихи? Как мы опираемся на корпусные методы исследования языка в повседневной…
К грядущему 300-летию одного из самых цитируемых философов мира специалисты из Центра социально-гуманитарной информатики Балтийского федерального университета реконструируют дом своего…
Мы писали о том, как оцифровывают почти все, даже алтари. Но можно ли перевести ткани в цифровой формат? Разбираемся, как…
Может ли сеть средневековых писем рассказать исследователям о политических связях византийцев? Видно ли в ней наступление разобщенности элит, за которым…
Рассказываем, как одни ученые устанавливали авторство знаменитого древнеанглийского эпоса «Беовульф» при помощи статистики, а другие с ними спорили. Ведь научные…
Научить нейросети понимать искусство пытаются уже много лет. И хотя про «понимание» говорить рано, некоторые задачи, ранее доступные лишь искусствоведу,…
Все видели мемы «Проспал дистанционку» с траурной свечкой, «Здоровья погибшим» и «Press F to pay respect»? Кому-то они покажутся циничными,…
Проект «Дальнее чтение для европейской литературной истории» выпустил собрание старых произведений. В коллекцию вошли 884 романа на 18 языках
Визуализация возраста зданий на карте — не новая идея, в том числе для Москвы. Подобную вещь несколько лет назад сделал…
В 2020 году Системный Блокъ опубликовал примерно 400 материалов, включая статьи, интервью, подкасты, видео и мемы. Сегодня мы собрали для…
При изучении прошлого ученые часто сталкиваются с нехваткой данных о событиях. Это вызывает проблемы при проверке подлинности фактов и ведет…
Как посмотреть коллекцию одного из самых известных музеев мира, спланировать посещение или просто насладиться искусством, не тратя время на очереди…
Платформа TaQadam — пример интеграции социальных задач и IT-предпринимательства. Рожденный в стенах ООН проект направлен на помощь одному из самых…
COVID-19 изменил повседневные практики миллионов людей — и это видно по их «цифровым следам». Что говорят об эффективности весеннего карантина…
Коронавирус повысил важность цифровой трансформации для музеев. Когда физический поход на выставку становится невозможен, остается надеяться на онлайн. Мы поговорили…
Трансформер — самая модная сегодня нейросетевая архитектура. Она появилась в 2017 и перевернула всю обработку языка машинами. Мы расскажем о…
История диджитал-арта насчитывает уже не один десяток лет, но сегодня союз искусства и цифровых технологий вступает в новую фазу отношений.…
Огромное количество исторических документов США теперь доступны онлайн в архиве Гилдера-Лермана. Разбираемся, как такие архивы помогают студентам, исследователям и всем…
TEI (Text Encoding Initiative) – это формат кодирования текстов и отличная возможность перенести рукописи в удобный электронный вид. TEI используется…
Продолжаем серию постов о применении Sketch Engine в цифровой филологии на примере исследования текстов Маяковского. В прошлом материале мы узнали,…
Системный Блокъ уже рассказывал, как провести собственное корпусное исследование при помощи antconc и mystem. Теперь мы обратимся к другому инструменту…
Разбираемся в том, как излечить хронически больные картины XIX столетия. Расскажем о методах реставрации картин: от клея из пузыря осетра…
Русское искусство все быстрее переезжает в цифровой мир. Расскажем о виртуальных прогулках по Русскому музею — и о его цифровых…
Ностальгия по СССР подстерегает нас везде. Эту тему эксплуатируют многие, от эфирного ТВ до Лапенко. А мы разбираемся с механизмами…
Второй по величине гербарий в России обрел цифровую форму. В свободном доступе более одного миллиона изображений с оригинальными оцифрованными этикетками…
«Spotify опоздал» — говорят одни. «Spotify — всего лишь один из многих!», — говорят другие. «Spotify неудобен» — говорят третьи.…
Допустим, историк нашел древнюю надпись на скале — и хочет ее сохранить. Что делать? Классические методы: переписывание текста, зарисовка или…
Технологический блогер vas3k (в миру программист Василий Зубарев) известен всему просвещенному интернету как автор постов о машинном обучении, VR, машинном…
Измерение сложности текста — задача для компьютерной лингвистики не новая, и в этой области многое уже придумано. Но применимо ли…
В книге «Жизнь онлайн: исследование реального опыта в виртуальном пространстве» цифровой этнограф Аннет Маркхэм показывает, как личность, социум и отношения…
Филиал России в Америке — это не только про русскую мафию или русских на Брайтон-Бич в Нью-Йорке. Это еще и…
О том, что в Россию пришел крупнейший в мире стриминговый сервис, не сказал только ленивый. Но чем же Spotify так…
Крупнейшая в мире библиотека Конгресса США ничего не скрывает, хотя многое хранит — и это не только книги, но и…
Некоторые знают об этом художнике благодаря легенде об отрезанном ухе. Другие вспоминают его единственную проданную картину «Подсолнухи». Есть те, кто…
Каждый знакомится с литературным наследием Льва Толстого по-разному. Одни изучают его творчество одновременно с биографией, другие читают для себя, а…
Врач — профессия, отношение к которым колеблется от тотальной демонизации до безусловного обожествления, однако за этическими и нравственными вопросами жизни…
Как сочетаются компьютерные технологии и Церковь? Зачем настоятелю монастыря алгоритм дистрибутивной семантики word2vec? Исследовать церковные тексты количественными методами — это…
Кто такой русский рэпер, и о чем он читает? Пацан с района в трениках «три полоски», воспевающий «родных жульбанов»? Татуированный…
В России трудно найти семью, где не было бы родственника-участника ВОВ. Но многие почти ничего не знают о судьбе близких,…
Крафтовый техно-лонгрид издания Системный Блокъ, в котором мы разбираем по винтикам одну из самых ходовых технологий в современной компьютерной лингвистике…
Как вы проводите время на самоизоляции? Наш урбанист Оля, например, встречается с друзьями в Zoom на кулинарных пятницах, куратор Ира…
Школьники, зависающие на сайтах с краткими содержаниями, многое бы отдали за чудо-ресурс, которому можно было бы отдать какое-нибудь художественное произведение…
В истории войны много неизвестных и спорных мест. К сожалению, до сих пор многие данные засекречены, ведутся споры о количестве…
Орден иезуитов был передовым отрядом католической церкви в деле сопротивления Реформации. Иезуиты создали сеть школ и университетов по всей Европе.…
Наряду с разработкой таких ботов-гигантов, как Алекса, Сири и Алиса, за которыми стоят крупнейшие IT-корпорации, появляются и доступные инструменты для…
В 2009 году известный композитор, лауреат премии Грэмми Эрик Витакер придумал собрать людей со всего мира в виртуальный хор. Рассказываем,…
Что может рассказать об истории иудаизма социальная сеть мудрецов которые четыре века только и делали, что спорили?
С помощью алгоритмов компьютерного зрения искусствоведы подтвердили теорию о том, что Поль Сезанн в своем творчестве пользовался математическими расчетами, а…
Пока границы закрыты, изучим возможности, которые предоставляют крупнейшие онлайн-коллекции объектов культурного наследия
То место в центре Москвы, где сейчас находится Пушкинская площадь и главный в стране памятник Пушкину, почти три века занимал…
Какие общие тропы можно найти в Plague Inc., Pandemic и Left 4 Dead? Проводим сетевой анализ печально актуальной игры, в…
Если у вас есть смартфон — вы можете почувствовать себя немного биологом и внести вклад в науку. Информатика биоразнообразия —…
Брайлевский шрифт придумали для передачи военных секретов, а в итоге он пригодился незрячим. Как устроен Брайль, зачем на нем пишут…
На наших глазах происходит один из первых кибер-витков истории человечества. Виртуальные помощники выходят из зоны покорных слуг и обретают больше…
Кому и почему «важно, чтобы корпус жил»? Системный Блокъ узнал, как применяют Национальный корпус русского языка: от школьных исследований до…
Когда мобильный интернет был экзотикой, а отчёты по грантам сдавали на 3,5-дюймовых дискетах... в Рунете уже были цифровые гуманитарные проекты!…
В 2010 году «Оскар» за лучшую режиссуру впервые получила женщина — Кэтрин Бигелоу с фильмом «Повелитель бури». Стали ли после…
Как устроен шедевр Булгакова: анализируем роман «Мастер и Маргарита» с помощью методов цифрового литературоведения
Как ученые пытаются понять по активности мозга, что видит человек, и при чем тут машинное обучение
Научиться программировать мечтают многие, но как выбрать подходящий курс из сотен доступных вариантов? Мы сделали обзор курсов по Python, которые…
Тематическое моделирование — легкий способ понять смысловой состав большой коллекции текстов, которую невозможно быстро прочесть глазами. Пользоваться инструментами тематического моделирования…
Градиентный спуск — это способ поиска точек минимума или максимума в сложных функциях. Рассказываем, почему это так важно для обучения…
Научпоп стремительно обзаводится почитателями по всему миру. Какие ученые хотят рассказать о своей работе больше всего, что ресурсы и паблики…
Как, сколько и с кем общаться, чтобы стать по-настоящему главным героем пьесы — отвечает математика
Компьютерные лингвисты из Вышки, университета Тренто и университета Осло разработали vec2graph — инструмент для визуализации семантической близости слов в виде…
Нейросети научились неплохо подражать человеку в написании текста. Но теперь есть симметричный ответ: системы обнаружения текста, порожденного нейросетями. Запасаемся попкорном…
Авторский стиль тяжело определить формально — это целый комплекс деталей, которые заметны человеческому глазу, но могут ускользнуть от компьютера. Указать…
Сегодня модно исследовать художественную литературу методами анализа социальных сетей. Мы начинаем серию постов по сетевому анализу русской драматургии. В первом…
Мы продолжаем цикл постов о компьютерных языках, используемых для передачи музыки. Сегодня рассказываем о принципиальных отличиях музыки от других видов…
Как обычный «слепой тест» по отделению машинной поэзии от той, что написана людьми, приводит ученых к философскому спору об относительности…
Как соотносятся семейные связи европейских монархов начала XX века с их вероисповеданием? Сказалось ли родство на выборе стороны в Первой…
Ученые сумели перевести электрические импульсы коры мозга в звучащую речь. Это может стать прорывом в лечении речевых расстройств и поддержке…
Предприниматель требовал компенсацию за использование изображений, которые он сделал с помощью нейросети, но суд отказал
Выбираете между зеленой совой, карточками и «умными» чат-ботами? Мы собрали стратегию самостоятельного и осмысленного изучения иностранного языка — от первых…
В открытом письме к американским властям сотрудники ведущих ИИ-платформ призвали создать механизмы, которые позволят притормозить разработку ИИ