Модели

ViT

Модель с архитектурой Transformer для работы с изображениями

date_range

Год выпуска: 2020

assignment

Описание

ViT (Vision Transformer) – модель с архитектурой Transformer, предназначенная для работы с изображениями. Изначально архитектура Transformer была изобретена для работы с последовательностями (в сущности – с текстовыми последовательностями). Поэтому перед тем, как подать изображение на вход модели, оно преобразовывается в последовательность: изображение делится на непересекающиеся фрагменты одинаковых размеров. Затем полученный набор фрагментов обрабатывается стандартным Transformer’ом. В отличие от свёрточных нейросетей в архитектуре ViT практически не используются специфичные знания о домене изображений. Таким образом, ViT стал очередным подтверждением того, что Transformer – это универсальная и при этом эффективная архитектура. ViT достигает более высокое качество решения задач, чем классические свёрточные сети, а также легче масштабируется. Однако для обучения ViT необходимо больше данных. 

Примеры использования:

Классификация изображений, детекция объектов на изображении, сегментация изображений

Нововведения

Адаптация архитектуры Transformer под домен изображений

Количество параметров: 86M-632M

Share

Recent Posts

Российский суд не признал копирайт на сгенерированную Джоконду

Предприниматель требовал компенсацию за использование изображений, которые он сделал с помощью нейросети, но суд отказал

24.08.2026

Как самостоятельно учить иностранный язык?

Выбираете между зеленой совой, карточками и «умными» чат-ботами? Мы собрали стратегию самостоятельного и осмысленного изучения иностранного языка — от первых…

20.08.2026

Создатели ИИ требуют замедлить его разработку

В открытом письме к американским властям сотрудники ведущих ИИ-платформ призвали создать механизмы, которые позволят притормозить разработку ИИ

18.08.2026