Модели

ViT

Модель с архитектурой Transformer для работы с изображениями

date_range

Год выпуска: 2020

assignment

Описание

ViT (Vision Transformer) – модель с архитектурой Transformer, предназначенная для работы с изображениями. Изначально архитектура Transformer была изобретена для работы с последовательностями (в сущности – с текстовыми последовательностями). Поэтому перед тем, как подать изображение на вход модели, оно преобразовывается в последовательность: изображение делится на непересекающиеся фрагменты одинаковых размеров. Затем полученный набор фрагментов обрабатывается стандартным Transformer’ом. В отличие от свёрточных нейросетей в архитектуре ViT практически не используются специфичные знания о домене изображений. Таким образом, ViT стал очередным подтверждением того, что Transformer – это универсальная и при этом эффективная архитектура. ViT достигает более высокое качество решения задач, чем классические свёрточные сети, а также легче масштабируется. Однако для обучения ViT необходимо больше данных. 

Примеры использования:

Классификация изображений, детекция объектов на изображении, сегментация изображений

Нововведения

Адаптация архитектуры Transformer под домен изображений

Количество параметров: 86M-632M

Share

Recent Posts

Google представила виртуальный музей с ИИ

The Talking Museum позволяет изучать 3D-артефакты и задавать вопросы об их истории и особенностях Gemini

09.10.2026

Господин Никто: как устроена анонимность на японских форумах

Представьте общение в интернете без аккаунтов и аватарок: есть только тред и реплики без подписи. В Японии такие анонимные форумы,…

08.10.2026

Тест: Угадайте, что отправители писали на старых открытках

До появления социальных сетей открытка была не только красивой картинкой, но и способом отправить короткое сообщение — от поздравления до…

05.10.2026