Одна из первых больших генеративных языковых моделей с архитектурой Transformer
Год выпуска: 2018
Описание
Языковая модель (Generative Pre-training Transformer), используящая decoder only transformer архитектуру. В отличие от BERT GPT была обучена на классической задаче моделирования языка – задаче предсказания следующего токена по предыдущим. За счёт обучения под такую задачу на большом корпусе текстов GPT можно дообучить под конкретную задачу на относительно небольшой выборке.
Примеры использования: основа для решения большинства задач автоматической обработки языка
Нововведения: из-за обучения генеративной задачи (Causal Language Modeling) модель можно дообучить под конкретные задачи без существенно изменения её архитектуры: например, в случае задачи Natural Language Inference можно объединить текст посылки (premise) и текст возможно следствия этой посылки (hypothesis), подать на вход предобученной GPT и на её выходе обучить простой линейный классификатор.
Количество параметров: 117M
Область: NLP
В 1989 году два брата из Гвинеи, которым было всего 14 и 10 лет, решили придумать письменность для родного языка.…
Предприниматель требовал компенсацию за использование изображений, которые он сделал с помощью нейросети, но суд отказал
Выбираете между зеленой совой, карточками и «умными» чат-ботами? Мы собрали стратегию самостоятельного и осмысленного изучения иностранного языка — от первых…