36 GPT-2
Контекст
GPT-1 дообучался под задачи. OpenAI проверяет: что если просто СИЛЬНО увеличить модель и данные?
Идея и механизм
Тот же decoder-only трансформер, но до 1.5B параметров, обученный на WebText (качественный веб-корпус). Никаких изменений механизма — только масштаб. И обнаруживается: модель выполняет перевод, ответы на вопросы, суммаризацию ZERO-SHOT, без дообучения, если задача выражена текстом промпта.
теория вероятностей Почему обычная LM решает задачи zero-shot
Языковая модель учит одно — распределение P(x) над текстом. Но если задачу и вход выразить как текст, то условная вероятность продолжения и есть решение:
Например, на «Переведи на французский: cat ⟹» модель продолжит «chat». Откуда это умение? Веб-корпус содержит множество неявных демонстраций задач — переводы, вопросы-ответы, краткие пересказы, код с комментариями. Минимизируя лосс языкового моделирования на таком тексте, модель попутно учится выполнять эти задачи. Отсюда название: «unsupervised multitask learners» — многозадачность возникает сама как побочный продукт предсказания слова на разнообразных данных.
Python Zero-shot через промпт
# задача выражена прямо в промпте, без дообучения и примеров
prompt = "Переведи на французский: cat =>"
out = lm.generate(prompt) # модель продолжает: " chat"
prompt = "Краткое содержание: <длинный текст> TL;DR:"
out = lm.generate(prompt) # модель продолжает резюме
Почему это важно
Сдвиг к идее general-purpose LM, управляемой промптом — то, что полностью подтвердит GPT-3 и превратится в ChatGPT. Знаменита поэтапным релизом из-за опасений злоупотреблений («слишком опасно выпускать» → позже «нет свидетельств злоупотреблений»).
Связи
Архитектура и рецепт те же — только больше модели и данных. GPT-2 — это эксперимент «что даст чистый масштаб», и ответ оказался качественным скачком (zero-shot), а не просто количественным.
GPT-2 намекнул на zero-shot; GPT-3 довёл масштаб ещё на два порядка и открыл few-shot in-context learning. Прямая лестница масштаба: 1.5B → 175B, и с ней — от «намёка на способности» к «универсальному few-shot решателю».
Наблюдение GPT-2 «больше = качественно лучше» вскоре формализуют scaling laws: лосс падает предсказуемым степенным законом от масштаба. Это превратит «давайте увеличим» из интуиции в инженерную стратегию.
Вопросы пытливого ума
«Слишком опасно выпускать» — это была реальная угроза или маркетинг?
Спорный момент. OpenAI обосновали поэтапный релиз риском масс-генерации дезинформации; критики назвали это раздуванием и пиаром. По факту катастрофы не случилось, и полную модель выложили через ~9 месяцев. Эпизод важен как первый громкий прецедент дебатов о «responsible release» мощных моделей — тема, которая с тех пор только обострилась.
Zero-shot работает, но плохо — почему это всё равно считают прорывом?
Потому что важен не уровень качества, а сам факт: модель, которую никто не учил переводить, переводит — просто из языкового моделирования. Это сменило вопрос с «как обучить под задачу» на «как масштаб рождает способности». Слабый zero-shot 2019-го — это предвестие сильного few-shot GPT-3 и инструкт-моделей; прорыв в направлении, а не в метрике.
Качество корпуса (WebText) — насколько оно критично?
Очень. WebText собирали из ссылок с Reddit с положительной кармой — грубый, но эффективный фильтр качества. Мусорный веб-текст ухудшил бы модель; курирование данных оказалось не менее важным, чем масштаб. Урок «данные решают» с тех пор только усилился — современные фронтир-модели тратят огромные усилия на фильтрацию и состав корпуса.
Что читать в оригинале
Читать ключевое — zero-shot framing и роль WebText; таблицы бенчмарков можно пролистать.