53 DeepSeek V3 / R1
Контекст
К 2024–25 фронтир был в основном закрытым (GPT-4, Claude, Gemini). DeepSeek выпускает открытые модели близкого уровня и громко заявляет о низкой стоимости обучения.
Идея и механизм
V3 — база: 671B-параметрный MoE (активны ~37B на токен) с двумя инженерными изюминами — Multi-head Latent Attention (MLA) и балансировкой нагрузки экспертов без вспомогательного лосса. R1 — reasoning: сильное рассуждение выращивается почти чистым RL на верифицируемых наградах (RLVR), вплоть до варианта R1-Zero без предварительного SFT.
обучение с подкреплением MLA (сжатие KV) и RLVR (рассуждение из RL)
MLA — Multi-head Latent Attention. Вместо кэширования полных K, V по всем головам их сжимают в общий низкоранговый латент c (down-projection), кэшируют только c, а при счёте внимания разворачивают обратно (up-projection):
KV-кэш становится кратно меньше → дешевле длинный контекст (ср. PagedAttention #49, но здесь экономия в самой архитектуре).
RLVR — RL on Verifiable Rewards. Награда — это проверяемая правильность финального ответа (математика, код, где результат можно проверить), а не оценка reward-модели:
R1-Zero обучали ЧИСТЫМ RL от базовой модели, без SFT — и поведения рассуждения (самопроверка, переосмысление, удлинение цепочки) ВОЗНИКЛИ сами, включая знаменитый «aha moment». Это эхо AlphaGo (#29): улучшение через взаимодействие + проверку, только «поиск» развернулся в цепочку мысли.
Python RLVR — награда за проверяемую правильность
# никакой reward-модели: награда = верен ли ответ (проверяемо)
def reward(answer, question):
return 1.0 if verify(answer, question.gold) else 0.0 # математика/код
# R1-Zero: чистый RL от базовой модели, без SFT
# → рассуждение (самопроверка, длинные цепочки) возникает само
Почему это важно
Приблизил открытые модели к фронтиру; R1 — публичный рецепт reasoning через RL (прямое развитие Chain-of-Thought #43 + идеи «обучение+поиск» из AlphaGo). Нюанс (флаг): заявленная стоимость финального прогона V3 (~2.788M H800-часов ≈ $5.6M) ОСПАРИВАЕТСЯ — она не включает прежние исследования, провальные прогоны, данные и capex; это стоимость финального прогона, не «всё-в-итоге».
Связи
V3 — это sparse-MoE «Outrageously Large» 2017-го, доведённый до фронтира: 671B общих, ~37B активных, плюс улучшения роутинга (балансировка без auxiliary loss). Прямая линия от идеи условных вычислений к открытой модели уровня GPT-4.
CoT (2022) показал, что рассуждение по шагам резко поднимает качество — но через промпт. R1 делает следующий шаг: обучает модель рассуждать через RL, и длинные цепочки мысли возникают сами. Промптинг превратился в выучиваемую способность.
Та же философия «улучшение через взаимодействие + проверка»: AlphaGo — self-play + поиск по дереву, R1 — RL + проверяемые награды, где «поиск» развёрнут в цепочку рассуждения. Спустя 9 лет идея вернулась из го в язык.
Вопросы пытливого ума
Почему рассуждение «возникает само» из чистого RL — это не запрограммировано?
Нет, не запрограммировано — это эмерджентно. Модель просто награждают за верный ответ; чтобы чаще попадать на трудных задачах, ей выгодно тратить больше «мысли» — выписывать шаги, проверять себя, перебирать. RL находит эту стратегию сам, без явных инструкций. Поразительно, что самопроверка и удлинение рассуждения возникают как инструментальная цель максимизации награды.
Почему RLVR работает там, где обычный RLHF буксует?
Потому что награда объективна и проверяема (ответ верен или нет), а не оценка несовершенной reward-модели. Нет reward hacking в обычном смысле — нельзя «обмануть» проверку правильности. Ограничение: RLVR применим лишь там, где результат проверяем (математика, код, логика); на «мягких» задачах (стиль, полезность) по-прежнему нужны человеческие/AI-предпочтения.
Стоила ли DeepSeek правда ~$6M — и почему это вызвало обвал рынка?
Цифра ~$5.6M — это стоимость финального прогона по арендным ставкам, без учёта прежних исследований, провальных запусков, данных и капитальных затрат на кластер. Полная стоимость кратно выше. Но сам факт, что открытая модель уровня фронтира обучена дёшево, в январе 2025 обвалил акции (Nvidia −~17% за день, рекордная потеря капитализации) — рынок испугался, что монополия дорогих закрытых лабораторий и спрос на GPU под угрозой. Урок: и инженерная цифра, и её интерпретация важны — здесь интерпретация была раздута.
Что читать в оригинале
V3 — выжимка (MLA, MoE-инженерия); R1 — ключевое (схема pure-RL reasoning, RLVR и описание «aha moment»). Это финал канона — и хорошая точка, с которой начинается фронтир сегодняшнего дня.