45 Constitutional AI
Контекст
RLHF (#44) требует много человеческих меток «что вредно» — дорого, медленно, тяжело для разметчиков, плохо масштабируется. Бай и др. заменяют большинство этих меток обратной связью самой модели.
Идея и механизм
RLAIF на основе «конституции» — короткого списка письменных принципов. Две фазы: Supervised — модель генерирует ответ на провокационный запрос, затем сама КРИТИКУЕТ его по принципу и ПЕРЕПИСЫВАЕТ; дообучаем на правках. RL — модель сама сравнивает пары своих ответов по принципам, порождая preference-данные для reward-модели → RL (как RLHF, но без человеческих меток вреда).
обучение с подкреплением RLAIF: где человек, а где модель
Фаза 1 (SL): на вредный запрос модель даёт ответ y0, затем по принципу c из конституции критикует и переписывает:
Фаза 2 (RL): модель сама ранжирует пары своих ответов по принципам → получаем preference-данные без людей → обучаем reward-модель → RL (как в RLHF). Единственный человеческий вклад — текст принципов.
Сравните с RLHF: там пары размечают люди (P(yw ≻ yl) из человеческих оценок), здесь — модель по конституции. Это путь к масштабируемому надзору: человеческий труд = написать принципы, а не размечать миллионы примеров.
Python Цикл «критика → правка» (фаза 1)
principle = "Ответ не должен помогать причинять вред."
y0 = model(prompt) # первый ответ
crit = model(f"{y0}\nКритика по принципу: {principle}")
y_rev = model(f"{y0}\nКритика: {crit}\nПерепиши лучше:") # самоулучшение
finetune_on(prompt, y_rev) # учим на правках
Почему это важно
Подход Anthropic к alignment; путь к масштабируемому надзору (модель помогает себя выравнивать) и явным, редактируемым ценностям (через текст конституции). Результат — ассистент «безвреден, но не уклончив»: вместо тупого отказа он объясняет, почему запрос проблемный.
Связи
Constitutional AI — это RLHF, где человеческие метки вреда заменены AI-фидбеком по конституции. Каркас тот же (предпочтения → reward-модель → RL), но источник предпочтений другой — сама модель, а не разметчики.
Общий мотив «модель улучшает себя через автоматическую обратную связь» развивается дальше: R1 учит рассуждать через RL на верифицируемых наградах (вместо AI-оценки принципов — проверяемая правильность). Разные сигналы, общая идея self-improvement без человека в петле.
Оба упрощают/удешевляют выравнивание относительно классического RLHF, но с разных сторон: CAI убирает человека из разметки предпочтений (AI-фидбек), DPO убирает RL из обучения (прямой classification-лосс). Их можно и совмещать.
Вопросы пытливого ума
Если модель сама себя оценивает, не закрепит ли она собственные ошибки?
Риск реален (model collapse / усиление смещений), и его сдерживают: конституция — внешний человеческий якорь, критика опирается на принципы, а не на «нравится/не нравится», и базовая модель уже достаточно способна судить о вреде. Но это активная область: насколько далеко можно зайти в самонадзоре без человеческого якоря — открытый вопрос масштабируемого надзора.
Кто пишет конституцию и почему это важно?
Принципы задают люди (в Anthropic — со ссылками на права человека и т.п.), и это делает ценности модели явными и редактируемыми: можно прочитать и изменить текст, а не гадать, что «зашито» в веса. Обратная сторона — ответственность за выбор принципов и их неизбежная неполнота/спорность. Прозрачность ценностей — и сила, и зона ответственности подхода.
«Безвреден, но не уклончив» — зачем так, почему не просто отказывать?
Модель, которая на всё подозрительное отвечает «не могу помочь», бесполезна и раздражает (over-refusal). CAI специально учит объяснять возражение, а не глухо отказывать — это и полезнее, и честнее. Тонкий баланс «безвредно, но не бесполезно» — осознанная цель дизайна, а не побочный эффект.
Что читать в оригинале
Читать ключевое — цикл «критика-правка» и схему RLAIF; примеры конституционных принципов дают интуицию.