15 ImageNet
Контекст
В середине 2000-х зрение упиралось не только в модели, но и в данные — наборы были маленькими. Фей-Фей Ли с командой делает ставку на масштаб данных, против тогдашнего консенсуса «важнее алгоритм».
Идея и механизм
~14 млн изображений, размеченных по ~22 тысячам категорий иерархии понятий WordNet. Собран краулингом веба, размечен краудсорсингом (Amazon Mechanical Turk, ~49k разметчиков из 167 стран) с контролем качества — несколько разметчиков на картинку и «золотые» примеры с известным ответом. На его основе — ежегодный конкурс ILSVRC (подмножество: 1000 классов, ~1.2 млн картинок), где и мерилась гонка.
NumPy Метрика ILSVRC: top-5 error
import numpy as np
def top5_error(logits, labels): # logits: (N, 1000)
top5 = np.argsort(-logits, axis=1)[:, :5] # 5 самых вероятных классов
hit = (top5 == labels[:, None]).any(axis=1) # истинный класс в топ-5?
return 1 - hit.mean() # доля промахов
# именно её AlexNet (2012) срезал с 26% до 15%
Почему это важно
ImageNet дал арену, на которой глубокие сети показали превосходство — без него не было бы прорыва AlexNet-2012 (#16). Закрепил урок эпохи: данные — такой же двигатель, как архитектуры и compute (data-centric взгляд). Нюанс: на постере CVPR-2009 датасет почти не заметили (многие сомневались, что огромный набор важен); признание пришло через 3 года.
Связи
ImageNet — это топливо, AlexNet — двигатель. Конкурс ILSVRC-2012 дал глубокой CNN масштаб данных, на котором она разгромно выиграла и запустила революцию. Дата-веха и архитектурный прорыв нераздельны.
Та же ставка на масштаб данных, но следующий уровень: вместо 14M размеченных вручную картинок — 400M пар «картинка-подпись» из веба, где разметка — естественный язык. Эволюция «данные-как-двигатель»: от кураторской разметки к веб-масштабу.
ImageNet эмпирически показал ценность масштаба данных в зрении. Scaling laws спустя десятилетие формализуют это для языка: качество — предсказуемая функция данных, параметров и compute. «Больше данных лучше» из наблюдения становится законом.
Вопросы пытливого ума
Почему именно top-5 error, а не top-1 — не занижает ли это сложность?
Top-5 терпит неоднозначность: на фото может быть несколько объектов, а близкие классы (породы собак) трудно различимы даже людям. Засчитывать правильным, если истинный класс в пяти лучших, — это про «понял ли в принципе», а не про идеальную точность. Top-1 тоже репортят, но top-5 был основной метрикой гонки как более устойчивый к шуму разметки.
14 миллионов картинок размечены краудом — насколько чистые эти метки?
Не идеально. Несмотря на «золотые» примеры и нескольких разметчиков, в ImageNet находят ошибочные и неоднозначные метки, дубликаты и культурные перекосы (что считать «правильным» объектом). Поздние аудиты показали заметную долю спорных меток в validation-наборе. Это напоминание: «бенчмарк» — не истина, а измеримое приближение.
Датасет может нести предвзятость — это реальная проблема?
Да, и серьёзная. Источник (веб) и разметчики вносят географические, культурные и социальные перекосы; печально известна была «person»-ветвь ImageNet с оскорбительными категориями, которую позже вычистили. Модель наследует смещения данных — поэтому состав и происхождение датасета сегодня считают частью ответственного ML, а не технической мелочью.
Что читать в оригинале
Конспекта достаточно — это инфраструктурная веха, а не теория. Если интересно, посмотрите, как устроены сбор и контроль качества разметки: это образец того, как «просто датасет» меняет ход целой области.