← All news

Как модели упаковывают концепты в многообразия: смотрим на теорию, рушим идеальный мир и ищем кружочки

Mechanistic claims в interpretability для бедных, но бравых. Шучу, конечно. Просто когда дело дошло до задачи "придумать название" — вспомнила шутки моей коллеги.

В одном из приближений можно сказать, что AI-модели обрабатывают входы послойно. На каждом слое модель выдаёт вектор h \in \mathbb{R}^D, который можно читать как точку, центроид, область и так далее. Все эти точки, центроиды, области, направления кажутся абстракциями, но как только мы структурируем их — мы видим тонну прекрасного. Например, мы можем геометрически понимать и находить концепты, упакованные в многообразия.

Что называется концептом, а что многообразием? Какие структуры образуют циклические компоненты и как откопать это в модели? Почему теория существует и находится эмпирически, но пока не машстабируется? На эти вопросы мы и покопаем ответы в данной статье.

Читать далее
Read original at Хабр — Машинное обучение →