
Как модели упаковывают концепты в многообразия: смотрим на теорию, рушим идеальный мир и ищем кружочки
Mechanistic claims в interpretability для бедных, но бравых. Шучу, конечно. Просто когда дело дошло до задачи "придумать название" — вспомнила шутки моей коллеги. В одном из приближений можно сказать, что AI-модели обрабатывают входы послойно. На каждом слое модель выдаёт вектор , который можно читать как точку, центроид, область и так далее. Все эти точки, центроиды, области, направления кажутся абстракциями, но как только мы структурируем их — мы видим тонну прекрасного. Например, мы можем геометрически понимать и находить концепты, упакованные в многообразия. Что называется концептом, а что многообразием? Какие структуры образуют циклические компоненты и как откопать это в модели? Почему теория существует и находится эмпирически, но пока не машстабируется? На эти вопросы мы и покопаем ответы в данной статье. Читать далее