RU

Как модели упаковывают концепты в многообразия: смотрим на теорию, рушим идеальный мир и ищем кружочки

Mechanistic claims в interpretability для бедных, но бравых. Шучу, конечно. Просто когда дело дошло до задачи "придумать название" — вспомнила шутки…

explainable aimanifoldmathematicsmechanistic interpretability
Habr
RU

Можно ли пересадить алгоритм из маленькой модели в LLM? Эксперимент с grokking, residual stream и линейной проекцией

Можно ли взять алгоритм из маленькой нейросети и «вставить» его в большую языковую модель на лету, без дообучения? Мы проверили эту гипотезу на моду…

grokkingresidual streammechanistic interpretabilityмодульная арифметикаtransfer learningлинейный пробникPhi-2трансформерыactivation patching
Habr
RU

П維чему нейро考ети дел思ют так

Если вы хоть раз тестировали локальную модель (да и нелокальную тоже) и замечали, как она посреди нормального текста вдруг выдает иероглиф, то загол…

нейросетимашинное обучениеэмбеддингиgrokkingгроккингllmвекторное пространствоmechanistic interpretabilityтокеныselectel
Habr
RU

Метрика EICS — ищем у трансформера причинное место

У больших языковых моделей есть неприятное свойство: снаружи ответ может выглядеть одинаково уверенно и тогда, когда модель действительно «собрала»…

uncertainty estimationtransformerssheaf theorycausal emergence theoryinformation theorymechanistic interpretabilityllm