RU

Тернарный KAN: не баг, а фича — почему дискретные веса работают лучше

Это продолжение поста “Две нейросети по 15 КБ” - там были базовые цифры. А тут уже личная история: как делалось, что пошло не так, и что выяснилось…

KANKolmogorov-Arnold Networksтернарные весаквантованиеQATTinyMLEdge AIMNISTрегуляризацияSTM32
Habr
RU

Я научил небольшой Transformer генерировать цифры одной нитью

Наверняка вы видели портреты, собранные из одной нити, натянутой между сотнями гвоздей. Я решил проверить: можно ли научить нейросеть генерировать н…

Transformerмашинное обучениеMNISTstring artобработка изображенийгенеративная модельautoregressive generationsequence modelingпроцедурная генерацияPython