RU

Квантизация LLM: как запихнуть 70B модель в свою видюху

Ну что, думаете что для запуска LLaMA 3 70B вам нужна серверная стойка за лярд рублей? Поздравляю, вас обманули маркетологи GPU-вендоров. Модели с с…

квантизацияLLMоптимизациявеса моделейmoe архитектуратрансформеры
Habr
RU

Всё, что вы хотели знать о локальном ИИ, но стеснялись спросить

Если вы когда-нибудь смотрели на HF и не понимали, что такое DFlash, квантизация и почему одна и та же модель лежит в десяти репозиториях от десяти…

llmлокальные моделиквантизацияllama.cppapple siliconggufинференсmoemeta
Habr
RU

Нейронные сети нетрадиционного квантования

Ещё пару лет назад мысль о полноценной 27B модели на обычном ноутбуке звучала как шутка: нужна была либо мощная видеокарта, либо максимально урезанн…

искусственный интеллектнейронные сетиквантизацияхочется странного
Habr
RU

Как я писал in-memory векторный движок на Go — и в каком месте он обогнал hnswilb

Полгода назад я начал писать in-memory базу с векторным поиском на Go: RESP-протокол, HNSW-индекс, WAL, многопоточность. Рассказываю, что из этого в…

векторные базы данныхвекторный поискhnswgolanggoin-memorybenchmarkквантизацияrag
Habr
RU

Сжатие декодерных эмбеддеров: как ужать 8B до продакшена без потери recall

Декодерный эмбеддер 7–8B дает качество, но платит за него памятью, latency и деньгами. Разбираем все оси сжатия - int8, int4, binary + rescoring, PQ…

сжатие эмбеддинговквантизацияэмбеддингиembeddingsRAGQdrantQwen3binary quantizationMatryoshkaretrieval
Habr
RU

Каталог из 83 форматов с плавающей точкой, который сам себя проверяет

Если вы ловили расхождение точности между двумя реализациями одной сети, то знаете это чувство: один matmul на двух устройствах даёт разные числа, и…

числовые форматыfloating pointFP8bfloat16GoldenFloatIEEE 754квантизацияRTLpositмашинная точность
Habr
RU

Линейка для чисел: как я собрал каталог из 83 форматов с плавающей точкой — и почему он всё время «не сходится»

Любой, кто дебажил несовпадение точности между двумя реализациями нейросети, знает это чувство: один и тот же matmul на двух устройствах даёт разный…

числовые форматыfloating pointGoldenFloatbfloat16FP8P3109RTLквантизациямашинное обучениечисла с плавающей точкой
Habr
RU

LongConspectWriter: автоматическая генерация структурированных конспектов лекций на потребительском GPU

Автоматическая генерация структурированных академических конспектов из аудиозаписей лекций по точным и естественным наукам затруднена для локальных…

LLMлокальные LLMllama.cppквантизациясуммаризация текстадлинный контекстмультиагентные системысемантическая кластеризацияLLM-as-a-judgeконспекты лекций
Habr