RU

Как я ужал русский эмбеддер до 24 млн параметров — и чуть не испортил его одной цифрой

TL;DR.  У меня локальный RAG на AMD Strix Halo. Памяти там достаточно, но вычислительно всё упирается в один iGPU: его деля…

эмбеддингиRAGretrievalэнкодерыRuModernBERTSTRIZHllama.cppGGUFVulkanStrix Halo
Habr
RU

Маленькая модель на 0.6B держит квантование лучше, чем «крупная» на 1B: измерил деградацию function-calling на 4 ГБ VRAM

Как квантование ломает function-calling у LLM? Собрал бенчмарк QuantCall, протестировав модели на 4 ГБ VRAM. Главный инсайт: устойчивость к квантам…

квантованиеfunction-callingQwen3Llama-3.2BFCLQuantCallJSON-схемаGBNFGGUFдеградация модели
Habr
RU

Локальный запуск openai/gpt-oss-20b MXFP4 GGUF на ноутбуке без дискретной видеокарты: практический тест на 32 GB RAM

Запустил openai/gpt-oss-20b в варианте MXFP4 GGUF на обычном ноутбуке без дискретной видеокарты: только CPU, встроенная Radeon 780M и общая оператив…

локальные LLMopenai gpt-oss-20bGGUFMXFP4LM StudioRadeon 780MRyzenноутбук без дискретной видеокартыWindows 11benchmark
Habr
RU

Локальная Gemma 4 на MacBook читает графики и таблицы — и врёт красивее, чем говорит правду

MacBook M3, 16 ГБ, никакого облака. Поставил свежую Gemma 4, написал инструмент: кидаешь картинку с графиком или таблицей — получаешь CSV. Три кейса…

Gemma 4llama.cppлокальные LLMмультимодальные моделиOCRизвлечение данных из графиковvision-моделиMacBook M3GGUFвизуализация данных