RU

Маленькая модель на 0.6B держит квантование лучше, чем «крупная» на 1B: измерил деградацию function-calling на 4 ГБ VRAM

Как квантование ломает function-calling у LLM? Собрал бенчмарк QuantCall, протестировав модели на 4 ГБ VRAM. Главный инсайт: устойчивость к квантам за…

квантованиеfunction-callingQwen3Llama-3.2BFCLQuantCallJSON-схемаGBNFGGUFдеградация модели
Habr
RU

Локальный запуск openai/gpt-oss-20b MXFP4 GGUF на ноутбуке без дискретной видеокарты: практический тест на 32 GB RAM

Запустил openai/gpt-oss-20b в варианте MXFP4 GGUF на обычном ноутбуке без дискретной видеокарты: только CPU, встроенная Radeon 780M и общая оперативна…

локальные LLMopenai gpt-oss-20bGGUFMXFP4LM StudioRadeon 780MRyzenноутбук без дискретной видеокартыWindows 11benchmark