RU

Как запустить LLM на 2,8 трлн параметров на ноутбуке

Локальный запуск больших LLM быстро упирается в память: веса не помещаются, оффлоад режет скорость, а красивые бенчмарки мало го…

LLMлокальный запуск LLMMoEMixture of Expertsинференсквантование моделейоффлоад экспертовиерархия памятипропускная способность памятиKimi K3.
Habr
RU

MoE на 5090 недобирает полтора раза, и дело не в маршрутизации

RTX 5090, одна и та же сборка llama.cpp, один драйвер, батч 1. Плотная Qwen3.5-9B выбирает 72% пропускной способности памяти карты. MoE Qwen3.5-35B-…

llama.cppmoertx 5090пропускная способность памятиcudagpuинференс ллмбенчмаркпрофилированиеqwen 3.5