RU

Как запустить LLM на 2,8 трлн параметров на ноутбуке

Локальный запуск больших LLM быстро упирается в память: веса не помещаются, оффлоад режет скорость, а красивые бенчмарки мало го…

LLMлокальный запуск LLMMoEMixture of Expertsинференсквантование моделейоффлоад экспертовиерархия памятипропускная способность памятиKimi K3.
Habr
RU

DeepSeek 0731 на DGX Spark: разгоняю до 68 tok/s и разбираюсь, почему у автора карточки 57

TL;DR Железо:  2× NVIDIA DGX Spark (GB10, SM121), 128 GB unified номинально и около 122 GiB видимых системе на ноду, QSFP 200G /…

DGX SparkvLLMLLM инференсбенчмаркспекулятивное декодированиеGB10MoEлокальные нейросетиspeculative decodingDeepSeek 0731
Habr
RU

Почему дорогая LLM дороже: экономика инференса, которую видно в твоём 5-часовом лимите

Каждый из вас, кто работал с Claude или с ChatGPT, смотрел на свои лимиты Или задавался вопросом «Да как один запрос съел 10% от лимита» Я потратил…

LLMMoEactive-параметрыKV-cacheинференс LLMoutput-токеныreasoning-токеныVRAMclaude codecodex
Habr