RU

Дело о 38 токенах в секунду: почему M3 Ultra начинал с двенадцати

Всё началось с простой, на первый взгляд, задачи. Я хотел использовать локально Qwen3.8-27B именно в BF16. Причём не исходный PyTorch-чекпойнт через…

Qwen3.8-27BDFlash2oMLXMLXApple SiliconMac Studio M3 Ultraлокальные LLMинференс LLMspeculative decodingBF16
Habr
RU

DeepSeek 0731 на DGX Spark: разгоняю до 68 tok/s и разбираюсь, почему у автора карточки 57

TL;DR Железо:  2× NVIDIA DGX Spark (GB10, SM121), 128 GB unified номинально и около 122 GiB видимых системе на ноду, QSFP 200G /…

DGX SparkvLLMLLM инференсбенчмаркспекулятивное декодированиеGB10MoEлокальные нейросетиspeculative decodingDeepSeek 0731
Habr
RU

DSpark на двух DGX Spark: порт, баг на одну строку и бенчмарки, которые пришлось мерить заново

DeepSeek выпустил DSpark — спекулятивный декодер для V4. В окне 27–30 июня 2026 рабочего публичного пути для GB10&nbsp…

dgx sparkdeepseekvllmспекулятивный декодингspeculative decodingdsparkllm-инференсбенчмаркиnvfp4nvfp8