RU

Дело о 38 токенах в секунду: почему M3 Ultra начинал с двенадцати

Всё началось с простой, на первый взгляд, задачи. Я хотел использовать локально Qwen3.8-27B именно в BF16. Причём не исходный PyTorch-чекпойнт через…

Qwen3.8-27BDFlash2oMLXMLXApple SiliconMac Studio M3 Ultraлокальные LLMинференс LLMspeculative decodingBF16