MoE на 5090 недобирает полтора раза, и дело не в маршрутизации
RTX 5090, одна и та же сборка llama.cpp, один драйвер, батч 1. Плотная Qwen3.5-9B выбирает 72% пропускной способности памяти карты. MoE Qwen3.5-35B-…
Tech news from the best sources
RTX 5090, одна и та же сборка llama.cpp, один драйвер, батч 1. Плотная Qwen3.5-9B выбирает 72% пропускной способности памяти карты. MoE Qwen3.5-35B-…
ComfyUI даёт контроль над генерацией: можно сохранять workflow, менять отдельные этапы, подключать референсы, апскейл и редактирование, а затем повт…
LLM может влезать в контекст и генерировать 200 tok/s, но если она не может найти нужный факт в тексте, толку от этого мало. Поэтому мы захостили 8…
Разобрал, как GPU ускоряет инженерные расчёты на примере массового моделирования 2D-траекторий. Сравнил NumPy CPU, CuPy vectorized и CuPy RawKernel…