RU

MoE на 5090 недобирает полтора раза, и дело не в маршрутизации

RTX 5090, одна и та же сборка llama.cpp, один драйвер, батч 1. Плотная Qwen3.5-9B выбирает 72% пропускной способности памяти карты. MoE Qwen3.5-35B-…

llama.cppmoertx 5090пропускная способность памятиcudagpuинференс ллмбенчмаркпрофилированиеqwen 3.5
Habr
RU

От аренды до контента: как наш ComfyUI-образ помогает быстро развернуть локальную студию

ComfyUI даёт контроль над генерацией: можно сохранять workflow, менять отдельные этапы, подключать референсы, апскейл и редактирование, а затем повт…

comfyuicomfyfluxrtx 5090облачная инфраструктурааренда gpuгенерация изображений
Habr
RU

Всё, что вы хотели знать про локальные LLM, но боялись заинференсить

LLM может влезать в контекст и генерировать 200 tok/s, но если она не может найти нужный факт в тексте, толку от этого мало. Поэтому мы захостили 8…

квантованиеllmбенчмаркиоблачная инфраструктураgpurtx 5090большие языковые модели
Habr
RU

GPU для инженерных задач: как я ускорял массовый расчёт траекторий с RTX 5090

Разобрал, как GPU ускоряет инженерные расчёты на примере массового моделирования 2D-траекторий. Сравнил NumPy CPU, CuPy vectorized и CuPy RawKernel…

rtx 5090аренда виртуальной инфраструктурыинженерные расчетычисленные методы и оптимизациябенчмаркиоблачные сервисыоблачная инфраструктуравычисления на gpucupynumpy