RU

MoE на 5090 недобирает полтора раза, и дело не в маршрутизации

RTX 5090, одна и та же сборка llama.cpp, один драйвер, батч 1. Плотная Qwen3.5-9B выбирает 72% пропускной способности памяти карты. MoE Qwen3.5-35B-…

llama.cppmoertx 5090пропускная способность памятиcudagpuинференс ллмбенчмаркпрофилированиеqwen 3.5
Habr
RU

Как выбрать OCR в 2026-м: тестируем девять моделей на трех движках инференса на рукописном русском

Вам нужен OCR. В техобзорах рекомендуют Tesseract, на Хабре все пишут про VLM, идете на Hugging Face — там PaddleOCR-VL, DeepSeek-OCR, Dots.OCR, Qwe…

OCRvlmmws aiраспознавание изображенийраспознавание текстабенчмаркиискусственный интеллектmlинференс ллмдвижки
Habr
RU

Как выбрать OCR в 2026-м: тестируем девять моделей на трех движках инференса на рукописном русском

Вам нужен OCR. В техобзорах рекомендуют Tesseract, на Хабре все пишут про VLM, идете на Hugging Face — там PaddleOCR-VL, DeepSeek-OCR, Dots.OCR, Qwe…

OCRvlmmws aiраспознавание изображенийраспознавание текстабенчмаркиискусственный интеллектmlинференс ллмдвижки
Habr
RU

Анализ сервисов на замену OpenRouter в РФ

Заголовок конечно очень похож на классический ИИ SEO слоп, но не спешите закрывать. Анализ вцелом я делал для себя и не претендую на истину в послед…

openrouterинференсllmагрегаторы нейросетейLLM провайдерыинференс ллмоблачные инференсыроссийские нейросетипровайдеры нейросетей
Habr
RU

Как работает адаптивный RAG, которому вообще не нужна LLM

Один из самых популярных способов снизить процент галлюцинаций языковых моделей — метод RAG, то есть схема, в которой модель при необходимости обращ…

ragllmmachinelearninginferenceоптимизация вычисленийискусственный интеллектклассификаторархитектура ииинференс ллм
Habr
RU

Как работает адаптивный RAG, которому вообще не нужна LLM

Один из самых популярных способов снизить процент галлюцинаций языковых моделей — метод RAG, то есть схема, в которой модель при необходимости обращ…

ragllmmachinelearninginferenceоптимизация вычисленийискусственный интеллектклассификаторархитектура ииинференс ллм