RU

Свой инференс для 25 разработчиков: 452:1, KV‑пул и почему это не экономит денег

Для тех, кто держит или собирается держать LLM внутри контура: тимлидов, DevOps, архитекторов. Здесь конфиги, цифры и грабли, а не&nb…

vLLMLiteLLMprefix cachingKV-cacheлокальные LLMинференс LLMQwenагентская разработкаRTX PRO 6000claude
Habr
RU

Бесплатные API к Claude, GPT, DeepSeek и другим моделям: 6 AI-роутеров с бесплатным доступом

Собрал 6 AI-роутеров с бесплатным доступом к Claude, GPT, DeepSeek, Qwen и другим моделям. Показываю, что реально дают после регистрации: баланс, до…

AI APILLMClaudeGPTDeepSeekQwenбесплатный APIAI-роутерыAPI-роутерынейросети
Habr
RU

Как я собрал полностью локальную диктовку для русского языка на Mac: GigaAM, Whisper, Qwen и Apple

VoiceSwitch — открытое menu bar-приложение для Apple Silicon: одна глобальная клавиша запускает запись, GigaAM, Whisper, Qwen или Apple распознают р…

VoiceSwitchраспознавание речиGigaAMWhisperQwenMLXmacOSлокальные модели
Habr
RU

502 на ingress, 302 в приложении: как я учил инфраструктурного LLM-агента не врать

Я делаю внутреннего read-only LLM-агента для инфраструктурных расследований. Инженер задаёт вопрос обычным языком, а агент собирает доказательства и…

LLM-агентыSREDevOpsMCPGoQwenDeepSeekKubernetesevaluationobservability
Habr
RU

Браузер вместо API: как я объединил DeepSeek, Qwen и ChatGPT в одного локального агента

Я хотел получить локального AI-агента без отдельного API для каждой модели — и превратил браузерные сессии DeepSeek, Qwen и ChatGPT в единый транспо…

AI-агентыLLMDeepSeekQwenChatGPTPlaywrightChromiumNode.jsopen sourceVS Code
Habr
RU

«ChatGPT с AliExpress» или лучшая нейросеть с открытым кодом: разбираемся в Qwen 3.7

Роли между популярными нейросетями более-менее распределены. ChatGPT остается главным универсальным помощником для большинства пользователей. Claude…

нейросетиИИискусственный интеллектQwenAlibabaopen source AILLMAI агентыComputer Use
Habr
RU

Модели почти год, а она всё ещё №1 по цене/качеству. Прогнал свежий батл-тест — и опять не сдвинул

Я собрал четыре модели в один батч — две Gemma, DeepSeek V4 Flash и Qwen3-235B — потому что не поверил кросс-сессионным данным: выходило, что малень…

LLMQwenDeepSeekGemmaBenchmarksOpenRouterQuality AssessmentMethodologyRussian NLP
Habr
RU

Gemini-3.5-flash догнал GPT-5.5 на 97/S и в 2.5× дешевле. Но главное — китайцы выигрывают по цене и качеству

Месяц назад я писал про парадокс DeepSeek V4 Pro — модель проиграла собственному Flash и Qwen 3.6 Plus трёхнедельной давности. Сегодня прогнал свежи…

LLMGeminigpt-5DeepSeekQwenTencentBenchmarksAIOpenRouterRussian NLP
Habr
RU

Как мы в отделе документации создали LLM агента для автоматизированного перевода с английского на другие языки

Разбираем, как в отделе документации построили LLM-агента для автоматизированного перевода Markdown-документации. Архитектура, пайплайн, валидация,…

LLMавтоматизация переводатехническая документацияPythonвалидацияMarkdownOpenWebUIQwenоркестрацияhostkey
Habr
RU

Разбираю «Qwen3.5-21B-Claude-4.6-Opus-Heretic-Uncensored»: что на самом деле внутри файнтюна с громким именем

В телеграме завирусился пост: якобы кто-то “дообучил Qwen 3.5 до уровня Claude 4.6 Opus и убрал цензуру через Heretic”. Я открыл карточку модели на…

LLMQwenabliterationфайнтюнHuggingFacedistillationintepretabilityopen-weights