RU

Qwen3.8. MTP и тензорный параллелизм в llama.cpp: 75 ток/сек на двух RTX 3090

Плотная 27-миллиардная модель на двух RTX 3090 в llama.cpp из коробки даёт 32 токена в секунду. Интуитивно понятно, что это не предел: две карты по…

llmaillama.cppqwenqwen3.8ggufквантованиелокальные нейросетилокальные модели
Habr
RU

Конец жирной маржинальности ИИ: всё о ценообразовании и дешёвых стоимостях моделей

В последнее время ИИ-сфера не просто падает, а даже входит в активную стадию конкурентности между несколькими фронтами — корпоративные ИИ (OpenAI и…

qwenz.aiglmox alphachatgptnvidiadeepseeknpuhugging face
Habr
RU

Мой опыт с Hermes Agent — ненависть, любовь, ненависть, любовь

Началось все с установки. Я пошёл почти по самому простому пути - установил его на Mac, в Docker. Потому что это агент, который работает автономно и…

hermes agentai-агентыllmлокальный llmлокальные моделиqwenagentic workflowsai automationworkflowgo
Habr
RU

Тест Qwen3.5 9b, Gemma 4 12b и Bonsai 27b на легенде пенсионного возраста GTX 1080 ti

Все началось вообще не с идеи написать очередной бенчмарк. Мне нужно было собрать локальный пайплайн для длинных подкастов: полу…

gemmaqwenbonsaiбенчмарклокальные нейросетиaiискусственный интеллект
Habr
RU

Дешевая LLM в проде: как мы ушли с прогнозных $2000 в месяц на $30 и какие минусы

Каждую ночь у нас в JobPath запускается Celery-задача, которая берёт свежие вакансии из каталога (мы собираем их из открытых источников и Telegram-к…

LLMqwenClaudeOpenRoutertool callingstructured outputоптимизация расходовэвал моделейfail-closed
Habr
RU

Локальный запуск LLM для SOC: сколько GPU действительно нужно?

Всем привет! На связи Сергей Иванов, аналитик технологий машинного обучения R-Vision. В этой статье разберем, почему для задач SOC можно начинать с…

llm-моделилокальный запуск llmvllmqwengpuNVIDIA RTX PRO 6000 Blackwellsocsoarai в кибербезопасности
Habr
RU

False positive под небом цвета телевизора, настроенного на мертвый канал

В «Ростелекоме», как в любом крупном корпоративном контуре, SAST-поток исчисляется тысячами срабатываний. Ручной триаж перестает быть инженерной раб…

llm-моделиllmинформационная безопасностьинференсинференс моделейsastqwentriage
Habr
RU

Как мы вынесли семантический поиск на обычный сервер без видеокарты, облака и выделенной поисковой системы

Когда мы занялись поисковым слоем AI-ассистента в «Первой Форме», договорились на входе: языковую модель, которая отвечает пользователю, не трогаем.…

llmaigpucpuqwenon-premiseenterprisebpmslow-code
Habr
RU

Hermes + Qwen3.6-27B: как я собрал первую линию email-поддержки

Я решил в качестве эксперимента собрать первую линию email-поддержки вокруг локальной LLM — без файн-тюнинга и попыток сразу заменить всю службу под…

hermesqwen3.6qwenhelpdeskagentоблачная инфраструктураgpuаренда gpurtx5090поддержка пользователей
Habr
RU

ИИ снова закрывается: почему нейросети оказались на грани блокировок

ИИ снова закрывается. Пока мир следит за технологической войной чипов, Пекин и Вашингтон начали закрывать доступ к самому главному — готовым моделям…

selectelaillm-моделиalibabaglmqwenDouBaoclaude mythosclaudeискусственный интеллект
Habr
RU

Кнопка «К началу ответа» для ChatGPT, Qwen, DeepSeek, Claude, Gemini, Grok и Perplexity: как я победил скролл и AI‑мысли

Спойлер: коды готовы — вставьте и пользуйтесь. Знаете, что меня расстраивало больше всего в чатах с нейросетями? Сидишь, читаешь…

tampermonkeyuserscriptjavascriptchatgptdeepseekqwenclaudegeminiperplexitydom
Habr
RU

Погружаем модели в сказки русские, да рассказы древние – тестируем возможности Qwen и Whisper на дореволюционномъ

Хотите не забывать детали диалога или то, что вас просили купить в магазине? Конечно, можно по старинке открывать блокнот в телефоне или чат в избра…

selectelраспознавание речиwhisperqwenasrтранскрибация речиавтоматическое распознавание речиискусственный интеллекттестирование моделей
Habr