RU

Одна строка в системном промпте отключала кеш целиком. 1% против 98% на живых вызовах

Токен, прочитанный из кеша, стоит не «немного дешевле». Он дешевле в 10–31 раз : DeepSeek — $0.44 против $0.014 за миллион, OpenAI — $4.00 против $0…

prompt cachingкеширование промптовLLMоптимизация затратprefix cachehit rateDeepSeekAnthropicOpenAIPython
Habr
RU

Не в 12,1 раз, а 2,3–2,9: сколько стоит новый тариф DeepSeek V4 и почему все решают 3 часа с 10:00 до 13:00 МСК

Цифру «+1100%» я увидел в чужом пересказе, и это ровно тот жанр новости, после которого приходят спрашивать, что будет со сметой. Часть нашей нагруз…

DeepSeekDeepSeek V4стоимость APILLM APIоптимизация затратпиковый тарифчасовые поясаcronбатч-обработкакеширование промптов
Habr
RU

Бесплатные API к Claude, GPT, DeepSeek и другим моделям: 6 AI-роутеров с бесплатным доступом

Собрал 6 AI-роутеров с бесплатным доступом к Claude, GPT, DeepSeek, Qwen и другим моделям. Показываю, что реально дают после регистрации: баланс, до…

AI APILLMClaudeGPTDeepSeekQwenбесплатный APIAI-роутерыAPI-роутерынейросети
Habr
RU

NVIDIA RTX PRO 5000 Blackwell с 72 Гб видеопамяти. Есть ли смысл переплачивать за «половинку» флагмана?

RTX PRO 5000 Blackwell на 72 Гб: золотая середина для локальных ИИ-моделей или переоцененный апгрейд? Разбираемся в нашем обзоре. Читать далее

NVIDIABlackwellRTX PRO 5000GPUVRAMLLMинференсDeepSeekCUDAhostkey
Habr
RU

Как агентные LLM встроили в операцию против госструктур: разбор кампании Hunt.io

Разбор отчёта Hunt.io о предполагаемой китайской кампании: открытый каталог, TencShell-инфраструктура, SQL-инъекции, фишинг и роль Claude Code с Dee…

кибербезопасностьthreat intelligenceClaude CodeDeepSeekLLMAI-агентыкибершпионажкитайapt
Habr
RU

Миллион токенов за 1 ₽ или за 20 726 ₽: одна RTX 5090, и почему API все равно дешевле

Разговор повторяется раз в месяц: платим за API прилично, может, купим свою карту? Сел и разложил все в цифры. Час своей 5090 в рублях, пропускная с…

RTX 5090локальный инференсстоимость токенаvLLMKV-кэшокупаемость GPULLM на своём железеDeepSeekYandexGPTTCO
Habr
RU

Большие модели и цена миллиона токенов

Китайские модели дешевле или это ловушка? Разбираемся, как не переплачивать за токены и почему цена в прайсе — еще не вся правда о расходах на ИИ. Ч…

hostkeyLLMAPIAnthropicOpenAIDeepSeekстоимость токеновкэшированиеконтекстное окнонейросети
Habr
RU

Финал саги: мой ИИ-ассистент на Hermes улетел на GitHub. ¡Забирайте! А грабли расскажу следом

Третья, финальная часть саги про личного ИИ-агента Паспарту: докачал ему искомую память и фоновый Codex, упаковал всё в Docker и выложил на GitHub -…

ИИ-агентHermesDeepSeekDockerCodexGitHubself-hosted
Habr
RU

502 на ingress, 302 в приложении: как я учил инфраструктурного LLM-агента не врать

Я делаю внутреннего read-only LLM-агента для инфраструктурных расследований. Инженер задаёт вопрос обычным языком, а агент собирает доказательства и…

LLM-агентыSREDevOpsMCPGoQwenDeepSeekKubernetesevaluationobservability
Habr
RU

Нашёл модель в 8 раз дешевле. Она начала писать иероглифы в русских новостях

Нашёл модель в 8 раз дешевле. Она начала писать иероглифы в русских новостях У меня новостной бот, и каждая новость в нём проходит через LLM: катего…

OpenRouterLLMнейросетиDeepSeekmax_tokensстоимость LLMPythonTelegram-ботмультиязычностьпродакшен
Habr
RU

AI‑тренер по CS2 на DeepSeek: где LLM выдумывает и почему семь недель стоили $1,45

Всем привет. Я много лет играю в Counter-Strike и тренируюсь, как большинство: захожу в Deathmatch «размяться», играю три катки, тильтую, выхожу. Се…

LLMDeepSeekгаллюцинациипет-проектASP.NET CoreSQLiteEntity FrameworkCounter-Strike 2
Habr
RU

[Перевод] Как я объединил четыре Mac Studio в один компьютер с 1,5 ТБ – и запустил ИИ, который не влезает ни в одну видеокарту

Представляю вашему вниманию довольно необычный эксперимент: объединение четырех компьютеров Mac Studio в единый кластер с 1,5 ТБ общей памяти с помо…

Mac Studioлокальные LLMтензорный параллелизмThunderboltDeepSeekKimi K2Qwen3timeweb_статьи_перевод
Habr
RU

Браузер вместо API: как я объединил DeepSeek, Qwen и ChatGPT в одного локального агента

Я хотел получить локального AI-агента без отдельного API для каждой модели — и превратил браузерные сессии DeepSeek, Qwen и ChatGPT в единый транспо…

AI-агентыLLMDeepSeekQwenChatGPTPlaywrightChromiumNode.jsopen sourceVS Code
Habr
RU

Гибель богов. Fable и ещё 10 LLM реорганизуют код. Сравнение

Это подробный разбор одного эксперимента. Я взял god node из реального LangGraph агента и попросил 5 американских и 6 китайских моделей сначала пред…

LLMLangGraphИИ-агентырефакторингнейросетиDeepSeekFableLLM-as-a-judgeархитектура ПОбенчмарки LLM
Habr
RU

Почему я перестал слать каждый вопрос в LLM: архитектура предсказуемого конвейера

Очевидный путь для бота поддержки на LLM — слать в модель каждый вопрос вместе с куском базы знаний. На демо работает, в проде разваливается: галлюц…

ТехподдержкаLLMRAGчат-ботклассификация обращенийYandexGPTDeepSeekNLPFastAPI
Habr
RU

Из одного слова целый бренд. Как развивался Колорит

Несколько дней назад я сделал маленький инструмент для себя. Надоело каждый раз начинать новый проект с колеса оттенков: крутишь Coolors, листаешь P…

Node.jsJavaScriptDeepSeekCanvas APIAIДизайнВеб-разработкаИнструменты разработчикаPrompt Engineeringfree
Habr
RU

Когда нейросети заменят живых продавцов? Тест 10 LLM на умение продавать для русского рынка

Нам всё чаще заказывают ИИ-ботов для продаж и квалификации. И каждый раз один и тот же вопрос: на каком движке его строить? Бенчмарков «кто умнее» —…

LLMпродажибенчмаркиOpenRouterчат-ботыпереговорыNLPDeepSeekGeminiметодология
Habr
RU

Как я сделал генератор палитр на Node.js + DeepSeek за два вечера — и что из этого вышло

Как-то вечером я поймал себя на том, что трачу по 20 минут на поиск цветовой палитры для каждого нового проекта. Coolors, Adobe Color, случайные пин…

Node.jsJavaScriptDeepSeekCanvas APIAIДизайнВеб-разработкаИнструменты разработчикаPrompt EngineeringOpen Source
Habr
RU

Как мы за неделю, подружили DeepSeek-R1 с отечественными процессорам ARM64, NVIDIA A100 в 100% отечественном сервере

Всем привет! Меня зовут Алфёров Валентин, я директор по развитию компании Е-Флопс. В этой статье хочу поделиться с вами опытом нашего инженера-тести…

LLMИИAIМВ2бМ1Модульный серверЕ-ФлопсDeepSeekNVIDIA A100ARM64
Habr
RU

Симулятор рисков для крипты: написал инструмент, который считает за меня размер позиции и стресс-тестирует портфель

Большинство трейдеров управляют рисками интуитивно. «Войду на 20% депозита, стоп поставлю пониже» — и пошёл. Исследование 500+ активных криптотрейде…

риск-менеджменткриптовалютатрейдингATRстресс-тестированиеDeepSeekJavaScriptбраузерное приложениеуправление капиталомалготрейдинг
Habr
RU

Модели почти год, а она всё ещё №1 по цене/качеству. Прогнал свежий батл-тест — и опять не сдвинул

Я собрал четыре модели в один батч — две Gemma, DeepSeek V4 Flash и Qwen3-235B — потому что не поверил кросс-сессионным данным: выходило, что малень…

LLMQwenDeepSeekGemmaBenchmarksOpenRouterQuality AssessmentMethodologyRussian NLP
Habr
RU

Мы вскрыли трафик ChatGPT, Gemini и DeepSeek, чтобы понять, откуда берутся «источники» в ответах

Когда нейросеть отвечает на вопрос и показывает блок «источников», кажется, что у всех систем это одно и то же — список ссылок, на которые модель оп…

ChatGPTGeminiDeepSeekGEOLLMцитированиеSSEProtobuf.
Habr
RU

«Обживаемся» с Паспарту после переезда на Hermes и наступаем на новые «грабли». Ну и Codex подключаем — как же без него?

Продолжение истории про переезд ИИ-агента Паспарту с OpenClaw на Hermes. На этот раз — как я пересадил его на дешёвый DeepSeek, научил переключать м…

HermesDeepSeekOpenRouterNemotronCodexИИ-агентself-hostedTelegram-ботOpenAI
Habr
RU

Режим thinking у ИИ: что на самом деле происходит, когда модель «думает»

Когда нажимаешь кнопку Thinking и видишь, как модель несколько секунд «размышляет» перед ответом — легко решить, что она просто старается сильнее. Р…

thinkingchain-of-thoughtLLMязыковые моделиИИreasoningo1DeepSeekGPTрежим мышления
Habr
RU

Искусственный интеллект без магии: Гигачат, нейросети, профессии и риск «дешёвого апокалипсиса» — интервью с Сергеем

Искусственный интеллект давно перестал быть темой только для исследовательских лабораторий. Он уже пишет код, редактирует изображения, помогает бизн…

ИИискусственный интеллектГигачатChatGPTнейросетимашинное обучениеDeepSeekSberAGIинтервью
Habr
RU

Gemini-3.5-flash догнал GPT-5.5 на 97/S и в 2.5× дешевле. Но главное — китайцы выигрывают по цене и качеству

Месяц назад я писал про парадокс DeepSeek V4 Pro — модель проиграла собственному Flash и Qwen 3.6 Plus трёхнедельной давности. Сегодня прогнал свежи…

LLMGeminigpt-5DeepSeekQwenTencentBenchmarksAIOpenRouterRussian NLP
Habr
RU

Пишем Java-скрипт, который собирает проект в один файл для контекста в чат DeepSeek или другие LLM

У нейросетей есть ограничение на количество символов в чате или на число запросов. И бывает так, что лимит уже закончился, а разработка проекта — не…

DeepSeekLLMJavaконтекстdeveloper toolsавтоматизацияChatGPT
Habr