RU

Одна строка в системном промпте отключала кеш целиком. 1% против 98% на живых вызовах

Токен, прочитанный из кеша, стоит не «немного дешевле». Он дешевле в 10–31 раз : DeepSeek — $0.44 против $0.014 за миллион, OpenAI — $4.00 против $0…

prompt cachingкеширование промптовLLMоптимизация затратprefix cachehit rateDeepSeekAnthropicOpenAIPython
Habr
RU

Почему нейросети съедают токены: что происходит с длинными чатами и как снизить расход

Один пользователь Claude утверждает, что прогнал через модель больше миллиарда входных токенов. Другой оставил AI-агента без присмотра и насчитал ок…

LLMтокеныконтекстное окноClaudeChatGPTcontext rotprompt cachingAI-агентыcontext engineeringрасход токенов
Habr
RU

Полез в исходники vLLM, чтобы понять, почему один символ убивает prompt caching

В первой части я вывел одно правило и предложил жить по нему: стабильное в начало, изменчивое в хвост , один символ в системном промпте обнуляет вес…

prompt cachingKV-cacheprefix cachingPagedAttentionvLLMLLMинференс LLMGPUprefillоптимизация
Habr
RU

Я собрал линтер для юридического соответствия сайтов. Сложнее всего было отличить Google Analytics от CSS‑переменной

Коротко . Сервис открывает чужой сайт и считает штраф по КоАП. Внутри двухуровневая проверка по 22 правилам: дешёвые эвристики на che…

152-ФЗперсональные данныекомплаенсprompt cachingрегулярные выражениякириллицаLLMPlaywrightаудит сайтаNext.js
Habr
RU

Сломанный кэш выглядит как рабочий: prompt caching для тех, кто строит LLM-агентов

Кэш режет цену входных токенов в десять раз и держит юнит-экономику агентов, но ломается без единой ошибки в логах. Что на самом деле кэшируется, че…

prompt cachingKV cacheкэширование контекстаLLM-агентыcache_controlGemini context cachingcache hit rateкэширование промптовпромпт-кэш
Habr
RU

Короткий промпт ≠ дешёвый промпт: как оптимизация ломает prefix cache в LLM-агентах

32 tools в промпте - дешевле, чем 7. Да, да - если вы строите агентов, это не опечатка. Это следствие того, как работает prefix cache в агентском ци…

llm-агентprefix cachingтокеныai-агентыaiprompt cachingprompt-engineeringcontext-engineering
Habr
RU

Code with Claude 2026: что Anthropic показали разработчикам на своей конференции

6 мая 2026 года в Сан-Франциско прошла вторая конференция Anthropic для разработчиков — Code with Claude. Площадку для мероприятия в этот раз расшир…

AnthropicClaude Codemanaged agentsroutinesmulti-agent orchestrationdreamingoutcomesGitHub Copilotprompt cachingOpus 4.7