RU

Сломанный кэш выглядит как рабочий: prompt caching для тех, кто строит LLM-агентов

Кэш режет цену входных токенов в десять раз и держит юнит-экономику агентов, но ломается без единой ошибки в логах. Что на самом деле кэшируется, че…

prompt cachingKV cacheкэширование контекстаLLM-агентыcache_controlGemini context cachingcache hit rateкэширование промптовпромпт-кэш
Habr
RU

Калькулятор VRAM для локальных LLM: Какие модели ИИ запустятся у вас на компьютере?

Когда я начал ковыряться с локальными LLM, главная боль была не в установке моделей, а в понимании, что вообще влезет в моё железо. Документация Hug…

LLMVRAMllama.cppлокальные моделиквантованиеKV cacheGQAбенчмаркGPU