RU

Цена за успешный результат: почему дешёвая модель может обойтись дороже дорогой

Дешёвая LLM легко превращается в дорогую, если агент чаще ошибается, уходит в повторные прогоны и требует внимания инженера. В статье…

ИИ-агентыLLMстоимость LLMстоимость токеноввыбор моделиAI-агентыкэшированиемаршрутизация моделейчеловеко-времяeval
Habr
RU

Нашёл модель в 8 раз дешевле. Она начала писать иероглифы в русских новостях

Нашёл модель в 8 раз дешевле. Она начала писать иероглифы в русских новостях У меня новостной бот, и каждая новость в нём проходит через LLM: катего…

OpenRouterLLMнейросетиDeepSeekmax_tokensстоимость LLMPythonTelegram-ботмультиязычностьпродакшен
Habr
RU

Скрытая цена LLM: как KV-cache увеличивает стоимость инференса и как эту проблему решает Google TurboQuant

При инференсе LLM общее потребление памяти определяется не только размером самой модели, но и промежуточными данными, накапливаемыми в процессе ее р…

LLMKV-cacheинференс LLMстоимость LLMоптимизация инференса