RU

7 ошибок в оценке качества LLM‑систем в продакшене

LLM‑фича может месяцами показывать хорошие метрики и при этом регулярно ошибаться на реальных запросах. В статье разберём 7 типи…

LLMоценка качества LLMLLM evaluationLLM-as-a-JudgeнаблюдаемостьOpenTelemetryтрассировкапродакшенметрики качестватестирование LLM
Habr
RU

Сможете ли вы найти пять ошибок в Python‑коде, который вызывает LLM

Вызов LLM легко принять за обычную функцию — пока код не сталкивается с квотами, тайм‑аутами, повторными списаниями и плавающими…

PythonLLMAPI языковых моделейасинхронные запросыограничение конкурентностиповторные запросынедетерминизмтестирование LLMуправление контекстомподсчёт токенов.
Habr
RU

Когда чат-бот продаёт Chevrolet за доллар: как тестировать и мониторить LLM-приложения

Генеративные модели разблокировали огромное количество новых продуктов и новых фич в уже существующих. Поиграться с ними успел, кажется, каждый. И с…

LLMоценка качества LLMLLM-as-a-judgeтестирование LLMмониторинг LLMRAGгаллюцинацииdata driftregression testingEvidently