RU

[Перевод] Сколько автономности должно быть у ИИ‑агента

ИИ‑агент не должен получать больше автономности только потому, что выглядит компетентным. Автономность должна расти тогда, когда система в…

ии-агентыавтономные агентыАвтономность ииверификация ИИevalsai safety
Habr
RU

ОК или НеОК: как мы строили LLM‑судью и дважды меняли формулу вердикта

У нашего AI‑агента поддержки было десять метрик и ноль ответов на главный вопрос: какую долю обращений он решает? Судья, который чита…

LLM JudgeAI-агентыоценка AI-системevalsRAGtool callinggolden setкаппа Коэнаproduction AI
Habr
RU

Честный RAG eval set: как собрать первые 100-300 кейсов и не обмануть себя цифрой

В прошлой статье серии мы сжимали эмбеддинги и замеряли, насколько изменится выдача относительно полного fp32-поиска. Там это был правильный вопрос:…

ragretrievalevalsоценка качестваLLMэмбеддингипоискMTEBragasBEIR
Habr
RU

Я объяснил KERNEL маме за пять минут. Потом проверил, переживёт ли он LLM в production

Недавно я попробовал объяснить маме, как нормально ставить задачи ChatGPT. Без temperature, context window, system prompt и прочих слов, после котор…

LLMprompt engineeringKERNELпромптыcontext engineeringevalsChatGPTRAGAI-агентыLLM в production
Habr
RU

Evals для чайников. Как тестировать AI-агента, чтобы понимать, где именно он ломается

Большинство команд оценивают производительность AI-агентов через end-to-end метрики: success rate, количество токенов, tool usage, стоимость запроса…

ai-агентыllmragevalsorchestrationretrievaltool callingcontext engineeringproductionai infrastructure
Habr
RU

Почему ломается ваш AI-агент — и почему смена модели обычно его не чинит

Представьте внутреннего AI-агента, который помогает компании искать общие документы и управлять ими. Он работает. До тех пор, пока 12–15% запросов н…

ai-агентыllmragorchestrationretrievaltool callingcontext engineeringevalsproductionai infrastructure
Habr
RU

AI Evals: Почему без оценки качества ваш продукт стоит на месте

Вы меняете системный промпт, надеетесь, что все заработало и деплоите фичу в продакшен. На следующее утро прилетает жалоба: агент выдумал дедлайн ил…

evalsоценка качестваулучшение llmllm as a judgehuman in the loopFaithfulnessCompleteness
Habr