RU

ОК или НеОК: как мы строили LLM‑судью и дважды меняли формулу вердикта

У нашего AI‑агента поддержки было десять метрик и ноль ответов на главный вопрос: какую долю обращений он решает? Судья, который чита…

LLM JudgeAI-агентыоценка AI-системevalsRAGtool callinggolden setкаппа Коэнаproduction AI