RU

ОК или НеОК: как мы строили LLM‑судью и дважды меняли формулу вердикта

У нашего AI‑агента поддержки было десять метрик и ноль ответов на главный вопрос: какую долю обращений он решает? Судья, который чита…

LLM JudgeAI-агентыоценка AI-системevalsRAGtool callinggolden setкаппа Коэнаproduction AI
Habr
RU

LLM-судье нельзя верить на слово: как построить надёжный гейт и проверить сами тесты

Как перестать доверять LLM-судье на слово и построить безопасную двухконтурную систему оценки? Внутри статьи: Архитектурный паттерн сдерживания: поч…

LLMLLM-as-a-judgeLLMOpsPythonтестированиевалидация моделейархитектура системкаппа Коэнакачество данных