RU

7 ошибок в оценке качества LLM‑систем в продакшене

LLM‑фича может месяцами показывать хорошие метрики и при этом регулярно ошибаться на реальных запросах. В статье разберём 7 типи…

LLMоценка качества LLMLLM evaluationLLM-as-a-JudgeнаблюдаемостьOpenTelemetryтрассировкапродакшенметрики качестватестирование LLM
Habr
RU

Детектор был прав, разметка врала: как мы искали слепую зону LLM-судей и нашли ошибки в эталоне

Мы собрали training‑free детектор галлюцинаций из шести готовых языковых моделей, получили хорошие метрики и наткнулись на красивую загадк…

LLMRAGLLM-as-a-JudgeRAGTruthHallucination DetectionAI EvaluationГаллюцинации LLMГенеративный ИИNLPMachine Learning