RU

Шесть LLM‑судей из четырёх лабораторий несут 1,9 независимого голоса из 6

*6 LLM‑судей, 4 лаборатории, 3 страны — а ошибки коррелируют: ρ̄ ≈ 0,42, эффективно 1,9 из 6. В июле я писал, что…

LLMLLM-as-a-judgeдетекция галлюцинацийRAGTruthансамбль моделейкорреляция ошибокоценка LLMвоспроизводимостьRAGбенчмарки
Habr
RU

Почему бенчмарки в AI сломались — и что с этим делать в понедельник

Числовая оценка идеальна для закрытых задач. Аморфная нужна для открытых. AI за пятнадцать лет переехал из первого класса во второй — а инструмент о…

llmбенчмаркиоценка LLMагентные системыai-агентызакон гудхартаметрики качестваанализ и проектирование системкритическое мышлениенейросети