RU

Шесть LLM‑судей из четырёх лабораторий несут 1,9 независимого голоса из 6

*6 LLM‑судей, 4 лаборатории, 3 страны — а ошибки коррелируют: ρ̄ ≈ 0,42, эффективно 1,9 из 6. В июле я писал, что…

LLMLLM-as-a-judgeдетекция галлюцинацийRAGTruthансамбль моделейкорреляция ошибокоценка LLMвоспроизводимостьRAGбенчмарки
Habr
RU

LLM-судье нельзя верить на слово: как построить надёжный гейт и проверить сами тесты

Как перестать доверять LLM-судье на слово и построить безопасную двухконтурную систему оценки? Внутри статьи: Архитектурный паттерн сдерживания: поч…

LLMLLM-as-a-judgeLLMOpsPythonтестированиевалидация моделейархитектура системкаппа Коэнакачество данных
Habr
RU

Гибель богов. Fable и ещё 10 LLM реорганизуют код. Сравнение

Это подробный разбор одного эксперимента. Я взял god node из реального LangGraph агента и попросил 5 американских и 6 китайских моделей сначала пред…

LLMLangGraphИИ-агентырефакторингнейросетиDeepSeekFableLLM-as-a-judgeархитектура ПОбенчмарки LLM
Habr
RU

LongConspectWriter: автоматическая генерация структурированных конспектов лекций на потребительском GPU

Автоматическая генерация структурированных академических конспектов из аудиозаписей лекций по точным и естественным наукам затруднена для локальных…

LLMлокальные LLMllama.cppквантизациясуммаризация текстадлинный контекстмультиагентные системысемантическая кластеризацияLLM-as-a-judgeконспекты лекций
Habr
RU

Когда чат-бот продаёт Chevrolet за доллар: как тестировать и мониторить LLM-приложения

Генеративные модели разблокировали огромное количество новых продуктов и новых фич в уже существующих. Поиграться с ними успел, кажется, каждый. И с…

LLMоценка качества LLMLLM-as-a-judgeтестирование LLMмониторинг LLMRAGгаллюцинацииdata driftregression testingEvidently