RU

Весь архив Циолковского, прочитанный машиной: 51 008 листов и точность, измеренная без эталона

Фонд 555 Архива РАН, 51 008 листов рукописей Циолковского, прочитан машиной целиком. Как измерить точность чтения, когда эталона нет,…

циолковскийархивыhtrрукописьllmдатасетopen dataopen datasetsоценка качества
Habr
RU

Честный RAG eval set: как собрать первые 100-300 кейсов и не обмануть себя цифрой

В прошлой статье серии мы сжимали эмбеддинги и замеряли, насколько изменится выдача относительно полного fp32-поиска. Там это был правильный вопрос:…

ragretrievalevalsоценка качестваLLMэмбеддингипоискMTEBragasBEIR
Habr
RU

Как мы с Claude Code учились оценивать качество RAG системы

Уверен, на Хабре найдётся немало статей, посвященных оценке качества RAG систем. Тема по-прежнему остаётся актуальной, потому что даже готовые библи…

claude-codeskill.mdrag_apirag системаавтоматизация рутиныклод кодmcp-serverоценка качества
Habr
RU

AI Evals: Почему без оценки качества ваш продукт стоит на месте

Вы меняете системный промпт, надеетесь, что все заработало и деплоите фичу в продакшен. На следующее утро прилетает жалоба: агент выдумал дедлайн ил…

evalsоценка качестваулучшение llmllm as a judgehuman in the loopFaithfulnessCompleteness
Habr
RU

SciGraph: как я учил ИИ читать научные статьи не только по словам, но и по связям

SciGraph показывает, почему GraphRAG для научных статей — это не только про графы и LLM, но и про честные метрики. В&n…

GraphRAGRAGLLMNLPграф знанийнаучные статьиизвлечение знанийцитированияоценка качестваF1-метрика