RU

Честный RAG eval set: как собрать первые 100-300 кейсов и не обмануть себя цифрой

В прошлой статье серии мы сжимали эмбеддинги и замеряли, насколько изменится выдача относительно полного fp32-поиска. Там это был правильный вопрос:…

ragretrievalevalsоценка качестваLLMэмбеддингипоискMTEBragasBEIR
Habr
RU

Инженерия качества: Как перестать надеяться на удачу и начать измерять своих ИИ-агентов [Часть 3]

Продолжаем рассмотрение, того как правильно оценивать качество ИИ систем, в данной части поговорим про метрики характерные для RAG системы. Способах…

искусственный интеллекткачество продуктаобработка естественного языкаragasragии-агенты
Habr
RU

Инженерия качества: Как перестать надеяться на удачу и начать измерять своих ИИ-агентов [Часть 2]

Продолжаем рассмотрение, того как правильно оценивать качество ИИ систем, в данной части поговорим о двух крайне полезных метриках: одна универсальн…

метрики качестваragasai-агенты
Habr
RU

Инженерия качества: Как перестать надеяться на удачу и начать измерять своих ИИ-агентов [Часть 1]

Инженерия качества: Как перестать надеяться на удачу и начать измерять своих ИИ-агентов [Часть 1] LLM глючит в продакшене? 🤖 Хватит надеяться на «vi…

агенты ииragragasтестирование приложений