RU

Как оценивать качество LLM, RAG и AI‑агентов: метрики, тестирование и LLM‑as‑a‑Judge

В 2024 году исследователи провели простой эксперимент: взяли тесты с вариантами ответа и начали менять варианты местами. Сами вопросы и со…

оценка качества llmтестирование llmllm evaluationai-агентыqaqa automation engineerllm-as-a-judgeтестирование RAGметрики LLMрегрессионное тестирование
Habr
RU

Flaky-тесты — не приговор: эксперименты по ускорению выпуска релизов

Привет, Хабр! Меня зовут Юра Жанов, я занимаюсь автоматизацией тестирования в hh.ru . Про flaky-тесты написано много, борьбу с ними не прекращаем и…

qa automationqa testingqa managementqa engineerqa automation engineerqaqa mobileтестированиетестирование сайтовтестировщик