RU

ИИ-агент вместо тестировщика: 20 копеек за диалог и причина, почему вас не заменит llm

Привет, Хабр! Меня зовут Никита Хробостов, я QA-инженер в Just AI. Тестирую диалоговые системы: чат-ботов и голосовых ботов, часть из них с обращени…

llmтестированиеqaавтоматизация тестированиячат-ботыголосовые ботыnlullm-as-a-judgecodex
Habr
RU

Как оценивать качество LLM, RAG и AI‑агентов: метрики, тестирование и LLM‑as‑a‑Judge

В 2024 году исследователи провели простой эксперимент: взяли тесты с вариантами ответа и начали менять варианты местами. Сами вопросы и со…

оценка качества llmтестирование llmllm evaluationai-агентыqaqa automation engineerllm-as-a-judgeтестирование RAGметрики LLMрегрессионное тестирование
Habr
RU

Собрал ИИ-бенчмарк под себя из 2 месяцев своих сессий — и дорогие модели проиграли дешёвым

Два месяца своих сессий с ИИ скормил скрипту и собрал бенчмарк под СВОЮ работу — не под чужой лидерборд. Результат: тройка «лучших открытых моделей»…

llmbenchmarkllm-as-a-judgegemmaglmself-hosting
Habr
RU

Свой инструмент для бенчмаркинга ИИ-агентов: архитектура, надёжность и интеграция с Airflow

Всем привет! Мы создаём GraphRAG-систему и нам постоянно приходится тестировать новые гипотезы: менять подходы к поиску по графу, обработку контекст…

бенчмаркингpythonairflowllm-as-a-judgeагент
Habr
RU

[Перевод] Месть дата-сайентиста: почему LLM не отменили нашу профессию

LLM упростили запуск AI-функций до нескольких вызовов API, и дата-сайентисты будто бы выпали из критического пути. На практике именно здесь начинают…

harnessData Scienceдата-сайентистоценка моделейllmllm-as-a-judgeметрики качестваанализ ошибокразметка данныхmlops
Habr