RU

7 ошибок в оценке качества LLM‑систем в продакшене

LLM‑фича может месяцами показывать хорошие метрики и при этом регулярно ошибаться на реальных запросах. В статье разберём 7 типи…

LLMоценка качества LLMLLM evaluationLLM-as-a-JudgeнаблюдаемостьOpenTelemetryтрассировкапродакшенметрики качестватестирование LLM
Habr
RU

Вы даже не поймете, что он сломан: почему панель мониторинга зеленая, а агент врет третий день подряд

Я давно привыкла первым делом спрашивать «а как это упадет?». Когда в наш ландшафт пришли ИИ‑агенты, выяснилось интересное: привычные отве…

ai agentobservabilityproduction-readyагентные системыагентные воркфлоунаблюдаемостьметрики качества
Habr
RU

AI‑агенты в проде: как оценивать качество, стоимость и стабильность

Хайп вокруг AI‑агентов продолжается. Компании активно внедряют агентов в продукты, внутренние процессы и даже повседневную рабочую рутину сотру…

llm-агентметрики качестваai-агентыаналитикаискусственный интеллект
Habr
RU

Почему QA не уменьшает технический долг — и именно поэтому он так важен

За последние десять лет роль тестирования изменилась гораздо сильнее, чем за предыдущие двадцать. Если раньше QA воспринимался как последний рубеж п…

технический долгнаблюдаемостьметрики качестваархитектурный долгтестирование по
Habr
RU

Как повысить отказоустойчивость сервисов в кластере виртуализации с помощью оптимизации их распределения

Всем привет! Это первая публикация из цикла статей про распределение сервисов в кластере виртуализации. В статье будет описан один из подходов к реш…

инфраструктуравиртуализациякластерсервисынадёжностьотказоустойчивостьоптимизациявиртуальные машиныбалансировка нагрузкиметрики качества
Habr
RU

[Перевод] Месть дата-сайентиста: почему LLM не отменили нашу профессию

LLM упростили запуск AI-функций до нескольких вызовов API, и дата-сайентисты будто бы выпали из критического пути. На практике именно здесь начинают…

harnessData Scienceдата-сайентистоценка моделейllmllm-as-a-judgeметрики качестваанализ ошибокразметка данныхmlops
Habr
RU

Как мы научили ИИ-агента отвечать за свои слова: 10 000 сообщений, Венгерский алгоритм и немного магии

На связи Сергей Смирнов, AI-инженер и основатель LLMStart.ru. Сегодня разбираем самое больное место разработки ИИ-агентов — как доказать, что они ре…

evaluationметрики качестваLLM-агентыRagasLangFuseRAGВенгерский алгоритмAI-driven разработкаLangChainlangchain агенты.
Habr
RU

От RAG-прототипа к агенту в продакшн: путь по метрикам, а не по моде

На связи Сергей Смирнов, AI-инженер LLMStart.ru. Сегодня расскажу о полноценном кейсе, который мы делали для компании Айтон: агенте-консультанте по…

RAGLLMИИ-агентыLangChainLangFuseRagasметрики качестваcontext engineeringмультимодальностьии
Habr
RU

Инженерия качества: Как перестать надеяться на удачу и начать измерять своих ИИ-агентов [Часть 2]

Продолжаем рассмотрение, того как правильно оценивать качество ИИ систем, в данной части поговорим о двух крайне полезных метриках: одна универсальн…

метрики качестваragasai-агенты
Habr
RU

Почему бенчмарки в AI сломались — и что с этим делать в понедельник

Числовая оценка идеальна для закрытых задач. Аморфная нужна для открытых. AI за пятнадцать лет переехал из первого класса во второй — а инструмент о…

llmбенчмаркиоценка LLMагентные системыai-агентызакон гудхартаметрики качестваанализ и проектирование системкритическое мышлениенейросети