RU

7 ошибок в оценке качества LLM‑систем в продакшене

LLM‑фича может месяцами показывать хорошие метрики и при этом регулярно ошибаться на реальных запросах. В статье разберём 7 типи…

LLMоценка качества LLMLLM evaluationLLM-as-a-JudgeнаблюдаемостьOpenTelemetryтрассировкапродакшенметрики качестватестирование LLM
Habr
RU

Рентген для нейросетей, или как я перестал понимать собственный ИИ и написал свой APM

Бывало у вас такое: месяцами пилишь архитектуру, фичи летят одна за другой, тесты зелёные. Всё работает. А потом в какой-то момент ловишь себя на мы…

observabilitytracingX-RayFastAPIAILLMархитектураотладкаPAD+ AIтрассировка
Habr
RU

Почему «3,3 В на мультиметре» ещё не означает, что питание хорошее

Мультиметр показывает ровные 3,3 В, но устройство всё равно зависает, перезагружается и ловит ошибки? Разбираем, почему среднее значение напряжения…

электроникасхемотехникатрассировкамультиметросциллограф
Habr
RU

OTel Collector в кастомизации Битрикс24: подключаем Observability

Рассказываем про инструмент для наблюдения за кастомизациями Битрикс24 — телеметрическую инфраструктуру на базе OpenTelemetry Collector. Для проекто…

open telemetryмониторингobservabilityлогированиетрассировкаgrafanaclickhousedockerdevopsбитрикс24
Habr
RU

Как оценивать ИИ-агентов в проде: нижняя планка, трассы и кодовые проверки

Если агент уже ходит в инструменты, читает документы, меняет состояние системы и принимает часть решений сам, проверка одного промпта почти ничего н…

evalaiai-агентыllmтестированиеdata analysisагенты в продакшенеагенты иитрассировкаharness engineering