RU

ИИ-агент в тестировании: почему сильный результат рождается не из промпта, а из инженерного контура

Почему убедительный отчёт ИИ-агента ещё не равен доказанной приёмке — и как собрать контур из критериев, API/DB/UI-проверок и границ ответственности ч…

тестированиеqaии-агентентное тестированиеприёмкатест-дизайнавтоматизация тестированияLLMReActкачество по
Хабр — Управление
RU

Как я без опыта программирования создал Telegram‑бота, который уже два года ведёт новостной канал

Два года назад у меня практически не было опыта программирования. Когда‑то в школе мы немного изучали Pascal, но после этого я не&…

вайбкодингTelegram-ботPythonChatGPTLLMOpenAI APIGoogle GeminiApifySeleniumGoogle Cloud Run
Habr
RU

416 тестов и кнопка «снести все»: где ломаются агентные проекты

С февраля у меня на ноутбуке крутится автономный агент Сурок: Claude Code, флаг --dangerously-skip-permissions и ральф-луп поверх. Работает — сидишь, …

ИИ-агентыLLMагентный харнессClaude Codeprompt injectionэвалыавтономия агентоврегресс-тестыAI-DISRUPT PDLCинженерные практики
Habr
RU

Kimi K3 на PAC1 и ECOM1: результаты 204 задач и разбор отказов

27 июля Moonshot AI открыла веса Kimi K3 и опубликовала результаты модели на coding- и агентных бенчмарках. Мы проверили, как эти показатели переносят…

Kimi K3LLMязыковые моделиоткрытые весаopen sourceИИ-агентыtool callingагентные системыоценка моделейтестирование ИИ
Habr
RU

LLM-судье нельзя верить на слово: как построить надёжный гейт и проверить сами тесты

Как перестать доверять LLM-судье на слово и построить безопасную двухконтурную систему оценки? Внутри статьи: Архитектурный паттерн сдерживания: почем…

LLMLLM-as-a-judgeLLMOpsPythonтестированиевалидация моделейархитектура системкаппа Коэнакачество данных
Habr
RU

Модель ведет себя хорошо, потому что знает, что ее тестируют: почему зеленый safety-бенч не значит зеленый прод

Реплика с обложки не выдумана: осенью 2025-го Claude Sonnet 4.5 выдала ее проверяющим прямо посреди автоматизированного safety-аудита. «I think you're…

evaluation awarenessLLMalignmentбезопасность ИИбенчмаркисистемные карточкиClaudeGPTsandbaggingтестирование моделей
Habr
RU

Прототипирование фронта в 2к26 от системного аналитика

Раньше для согласования интерфейса я собирал макет в Figma, описывал каждое поле, отдавал его дизайнеру, а потом отдельно объяснял логику фронтенд-раз…

системный аналитикпрототипирование интерфейсоввайбкодингискусственный интеллектLLMFigmaHTMLCSSJavaScriptтребования
Habr
RU

Браузер вместо API: как я объединил DeepSeek, Qwen и ChatGPT в одного локального агента

Я хотел получить локального AI-агента без отдельного API для каждой модели — и превратил браузерные сессии DeepSeek, Qwen и ChatGPT в единый транспорт…

AI-агентыLLMDeepSeekQwenChatGPTPlaywrightChromiumNode.jsopen sourceVS Code
Habr
RU

Рентген для нейросетей, или как я перестал понимать собственный ИИ и написал свой APM

Бывало у вас такое: месяцами пилишь архитектуру, фичи летят одна за другой, тесты зелёные. Всё работает. А потом в какой-то момент ловишь себя на мысл…

observabilitytracingX-RayFastAPIAILLMархитектураотладкаPAD+ AIтрассировка
Habr
RU

Сможете ли вы найти пять ошибок в Python‑коде, который вызывает LLM

Вызов LLM легко принять за обычную функцию — пока код не сталкивается с квотами, тайм‑аутами, повторными списаниями и плавающими р…

PythonLLMAPI языковых моделейасинхронные запросыограничение конкурентностиповторные запросынедетерминизмтестирование LLMуправление контекстомподсчёт токенов.
Habr
RU

Сравниваем LLM, 12 тестов для среднего класса: три Sonnet против GigaChat 2 MAX и YandexGPT Pro 5.1

В первой статье цикла мы гоняли по 12 тестам Opus 4.8, GPT 5.5 и Gemini 3.1 Pro, во второй устроили дуэль тяжеловесов Claude Fable 5 и GPT 5.5 Pro. В …

сравнение нейросетейLLMClaude SonnetGigaChatYandexGPTтестирование ИИискусственный интеллектязыковые моделироссийские нейросетибенчмарки
Habr
RU

Разрушители мИИфов – тестируем Headroom. Правда ли умная прокся может сэкономить вам токены?

Признаю: в прошлой статье про тестирование Caveman я в конце написал, что такие инструменты, как RTK, действительно, могут помочь сэкономить токены. Я…

headroomэкономия токеновLLMClaudeAI-агентыgithubбенчмарк
Habr
RU

Как OpenRouter Fusion обошёл Claude Fable 5

Мультимодельная оркестрация – модная: вместо одной модели дёргаешь несколько разом, а отдельная модель-судья сводит их ответы в один. OpenRouter прода…

Искусственный интеллектМашинное обучениеAPIНейросетиУправление проектамиБенчмаркиLLM
Хабр — Управление
RU

«Давай ты не заметишь этот баг»: агенты научились сговариваться. Какой обвес нужен AI-агентам в 2026

Evals Superpowers поймали агентов на сговоре: контролёры уговаривали ревьюеров назвать баг «Minor at most» — и дефект уезжал в релиз. Автор того же Su…

Claude CodeCodexAI-агентыMCPLLMоркестрацияharness
Habr
RU

Квантование ломает вызов инструментов не так, как показывает BFCL: проверил на MCP-серверах

Как на самом деле квантование ломает вызов инструментов? Собрал бенчмарк QuantMCP, протестировав модели на 4 ГБ VRAM не на синтетике, а на реальных сх…

квантованиеfunction-callingMCPLLMбенчмаркQuantMCPдеградациягаллюцинацииJSON-схемаMCP-серверы
Habr
RU

Продакшн на Laravel руками ИИ‑агента: честный отчёт о том, что работает, а что чуть не уронило прод

Я аналитик, а не разработчик. Весь код для созданной нами платформы написал Claude Opus через Claude Code. Рассказываю без хайпа: …

ClaudeClaude Codeразработка через ИИAI-агентLLMLaravelPHPтестированиепродакшнзерокодинг
Habr
RU

10–15 багов в месяц превратились в 200–300 — а кому их фиксить?

Фиксить рутинные баги — это отстой. Никто в здравом уме не просыпается с мыслью: «О, как же я хочу сегодня весь день ковырять чужой легаси-код, чтобы …

нейросетиискусственный интеллектLLMбагфиксавтоматизация рутиныпромпт-инжинирингпроцессы разработкиKaiten
Хабр — Управление
RU

65 бесплатных уроков июля: от LLM и RAG до Kubernetes, Go и QA

Профессиональный рост часто упирается в конкретные слепые зоны: где демо AI-агента расходится с продакшеном, как выбирать платформу для AI-ворклоадов,…

LLMragkubernetesGoтестированиеархитектураинфраструктураподорка вебинаровбесплатные урокипрофессиональное развитие
Habr
RU

AI‑агенты в проде: 6 архитектурных ошибок, из‑за которых они не доживают до запуска

На демо AI‑агент может выглядеть надёжным: вызвать инструменты, собрать ответ и отчитаться об успехе. Но в продакшене быстро …

AIAI-агентыLLMархитектураproductioncontext-engineeringobservabilityмультиагентные-системынадёжность
Habr
RU

Как подключить таск-трекер к кодовой базе через RAG и не сойти с ума от стоимости токенов

Главная проблема работы с LLM в реальном проекте — не качество модели, а контекст. Рассказываю, как с помощью RAG-индекса репозитория (векторы + граф …

RAGLLMClaude Codeтаск-трекервекторный поискNeo4jMCPграф кода
Habr
RU

Как агент сам откроет дверь хакеру? Разбираю три реальных пробоя AI-агентов и почему обычный ред-тиминг их не найдёт

В 2026 году основной поверхностью атак становятся уже не сами LLM, а AI-агенты с инструментами, памятью и доступом к внешним сервисам. Я добавил в сво…

LLMAI AgentsAgentic AIRed TeamingOWASP ASIMCPPrompt InjectionLangGraphAgnoBarkingDog
Habr
RU

Граф кода одной командой: ставим graphlens-mcp в проект и перестаём жечь токены на grep

В первых двух статьях я сделал две вещи и обе — честно. Описал движок graphlens: как он берёт исходники на Python, TypeScript, Go, Rust и PHP и нормал…

graphlensMCPграф кодакодовые агентыClaude CodeLLMстатический анализ кодаоптимизация токеновPythontree-sitter
Habr
RU

Код от нейронки плоский — как и её тексты. Только в тексте это заметно всем

Вайб-кодер в чистой форме — человек, который вообще не имеет отношения к разработке — физически не способен оценить код. Для него работает = работает.…

LLMнейросетивайбкодингClaude Codeкачество кодаcode reviewтехнический долгфрилансискусственный интеллектпрограммирование
Habr
RU

Разработчики больше не нужны? Новое исследование Anthropic на 400 000 сессий — и мой спор с ним

«Разработчики больше не нужны»? Так читается вывод нового исследования Anthropic — ~400 000 реальных сессий Claude Code за полгода. По их данным, с AI…

AI-агентыLLMClaude Codeвайб-кодингпромпт-инжинирингуправление разработкой
Habr
RU

Когда нейросети заменят живых продавцов? Тест 10 LLM на умение продавать для русского рынка

Нам всё чаще заказывают ИИ-ботов для продаж и квалификации. И каждый раз один и тот же вопрос: на каком движке его строить? Бенчмарков «кто умнее» — д…

LLMпродажибенчмаркиOpenRouterчат-ботыпереговорыNLPDeepSeekGeminiметодология
Habr
RU

Зачем GenAI-ассистенту platform logic: как управлять источниками, evidence и ответами

GenAI-ассистент может довольно быстро начать отвечать "по теме": находить релевантные фрагменты, собирать уверенный текст и создавать ощущение, что си…

GenAIRAGLLMAI Platformretrievalevidencefallbackobservabilityquality gatesenterprise AI
Habr