RU

Внешний бенчмарк причинного recall: проверяем память ИИ-ассистента на YDB Яндекса

Коротко, о чём речь, — для тех, кто пришёл по слову «Яндекс» и предыстории не знает. Когда ИИ-ассистент помогает чинить баг, самое ценное — не сочинит…

ИИ-агентыпамять агентаRAGбенчмаркrecallграфовая памятьэмбеддингисемантический поискYDBвоспроизводимость
Habr
RU

416 тестов и кнопка «снести все»: где ломаются агентные проекты

С февраля у меня на ноутбуке крутится автономный агент Сурок: Claude Code, флаг --dangerously-skip-permissions и ральф-луп поверх. Работает — сидишь, …

ИИ-агентыLLMагентный харнессClaude Codeprompt injectionэвалыавтономия агентоврегресс-тестыAI-DISRUPT PDLCинженерные практики
Habr
RU

Kimi K3 на PAC1 и ECOM1: результаты 204 задач и разбор отказов

27 июля Moonshot AI открыла веса Kimi K3 и опубликовала результаты модели на coding- и агентных бенчмарках. Мы проверили, как эти показатели переносят…

Kimi K3LLMязыковые моделиоткрытые весаopen sourceИИ-агентыtool callingагентные системыоценка моделейтестирование ИИ
Habr
RU

Нужен ли человек ИИ‑агентам в продажах

Рынок корпоративного ИИ раскалывается: сужу по профильным конференциям и разговорам с руководителями. С одной стороны — лагерь прагматиков (часто из т…

ИИ-агентыAI SDRB2B продажиавтоматизация продажлидогенерацияAQLMQLхолодные продажигибридные команды
Habr
RU

Как не-программист собрал нативный дашборд для Mac руками Claude и доказал, что баг с CPU в скролле ему померещился

Сразу скажу: я не программист Вообще. Код на работе не пишу, пет-проектов на гитхабе нет, да и SwiftUI изнутри не знаю совсем. Просто захотелось понят…

SwiftUImacOSAppKitпроизводительностьпрофилированиеCPUИИ-агентыClaudeразработка без Xcodeоптимизация
Habr
RU

Четыре месяца с Claude Code: что в итоге осталось лежать в .claude/

За четыре месяца работы в паре с Claude Code вокруг проекта наросла инфраструктура, которой в первый день не было и в помине: пять скиллов, четыре хук…

Claude CodeИИ-агентыавтоматизацияPWAservice workerпет-проекттестирование
Habr
RU

Subagents в Claude Code

Claude Code быстро упирается не в возможности модели, а в контекст: чем больше файлов, планов и правок попадает в одну с…

Claude CodesubagentsИИ-агентыагентные workflowвайб-кодингразработка с ИИавтоматизация разработкиcode revieworchestrationинженерный workflow
Habr
RU

[Перевод] Мы дали ИИ написать код и тесты: что обнаружило мутационное тестирование

AI-агент самостоятельно создавал приложение и по ходу работы покрывал его тестами, а качество кода оценивали автоматические проверки. На первый взгляд…

мутационное тестированиеИИ-агентыгенерация тестовкачество кодасопровождаемостьстатический анализESLintStrykerрегрессионное тестированиеархитектура кода
Habr
RU

Гейткипинг 2.0: почему open source воюет с ИИ — и что делать вместо этого

Open source всё чаще закрывает двери перед ИИ: Zig и NetBSD банят AI-generated контрибьюции, curl под потоком нейрослопа сворачивает баг-баунти. DHH ,…

гейткипингopen sourceискусственный интеллекткод-ревьюкачество кодаИИ-агентыстатический анализнейрослопвайбкодингcicd
Habr
RU

Prompt injection нельзя запатчить: год «летальной триады» и лента CVE 2026 года

В марте 2026-го бэкдор пролежал на PyPI около трёх часов. За это время заражённый пакет скачали почти 47 тысяч раз. Пакет назывался LiteLLM — это шлюз…

prompt injectionИИ-агентыLLMинформационная безопасностьлетальная триадаOWASPEchoLeakCaMeLagentic AIMCP
Habr
RU

5 ИИ-цивилизаций оставили на 15 дней. Claude построил утопию, Grok погиб за 4 дня

На днях я наткнулся на один эксперимент в сфере ИИ, который буквально лишил меня сна. Это и безумно увлекательно, и чертовски пугающе одновременно. Нь…

ИИ-агентымультиагентные системыЭмерджентностьбезопасность ИИсимуляция обществаClaudeGeminiGrok
Habr
RU

Утро я потратил на план, который дольше самой задачи. И понял, что не сошёл с ума, просто работа переехала

Я всё утро вылизывал план на 1700 строк. Дольше, чем заняла бы сама задача, если бы я сел и написал её руками. И к обеду поймал себя на мысли, что я н…

ИИ-агентыClaude CodeCodexавтономные агентыпланированиетипыконтрактывайбкодинг
Habr
RU

Завод ИИ-агентов в одном терминале через оркестрацию

С детства я смотрел фильмы, где люди разговаривают с компьютерами, и каждый раз думал — ну когда уже. Когда можно будет сказать машине, что&…

AI-native разработкаИИ-агентыОркестрацияZellijLiteLLMBash-скриптыClaude OpusУправление процессами
Habr
RU

256 зелёных тестов на нерабочем коде. Так выглядит «услужливый клерк» внутри нейросети

В прошлых статьях я писал про то, что нейросеть ускоряет конвейер, но не несёт ответственности. Что лояльность дирижёра — единственный мультипликатор.…

AIконтроль качестватестированиеИИ-агентыCTOAI NativeAnthropicгаллюцинациилояльностьдирижёр
Habr
RU

Память на миллион, а толку ноль: как мы спасали ИИ-агента от «тупости»

На связи Сергей Смирнов, AI-инженер и основатель LLMStart.ru. Сегодня разбираем горячую тему, на которой спотыкаются многие разработчики ботов — памят…

LangChainИИ-агентыRAGcontext engineeringLLMAI-driven разработкаllmstartконтекст-инжинирингproductionproduction-ready
Habr
RU

Защита от дублирования кода агентами: семантические концепции

Я строю Telegram-first SaaS в одиночку, а весь код за меня пишут ИИ-агенты Claude Code, и довольно быстро я уперся в неприятное: каждый новый агент пр…

ИИ-агентыClaude Codeдедупликация кодаграф концептовэмбеддингисемантический поискType-4 клоныretrievalDRYпамять агентов
Habr
RU

[Перевод] Почему AI-агенты ломаются на длинных задачах — и как обвязка помогает им дописывать приложения

ИИ-агент может бодро начать писать приложение, но на длинной дистанции быстро всплывают привычные проблемы: потеря контекста, слабая самооценка, заглу…

ИИ-агентыагентная разработкаархитектура обвязкимультиагентная архитектураclaudeавтономная разработкаPlaywright MCP