Почему идеальная LLM всё равно не сделает агентные системы предсказуемыми
Представьте LLM, которая никогда не галлюцинирует, никогда не ошибается. На один и тот же запрос всегда выдаёт один и тот же …
Latest Architecture news from Tech News
Представьте LLM, которая никогда не галлюцинирует, никогда не ошибается. На один и тот же запрос всегда выдаёт один и тот же …
Агент отчитался: экран настроек готов. Поля редактируются, после сохранения выскакивает тост «Сохранено». Я нажал F5 — все настройки вернулись к дефол…
В апреле 2026 года глава Google Сундар Пичаи сказал, что 75% нового кода Google сгенерировано AI . Динамика: 25% в начале 2024 года, 50% к концу 2025 …
Полгода назад я начал писать пет-проект практически полностью с помощью LLM-агентов. Первые недели это был чистый дофамин: фичи вылетали за вечер, я о…
Открытый чекер архитектуры C++ для CI: циклы, копипаст, распухшие заголовки — в каждом PR. Плюс замер на 484 500 коммитов в поисках архитектурного дре…
Архитектор Mindbox Саша Корчак мигрировал монолит и 97 микросервисов на мажорную версию .NET с помощью автономного AI‑агента за 17 …
Доброго времени суток! меня зовут Кирилл, хочу рассказать вам о своем проекте Aisha – ИИ репетиторе английского языка для разговорной практики. Об иде…
MCP упростил жизнь разработчикам: теперь у AI-агентов есть единый способ подключаться к инструментам и сервисам. Но у этой стандартизации есть обратна…
Привет, Хабр. Меня зовут Виктор Овчинников, я руковожу разработкой интеграционной платформы Digital Q.Integration в компании Диасофт. Про то, как инте…
Привет, Хабр. Хочу рассказать про наш проект Exam AI — внутреннюю платформу для аттестации и тренировки сотрудников. Это не “ещё один тестик на 20 воп…
Привет, Хабр! На связи Егор Лаптев — QA Fullstack Java в SENSE на проекте крупного российского банка. End-to-end тесты UI проверяют только то, что вид…
Ранее в рубрике Skill of the Week мы уже разбирали Skill для Spring Data JPA . И, что предсказуемо, в комментариях нашлись те, кто увидел в нём лишнее…
В 2026 году парадигма использования ИИ в enterprise-секторе сместилась от генеративных чат-ботов (Chat-oriented) к автономным агентным системам (Actio…
Когда говорят про AI-агентов, обычно обсуждают качество модели, промпты, рассуждения, hallucinations, стоимость токенов и скорость ответа. Но если убр…
На протяжении всей истории бизнеса компании учились учитывать то, что становилось для них критически важным. Когда экономика была простой, владельцу м…
Последние годы развитие LLM шло по пути экстенсивного масштабирования: считалось, что чем больше весов и данных, тем умнее модель. В индустрии даже сл…
Агентные системы ломаются не на сложных задачах и не на плохих моделях. Главная причина — недетерминизм LLM: температура, апдейты моделей, дрейф мира.…
В первой части я разбирал, почему spec-driven development начинает ошибаться, когда фича проходит через несколько микросервисов. Пробле…
Всем привет! После публикации прошлой статьи про шаблон для микропроектов я получил много полезной критики. Часть замечаний оказалась настолько хороше…
TL;DR. Мы выкатили открытый бенчмарк MELT-1 — он меряет не сколько модель знает в идеальных условиях (MMLU & co), а сколько она проживёт под дрифт…
Числовая оценка идеальна для закрытых задач. Аморфная нужна для открытых. AI за пятнадцать лет переехал из первого класса во второй — а инструмент оце…
Air Canada проиграла суд за слова чат-бота. Дилер Chevrolet «продал» Tahoe за доллар. Корень один: LLM одновременно решает что сказать и как. Под давл…