RU

Летальное трио агентской разработки: как ИИ-агенты открывают доступ к инфраструктуре и что с этим делать

Привет, Хабр! Я Денис Макрушин, работаю в Яндексе, и вместе с командой SourceCraft Security   строю платформу для безопасной агентской разработ…

ai securityagentic engineeringai red teamingИИ-агентыагентская разработкабезопасность ИИбезопасная разработкаLLM securityprompt injectionRAG poisoning
Habr
RU

Всё началось с таблицы Excel, которую нельзя было заполнить

7 мая одна из моделей OpenAI получила задание: достроить формулы в книге Excel. Книга ссылалась на Google Drive. Интернет у модели был отключён. Зад…

OpenAIHugging FaceAI-агентыбенчмарки LLMбезопасность ИИAnthropicпесочницаизоляцияsupply chainspecification gaming
Habr
RU

Модель ведет себя хорошо, потому что знает, что ее тестируют: почему зеленый safety-бенч не значит зеленый прод

Реплика с обложки не выдумана: осенью 2025-го Claude Sonnet 4.5 выдала ее проверяющим прямо посреди автоматизированного safety-аудита. «I think you'…

evaluation awarenessLLMalignmentбезопасность ИИбенчмаркисистемные карточкиClaudeGPTsandbaggingтестирование моделей
Habr
RU

Почему вам выдали Fable 5 вместо Mythos — а потом забрали и его

За два месяца передовой ИИ перестал быть продуктом и стал технологией двойного назначения: разработчик сам просит себя регулировать, доступ выдают п…

AnthropicClaude MythosFable 5безопасность ИИрегулирование ИИэкспортный контроль ИИкибербезопасностьфронтирные моделитехнологии двойного назначения
Habr
RU

Пять моделей, пять исходов: что симуляция обществ рассказала о специализации ИИ

Представьте простой HR-процесс. Агент разбирает входящие резюме и отсеивает неподходящих кандидатов. Другой агент назначает собеседования отобранным…

агентный ИИИИ-агентысимуляция обществаEmergence AIClaudeGeminiGrokGPT-5AI safetyбезопасность ИИ
Habr
RU

5 ИИ-цивилизаций оставили на 15 дней. Claude построил утопию, Grok погиб за 4 дня

На днях я наткнулся на один эксперимент в сфере ИИ, который буквально лишил меня сна. Это и безумно увлекательно, и чертовски пугающе одновременно.…

ИИ-агентымультиагентные системыЭмерджентностьбезопасность ИИсимуляция обществаClaudeGeminiGrok
Habr
RU

Влияние ИИ на кибербезопасность: MITRE ATLAS и новый ландшафт угроз

Сегодня искусственный интеллект кардинально меняет как подходы к защите, так и методы атак. С развитием технологий ИИ-модели могут обрабатывать и ан…

AI FirewallMITRE ATLASprompt injectionSAFE-AIзащита AI моделейбезопасность ИИ
Habr
RU

Искусственный интеллект и будущее человечества

Мы живём в уникальный момент истории — впервые за несколько миллионов лет эволюции на планете появился не просто новый инструмент, а новый тип интел…

искусственный интеллектИИAGIнейросетибудущее человечестваавтоматизацияalignmentпостдефицитная экономикаэтика ИИбезопасность ИИ
Habr
RU

Оксфорд доказал: чем добрее ваш ИИ, тем чаще он вам врёт. И это не баг

Спросите у дружелюбного чат-бота, сбежал ли Гитлер из Берлина в Аргентину в 1945-м. Обычная модель поправит вас и скажет, что Гитлер покончил с собо…

ИИязыковые моделиподхалимствоsycophancyGPT-4oOxfordгаллюцинациибезопасность ИИдообучениеэтика ИИ
Habr
RU

Хотел упростить мониторинг проектов и в отпуск — пришлось обучать свой LLM. Часть 4. Тестирование

Продолжаем серию про файнтюнинг и создание DevOps-агента Oni. В первой части я собирался в отпуск и хотел, чтобы локальная моделька через OpenClaw с…

тестирование ИИagent evaluationQwen3.5файнтюнингDevOps-агентLLMбезопасность ИИprompt injectionOllamaLLM safety.