RU

Правильный код мы отклоняем — и так задумано

Мой валидатор забраковал ответ, сославшись на несуществующую статью, — а ведь именно он поставлен ловить галлюцинации. После этого я собрал конвейер…

LLMгаллюцинациивалидацияllm-судьиpydanticконформное предсказаниеMAPIEragнадежностьпайплайн
Habr
RU

Жители Валдории живут 147 лет, а страна граничит с Германией и Японией одновременно. Исследование MiroFish. Часть 2

Вторая статья из трёх об исследовании MiroFish, открытого стека мультиагентной симуляции общества. В первой части изложены методология исследования…

MiroFishGraphRAGNeo4jLLMгаллюцинацииаудитвоспроизводимостьмультиагентные системы
Habr
RU

Как не дать ИИ‑психологу поддакивать и галлюцинировать. Инженерный разбор safety‑обвязки

Универсальная языковая модель отвечает складно, круглосуточно и почти бесплатно. Для домена, где на другом конце человек в уязвимом с…

LLMsafetyмультиагентные системыгаллюцинацииRLHFИИ-психологментальное здоровье
Habr
RU

Почему идеальная LLM всё равно не сделает агентные системы предсказуемыми

Представьте LLM, которая никогда не галлюцинирует, никогда не ошибается. На один и тот же запрос всегда выдаёт один и тот ж…

LLMмногоагентные системыхаосгаллюцинацииai-агенты
Habr
RU

AI‑тренер по CS2 на DeepSeek: где LLM выдумывает и почему семь недель стоили $1,45

Всем привет. Я много лет играю в Counter-Strike и тренируюсь, как большинство: захожу в Deathmatch «размяться», играю три катки, тильтую, выхожу. Се…

LLMDeepSeekгаллюцинациипет-проектASP.NET CoreSQLiteEntity FrameworkCounter-Strike 2
Habr
RU

Квантование ломает вызов инструментов не так, как показывает BFCL: проверил на MCP-серверах

Как на самом деле квантование ломает вызов инструментов? Собрал бенчмарк QuantMCP, протестировав модели на 4 ГБ VRAM не на синтетике, а на реальных…

квантованиеfunction-callingMCPLLMбенчмаркQuantMCPдеградациягаллюцинацииJSON-схемаMCP-серверы
Habr
RU

[Перевод] Когда ИИ-агент ошибается молча: 6 отказов, которые не видно по ответу

ИИ-агент может написать убедительный ответ и при этом вызвать не тот инструмент, потерять состояние между ходами или принять неверное решение с высо…

ии-агентagentic aiвалидация ИИLLMгаллюцинациииспользование инструментовмногошаговое рассуждениеотказоустойчивость
Habr
RU

Декодирование в LLM как эволюция стратегий

В этой статье мы проведем технический анализ эволюции стратегий декодирования, рассмотрим их внутреннюю механику и предложим критерии выбора оп…

LLMдекодированиегенерация текстастратегии декодированияGreedy SearchBeam SearchDoLaTop-p Samplingгаллюцинациисемантическая неопределённость
Habr
RU

Может ли софт помнить смысл экспертных решений?

Системы и так уже многое помнят. Они помнят действия пользователей, логи, тикеты, код, комментарии, трассировки, алерты и ответы моделей. Иногда они…

AIпамятьэкспертные решениязнаниеконтекстрекомендациидовериегаллюцинациисофтХабр
Habr
RU

[Перевод] Все демонические насельники ИИ… по старшинству

Гоблины, призраки, монстры, богини: фантастические твари и где они обитают. В конце апреля OpenAI  опубликовала у себя в блоге пост , в котором…

большие языковые моделиискусственный интеллектдемонологияЛоабНоваСиднишогготгаллюцинациинейронные сетисознание
Habr
RU

Когда чат-бот продаёт Chevrolet за доллар: как тестировать и мониторить LLM-приложения

Генеративные модели разблокировали огромное количество новых продуктов и новых фич в уже существующих. Поиграться с ними успел, кажется, каждый. И с…

LLMоценка качества LLMLLM-as-a-judgeтестирование LLMмониторинг LLMRAGгаллюцинацииdata driftregression testingEvidently
Habr
RU

[Перевод] Верификация программного обеспечения в эпоху искусственного интеллекта

Генеративный ИИ возродил давнее обещание: что нам больше не придётся писать программы — что достаточно будет лишь сформулировать, что требуется , а…

генеративный ИИбольшие языковые моделиверификация ПОпроектирование по контрактуEiffelAutoProofинженерия требованийгаллюцинацииформальные методы
Habr
RU

Системный промпт или галлюцинация: как я проверял AI-ассистентов и что ответили bug bounty-команды

В марте я проверял, можно ли уговорить AI-ассистентов выдать что-то похожее на системный промпт. Ответы выглядели убедительно: внутренние правила, т…

AI-ассистентысистемный промптгаллюцинацииbug bountyобход ограниченийуязвимостиинформационная безопасностьязыковые моделиАлисаGigaChat
Habr
RU

Оксфорд доказал: чем добрее ваш ИИ, тем чаще он вам врёт. И это не баг

Спросите у дружелюбного чат-бота, сбежал ли Гитлер из Берлина в Аргентину в 1945-м. Обычная модель поправит вас и скажет, что Гитлер покончил с собо…

ИИязыковые моделиподхалимствоsycophancyGPT-4oOxfordгаллюцинациибезопасность ИИдообучениеэтика ИИ
Habr
RU

256 зелёных тестов на нерабочем коде. Так выглядит «услужливый клерк» внутри нейросети

В прошлых статьях я писал про то, что нейросеть ускоряет конвейер, но не несёт ответственности. Что лояльность дирижёра — единственный мультипликато…

AIконтроль качестватестированиеИИ-агентыCTOAI NativeAnthropicгаллюцинациилояльностьдирижёр
Habr