RU

Квантование ломает вызов инструментов не так, как показывает BFCL: проверил на MCP-серверах

Как на самом деле квантование ломает вызов инструментов? Собрал бенчмарк QuantMCP, протестировав модели на 4 ГБ VRAM не на синтетике, а на реальных сх…

квантованиеfunction-callingMCPLLMбенчмаркQuantMCPдеградациягаллюцинацииJSON-схемаMCP-серверы
Habr
RU

Когда чат-бот продаёт Chevrolet за доллар: как тестировать и мониторить LLM-приложения

Генеративные модели разблокировали огромное количество новых продуктов и новых фич в уже существующих. Поиграться с ними успел, кажется, каждый. И сце…

LLMоценка качества LLMLLM-as-a-judgeтестирование LLMмониторинг LLMRAGгаллюцинацииdata driftregression testingEvidently
Habr
RU

Оксфорд доказал: чем добрее ваш ИИ, тем чаще он вам врёт. И это не баг

Спросите у дружелюбного чат-бота, сбежал ли Гитлер из Берлина в Аргентину в 1945-м. Обычная модель поправит вас и скажет, что Гитлер покончил с собой …

ИИязыковые моделиподхалимствоsycophancyGPT-4oOxfordгаллюцинациибезопасность ИИдообучениеэтика ИИ
Habr
RU

256 зелёных тестов на нерабочем коде. Так выглядит «услужливый клерк» внутри нейросети

В прошлых статьях я писал про то, что нейросеть ускоряет конвейер, но не несёт ответственности. Что лояльность дирижёра — единственный мультипликатор.…

AIконтроль качестватестированиеИИ-агентыCTOAI NativeAnthropicгаллюцинациилояльностьдирижёр