RU

Внешний бенчмарк причинного recall: проверяем память ИИ-ассистента на YDB Яндекса

Коротко, о чём речь, — для тех, кто пришёл по слову «Яндекс» и предыстории не знает. Когда ИИ-ассистент помогает чинить баг, самое ценное — не сочинит…

ИИ-агентыпамять агентаRAGбенчмаркrecallграфовая памятьэмбеддингисемантический поискYDBвоспроизводимость
Habr
RU

Как принудить нейросеть рассказать про ваш продукт. Часть 2 из 3

Начну с тезиса, который большинство классических сеошников и маркетологов, честно говоря, не очень любят. Но именно с него начинается понимание, что т…

GEOнейросетинейровыдачаграундингфакт-чекингличный брендКарта смысловE-E-A-TAI-поискRAG
Habr
RU

Сжатие декодерных эмбеддеров: как ужать 8B до продакшена без потери recall

Декодерный эмбеддер 7–8B дает качество, но платит за него памятью, latency и деньгами. Разбираем все оси сжатия - int8, int4, binary + rescoring, PQ, …

сжатие эмбеддинговквантизацияэмбеддингиembeddingsRAGQdrantQwen3binary quantizationMatryoshkaretrieval
Habr
RU

Как подключить таск-трекер к кодовой базе через RAG и не сойти с ума от стоимости токенов

Главная проблема работы с LLM в реальном проекте — не качество модели, а контекст. Рассказываю, как с помощью RAG-индекса репозитория (векторы + граф …

RAGLLMClaude Codeтаск-трекервекторный поискNeo4jMCPграф кода
Habr
RU

Зачем GenAI-ассистенту platform logic: как управлять источниками, evidence и ответами

GenAI-ассистент может довольно быстро начать отвечать "по теме": находить релевантные фрагменты, собирать уверенный текст и создавать ощущение, что си…

GenAIRAGLLMAI Platformretrievalevidencefallbackobservabilityquality gatesenterprise AI
Habr
RU

Когда чат-бот продаёт Chevrolet за доллар: как тестировать и мониторить LLM-приложения

Генеративные модели разблокировали огромное количество новых продуктов и новых фич в уже существующих. Поиграться с ними успел, кажется, каждый. И сце…

LLMоценка качества LLMLLM-as-a-judgeтестирование LLMмониторинг LLMRAGгаллюцинацииdata driftregression testingEvidently
Habr
RU

Как я мерил точность ИИ в распознавании еды: бенчмарк, LLM-as-judge и баг с варёной гречкой

Строю приложение для подсчёта калорий по фото. Пользователь снимает тарелку, модель определяет блюдо, считает КБЖУ. Идея не новая, но мне важно, чтобы…

LLMбенчмаркраспознавание едыcomputer visionRAGGeminiподсчёт калорийLLM-as-judgeоценка качества моделейнутриенты
Habr
RU

Что такое контекстное окно и почему модели забывают

Ты час разговариваешь с ChatGPT. Даёшь контекст, объясняешь задачу, уточняешь детали. А потом модель вдруг начинает противоречить тому, что говорила р…

контекстное окноLLMтокеныпамять ИИChatGPTязыковые моделиlost in the middleRAGGPTконтекст
Habr
RU

Агентные фреймворки: обещали революцию,  что осталось в 2026

Два года назад все хотели агента, который «сам пишет код, сам его тестирует и сам деплоит в прод».  Сейчас 2026 год. Давайте честно поговорим о т…

LLM-агентыLangChainLangGraphAutoGenMCPRAGагентные системыAI в продакшенеLlamaIndex
Habr
RU

Мультимодальность в ИИ-агентах: картинки на вход, картинки на выход и отказ от Multimodal RAG

На связи Сергей Смирнов, AI-инженер и основатель LLMStart.ru. Сегодня разбираем мультимодальность в ИИ-агентах на реальном примере из продакшена. Мы п…

RAGmultimodal RAGмультимодальностьvision LLMimage-onlyColPaliCLIPLLM-агентыLangChaincontext engineering
Habr
RU

Почему RAG — это не просто «добавить поиск»: latency, качество и выбор стратегии retrieval

Когда говорят про RAG, его часто описывают как простой способ улучшить LLM‑систему: добавить поиск по внешним данным, найти релевантный…

RAGLLMretrievallatencyChromaOllamavector searchembeddingstop-kchunk size
Habr
RU

Как мы научили ИИ-агента отвечать за свои слова: 10 000 сообщений, Венгерский алгоритм и немного магии

На связи Сергей Смирнов, AI-инженер и основатель LLMStart.ru. Сегодня разбираем самое больное место разработки ИИ-агентов — как доказать, что они реал…

evaluationметрики качестваLLM-агентыRagasLangFuseRAGВенгерский алгоритмAI-driven разработкаLangChainlangchain агенты.
Habr
RU

Память на миллион, а толку ноль: как мы спасали ИИ-агента от «тупости»

На связи Сергей Смирнов, AI-инженер и основатель LLMStart.ru. Сегодня разбираем горячую тему, на которой спотыкаются многие разработчики ботов — памят…

LangChainИИ-агентыRAGcontext engineeringLLMAI-driven разработкаllmstartконтекст-инжинирингproductionproduction-ready
Habr
RU

Могут ли LLM находить flaky‑тесты по одному только коду теста? Разбор одного исследования

Flaky‑тесты сложно ловить даже привычными инженерными методами: они ломают CI, подрывают доверие к автотестам и часто воспроизводятся только тогд…

flaky-тестыLLMавтотестытестирование ПОнестабильные тестыQAмашинное обучениеанализ кодапромптингRAG
Habr
RU

SocratiCode: разбираю MCP-сервер, который даёт ИИ-агенту понимание кодовой базы

Если ваш ИИ-агент при каждом вопросе начинает grep-ом по всему проекту — у меня есть для вас одна штука. SocratiCode — это MCP-сервер, который индекси…

MCPClaude Codeвекторный поискQdrantOllamacodebase intelligenceAI-агентыRAG