RU

LLM‑судья вместо косинусной близости: точность подбора кандидатов с 44 до 66% и четыре провалившихся приёма

У нас есть внутренняя платформа подбора ИТ-специалистов. Вакансии приходят от заказчиков, и по каждой платформа находит в базе резюме, близкие к её…

LLMэмбеддингипоиск по резюмеэталонный наборBM25рекрутинг
Habr
RU

GigaChat 2 Max с памятью на связях обходит Claude Opus 5 без неё: замер семи моделей

На классе задач «в работе всплыла проблема — каким изменением её уже чинили»  GigaChat 2 Max с памятью на связях отвечает верно в 57% случаев,…

GigaChatYandexGPTClaudeLLMRAGвекторный поискэмбеддингиИИ-агентыпамять ИИ-агентаopus
Habr
RU

У Claude Code уже есть такая память. Тогда зачем я держу свою?

Недавно я рассказал, как держу долговременную память агента на обычных markdown‑файлах, без вектор‑базы и эмбеддингов. За кадром…

Claude CodeLLM-агентыAI-агентыпамять агентадолговременная памятьRAGвектор-БДэмбеддингиmarkdowngit
Habr
RU

Почему токенайзер реж ет сло ва не там где нужно

Заголовок этой статьи, частично, наглядная демонстрация того, как его видит языковая модель. Куски слов, нарезанные по логике, которая к русскому яз…

токенизациятокенизаторBPEbyte pair encodingLLMязыковые моделиэмбеддингиконтекстное окнопромпт-инжинирингselectel
Habr
RU

Positional encoding или как нейросеть «читает» текст

Большинство нейросетей работают с числами и читать как человек они не умеют, поэтому инженерами были придуманы способы помочь нейросети уловить не т…

нейросетипрограммированиеэмбеддингиэмбеддингпозиционный контекстdata scienceembeddingtransformerтрансформерынейросеть
Habr
RU

Разговорили гуманоида: как за месяц мы построили русскоязычный голосовой стек для китайского робота

Можно ли управлять гуманоидом Walker Tienkung через свой голосовой ассистент по-русски? Мы решили проверить — и быстро выяснили, что ответ сложнее,…

распознавание речисинтез речиwhispersilerovoskголосовой ассистентробототехникагуманоидllmэмбеддинги
Habr
RU

Честный RAG eval set: как собрать первые 100-300 кейсов и не обмануть себя цифрой

В прошлой статье серии мы сжимали эмбеддинги и замеряли, насколько изменится выдача относительно полного fp32-поиска. Там это был правильный вопрос:…

ragretrievalevalsоценка качестваLLMэмбеддингипоискMTEBragasBEIR
Habr
RU

Винни-Пух в 768 измерениях: семантический поиск Codex Pets на YDB

В многомерном пространстве найти Винни-Пуха можно даже не зная его имени. В запросе “тревожный коричневый медведь из старого мультфильма” нет ни одн…

YDBсемантический поисквекторный поискэмбеддингиYandex AI StudioCodexCodex Petsрекомендательные системы
Habr
RU

SayFable: офлайн-библиотека с NLP-разметкой, синтезом на 68 языков и чатом по книге

Привет, Хабр! В прошлых статьях я рассказывал про  локальный переводчик с синтезом голоса на кабардинском  и про то,  как собрать пол…

NLPRAGсинтез речиsileroсемантический поискэмбеддингиswiftразработка под iosискусственный интеллектмалоресурсные языки
Habr
RU

Как я делал базу знаний для ИИ‑агента и тестировал её на собственных медицинских анализах

Результаты годового чекапа пришли в пятницу вечером. Семь документов в личном кабинете лаборатории, в половине строк звёздочки «выше нормы» и «ниже…

RAGбазы знанийLLM-агентыэмбеддингипоиск по документамAI-ассистент
Habr
RU

Промпт, RAG или дообучение: что реально выучит вашу LLM

Локальная модель может уверенно отвечать на общие вопросы и так же уверенно ошибаться в вашем домене. В статье сравнили на …

llmqloraragfine-tuningдообучениепромпт-инжинирингunslothqwen3локальные-llmэмбеддинги
Habr
RU

Эволюция поиска вакансий в Авито Работе: ML-оптимизации и инсайты из АБ-тестов

Привет! Меня зовут Вадим Вахрушев , я старший DS-инженер в  Авито , занимаюсь задачами поиска. В статье расскажу, как устроено р…

retrieval systemsmachine-learningранжированиерекомендательные системыCTRab-тестированиевекторный поискэмбеддинги
Habr
RU

Внешний бенчмарк причинного recall: проверяем память ИИ-ассистента на YDB Яндекса

Коротко, о чём речь, — для тех, кто пришёл по слову «Яндекс» и предыстории не знает. Когда ИИ-ассистент помогает чинить баг, самое ценное — не сочин…

ИИ-агентыпамять агентаRAGбенчмаркrecallграфовая памятьэмбеддингисемантический поискYDBвоспроизводимость
Habr
RU

Как я ужал русский эмбеддер до 24 млн параметров — и чуть не испортил его одной цифрой

TL;DR.  У меня локальный RAG на AMD Strix Halo. Памяти там достаточно, но вычислительно всё упирается в один iGPU: его деля…

эмбеддингиRAGretrievalэнкодерыRuModernBERTSTRIZHllama.cppGGUFVulkanStrix Halo
Habr
RU

Локальная RAG-система на Go, PostgreSQL и Ollama без облачных API

RAG уже стал стандартным способом научить LLM работать с собственными документами без дорогостоящего дообучения. Но за кажущейся простотой скрываетс…

RAGRetrieval-Augmented GenerationGogolangPostgreSQLOllamaэмбеддингивекторный поисклокальные моделиllm
Habr
RU

Поймали ИИ-агента на вранье — его же памятью

На днях наш агент собрался дежурно отчитаться об успехе. Прежде чем нажать «готово», он сверился с собственной памятью — и нашёл там запись из прошл…

ИИ-агентыпамять агентаLLMRAGвекторный поискэмбеддингиграфовая памятьранжированиеMRRHippoRAG
Habr
RU

Персонализация без BigData: как мы ранжируем новости в Telegram с помощью pgvector и пяти сигналов

У меня 23 Telegram-канала. Не потому что я такой организованный — просто постепенно добавлял, пока не понял, что читаю примерно 3% из них, а остальн…

рекомендательные системымашинное обучениеrustэмбеддингиперсонализация
Habr
RU

Как мы создавали «умный» поиск по регламенту вуза

Я преподаю на кафедре информационных технологий и больше двадцати лет пишу код. Однажды эти две роли сошлись в проекте, который я затеял для себя: н…

ragretrieval-augmented generationэмбеддингивекторный поисксемантический поискllmгибридный поискчат-ботmax мессенджерии-ассистент
Habr
RU

Сжатие декодерных эмбеддеров: как ужать 8B до продакшена без потери recall

Декодерный эмбеддер 7–8B дает качество, но платит за него памятью, latency и деньгами. Разбираем все оси сжатия - int8, int4, binary + rescoring, PQ…

сжатие эмбеддинговквантизацияэмбеддингиembeddingsRAGQdrantQwen3binary quantizationMatryoshkaretrieval
Habr
RU

Как я заставил 9B обгонять 30B: три месяца с local LLM агентом

Я дал 9B и 30B одну задачу. 30B сделал 24 шага и вернул неправильный ответ. 9B справился за 3. Разбираю почему размер модели — не главное, и что на…

локальные llmлокальный агентуправление контекстомагентный CLIlm studioslmnode.jsэмбеддинги
Habr
RU

В 14 раз быстрее: как мы ускорили генерацию эмбеддингов в Manticore через ONNX

Когда мы выпустили  Auto Embeddings  — функцию автоматического преобразования текстов в векторные представления — без развёртывания отдель…

onnxonnx runtimeonnxruntimeembeddingsэмбеддингиинференсвекторный поискvector search
Habr
RU

Как выбрать эмбеддинг для проекта

Эмбеддинги (иначе говоря, векторные представления) — это способ представления абстрактных данных в виде набора чисел (в виде векторов, как вы могли…

aiэмбеддингикак выбрать эмбединггайд на эмбедингembeddingsLLMdocumentationdocument-oriented databasesкак подключить embeddingвекторная база данных
Habr
RU

RAG не только для вопросов и ответов: почему он естественно подходит для рекомендаций

Retrieval-Augmented Generation (RAG) чаще всего рассматривается в контексте вопросно-ответных систем и чат-ботов поверх базы знаний. Большинство пуб…

ragnlpрекомендательные системыmachine learningllmинформационный поискfaissэмбеддинги
Habr
RU

Retrieval в 2026: как RAG переехал с энкодеров на LLM (и что с этим делать в своём проекте)

Если вы строили RAG в 2023, ваш стек выглядел плюс-минус одинаково. BERT-семейство (BGE, e5) для семантики, BM25 для буквальных совпадений, cross-en…

RAGэмбеддингиembeddingsretrievalLLMQwen3Qdrantvector searchhard negativesLLM2Vec
Habr
RU

Почему AI-агент ищет по коду неправильно, и как это чинит cocoindex-code за две команды

Если вы работаете с Claude Code или Cursor на большом проекте, знаете боль: просишь “найди, где обрабатывается авторизация”, а агент гоняет grep по…

Claude Codeсемантический поискэмбеддингиTree-sitterASTMCPcocoindexcode search
Habr
RU

Как рассказать ребёнку, чем занимается папа, если папа работает с ИИ?

Наверняка все, у кого есть дети, слышали вопрос «чем ты занимаешься на работе?» Мне его точно задавали, и неоднократно. Дать ответ на&nbsp…

машинное обучениеискусственный интеллектнаучная фантастикаЭлектроникВелтистовтрансформерыэмбеддингиШеннондетская литературатеория информации
Habr
RU

Как рассказать ребёнку, чем занимается папа, если папа работает с ИИ?

Наверняка все, у кого есть дети, слышали вопрос «чем ты занимаешься на работе?» Мне его точно задавали, и неоднократно. Дать ответ на&nbsp…

машинное обучениеискусственный интеллектнаучная фантастикаЭлектроникВелтистовтрансформерыэмбеддингиШеннондетская литературатеория информации
Habr
RU

Как научить языковую модель читать транзакции: превращаем историю платежей в базу знаний

Меня зовут Дмитрий Валов, я тимлид команды «Инструменты для банка (агенты)» в Sber AI Lab — Центре практического искусственного интеллекта Сбера. Бо…

машинное обучение и нейросетиllmragretrieval-augmented generationтранзакцииknowledge baseантифродsber ai labэмбеддингиfinance
Habr
RU

RAG от А до Я: шпаргалка архитектора (векторные базы, чанкинг, реранкинг и 8 граблей продакшена)

Создать демо-версию RAG сегодня можно за 15 минут: LangChain, ChromaDB, API OpenAI — и бот отвечает на простые вопросы. Но когда этот прототип сталк…

RAGLLMLangChainэмбеддингивекторная база данныхчанкингреранкингпромпт-инжиниринггибридный поискmachine learning
Habr
RU

П維чему нейро考ети дел思ют так

Если вы хоть раз тестировали локальную модель (да и нелокальную тоже) и замечали, как она посреди нормального текста вдруг выдает иероглиф, то загол…

нейросетимашинное обучениеэмбеддингиgrokkingгроккингllmвекторное пространствоmechanistic interpretabilityтокеныselectel
Habr