jina-embeddings-v4 as an OpenAI-Compatible Embeddings Server
jina-embeddings-v4 is a self-hosted server for the jina-embeddings-v4 embedding model with an OpenAI-compatible /v1/embeddings endpoint. It runs on…
Tech news from the best sources
jina-embeddings-v4 is a self-hosted server for the jina-embeddings-v4 embedding model with an OpenAI-compatible /v1/embeddings endpoint. It runs on…
When you ask a chatbot for a pasta recipe, it doesn’t understand “pasta” the way you do. It sees a list of numbers. Those numbers are not random. Th…
В прошлой статье я рассказывал, как добавил в Obsidian локальный семантический индекс. Сам проект развивается открыто, код лежит здесь: GitHub: http…
Short answer: for B2B support triage, split PDF retrieval from answer generation, rerank a small evidence set, and let the final summary assign a qu…
Городские Telegram-чаты похожи на непрерывный поток логов без схемы. В одном сообщении человек ищет квартиру, в следующем агент публикует двадцатую…
Short answer: for semantic search over messy B2B catalog PDFs, I would spend the latency budget during ingestion, preserve page-level evidence, and…
A gaming knowledge base can contain hundreds of PDF pages of rules, patch notes, quest logic, and support policy. To summarize those pages without b…
Short answer: for an ask-your-docs feature in a multi-tenant SaaS help center, start with embeddings over document chunks, retain keyword search for…
В комментариях к прошлой статье мне написали примерно следующее: граф связей выглядит красиво, но хороший поиск по заметкам полезнее. Спорить было т…
Ио — это LLM-бот для Telegram-чатов. Он умеет отвечать на сообщения пользователей, распознавать изображения и голосовые сообщения, учитывать текущий…
My index reported 354 points. The collection had 451. Both numbers were "correct," and that gap is the whole problem. Here's the setup. I have a wik…
I watched a draft miss the exact file span I needed, and the failure was embarrassingly clean: the vector was "close," but the chunk I wanted was bu…
The failure that pushed me into this design was not subtle. I had a blended embedding that kept returning candidate matches that looked reasonable a…
Есть задачи, которые вроде бы не выглядят тупиком. Всё уже обсудили, аргументы есть — а решение почему-то снова переезжает на следующую неделю. Я ре…
TL;DR: If you run concurrent inference (e.g., via OpenVINO AsyncInferQueue or custom threading) for text/code embeddings, your tests might show 0 ex…
У меня накопилось 23 Telegram-канала. Не потому что я специально их коллекционировал. Просто со временем подписывался на новые. В какой-то момент по…
Every system that does "semantic" anything — RAG pipelines, recommendation engines, image search, dedup — boils down to one operation: given this ve…
Behind almost every "AI-powered search" and RAG feature sits the same quiet workhorse: similarity search over vectors. If you're building anything t…
Классический RAG часто ошибается не из‑за слабой embedding‑модели, а потому что чанки теряют связь с исходным документом. Разбир…
Декодерный эмбеддер 7–8B дает качество, но платит за него памятью, latency и деньгами. Разбираем все оси сжатия - int8, int4, binary + rescoring, PQ…
Transforming language into geometry. Introduction Embeddings are one of the most important building blocks of modern AI applications, yet they're of…
Когда мы выпустили Auto Embeddings — функцию автоматического преобразования текстов в векторные представления — без развёртывания отдель…
Эмбеддинги (иначе говоря, векторные представления) — это способ представления абстрактных данных в виде набора чисел (в виде векторов, как вы могли…
Хотел разобраться где заканчивается простой вызов локальной LLM и начинается backend система. Сначала всё выглядело просто: frontend отправляет вопр…
Если вы строили RAG в 2023, ваш стек выглядел плюс-минус одинаково. BERT-семейство (BGE, e5) для семантики, BM25 для буквальных совпадений, cross-en…
Most RAG tutorials stop at "embed your docs, do a similarity search, stuff the results in a prompt." That gets you a demo. It does not get you somet…
Долго воспринимал Python как язык из соседнего мира. Где то там data science, pandas, ноутбуки, модели, эксперименты. А у меня обычный backend: API,…
Retrieval-Augmented Generation (RAG) is a practical pattern: store knowledge as embeddings, retrieve the most relevant chunks with semantic search,…
Каждый, кто пробовал создавать текстовые RPG или симуляторы на базе LLM (будь то GPT-4, DeepSeek или локальная 70B), сталкивался с проблемой «Yes-An…
Современные поисковые системы уже не просто сопоставляют ключевые слова. Когда вы ищете «уютный детектив, действие которого происходит в Париже», а…