RU

Qwen3.8. MTP и тензорный параллелизм в llama.cpp: 75 ток/сек на двух RTX 3090

Плотная 27-миллиардная модель на двух RTX 3090 в llama.cpp из коробки даёт 32 токена в секунду. Интуитивно понятно, что это не предел: две карты по…

llmaillama.cppqwenqwen3.8ggufквантованиелокальные нейросетилокальные модели
Habr
RU

MoE на 5090 недобирает полтора раза, и дело не в маршрутизации

RTX 5090, одна и та же сборка llama.cpp, один драйвер, батч 1. Плотная Qwen3.5-9B выбирает 72% пропускной способности памяти карты. MoE Qwen3.5-35B-…

llama.cppmoertx 5090пропускная способность памятиcudagpuинференс ллмбенчмаркпрофилированиеqwen 3.5
Habr
RU

Всё, что вы хотели знать о локальном ИИ, но стеснялись спросить

Если вы когда-нибудь смотрели на HF и не понимали, что такое DFlash, квантизация и почему одна и та же модель лежит в десяти репозиториях от десяти…

llmлокальные моделиквантизацияllama.cppapple siliconggufинференсmoemeta
Habr
RU

Тест локальных MOE моделей

Я тут решил решил чуток заморочиться и протестировать локальные MOE модели на кодинг. Кодинг громко сказано - мои задачи исключительно игры причем н…

llmllama.cppигрыhtml
Habr
RU

Как я ужал русский эмбеддер до 24 млн параметров — и чуть не испортил его одной цифрой

TL;DR.  У меня локальный RAG на AMD Strix Halo. Памяти там достаточно, но вычислительно всё упирается в один iGPU: его деля…

эмбеддингиRAGretrievalэнкодерыRuModernBERTSTRIZHllama.cppGGUFVulkanStrix Halo
Habr
RU

Дообучим старый ruGPT3 XL 1.3B (~2020 год) до уровня LLM. ChatGPT выйдет только через 2 года. Сравним с Gemma3 2025 года

Древняя модель ruGPT-3 XL 1.3B конца 2020 - начала 2021. Модели тех времён не умели выполнять инструкции или вести диалог в чате, они умели только п…

llama.cpptransformersобучениеfinetunerugptrugpt3sftdpo
Habr
RU

Как я обучил русский RAG‑сплиттер, который режет документы по индексам, а не по тексту

TL;DR.  Из интереса обучил собственный русский RAG‑сплиттер — захотелось проверить, можно ли сделать context‑aware‑нарезку русск…

ragчанкингдистилляцияloraunslothтокенизацияllama.cppggufvulkanamd
Habr
RU

Я устал писать одноразовые скрипты для бенчмарков LLM и собрал харнесс, который сам считает Pareto-front

Неважно, где ты гоняешь инференс: в проде на vLLM под нагрузкой или в локалке на llama.cpp, пытаясь втиснуть Llama-3 в 4 ГБ видеопамяти — вопрос все…

LLMинференсбенчмаркингvLLMllama.cppметрикивоспроизводимостьэнергоэффективностьпроизводительностьgpu
Habr
RU

LongConspectWriter: автоматическая генерация структурированных конспектов лекций на потребительском GPU

Автоматическая генерация структурированных академических конспектов из аудиозаписей лекций по точным и естественным наукам затруднена для локальных…

LLMлокальные LLMllama.cppквантизациясуммаризация текстадлинный контекстмультиагентные системысемантическая кластеризацияLLM-as-a-judgeконспекты лекций
Habr
RU

Vibecode по дешевке — домашний сервер с Qwen Code за 25к, который не отключит Anthropic

Я начинающий инженер: учусь, работаю, пишу код. Подсел на Claude — и быстро уткнулся в лимиты: полчаса работы, и могучие руки превращаются в лапки.…

Tesla V100локальный LLMllama.cppдомашний серверинференсself-hostedнейросетиAI-агентводяное охлаждениеqwen code
Habr
RU

Кто ворует ваш GPU: атаки на открытые LLM-эндпоинты (Ollama, llama.cpp) — и при чём тут кража облачных ключей

Коротко тезис: открытый Ollama — это бесплатный GPU для атакующего , и охота за таким compute давно поставлена на поток. Но за май наша сеть ханипот…

LLMOllamallama.cpphoneypotSSRFIMDSинформационная безопасностьGPUn8n
Habr
RU

Claude Code с локальными Qwen3.6 на AMD Strix Halo: полное руководство по настройке

Всем привет! Продолжаю тему локальных LLM. В предыдущей статье  мы сравнивали железо для инференса — Nvidia DGX Spark, Mac Studio M3 Ultra и St…

claude-codestrix haloии-агентыпрограммированиеantropicqwen3.6локальный ииllama.cppvibecoding
Habr
RU

Локальная Gemma 4 на MacBook читает графики и таблицы — и врёт красивее, чем говорит правду

MacBook M3, 16 ГБ, никакого облака. Поставил свежую Gemma 4, написал инструмент: кидаешь картинку с графиком или таблицей — получаешь CSV. Три кейса…

Gemma 4llama.cppлокальные LLMмультимодальные моделиOCRизвлечение данных из графиковvision-моделиMacBook M3GGUFвизуализация данных
Habr
RU

Тестируем выделенный L40S и vGPU на 16 ГБ по производительности (llama.cpp, ComfyUI)

Сегодня в интернете какой только нет информации об искусственном интеллекте или его применении в разных сферах. Можно сказать, что он уже плотно вош…

gpuvgpullmllama.cppнейросетиcomfyuivdsпроизводительностьтестированиеfirstvds
Habr