RU

Дело о 38 токенах в секунду: почему M3 Ultra начинал с двенадцати

Всё началось с простой, на первый взгляд, задачи. Я хотел использовать локально Qwen3.8-27B именно в BF16. Причём не исходный PyTorch-чекпойнт через…

Qwen3.8-27BDFlash2oMLXMLXApple SiliconMac Studio M3 Ultraлокальные LLMинференс LLMspeculative decodingBF16
Habr
RU

Свой инференс для 25 разработчиков: 452:1, KV‑пул и почему это не экономит денег

Для тех, кто держит или собирается держать LLM внутри контура: тимлидов, DevOps, архитекторов. Здесь конфиги, цифры и грабли, а не&nb…

vLLMLiteLLMprefix cachingKV-cacheлокальные LLMинференс LLMQwenагентская разработкаRTX PRO 6000claude
Habr
RU

[Перевод] Как я объединил четыре Mac Studio в один компьютер с 1,5 ТБ – и запустил ИИ, который не влезает ни в одну видеокарту

Представляю вашему вниманию довольно необычный эксперимент: объединение четырех компьютеров Mac Studio в единый кластер с 1,5 ТБ общей памяти с помо…

Mac Studioлокальные LLMтензорный параллелизмThunderboltDeepSeekKimi K2Qwen3timeweb_статьи_перевод
Habr
RU

Сотрудники сливают данные в чужой ИИ. Разбираемся чем это грозит

За последний год я провёл серию корпоративных тренингов по использованию ИИ для рабочих офисных задач — в разных по ра…

персональные данныеутечки данныхChatGPTлокальные LLMOllamaРоскомнадзоринформационная безопасность152-фз
Habr
RU

LongConspectWriter: автоматическая генерация структурированных конспектов лекций на потребительском GPU

Автоматическая генерация структурированных академических конспектов из аудиозаписей лекций по точным и естественным наукам затруднена для локальных…

LLMлокальные LLMllama.cppквантизациясуммаризация текстадлинный контекстмультиагентные системысемантическая кластеризацияLLM-as-a-judgeконспекты лекций
Habr
RU

Локальный запуск openai/gpt-oss-20b MXFP4 GGUF на ноутбуке без дискретной видеокарты: практический тест на 32 GB RAM

Запустил openai/gpt-oss-20b в варианте MXFP4 GGUF на обычном ноутбуке без дискретной видеокарты: только CPU, встроенная Radeon 780M и общая оператив…

локальные LLMopenai gpt-oss-20bGGUFMXFP4LM StudioRadeon 780MRyzenноутбук без дискретной видеокартыWindows 11benchmark
Habr
RU

Локальная Gemma 4 на MacBook читает графики и таблицы — и врёт красивее, чем говорит правду

MacBook M3, 16 ГБ, никакого облака. Поставил свежую Gemma 4, написал инструмент: кидаешь картинку с графиком или таблицей — получаешь CSV. Три кейса…

Gemma 4llama.cppлокальные LLMмультимодальные моделиOCRизвлечение данных из графиковvision-моделиMacBook M3GGUFвизуализация данных
Habr
RU

PewDiePie: разбираю self-hosted AI-workspace, который собрал 47 тысяч звёзд за пару дней

PewDiePie последние полтора года ушёл из развлекательного контента в технику: домашний сервер, локальные LLM, self-hosting. Результат — репозиторий…

self-hostedAI workspaceлокальные LLMOdysseusPewDiePieOllamaDockeropencodeприватность