RU

[Перевод] Скидка в 97%: как устроен китайский мошеннический рынок ИИ-токенов

Моя история Я долгое время размышлял о мошенничестве с токенами — проблеме, с которой впервые столкнулся, когда работал разработчиком ПО в ИИ-шлюзе.…

токены llmязыковые моделиllmинференсчерный рынокruvds_перевод
Habr
RU

Как запустить LLM на 2,8 трлн параметров на ноутбуке

Локальный запуск больших LLM быстро упирается в память: веса не помещаются, оффлоад режет скорость, а красивые бенчмарки мало го…

LLMлокальный запуск LLMMoEMixture of Expertsинференсквантование моделейоффлоад экспертовиерархия памятипропускная способность памятиKimi K3.
Habr
RU

ИИ‑прогноз погоды на своём железе: запускаем AIFS 2.0 от ECMWF

Открытые веса модели мало помогают, если для её запуска нужен конкретный GPU и непростое окружение. Разберём, как запустить AIFS Single 2.0 от ECMWF…

AIFS 2.0ECMWFпрогнозирование погодымашинное обучениенейросетиинференсHugging Faceлокальный запускGPUвременные ряды
Habr
RU

Всё, что вы хотели знать о локальном ИИ, но стеснялись спросить

Если вы когда-нибудь смотрели на HF и не понимали, что такое DFlash, квантизация и почему одна и та же модель лежит в десяти репозиториях от десяти…

llmлокальные моделиквантизацияllama.cppapple siliconggufинференсmoemeta
Habr
RU

NVIDIA RTX PRO 5000 Blackwell с 72 Гб видеопамяти. Есть ли смысл переплачивать за «половинку» флагмана?

RTX PRO 5000 Blackwell на 72 Гб: золотая середина для локальных ИИ-моделей или переоцененный апгрейд? Разбираемся в нашем обзоре. Читать далее

NVIDIABlackwellRTX PRO 5000GPUVRAMLLMинференсDeepSeekCUDAhostkey
Habr
RU

Подводные камни ИИ-инфраструктуры: что узнаёт заказчик через полгода после запуска (и как мы предусмотрели это в ПАК)

Привет, Хабр! Меня зовут Алексей, я архитектор в команде Скала^р (входим в Группу Rubytech). Мы разрабатываем программно-аппаратные комплексы (ПАК)…

gpullmrdmaинференсии-инфраструктурапрограммно-аппаратный комплекссамосборcudanvidiapytorch
Habr
RU

Анализ сервисов на замену OpenRouter в РФ

Заголовок конечно очень похож на классический ИИ SEO слоп, но не спешите закрывать. Анализ вцелом я делал для себя и не претендую на истину в послед…

openrouterинференсllmагрегаторы нейросетейLLM провайдерыинференс ллмоблачные инференсыроссийские нейросетипровайдеры нейросетей
Habr
RU

Mac mini feat OpenClaw: проверяем локальный инференс LLM

Локальный инференс LLM требует не только мощного GPU, но и огромной ширины шины памяти. Объединенная память Apple Silicon частично решает проблему н…

openclawmac miniselectelit-компанииit-инфраструктураинференсllmжелезо для нейросетей
Habr
RU

Не всё надо решать LLM. Где в продакшене побеждают бустинги, эмбеддинги и правила

Нам очень хотелось поговорить о том, в каких местах важно оставаться приверженцами классического ML, а где хотелось бы идти в сторону инноваций, вне…

llmмашинное обучениеклассический mlragгибридные архитектурыproductionинференсвалидация llmдрейф данных
Habr
RU

False positive под небом цвета телевизора, настроенного на мертвый канал

В «Ростелекоме», как в любом крупном корпоративном контуре, SAST-поток исчисляется тысячами срабатываний. Ручной триаж перестает быть инженерной раб…

llm-моделиllmинформационная безопасностьинференсинференс моделейsastqwentriage
Habr
RU

Я устал писать одноразовые скрипты для бенчмарков LLM и собрал харнесс, который сам считает Pareto-front

Неважно, где ты гоняешь инференс: в проде на vLLM под нагрузкой или в локалке на llama.cpp, пытаясь втиснуть Llama-3 в 4 ГБ видеопамяти — вопрос все…

LLMинференсбенчмаркингvLLMllama.cppметрикивоспроизводимостьэнергоэффективностьпроизводительностьgpu
Habr
RU

4.6-битные сети: от теории к практике. Причём здесь HardTanh?

Уже прошло два года с тех пор, как мы предложили схему 4.6-битного квантования и рассказали про нее, в том числе и на Хабре: раз и два . Вспомним, ч…

нейронные сетиквантованиеинференснизкоразрядные вычисленияresnetedge aiмобильный ииHardTanh4.6-битное квантование
Habr
RU

В 14 раз быстрее: как мы ускорили генерацию эмбеддингов в Manticore через ONNX

Когда мы выпустили  Auto Embeddings  — функцию автоматического преобразования текстов в векторные представления — без развёртывания отдель…

onnxonnx runtimeonnxruntimeembeddingsэмбеддингиинференсвекторный поискvector search
Habr
RU

Tensordyne Napier — еще одно решение на замену традиционных GPU в инференсе

Почти каждый месяц очередной стартап, производящий серверное железо, объявляет о своих ноу-хау. Естественно, ориентированных на задачи инференса и о…

selectelit-компанииit-инфраструктураgpuинференсsram
Habr
RU

Vibecode по дешевке — домашний сервер с Qwen Code за 25к, который не отключит Anthropic

Я начинающий инженер: учусь, работаю, пишу код. Подсел на Claude — и быстро уткнулся в лимиты: полчаса работы, и могучие руки превращаются в лапки.…

Tesla V100локальный LLMllama.cppдомашний серверинференсself-hostedнейросетиAI-агентводяное охлаждениеqwen code
Habr
RU

Два игрока на весь российский рынок ИИ: что показал ЦИПР-2026

Почему в каждом разговоре про промышленный ИИ в России за спиной заказчика оказывается одна из двух компаний - Сбер или Яндекс? Я съездил на ЦИПР-20…

ципр-2026ципрконференцияагрегатор нейросетейнейросетьнейросетиинференсобучение нейронных сетейинференс нейросетейсбер
Habr
RU

DGX Spark на 256K контексте: тестирую конфигурации vLLM, реальные замеры и почему NVFP4 в mainline сломан

NVIDIA продаёт спарку с лозунгом «один петафлоп на FP4». Я купил коробку, поставил vLLM, запустил инференс и получил 40 токенов в&nbs…

vllmdgx sparkgb10blackwellnvfp4llmинференслокальный ии