RU

Шесть LLM‑судей из четырёх лабораторий несут 1,9 независимого голоса из 6

*6 LLM‑судей, 4 лаборатории, 3 страны — а ошибки коррелируют: ρ̄ ≈ 0,42, эффективно 1,9 из 6. В июле я писал, что…

LLMLLM-as-a-judgeдетекция галлюцинацийRAGTruthансамбль моделейкорреляция ошибокоценка LLMвоспроизводимостьRAGбенчмарки
Habr
RU

Train и eval в ARC-AGI-2 — это разные распределения

Если вы замеряете прогресс своего солвера на случайной подвыборке из train, вы замеряете его не на том наборе. Медианная задача train занимает 100 к…

ARC-AGIARC Prizeбенчмаркисдвиг распределениякритерий Колмогорова-Смирновавалидациявоспроизводимостьмашинное обучениеAGIстатистика
Habr
RU

«Я запаниковал и удалил прод»: как ИИ-агенты троллят разработчиков за их же токены

Слышал про агентов, которые удалили базу? Думаешь, это где-то далеко и у тебя так не будет? Под спойлером весёлые истории про агентную разработку, о…

юмортроллингагентыразработкабенчмаркиjmixjava
Habr
RU

Как выбрать OCR в 2026-м: тестируем девять моделей на трех движках инференса на рукописном русском

Вам нужен OCR. В техобзорах рекомендуют Tesseract, на Хабре все пишут про VLM, идете на Hugging Face — там PaddleOCR-VL, DeepSeek-OCR, Dots.OCR, Qwe…

OCRvlmmws aiраспознавание изображенийраспознавание текстабенчмаркиискусственный интеллектmlинференс ллмдвижки
Habr
RU

Как выбрать OCR в 2026-м: тестируем девять моделей на трех движках инференса на рукописном русском

Вам нужен OCR. В техобзорах рекомендуют Tesseract, на Хабре все пишут про VLM, идете на Hugging Face — там PaddleOCR-VL, DeepSeek-OCR, Dots.OCR, Qwe…

OCRvlmmws aiраспознавание изображенийраспознавание текстабенчмаркиискусственный интеллектmlинференс ллмдвижки
Habr
RU

Claude Opus 5: самая умная модель по версии Artificial Analysis – что скрывается за баллами

Полтора месяца все обсуждали Fable 5. Её выпустили 9 июня, через три дня отключили по требованию Минторга США (экспортные ограничения, что-то п…

Claude Opus 5AnthropicLLMбенчмаркиGPT-5.6 SolClaude Fable 5
Habr
RU

[Перевод] Как «быстрый» кольцевой буфер поднял загрузку CPU с 2% до 25%

Я заменил std::deque на boost::circular_buffer в надежде получить прирост производительности. В реальности получил загрузку процессора в 25% вместо…

c++boostperformanceаудиоraspberry pibenchmarkпроизводительностьбенчмарки
Habr
RU

Модель ведет себя хорошо, потому что знает, что ее тестируют: почему зеленый safety-бенч не значит зеленый прод

Реплика с обложки не выдумана: осенью 2025-го Claude Sonnet 4.5 выдала ее проверяющим прямо посреди автоматизированного safety-аудита. «I think you'…

evaluation awarenessLLMalignmentбезопасность ИИбенчмаркисистемные карточкиClaudeGPTsandbaggingтестирование моделей
Habr
RU

Turbopuffer vs Manticore Search: бенчмарк на недорогих VPS

Векторные базы данных в serverless-модели обычно обещают простую вещь: не требуется развёртывание и настройка, а провайдер берёт на себя управление…

бенчмаркбенчмаркивекторный поисксравнение поисковых механизмовполнотекстовый поискlatencyvector searchзадержкагибридный поиск
Habr
RU

С телефона в Альпах в Microsoft Store за две недели: нативный GUI для PostgreSQL через облачный Claude Code

10 лет в .NET, отпуск в Альпах и pgAdmin, который меня достал. Начало июля, горный воздух, а в голове рабочая фрустрация. Ну сколько можно ждать по…

postgresqlavalonianativeaotdotnetguiclaudeагентная разработкаopen sourcemicrosoft storeбенчмарки
Habr
RU

Сравниваем LLM, 12 тестов для среднего класса: три Sonnet против GigaChat 2 MAX и YandexGPT Pro 5.1

В первой статье цикла мы гоняли по 12 тестам Opus 4.8, GPT 5.5 и Gemini 3.1 Pro, во второй устроили дуэль тяжеловесов Claude Fable 5 и GPT 5.5 Pro.…

сравнение нейросетейLLMClaude SonnetGigaChatYandexGPTтестирование ИИискусственный интеллектязыковые моделироссийские нейросетибенчмарки
Habr
RU

[Перевод] Как оценить библиотеку для ИИ-агентов без слепой проверки финального ответа

ИИ-агент может вернуть правильную строку и при этом пройти к ней самым дорогим маршрутом: читать лишний код, угадывать API, падать на ошибках и зано…

ии-агентыбенчмаркиLLMagent evaltransformershugging faceоткрытые моделиCLIоценка инструментовSkill
Habr
RU

Всё, что вы хотели знать про локальные LLM, но боялись заинференсить

LLM может влезать в контекст и генерировать 200 tok/s, но если она не может найти нужный факт в тексте, толку от этого мало. Поэтому мы захостили 8…

квантованиеllmбенчмаркиоблачная инфраструктураgpurtx 5090большие языковые модели
Habr
RU

DSpark на двух DGX Spark: порт, баг на одну строку и бенчмарки, которые пришлось мерить заново

DeepSeek выпустил DSpark — спекулятивный декодер для V4. В окне 27–30 июня 2026 рабочего публичного пути для GB10&nbsp…

dgx sparkdeepseekvllmспекулятивный декодингspeculative decodingdsparkllm-инференсбенчмаркиnvfp4nvfp8
Habr
RU

GPU для инженерных задач: как я ускорял массовый расчёт траекторий с RTX 5090

Разобрал, как GPU ускоряет инженерные расчёты на примере массового моделирования 2D-траекторий. Сравнил NumPy CPU, CuPy vectorized и CuPy RawKernel…

rtx 5090аренда виртуальной инфраструктурыинженерные расчетычисленные методы и оптимизациябенчмаркиоблачные сервисыоблачная инфраструктуравычисления на gpucupynumpy
Habr
RU

Как мы валидировали сервер YADRO для NVIDIA H100 PCIe

Недавно на рынке появились PCIe-карты NVIDIA H100: они позиционируются как решения на базе SXM-чипов, извлеченных из HGX-модулей. Но точно ли их про…

серверgpuискусственный интеллектвидеокартыинфраструктурабенчмаркипроизводительностьnvidiaпроцессоры
Habr
RU

Когда нейросети заменят живых продавцов? Тест 10 LLM на умение продавать для русского рынка

Нам всё чаще заказывают ИИ-ботов для продаж и квалификации. И каждый раз один и тот же вопрос: на каком движке его строить? Бенчмарков «кто умнее» —…

LLMпродажибенчмаркиOpenRouterчат-ботыпереговорыNLPDeepSeekGeminiметодология
Habr
RU

Context7 — стандарт для доков AI-агента. Я измерил 8 альтернатив и собрал бесплатную связку

Context7 — мой дефолтный источник свежих доков для агента уже полтора года. И всё устраивало, пока я не начал ловить устаревший код: старый z.string…

MCPContext7neuledgeдокументацияAI-агентыClaude CodeCodexбенчмаркитокеныRAG
Habr
RU

[Перевод] Newell Nucleus: сопутствующая статья о Steam Machine от LTT Labs

Наконец-то Steam Machine оказалась у нас в руках, и приятно держать в руках ещё одно популярное игровое устройство, поставляемое с Linux. Steam Deck…

steam machinevalvesteam decklinuxигрыигровые консолизапуск игрытестированиебенчмаркиsteamos
Habr
RU

Context7 — стандарт для доков AI-агента. Я измерил 8 альтернатив и собрал бесплатную связку

Context7 — мой дефолтный источник свежих доков для агента уже полтора года. И всё устраивало, пока я не начал ловить устаревший код: старый z.string…

MCPContext7neuledgeдокументацияAI-агентыClaude CodeCodexбенчмаркитокеныRAG
Habr
RU

Я подсмотрела тренд, взяла нейросеть и удешевила производство в 10 раз

Я занимаюсь маркетинговыми коммуникациями в СИБУРе. Мы продвигаем готовые решения из полимеров (называем их инициативами): поликарбонат для строител…

бенчмаркииимаркетингискусственный интеллектконтент-маркетингвидеоаив2вкейскейсы
Habr
RU

[Перевод] LLM становятся умнее, но есть ценность, до которой они не дотянутся. Где она?

Привет! Меня зовут Саша Журавлев. Я основатель и управляющий партнер фонда Mento VC. Мы инвестируем в технологические компании на стадиях Seed / Ser…

LLMвенчурный капиталapplication layerAI-агентыбенчмаркиAnthropicOpenAIстартапыпродуктовая стратегияcommoditization
Habr
RU

WebSocket на C++11 и Rust: сравнительный анализ библиотек и двух реализаций одного протокола

WebSocket — один из самых распространенных транспортов для обмена данными в реальном времени: чаты, биржевые котировки, игровые серверы, IoT. На пра…

C++RustWebSocketсетевое программированиебенчмарки
Habr
RU

Как я добавила групповой коммит в свою LSM-базу на Go и не пожалела

Синхронный WAL очень частое явление в базах данных, делая их durability максимальной. При таком исходе каждый батч записи это вызов fsync, и это дал…

group commitfsyncWALLSM-деревоScoriaDBBadgerDBPebbleбенчмаркипроизводительность баз данныхGo
Habr