RU

Шесть миллиардов прогонов ради одной галочки: как устроено ревью научного софта на GitHub

Последние месяцы я рецензирую научный софт для JOSS, Journal of Open Source Software. Это настоящий рецензируемый журнал с редколлегией, только стат…

peer reviewJOSSнаучный софтopen sourceтестированиевоспроизводимостьсанитайзерыAddressSanitizerкод-ревьюGitHub
Habr
RU

Шесть LLM‑судей из четырёх лабораторий несут 1,9 независимого голоса из 6

*6 LLM‑судей, 4 лаборатории, 3 страны — а ошибки коррелируют: ρ̄ ≈ 0,42, эффективно 1,9 из 6. В июле я писал, что…

LLMLLM-as-a-judgeдетекция галлюцинацийRAGTruthансамбль моделейкорреляция ошибокоценка LLMвоспроизводимостьRAGбенчмарки
Habr
RU

Train и eval в ARC-AGI-2 — это разные распределения

Если вы замеряете прогресс своего солвера на случайной подвыборке из train, вы замеряете его не на том наборе. Медианная задача train занимает 100 к…

ARC-AGIARC Prizeбенчмаркисдвиг распределениякритерий Колмогорова-Смирновавалидациявоспроизводимостьмашинное обучениеAGIстатистика
Habr
RU

Я хотел просто спросить нейросети, где искать квартиру. В итоге собрал исследовательский пайплайн с 1197 тестами

Вокруг GEO‑продвижения слишком много разговоров о том, как попасть в ответы нейросетей, какие сайты любят ИИ и что нужно сделать…

AI SearchGEOLLMOpenRouterPythonAI Visibilityentity resolutionJaccardвоспроизводимостьAPI
Habr
RU

Ваш бэктест нейронки врёт на ±10 процентных пунктов

Недавно я решил проверить на себе классический сюжет: может ли нейронка зарабатывать на бирже. Не «взял стратегию с&nb…

алготрейдингмашинное+обучениебэктестингнейронные сетивоспроизводимостьмосбиржа
Habr
RU

2160 раундов симуляции без кнопки «стоп». Исследование MiroFish, часть 3

Третья, заключительная статья об исследовании MiroFish, открытого стека мультиагентной симуляции общества. В первой части изложены методология и Sil…

MiroFishLLMавтономные агентымультиагентные системыаудитвоспроизводимостьopen source
Habr
RU

Жители Валдории живут 147 лет, а страна граничит с Германией и Японией одновременно. Исследование MiroFish. Часть 2

Вторая статья из трёх об исследовании MiroFish, открытого стека мультиагентной симуляции общества. В первой части изложены методология исследования…

MiroFishGraphRAGNeo4jLLMгаллюцинацииаудитвоспроизводимостьмультиагентные системы
Habr
RU

Что будет если загрузить в «симулятор общества» чистый lorem ipsum? Большое исследование MiroFish, часть 1

Первая статья из трёх об исследовании MiroFish, открытого стека мультиагентной симуляции общества. В этой части: стек, методология и находка Silent…

MiroFishGraphRAGLLMNeo4jаудитвоспроизводимостьтестированиемультиагентные системы
Habr
RU

«Скопируй промпт дважды и получишь +76%». Я решил проверить

Всем привет. В декабре по всем AI-каналам пролетел лайфхак, который звучал как развод: продублируй свой запрос к нейросети, буквально Ctrl+C, Ctrl+V…

LLMпромпт-инжинирингGeminiвоспроизводимостьэкспериментreasoningпромптыab test
Habr
RU

Внешний бенчмарк причинного recall: проверяем память ИИ-ассистента на YDB Яндекса

Коротко, о чём речь, — для тех, кто пришёл по слову «Яндекс» и предыстории не знает. Когда ИИ-ассистент помогает чинить баг, самое ценное — не сочин…

ИИ-агентыпамять агентаRAGбенчмаркrecallграфовая памятьэмбеддингисемантический поискYDBвоспроизводимость
Habr
RU

Мы провели 35 контролируемых экспериментов с «экзотическими алгебрами» в нейросетях

Кватернионные, октонионные и Clifford-слои обещают parameter efficiency и «особую выразительность». Мы проверили честно: 35 контролируемых экспериме…

гиперкомплексные числакватернионыоктонионынейросетивоспроизводимость
Habr
RU

Я устал писать одноразовые скрипты для бенчмарков LLM и собрал харнесс, который сам считает Pareto-front

Неважно, где ты гоняешь инференс: в проде на vLLM под нагрузкой или в локалке на llama.cpp, пытаясь втиснуть Llama-3 в 4 ГБ видеопамяти — вопрос все…

LLMинференсбенчмаркингvLLMllama.cppметрикивоспроизводимостьэнергоэффективностьпроизводительностьgpu
Habr
RU

MLE-bench: золото взято, а доказательства остались в /tmp

В апреле мой агент смог перешагнуть золотой порог на MLE-bench в агентских соревнованиях Berkeley RDI, а когда я решил показать «тот самый код, кото…

MLE-benchAI-агентыавтономные агентыAgentBeatsKaggleSpaceship TitanicLLMпровенансвоспроизводимостьGemini 2.5 Pro
Habr
RU

Я попробовал считать нейросетевой слой в конечном поле Галуа GF(137): 4x по памяти, ARM NEON и честные ограничения

Я проверил маленький нейросетевой слой в арифметике GF(137): не через квантизацию готовой float32-модели, а сразу в байтовом конечнополевом представ…

GF137конечные-поляпериферийный-инференсARM-NEONuint8benchmarkcppвоспроизводимость