RU

Train и eval в ARC-AGI-2 — это разные распределения

Если вы замеряете прогресс своего солвера на случайной подвыборке из train, вы замеряете его не на том наборе. Медианная задача train занимает 100 к…

ARC-AGIARC Prizeбенчмаркисдвиг распределениякритерий Колмогорова-Смирновавалидациявоспроизводимостьмашинное обучениеAGIстатистика
Habr
RU

Бенчмарки AGI никогда не будут объективными

Тест Тьюринга явно устарел, сейчас пытаются придумать новые тесты на сильный ИИ . Но как оценить интеллект модели, если учёные сильно расходятся в о…

интеллектсильный ИИAGIличностьСверхинтеллектсамосознаниекогнитивная наукаGeneral-BenchARC-AGIruvds_статьи