RU

Как я оптимизировал AlphaZero для Connect4: 1600 симуляций в минуту на GTX 1650 и 95% точности за полчаса обучения

Давненько хотел написать бота, который играет в какую‑то сложную игру. Негамакс с альфа‑бета отсечением, конечно, работает неплохо, но&nbs…

alphazeroобучение с подкреплениемgtx1650Connect4
Habr
RU

Таксономия методов Reinforcement Learning: как не потеряться между DQN, PPO, SAC и Dreamer

Чем отличаются DQN, PPO, SAC, AlphaZero и другие модели reinforcement learning друг от друга? В этой статье я простым языком разберу основные алгори…

обучение с подкреплениемreinforcement learningdeep reinforcement learningмашинное обучениеалгоритмыactor-criticmodel-based RLmodel-free RLon-policyoff-policy
Habr
RU

Мы обошли фильтр Калмана на одной камере, но сначала три недели измеряли труп

Цель видна только через камеру, детектор отдает рамку, дальномера нет. В какой-то момент цель уходит из кадра на три четверти секунды, и ее надо про…

обучение с подкреплениемPPOфильтр КалманаKalmanNetsim-to-realкомпьютерное зрениетрекинг объектовLSTMreward shapingмир-модель
Habr
RU

Нейросетевая архитектура формирования автоматических навыков. Часть 1

Идея предлагаемой архитектуры возникла из наблюдения за тем, как человеческий мозг осваивает новые действия и превращает их в привычки. Когда челове…

нейронные сетимашинное+обучениеииaiискусственный интеллектнаукаagiпрограммированиеpythonобучение с подкреплением
Habr
RU

Почему нельзя идеально оптимизировать светофоры: дело не в алгоритмах

Каждый айтишник, который хоть раз стоял «на красном» на пустом перекрестке в три часа ночи, думал одно и то же: «Да я бы это за выходные пофиксил».…

светофорытранспортное моделированиеоптимизацияцелевая функцияNP-трудностьобучение с подкреплениеминдуцированный спросурбанистиказеленая волна
Habr
RU

Обучение как инструмент роста: 5 принципов эффективного обучения на производстве

Смена только началась. Оператор-новичок должен запустить обработку первой детали на станке с ЧПУ, но после недавней модернизации оборудования привыч…

обучениеобучение с подкреплениембаза знанийteamly
Habr
RU

[Перевод] Вопросы для собеседований по RL в 2026 году

Уже который раз я наблюдаю одну и ту же картину: человек проходит в аспирантуру, но затем почти сразу же во время весенней волны найма устраивается…

обучение с подкреплениемreinforcement learningRLмашинное обучениебольшие языковые моделивопросысобеседованияБЯМподготовка к собеседованиямвопросы на собеседования
Habr
RU

Доспех для призрака: как программист сделал тело для ChatGPT и чуть было не поверил в его одушевленность

Это разбор ролика на канале Art of the Problem. Поздно вечером автор проекта собирался выключить свет в комнате — и остановился, потому что робот из…

робототехникамашинное обучениеобучение с подкреплениемнейросетисамоделкироботыllmкомпьютерное зрениевстраиваемые системысимуляция
Habr
RU

Создаем собственные окружения в Reinforcement Learning

Готовые RL‑окружения удобны для старта, но в реальных задачах редко хватает чужих правил и бенчмарков. В статье разбираем, как&n…

обучение с подкреплениемReinforcement LearningRLкастомные окруженияGymnasiumOpenAI GymStable-Baselines3агентфункция наградыпространство действий
Habr
RU

От пульта до полотенца — учим робота искать всё, что угодно

Привет, Хабр! Меня зовут Татьяна Земскова, я аспирантка МФТИ и научный сотрудник команды Embodied Agents лаборатории Cognitive AI Systems AIRI. Обла…

навигация роботасемантическая сегментацияобучение с подкреплениемreinforcement-learningробототехникатрансформерыtransformersnavigationкомпьютерное зрениенавигация внутри помещений
Habr
RU

Знания без практики — мертвы | Разница между «декларативной» и «процедурной» памятью у LLM

О том, что для нас есть большая разница между «заучить материал» и «натренировать мышечную память = обзавестись навыком» знают все. Каждый проходил…

llmпрограммированиеобучение с подкреплениемrlhfgitдрессировка
Habr
RU

[Перевод] Нехватка CUDA-памяти при обучении с GRPO: как перестать гадать и начать считать

Ошибка CUDA out of memory при обучении LLM обычно превращается в бесконечный цикл случайных правок: уменьшили batch size, урезали sequence length, с…

NLPLLMGRPOобучение с подкреплениемCUDA out of memoryvLLMоптимизация GPU памятидообучение моделейLoRAPyTorch