Курс Deep Reinforcement Learning 2023: Сезон курсов: В первой лекции: Раскрывается содержательная идея принципа обучения с подкреплением. Описывается математически строгая постановка задачи обучения с подкреплением в терминах марковских процессов принятия решений. Рассматриваются примеры задач, которые могут быть формализованы в рамках этой постановки. Обсуждается понятие политики агента. При дополнительных ограничениях, исследуется взгляд на задачу обучения с подкреплением как на задачу конечномерно математической оптимизации. Опираясь на это, приводится эволюционный алгоритм Кросс-энтропии, должным образом модифицированный в соответствии с особенностями задачи обучения с подкреплением. Обсуждаются недостатки этого алгоритма и способы их преодоления. Автор курса: Антон Плаксин, исследователь в группе и доцент Уральского федерального университета. Наши соц.сети: Telegram: Вконтакте: Канал с вакансиями в telegram: Канал с вакансиями в matrix: #/#jobs-list:
Hide player controls
Hide resume playing