Свържете се с нас

Съдържание и теми, включени в курса

1. Въведение в дълбокото обучение с подсилване

  • Какво е обучение с подсилване?
  • Разлика между обучение с учител, без учител и с подсилване
  • Приложения на DRL през 2025 г. (роботика, здравеопазване, финанси, логистика)
  • Разбиране на цикъла на взаимодействие агент-среда

2. Основи на обучението с подсилване

  • Марковски процеси на вземане на решения (MDP)
  • Функции на състояние, действие, награда, политика и стойност
  • Компромис между проучване и експлоатация
  • Методи Монте Карло и обучение с времева разлика (TD)

3. Реализация на основни алгоритми за обучение с подсилване

  • Таблични методи: динамично програмиране, оценка на политика и итерация
  • Q-Learning и SARSA
  • Епсилон-алчно проучване и стратегии с намаляване
  • Реализация на среди за обучение с подсилване с OpenAI Gymnasium

4. Преход към дълбоко обучение с подсилване

  • Ограничения на табличните методи
  • Използване на невронни мрежи за апроксимация на функции
  • Архитектура и работен процес на Deep Q-Network (DQN)
  • Възпроизвеждане на опит и целеви мрежи

5. Усъвършенствани алгоритми за дълбоко обучение с подсилване

  • Double DQN, Dueling DQN и приоритизирано възпроизвеждане на опит
  • Методи с градиент на политиката: алгоритъм REINFORCE
  • Архитектури Actor-Critic (A2C, A3C)
  • Proximal Policy Optimization (PPO)
  • Soft Actor-Critic (SAC)

6. Работа с непрекъснати пространства на действия

  • Предизвикателства при непрекъснатото управление
  • Използване на DDPG (Deep Deterministic Policy Gradient)
  • Twin Delayed DDPG (TD3)

7. Практически инструменти и рамки

  • Използване на Stable-Baselines3 и Ray RLlib
  • Регистриране и наблюдение с TensorBoard
  • Настройка на хиперпараметри за DRL модели

8. Инженеринг на награди и проектиране на среда

  • Оформяне на награди и балансиране на наказания
  • Концепции за трансфер на обучение от симулация към реалност
  • Създаване на персонализирани среди в Gymnasium

9. Частично наблюдаеми среди и генерализация

  • Обработка на непълна информация за състоянието (POMDP)
  • Подходи, базирани на памет, използващи LSTM и RNN
  • Подобряване на устойчивостта и генерализацията на агента

10. Теория на игрите и многоагентно обучение с подсилване

  • Въведение в многоагентните среди
  • Сътрудничество срещу конкуренция
  • Приложения в състезателното обучение и оптимизацията на стратегии

11. Казуси и приложения от реалния свят

  • Симулации на автономно шофиране
  • Динамично ценообразуване и стратегии за финансова търговия
  • Роботика и индустриална автоматизация

12. Отстраняване на проблеми и оптимизация

  • Диагностициране на нестабилно обучение
  • Управление на рядкостта на наградите и пренастройването
  • Мащабиране на DRL модели на GPU и разпределени системи

13. Обобщение и следващи стъпки

  • Преговор на архитектурата на DRL и ключовите алгоритми
  • Индустриални тенденции и насоки за изследвания (например RLHF, хибридни модели)
  • Допълнителни ресурси и материали за четене

Изисквания

  • Умения за програмиране на Python
  • Разбиране на математически анализ и линейна алгебра
  • Основни познания по вероятности и статистика
  • Опит в изграждането на модели за машинно обучение с помощта на Python и NumPy или TensorFlow/PyTorch

Аудитория

  • Разработчици, интересуващи се от изкуствен интелект и интелигентни системи
  • Специалисти по данни, изследващи рамки за обучение с подсилване
  • Инженери по машинно обучение, работещи с автономни системи
 21 Часа

Брой участници


Цена за участник

Отзиви от участници (3)

Предстоящи Курсове

Свързани Kатегории