Свържете се с нас

Съдържание и теми, включени в курса

1. Въведение в задълбоченото обучение с утвърждение

  • Какво е обучение с утвърждение?
  • Разлика между обучение с учител, обучение без учител и обучение с утвърждение
  • Приложения на DRL през 2025 г. (роботика, здравеопазване, финанси, логистика)
  • Разбиране на цикъла на взаимодействие агент-среда

2. Основи на обучението с утвърждение

  • Марковски процеси за вземане на решения (MDP)
  • Функции на състоянието, действието, наградата, политиката и стойността
  • Компромис между проучване и експлоатация
  • Методи Монте Карло и обучение с времева разлика (TD)

3. Внедряване на основни алгоритми за ОУ

  • Таблични методи: Динамично програмиране, оценка на политика и итерация
  • Q-Learning и SARSA
  • Епсилон-алчно проучване и стратегии за намаляване
  • Внедряване на среди за ОУ с OpenAI Gymnasium

4. Преход към задълбочено обучение с утвърждение

  • Ограничения на табличните методи
  • Използване на невронни мрежи за апроксимация на функции
  • Архитектура и работен процес на Deep Q-Network (DQN)
  • Възпроизвеждане на опита и целеви мрежи

5. Усъвършенствани алгоритми за DRL

  • Double DQN, Dueling DQN и приоритизирано възпроизвеждане на опита
  • Методи с градиент на политиката: Алгоритъм REINFORCE
  • Архитектури Actor-Critic (A2C, A3C)
  • Проксимална оптимизация на политиката (PPO)
  • Soft Actor-Critic (SAC)

6. Работа с пространства за непрекъснати действия

  • Предизвикателства при непрекъснатото управление
  • Използване на DDPG (Deep Deterministic Policy Gradient)
  • Twin Delayed DDPG (TD3)

7. Практически инструменти и рамки

  • Използване на Stable-Baselines3 и Ray RLlib
  • Регистриране и наблюдение с TensorBoard
  • Настройка на хиперпараметри за DRL модели

8. Инженеринг на награди и дизайн на средата

  • Оформяне на наградата и балансиране на неустойките
  • Концепции за трансферно обучение от симулация към реалност
  • Създаване на персонализирана среда в Gymnasium

9. Частично наблюдаеми среди и генерализация

  • Справяне с непълна информация за състоянието (POMDPs)
  • Подходи, базирани на памет, използващи LSTM и RNN
  • Подобряване на устойчивостта и генерализацията на агента

10. Теория на игрите и обучение с утвърждение с множество агенти

  • Въведение в среди с множество агенти
  • Сътрудничество срещу конкуренция
  • Приложения в състезателното обучение и оптимизацията на стратегии

11. Казуси и реални приложения

  • Симулации за автономно шофиране
  • Стратегии за динамично ценообразуване и финансова търговия
  • Роботика и индустриална автоматизация

12. Отстраняване на проблеми и оптимизация

  • Диагностициране на нестабилно обучение
  • Управление на рядкост на наградите и пренастройване
  • Мащабиране на DRL модели на GPU и разпределени системи

13. Обобщение и следващи стъпки

  • Преговор на DRL архитектурата и ключовите алгоритми
  • Индустриални тенденции и изследователски насоки (напр. RLHF, хибридни модели)
  • Допълнителни ресурси и материали за четене

Изисквания

  • Умения за програмиране с Python
  • Разбиране на математически анализ и линейна алгебра
  • Основни познания по вероятности и статистика
  • Опит в изграждането на модели за машинно обучение с Python и NumPy или TensorFlow/PyTorch

Аудитория

  • Разработчици, интересуващи се от ИИ и интелигентни системи
  • Специалисти по данни, изследващи рамки за обучение с утвърждение
  • Инженери по машинно обучение, работещи с автономни системи
 21 Часа

Брой участници


Цена за участник

Отзиви от участници (3)

Предстоящи Курсове

Свързани Kатегории