Съдържание и теми, включени в курса
1. Въведение в дълбокото обучение с подсилване
- Какво е обучение с подсилване?
- Разлика между обучение с учител, без учител и с подсилване
- Приложения на DRL през 2025 г. (роботика, здравеопазване, финанси, логистика)
- Разбиране на цикъла на взаимодействие агент-среда
2. Основи на обучението с подсилване
- Марковски процеси на вземане на решения (MDP)
- Функции на състояние, действие, награда, политика и стойност
- Компромис между проучване и експлоатация
- Методи Монте Карло и обучение с времева разлика (TD)
3. Реализация на основни алгоритми за обучение с подсилване
- Таблични методи: динамично програмиране, оценка на политика и итерация
- Q-Learning и SARSA
- Епсилон-алчно проучване и стратегии с намаляване
- Реализация на среди за обучение с подсилване с OpenAI Gymnasium
4. Преход към дълбоко обучение с подсилване
- Ограничения на табличните методи
- Използване на невронни мрежи за апроксимация на функции
- Архитектура и работен процес на Deep Q-Network (DQN)
- Възпроизвеждане на опит и целеви мрежи
5. Усъвършенствани алгоритми за дълбоко обучение с подсилване
- Double DQN, Dueling DQN и приоритизирано възпроизвеждане на опит
- Методи с градиент на политиката: алгоритъм REINFORCE
- Архитектури Actor-Critic (A2C, A3C)
- Proximal Policy Optimization (PPO)
- Soft Actor-Critic (SAC)
6. Работа с непрекъснати пространства на действия
- Предизвикателства при непрекъснатото управление
- Използване на DDPG (Deep Deterministic Policy Gradient)
- Twin Delayed DDPG (TD3)
7. Практически инструменти и рамки
- Използване на Stable-Baselines3 и Ray RLlib
- Регистриране и наблюдение с TensorBoard
- Настройка на хиперпараметри за DRL модели
8. Инженеринг на награди и проектиране на среда
- Оформяне на награди и балансиране на наказания
- Концепции за трансфер на обучение от симулация към реалност
- Създаване на персонализирани среди в Gymnasium
9. Частично наблюдаеми среди и генерализация
- Обработка на непълна информация за състоянието (POMDP)
- Подходи, базирани на памет, използващи LSTM и RNN
- Подобряване на устойчивостта и генерализацията на агента
10. Теория на игрите и многоагентно обучение с подсилване
- Въведение в многоагентните среди
- Сътрудничество срещу конкуренция
- Приложения в състезателното обучение и оптимизацията на стратегии
11. Казуси и приложения от реалния свят
- Симулации на автономно шофиране
- Динамично ценообразуване и стратегии за финансова търговия
- Роботика и индустриална автоматизация
12. Отстраняване на проблеми и оптимизация
- Диагностициране на нестабилно обучение
- Управление на рядкостта на наградите и пренастройването
- Мащабиране на DRL модели на GPU и разпределени системи
13. Обобщение и следващи стъпки
- Преговор на архитектурата на DRL и ключовите алгоритми
- Индустриални тенденции и насоки за изследвания (например RLHF, хибридни модели)
- Допълнителни ресурси и материали за четене
Изисквания
- Умения за програмиране на Python
- Разбиране на математически анализ и линейна алгебра
- Основни познания по вероятности и статистика
- Опит в изграждането на модели за машинно обучение с помощта на Python и NumPy или TensorFlow/PyTorch
Аудитория
- Разработчици, интересуващи се от изкуствен интелект и интелигентни системи
- Специалисти по данни, изследващи рамки за обучение с подсилване
- Инженери по машинно обучение, работещи с автономни системи
Отзиви от участници (3)
Много ми хареса краят, когато прекарахме време, разглеждайки CHAT GPT. Залата не беше най-добре организирана за това – вместо едно голямо стола, няколко по-малки щеше да помогне, за да се разделим на малки групи и да мислим съвместно.
Nola - Laramie County Community College
Курс - Artificial Intelligence (AI) Overview
Машинен превод
Работата с първични принципи по фокусиран начин и прилагане на кейс студии вътре в същия ден
Maggie Webb - Department of Jobs, Regions, and Precincts
Курс - Artificial Neural Networks, Machine Learning, Deep Thinking
Машинен превод
Че се прилага реални данни на компаниите. Тренърът имаше много добър подход, подказвайки участниците да участват и конкурират.
Jimena Esquivel - Zaklad Uslugowy Hakoman Andrzej Cybulski
Курс - Applied AI from Scratch in Python
Машинен превод