Съдържание и теми, включени в курса
1. Въведение в задълбоченото обучение с утвърждение
- Какво е обучение с утвърждение?
- Разлика между обучение с учител, обучение без учител и обучение с утвърждение
- Приложения на DRL през 2025 г. (роботика, здравеопазване, финанси, логистика)
- Разбиране на цикъла на взаимодействие агент-среда
2. Основи на обучението с утвърждение
- Марковски процеси за вземане на решения (MDP)
- Функции на състоянието, действието, наградата, политиката и стойността
- Компромис между проучване и експлоатация
- Методи Монте Карло и обучение с времева разлика (TD)
3. Внедряване на основни алгоритми за ОУ
- Таблични методи: Динамично програмиране, оценка на политика и итерация
- Q-Learning и SARSA
- Епсилон-алчно проучване и стратегии за намаляване
- Внедряване на среди за ОУ с OpenAI Gymnasium
4. Преход към задълбочено обучение с утвърждение
- Ограничения на табличните методи
- Използване на невронни мрежи за апроксимация на функции
- Архитектура и работен процес на Deep Q-Network (DQN)
- Възпроизвеждане на опита и целеви мрежи
5. Усъвършенствани алгоритми за DRL
- Double DQN, Dueling DQN и приоритизирано възпроизвеждане на опита
- Методи с градиент на политиката: Алгоритъм REINFORCE
- Архитектури Actor-Critic (A2C, A3C)
- Проксимална оптимизация на политиката (PPO)
- Soft Actor-Critic (SAC)
6. Работа с пространства за непрекъснати действия
- Предизвикателства при непрекъснатото управление
- Използване на DDPG (Deep Deterministic Policy Gradient)
- Twin Delayed DDPG (TD3)
7. Практически инструменти и рамки
- Използване на Stable-Baselines3 и Ray RLlib
- Регистриране и наблюдение с TensorBoard
- Настройка на хиперпараметри за DRL модели
8. Инженеринг на награди и дизайн на средата
- Оформяне на наградата и балансиране на неустойките
- Концепции за трансферно обучение от симулация към реалност
- Създаване на персонализирана среда в Gymnasium
9. Частично наблюдаеми среди и генерализация
- Справяне с непълна информация за състоянието (POMDPs)
- Подходи, базирани на памет, използващи LSTM и RNN
- Подобряване на устойчивостта и генерализацията на агента
10. Теория на игрите и обучение с утвърждение с множество агенти
- Въведение в среди с множество агенти
- Сътрудничество срещу конкуренция
- Приложения в състезателното обучение и оптимизацията на стратегии
11. Казуси и реални приложения
- Симулации за автономно шофиране
- Стратегии за динамично ценообразуване и финансова търговия
- Роботика и индустриална автоматизация
12. Отстраняване на проблеми и оптимизация
- Диагностициране на нестабилно обучение
- Управление на рядкост на наградите и пренастройване
- Мащабиране на DRL модели на GPU и разпределени системи
13. Обобщение и следващи стъпки
- Преговор на DRL архитектурата и ключовите алгоритми
- Индустриални тенденции и изследователски насоки (напр. RLHF, хибридни модели)
- Допълнителни ресурси и материали за четене
Изисквания
- Умения за програмиране с Python
- Разбиране на математически анализ и линейна алгебра
- Основни познания по вероятности и статистика
- Опит в изграждането на модели за машинно обучение с Python и NumPy или TensorFlow/PyTorch
Аудитория
- Разработчици, интересуващи се от ИИ и интелигентни системи
- Специалисти по данни, изследващи рамки за обучение с утвърждение
- Инженери по машинно обучение, работещи с автономни системи
Отзиви от участници (3)
Много ми хареса краят, когато прекарахме време, разглеждайки CHAT GPT. Залата не беше най-добре организирана за това – вместо едно голямо стола, няколко по-малки щеше да помогне, за да се разделим на малки групи и да мислим съвместно.
Nola - Laramie County Community College
Курс - Artificial Intelligence (AI) Overview
Машинен превод
Работата с първични принципи по фокусиран начин и прилагане на кейс студии вътре в същия ден
Maggie Webb - Department of Jobs, Regions, and Precincts
Курс - Artificial Neural Networks, Machine Learning, Deep Thinking
Машинен превод
Че се прилага реални данни на компаниите. Тренърът имаше много добър подход, подказвайки участниците да участват и конкурират.
Jimena Esquivel - Zaklad Uslugowy Hakoman Andrzej Cybulski
Курс - Applied AI from Scratch in Python
Машинен превод