Съдържание и теми, включени в курса
Въведение в обучението с подкрепа и агентния изкуствен интелект
- Вземане на решения при несигурност и последователно планиране
- Ключови компоненти на RL: агенти, среди, състояния и награди
- Ролята на RL в адаптивните и агентни AI системи
Марковски процес за вземане на решения (MDP)
- Формално определение и свойства на MDP
- Функции на стойност, уравнения на Белман и динамично програмиране
- Оценка, подобрение и итерация на стратегиите
Обучение с подкрепа без модел
- Монте Карло и учене на временна разлика (TD)
- Q-учене и SARSA
- Практика: прилагане на таблични RL методи в Python
Дълбоко обучение с подкрепа
- Комбиниране на невронни мрежи с RL за апроксимация на функции
- Дълбоки Q-мрежи (DQN) и възпроизвеждане на опита
- Архитектури от тип Актьор-Критик и градиенти на стратегията
- Практика: обучение на агент с DQN и PPO с Stable-Baselines3
Стратегии за изследователство и оформяне на наградите
- Баланс между изследователство и експлоатация (epsilon-greedy, UCB, ентропийни методи)
- Проектиране на функции за награди и избягване на непредвидени поведения
- Оформяне на награди и обучение с програма (curriculum learning)
Напреднали теми в RL и вземането на решения
- Обучение с подкрепа за множество агенти и кооперативни стратегии
- Иерархично обучение с подкрепа и рамка на опциите
- Офлайн RL и учене чрез имитация за по-безопасно внедряване
Среди за симулация и оценка
- Използване на OpenAI Gym и персонализирани среди
- Непрекъснати срещу дискретни пространства за действия
- Метрики за производителност, стабилност и ефективност на пробите на агента
Интегриране на RL в системи с агентен изкуствен интелект
- Комбиниране на мислене и RL в хибридни агентови архитектури
- Интегриране на обучение с подкрепа в агенти, използващи инструменти
- Оперативни съображения за мащабиране и внедряване
Финален проект
- Проектиране и прилагане на агент за обучение с подкрепа за симулирана задача
- Анализ на производителността при обучението и оптимизиране на хиперпараметрите
- Демонстрация на адаптивно поведение и вземане на решения в агентен контекст
Обобщение и следващи стъпки
Изисквания
- Добра владеене на програмирането на Python
- Здрави познания за концепциите в машинното учене и дълбокото учене
- Запознатост с линейната алгебра, вероятностите и основните методи за оптимизация
Аудитория
- Инженери по обучение с подкрепа и приложни изследователи на AI
- Разработчици в областта на роботиката и автоматизацията
- Инженерни отбори, работещи с адаптивни и агентни AI системи
Отзиви от участници (3)
Тренерът е търпелив и много полезен. Той познава добре темата.
CLIFFORD TABARES - Universal Leaf Philippines, Inc.
Курс - Agentic AI for Business Automation: Use Cases & Integration
Машинен превод
Добра смес от знания и практика
Ion Mironescu - Facultatea S.A.I.A.P.M.
Курс - Agentic AI for Enterprise Applications
Машинен превод
Мистото на теорията и практиката, както и на високонивелните и нисконивелните перспективи
Ion Mironescu - Facultatea S.A.I.A.P.M.
Курс - Autonomous Decision-Making with Agentic AI
Машинен превод