Свържете се с нас

Съдържание и теми, включени в курса

Въведение в обучението с подкрепа и агентния изкуствен интелект

  • Вземане на решения при несигурност и последователно планиране
  • Ключови компоненти на RL: агенти, среди, състояния и награди
  • Ролята на RL в адаптивните и агентни AI системи

Марковски процес за вземане на решения (MDP)

  • Формално определение и свойства на MDP
  • Функции на стойност, уравнения на Белман и динамично програмиране
  • Оценка, подобрение и итерация на стратегиите

Обучение с подкрепа без модел

  • Монте Карло и учене на временна разлика (TD)
  • Q-учене и SARSA
  • Практика: прилагане на таблични RL методи в Python

Дълбоко обучение с подкрепа

  • Комбиниране на невронни мрежи с RL за апроксимация на функции
  • Дълбоки Q-мрежи (DQN) и възпроизвеждане на опита
  • Архитектури от тип Актьор-Критик и градиенти на стратегията
  • Практика: обучение на агент с DQN и PPO с Stable-Baselines3

Стратегии за изследователство и оформяне на наградите

  • Баланс между изследователство и експлоатация (epsilon-greedy, UCB, ентропийни методи)
  • Проектиране на функции за награди и избягване на непредвидени поведения
  • Оформяне на награди и обучение с програма (curriculum learning)

Напреднали теми в RL и вземането на решения

  • Обучение с подкрепа за множество агенти и кооперативни стратегии
  • Иерархично обучение с подкрепа и рамка на опциите
  • Офлайн RL и учене чрез имитация за по-безопасно внедряване

Среди за симулация и оценка

  • Използване на OpenAI Gym и персонализирани среди
  • Непрекъснати срещу дискретни пространства за действия
  • Метрики за производителност, стабилност и ефективност на пробите на агента

Интегриране на RL в системи с агентен изкуствен интелект

  • Комбиниране на мислене и RL в хибридни агентови архитектури
  • Интегриране на обучение с подкрепа в агенти, използващи инструменти
  • Оперативни съображения за мащабиране и внедряване

Финален проект

  • Проектиране и прилагане на агент за обучение с подкрепа за симулирана задача
  • Анализ на производителността при обучението и оптимизиране на хиперпараметрите
  • Демонстрация на адаптивно поведение и вземане на решения в агентен контекст

Обобщение и следващи стъпки

Изисквания

  • Добра владеене на програмирането на Python
  • Здрави познания за концепциите в машинното учене и дълбокото учене
  • Запознатост с линейната алгебра, вероятностите и основните методи за оптимизация

Аудитория

  • Инженери по обучение с подкрепа и приложни изследователи на AI
  • Разработчици в областта на роботиката и автоматизацията
  • Инженерни отбори, работещи с адаптивни и агентни AI системи
 28 Часа

Брой участници


Цена за участник

Отзиви от участници (3)

Предстоящи Курсове

Свързани Kатегории