Благодарим ви, че изпратихте вашето запитване! Един от членовете на нашия екип ще се свърже с вас скоро.
Благодарим ви, че направихте своята резервация! Един от членовете на нашия екип ще се свърже с вас скоро.
Съдържание и теми, включени в курса
Въведение в прогнозния AIOps
- Преглед на прогнозните анализи в ИТ операциите
- Източници на данни за прогнозиране (логове, метрики, събития)
- Ключови концепции в прогнозирането на времеви редове и модели на аномалии
Проектиране на модели за прогнозиране на инциденти
- Етикетиране на исторически инциденти и системно поведение
- Избор и обучение на модели (напр. LSTM, Random Forest, AutoML)
- Оценка на производителността на модела и управление на фалшивите положителни резултати
Събиране на данни и инженеринг на характеристики
- Поглъщане и подравняване на данни от логове и метрики за вход на модела
- Извличане на характеристики от структурирани и неструктурирани данни
- Справяне с шум и липсващи данни в оперативните конвейери
Автоматизиране на анализа на първопричините (RCA)
- Корелация на услуги и инфраструктура на базата на графи
- Използване на ML за извеждане на вероятни първопричини от вериги от събития
- Визуализиране на RCA с топологично ориентирани табла
Отстраняване на проблеми и автоматизация на работни потоци
- Интеграция с платформи за автоматизация (напр. Ansible, Rundeck)
- Задействане на откати, рестартирания или пренасочване на трафик
- Одит и документиране на автоматизираните интервенции
Мащабиране на интелигентни AIOps конвейери
- MLOps за наблюдаемост: преобучение и версиониране на модели
- Изпълнение на прогнози в реално време върху разпределени възли
- Най-добри практики за внедряване на AIOps в производствени среди
Казуси и практически приложения
- Анализиране на реални данни за инциденти с помощта на прогнозни AIOps модели
- Внедряване на RCA конвейери със синтетични и производствени данни
- Преглед на индустриални случаи на употреба: облачни прекъсвания, нестабилност на микросървиси, деградации на мрежата
Обобщение и следващи стъпки
Изисквания
- Опит със системи за наблюдение като Prometheus или ELK
- Практически познания по Python и основи на машинното обучение
- Запознатост с работни потоци за управление на инциденти
Аудитория
- Старши инженери по надеждност на сайтове (SRE)
- Архитекти на ИТ автоматизация
- Ръководители на DevOps и платформи за наблюдаемост
14 Часа