Съдържание и теми, включени в курса
PySpark и машинно обучение
Модул 1: Основи на Big Data и Spark
- Преглед на Big Data екосистемата и ролята на Spark в модерните платформи за данни
- Разбиране на архитектурата на Spark: драйвер, изпълнители, мениджър на клъстер, мързеливо оценяване, DAG и планиране на изпълнението
- Разлики между RDD и DataFrame API и кога да се използва всеки подход
- Създаване и конфигуриране на SparkSession и разбиране на основите на конфигурацията на приложенията
Модул 2: PySpark DataFrames
- Четене и запис на данни от корпоративни източници и формати (CSV, JSON, Parquet, Delta)
- Работа с PySpark DataFrames: трансформации, действия, изрази на колони, филтриране, съединения и агрегации
- Внедряване на разширени операции като прозоречни функции, работа с времеви отпечатъци и работа с вложени данни
- Прилагане на проверки за качество на данните и писане на многократно използваем и поддържаем PySpark код
Модул 3: Ефективна обработка на големи набори от данни
- Разбиране на основите на производителността: стратегии за партициониране, поведение при разместване (shuffle), кеширане и персистиране
- Използване на техники за оптимизация, включително broadcast съединения и анализ на план за изпълнение
- Ефективна обработка на големи набори от данни и най-добри практики за мащабируеми работни процеси с данни
- Разбиране на еволюцията на схемата и модерните формати за съхранение, използвани в корпоративни среди
Модул 4: Инженеринг на признаци в мащаб
- Извършване на инженеринг на признаци с Spark MLlib: справяне с липсващи стойности, кодиране на категорийни променливи и мащабиране на признаци
- Проектиране на многократно използваеми стъпки за предварителна обработка и подготовка на набори от данни за процеси за машинно обучение
- Въведение в селекцията на признаци и справянето с небалансирани набори от данни
Модул 5: Машинно обучение със Spark MLlib
- Разбиране на архитектурата на MLlib и модела Estimator/Transformer
- Обучение на регресионни и класификационни модели в мащаб (Линейна регресия, Логистична регресия, Дървета на решенията, Случайна гора)
- Сравняване на модели и интерпретиране на резултатите в разпределени работни процеси за машинно обучение
Модул 6: Цялостни ML процеси
- Изграждане на цялостни процеси за машинно обучение, комбиниращи предварителна обработка, инженеринг на признаци и моделиране
- Прилагане на стратегии за разделяне на данните за обучение/валидиране/тестване
- Извършване на кръстосано валидиране и настройка на хиперпараметри с помощта на мрежово и произволно търсене
- Структуриране на възпроизводими експерименти за машинно обучение
Модул 7: Оценка на модели и практически решения в ML
- Прилагане на подходящи метрики за оценка при регресионни и класификационни проблеми
- Идентифициране на прекомерно и недостатъчно обучение и вземане на практически решения за избор на модел
- Интерпретиране на важността на признаците и разбиране на поведението на модела
Модул 8: Производствени и корпоративни практики
- Запазване и зареждане на модели в Spark
- Внедряване на работни процеси за пакетно инфериране върху големи набори от данни
- Разбиране на жизнения цикъл на машинното обучение в корпоративни среди
- Въведение в концепциите за версиониране, проследяване на експерименти и основни стратегии за тестване
Практически резултат
- Способност за самостоятелна работа с PySpark
- Способност за ефективна обработка на големи набори от данни
- Способност за извършване на инженеринг на признаци в мащаб
- Способност за изграждане на мащабируеми процеси за машинно обучение
Изисквания
Участниците трябва да имат следния опит:
Основни познания по програмиране на Python, включително работа с функции, структури от данни и библиотеки
Фундаментално разбиране на концепции за анализ на данни, като набори от данни, трансформации и агрегации
Основни познания за SQL и концепции за релационни данни
Въвеждащо разбиране на концепции за машинно обучение, като набори за обучение, признаци и метрики за оценка
Препоръчително е познаване на среди с команден ред и основни практики за разработка на софтуер
Опитът с Pandas, NumPy или подобни библиотеки за обработка на данни е от полза, но не е задължителен.
Отзиви от участници (1)
Ми ми допадна, че беше praktično. Обичах да прилагам теоретичните знания с практически примери.
Aurelia-Adriana - Allianz Services Romania
Курс - Python and Spark for Big Data (PySpark)
Машинен превод