Свържете се с нас

Съдържание и теми, включени в курса

PySpark и машинно обучение

Модул 1: Основи на Big Data и Spark

  • Преглед на Big Data екосистемата и ролята на Spark в модерните платформи за данни
  • Разбиране на архитектурата на Spark: драйвер, изпълнители, мениджър на клъстер, мързеливо оценяване, DAG и планиране на изпълнението
  • Разлики между RDD и DataFrame API и кога да се използва всеки подход
  • Създаване и конфигуриране на SparkSession и разбиране на основите на конфигурацията на приложенията

Модул 2: PySpark DataFrames

  • Четене и запис на данни от корпоративни източници и формати (CSV, JSON, Parquet, Delta)
  • Работа с PySpark DataFrames: трансформации, действия, изрази на колони, филтриране, съединения и агрегации
  • Внедряване на разширени операции като прозоречни функции, работа с времеви отпечатъци и работа с вложени данни
  • Прилагане на проверки за качество на данните и писане на многократно използваем и поддържаем PySpark код

Модул 3: Ефективна обработка на големи набори от данни

  • Разбиране на основите на производителността: стратегии за партициониране, поведение при разместване (shuffle), кеширане и персистиране
  • Използване на техники за оптимизация, включително broadcast съединения и анализ на план за изпълнение
  • Ефективна обработка на големи набори от данни и най-добри практики за мащабируеми работни процеси с данни
  • Разбиране на еволюцията на схемата и модерните формати за съхранение, използвани в корпоративни среди

Модул 4: Инженеринг на признаци в мащаб

  • Извършване на инженеринг на признаци с Spark MLlib: справяне с липсващи стойности, кодиране на категорийни променливи и мащабиране на признаци
  • Проектиране на многократно използваеми стъпки за предварителна обработка и подготовка на набори от данни за процеси за машинно обучение
  • Въведение в селекцията на признаци и справянето с небалансирани набори от данни

Модул 5: Машинно обучение със Spark MLlib

  • Разбиране на архитектурата на MLlib и модела Estimator/Transformer
  • Обучение на регресионни и класификационни модели в мащаб (Линейна регресия, Логистична регресия, Дървета на решенията, Случайна гора)
  • Сравняване на модели и интерпретиране на резултатите в разпределени работни процеси за машинно обучение

Модул 6: Цялостни ML процеси

  • Изграждане на цялостни процеси за машинно обучение, комбиниращи предварителна обработка, инженеринг на признаци и моделиране
  • Прилагане на стратегии за разделяне на данните за обучение/валидиране/тестване
  • Извършване на кръстосано валидиране и настройка на хиперпараметри с помощта на мрежово и произволно търсене
  • Структуриране на възпроизводими експерименти за машинно обучение

Модул 7: Оценка на модели и практически решения в ML

  • Прилагане на подходящи метрики за оценка при регресионни и класификационни проблеми
  • Идентифициране на прекомерно и недостатъчно обучение и вземане на практически решения за избор на модел
  • Интерпретиране на важността на признаците и разбиране на поведението на модела

Модул 8: Производствени и корпоративни практики

  • Запазване и зареждане на модели в Spark
  • Внедряване на работни процеси за пакетно инфериране върху големи набори от данни
  • Разбиране на жизнения цикъл на машинното обучение в корпоративни среди
  • Въведение в концепциите за версиониране, проследяване на експерименти и основни стратегии за тестване

Практически резултат

  • Способност за самостоятелна работа с PySpark
  • Способност за ефективна обработка на големи набори от данни
  • Способност за извършване на инженеринг на признаци в мащаб
  • Способност за изграждане на мащабируеми процеси за машинно обучение

Изисквания

Участниците трябва да имат следния опит:

Основни познания по програмиране на Python, включително работа с функции, структури от данни и библиотеки
Фундаментално разбиране на концепции за анализ на данни, като набори от данни, трансформации и агрегации
Основни познания за SQL и концепции за релационни данни
Въвеждащо разбиране на концепции за машинно обучение, като набори за обучение, признаци и метрики за оценка
Препоръчително е познаване на среди с команден ред и основни практики за разработка на софтуер

Опитът с Pandas, NumPy или подобни библиотеки за обработка на данни е от полза, но не е задължителен.

 21 Часа

Брой участници


Цена за участник

Отзиви от участници (1)

Предстоящи Курсове

Свързани Kатегории