Съдържание и теми, включени в курса
Платформа Databricks и основи на Lakehouse
- Архитектура и компоненти на Databricks Lakehouse
- Организиране на работни пространства и каталози
Работно пространство и бележници на Databricks
- Навигация в работното пространство и разработка, базирана на бележници
- Структуриране на кода във повторно използваеми бележници
Архитектура и изпълнение на Apache Spark
- Архитектура на средата за изпълнение на Spark и модел на изпълнение
- Лениво оценяване (lazy evaluation) и DAG на задачите
DataFrames в PySpark и API-то за DataFrame
- Абстракции на DataFrame и схеми (schemas)
- Основни операции с DataFrame и изрази по колони
Прехвърляне на SQL към DataFrames в PySpark
- Превеждане на основните клаузи на SQL към операции с DataFrame
- Функции за прозорец (window functions) и агрегации в PySpark
Четене и записване на данни в Databricks
- Четене от общи източници на файлове и бази данни
- Записване и партициониране на данни в Lakehouse
Delta Lake и управление на таблици
- Таблиците Delta и транзакции ACID
- Пътуване във времето (time travel) и еволюция на схемата (schema evolution)
Шаблони за почистване и трансформация на данни
- Почистване на данни и превъртане на типове
- Изграждане на повторно използваема логика за трансформации
Потребителски дефинирани функции и модулен код
- Python UDFs и pandas UDFs
- Модулизиране на процедурната логика във функции
Настройка на производителността и оптимизация
- Стратегии за партициониране и кеширане
- Диагностициране на тесни места чрез Spark UI
Основи на структурирания поток (Structured Streaming)
- Моделите на обработка на партита спрямо потока (streaming)
- Поточни DataFrames и основни агрегации
Задачи и оркестриране на работни потоци в Databricks
- Планиране на бележници като задачи и събития
- Изграждане на многостъпкови работни потоци с зависимости
Unity Catalog и управление на данните
- Архитектура и имена на пространства (namespaces) в Unity Catalog
- Контрол на достъпа и проследяване на произхода на данните (data lineage)
Тестване, отстраняване на грешки и практики за производство
- Еднолично тестване на логиката в PySpark
- Отстраняване на грешки и стандарти за качеството на кода
Приложни случаи в областта на финансовите услуги - Край до край (End-to-End)
- Изграждане на крайно-до-краен ETL поток за банкиране
- Прехвърляне на наследени SQL процеси към PySpark
Прехвърляне на SQL натоварвания към PySpark
- Стратегия за прехвърляне и модели за планиране
- Постепенно преобразуване на работни потоци от SQL в PySpark
Изисквания
- Опит с програмиране на Python, включително функции и типове данни
- Разбиране на SQL, включително joins (свързвания), агрегации и подзадачи
- Не е необходимо предишен опит с Databricks или PySpark
Целева аудитория
- Инженери по данни, анализатори на данни и специалисти по данни
- Екипи, които прехвърлят съществуващи работни потоци, базирани на SQL, към Databricks и PySpark
Отзиви от участници (1)
Ми ми допадна, че беше praktično. Обичах да прилагам теоретичните знания с практически примери.
Aurelia-Adriana - Allianz Services Romania
Курс - Python and Spark for Big Data (PySpark)
Машинен превод