Свържете се с нас

Съдържание и теми, включени в курса

Платформа Databricks и основи на Lakehouse

  • Архитектура и компоненти на Databricks Lakehouse
  • Организиране на работни пространства и каталози

Работно пространство и бележници на Databricks

  • Навигация в работното пространство и разработка, базирана на бележници
  • Структуриране на кода във повторно използваеми бележници

Архитектура и изпълнение на Apache Spark

  • Архитектура на средата за изпълнение на Spark и модел на изпълнение
  • Лениво оценяване (lazy evaluation) и DAG на задачите

DataFrames в PySpark и API-то за DataFrame

  • Абстракции на DataFrame и схеми (schemas)
  • Основни операции с DataFrame и изрази по колони

Прехвърляне на SQL към DataFrames в PySpark

  • Превеждане на основните клаузи на SQL към операции с DataFrame
  • Функции за прозорец (window functions) и агрегации в PySpark

Четене и записване на данни в Databricks

  • Четене от общи източници на файлове и бази данни
  • Записване и партициониране на данни в Lakehouse

Delta Lake и управление на таблици

  • Таблиците Delta и транзакции ACID
  • Пътуване във времето (time travel) и еволюция на схемата (schema evolution)

Шаблони за почистване и трансформация на данни

  • Почистване на данни и превъртане на типове
  • Изграждане на повторно използваема логика за трансформации

Потребителски дефинирани функции и модулен код

  • Python UDFs и pandas UDFs
  • Модулизиране на процедурната логика във функции

Настройка на производителността и оптимизация

  • Стратегии за партициониране и кеширане
  • Диагностициране на тесни места чрез Spark UI

Основи на структурирания поток (Structured Streaming)

  • Моделите на обработка на партита спрямо потока (streaming)
  • Поточни DataFrames и основни агрегации

Задачи и оркестриране на работни потоци в Databricks

  • Планиране на бележници като задачи и събития
  • Изграждане на многостъпкови работни потоци с зависимости

Unity Catalog и управление на данните

  • Архитектура и имена на пространства (namespaces) в Unity Catalog
  • Контрол на достъпа и проследяване на произхода на данните (data lineage)

Тестване, отстраняване на грешки и практики за производство

  • Еднолично тестване на логиката в PySpark
  • Отстраняване на грешки и стандарти за качеството на кода

Приложни случаи в областта на финансовите услуги - Край до край (End-to-End)

  • Изграждане на крайно-до-краен ETL поток за банкиране
  • Прехвърляне на наследени SQL процеси към PySpark

Прехвърляне на SQL натоварвания към PySpark

  • Стратегия за прехвърляне и модели за планиране
  • Постепенно преобразуване на работни потоци от SQL в PySpark

Изисквания

  • Опит с програмиране на Python, включително функции и типове данни
  • Разбиране на SQL, включително joins (свързвания), агрегации и подзадачи
  • Не е необходимо предишен опит с Databricks или PySpark

Целева аудитория

  • Инженери по данни, анализатори на данни и специалисти по данни
  • Екипи, които прехвърлят съществуващи работни потоци, базирани на SQL, към Databricks и PySpark
 35 Часа

Брой участници


Цена за участник

Отзиви от участници (1)

Предстоящи Курсове

Свързани Kатегории