Свържете се с нас
 Продължителност 35 часa

Съдържание и теми, включени в курса

Въведение, цели и стратегия за миграция

  • Цели на курса, съответствие с профила на участниците и критерии за успех
  • Подходи за миграция на високо ниво и съображения за риска
  • Настройка на работни пространства, хранилища и лабораторни набори от данни

Ден 1 — Основи на миграцията и архитектура

  • Lakehouse концепции, преглед на Delta Lake и архитектура на Databricks
  • Разлики между SMP и MPP и последици за миграцията
  • Дизайн на Medallion (Bronze→Silver→Gold) и преглед на Unity Catalog

Лабораторно упражнение Ден 1 — Преобразуване на съхранена процедура

  • Практическа миграция на примерна съхранена процедура към notebook
  • Съпоставяне на временни таблици и курсори към DataFrame трансформации
  • Валидиране и сравнение с оригиналния резултат

Ден 2 — Разширен Delta Lake и инкрементално зареждане

  • ACID транзакции, журнали на комитите, версиониране и пътуване във времето
  • Auto Loader, модели за MERGE INTO, upserts и еволюция на схемата
  • OPTIMIZE, VACUUM, Z-ORDER, партициониране и настройка на съхранението

Лабораторно упражнение Ден 2 — Инкрементално зареждане и оптимизация

  • Внедряване на Auto Loader зареждане и MERGE работни процеси
  • Прилагане на OPTIMIZE, Z-ORDER и VACUUM; валидиране на резултатите
  • Измерване на подобренията в производителността при четене/запис

Ден 3 — SQL в Databricks, производителност и отстраняване на грешки

  • Аналитични SQL функции: прозоречни функции, функции от по-висок ред, обработка на JSON/масиви
  • Четене на Spark UI, DAG, shuffles, етапи, задачи и диагностика на тесни места
  • Модели за настройка на заявки: broadcast joins, подсказки, кеширане и намаляване на spill

Лабораторно упражнение Ден 3 — Рефакториране на SQL и настройка на производителността

  • Рефакториране на тежък SQL процес в оптимизиран Spark SQL
  • Използване на следи от Spark UI за идентифициране и отстраняване на проблеми със skew и shuffle
  • Бенчмарк преди/след и документиране на стъпките за настройка

Ден 4 — Тактически PySpark: Замяна на процедурната логика

  • Модел на изпълнение на Spark: драйвер, изпълнители, мързелива оценка и стратегии за партициониране
  • Трансформиране на цикли и курсори във векторизирани DataFrame операции
  • Модуларизация, UDF/pandas UDF, widgets и библиотеки за многократна употреба

Лабораторно упражнение Ден 4 — Рефакториране на процедурни скриптове

  • Рефакториране на процедурен ETL скрипт в модулни PySpark notebook-и
  • Въвеждане на параметризация, тестове в стил unit и функции за многократна употреба
  • Преглед на кода и прилагане на контролен списък с най-добри практики

Ден 5 — Оркестрация, цялостен pipeline и най-добри практики

  • Databricks Workflows: дизайн на задачи, зависимости между задачи, тригери и обработка на грешки
  • Проектиране на инкрементални Medallion потоци с правила за качество и валидиране на схемата
  • Интеграция с Git (GitHub/Azure DevOps), CI и стратегии за тестване на PySpark логика

Лабораторно упражнение Ден 5 — Изграждане на пълен цялостен pipeline

  • Сглобяване на Bronze→Silver→Gold pipeline, оркестриран с Workflows
  • Внедряване на логване, одит, повторни опити и автоматизирани валидации
  • Изпълнение на пълния pipeline, валидиране на резултатите и подготовка на бележки за внедряване

Операционализация, управление и готовност за производство

  • Най-добри практики за управление на Unity Catalog, проследяване на произхода и контрол на достъпа
  • Модели за разходи, оразмеряване на клъстери, автомащабиране и конкурентност на задачи
  • Контролни списъци за внедряване, стратегии за връщане назад и създаване на runbook

Финален преглед, трансфер на знания и следващи стъпки

  • Презентации на участниците за миграционната работа и научените уроци
  • Анализ на пропуските, препоръчани последващи дейности и предаване на обучителните материали
  • Референции, допълнителни пътеки за обучение и опции за поддръжка

Изисквания

  • Разбиране на концепциите за инженеринг на данни
  • Опит със SQL и съхранени процедури (Synapse / SQL Server)
  • Запознатост с концепциите за ETL оркестрация (ADF или подобни)

Аудитория

  • Технологични мениджъри с опит в инженеринга на данни
  • Инженери по данни, преминаващи от процедурна OLAP логика към Lakehouse модели
  • Платформени инженери, отговорни за внедряването на Databricks

Брой участници


Цена за участник

Предстоящи Курсове

Свързани Kатегории