Съдържание и теми, включени в курса
Въведение, цели и стратегия за миграция
- Цели на курса, съответствие с профила на участниците и критерии за успех
- Подходи за миграция на високо ниво и съображения за риска
- Настройка на работни пространства, хранилища и лабораторни набори от данни
Ден 1 — Основи на миграцията и архитектура
- Lakehouse концепции, преглед на Delta Lake и архитектура на Databricks
- Разлики между SMP и MPP и последици за миграцията
- Дизайн на Medallion (Bronze→Silver→Gold) и преглед на Unity Catalog
Лабораторно упражнение Ден 1 — Преобразуване на съхранена процедура
- Практическа миграция на примерна съхранена процедура към notebook
- Съпоставяне на временни таблици и курсори към DataFrame трансформации
- Валидиране и сравнение с оригиналния резултат
Ден 2 — Разширен Delta Lake и инкрементално зареждане
- ACID транзакции, журнали на комитите, версиониране и пътуване във времето
- Auto Loader, модели за MERGE INTO, upserts и еволюция на схемата
- OPTIMIZE, VACUUM, Z-ORDER, партициониране и настройка на съхранението
Лабораторно упражнение Ден 2 — Инкрементално зареждане и оптимизация
- Внедряване на Auto Loader зареждане и MERGE работни процеси
- Прилагане на OPTIMIZE, Z-ORDER и VACUUM; валидиране на резултатите
- Измерване на подобренията в производителността при четене/запис
Ден 3 — SQL в Databricks, производителност и отстраняване на грешки
- Аналитични SQL функции: прозоречни функции, функции от по-висок ред, обработка на JSON/масиви
- Четене на Spark UI, DAG, shuffles, етапи, задачи и диагностика на тесни места
- Модели за настройка на заявки: broadcast joins, подсказки, кеширане и намаляване на spill
Лабораторно упражнение Ден 3 — Рефакториране на SQL и настройка на производителността
- Рефакториране на тежък SQL процес в оптимизиран Spark SQL
- Използване на следи от Spark UI за идентифициране и отстраняване на проблеми със skew и shuffle
- Бенчмарк преди/след и документиране на стъпките за настройка
Ден 4 — Тактически PySpark: Замяна на процедурната логика
- Модел на изпълнение на Spark: драйвер, изпълнители, мързелива оценка и стратегии за партициониране
- Трансформиране на цикли и курсори във векторизирани DataFrame операции
- Модуларизация, UDF/pandas UDF, widgets и библиотеки за многократна употреба
Лабораторно упражнение Ден 4 — Рефакториране на процедурни скриптове
- Рефакториране на процедурен ETL скрипт в модулни PySpark notebook-и
- Въвеждане на параметризация, тестове в стил unit и функции за многократна употреба
- Преглед на кода и прилагане на контролен списък с най-добри практики
Ден 5 — Оркестрация, цялостен pipeline и най-добри практики
- Databricks Workflows: дизайн на задачи, зависимости между задачи, тригери и обработка на грешки
- Проектиране на инкрементални Medallion потоци с правила за качество и валидиране на схемата
- Интеграция с Git (GitHub/Azure DevOps), CI и стратегии за тестване на PySpark логика
Лабораторно упражнение Ден 5 — Изграждане на пълен цялостен pipeline
- Сглобяване на Bronze→Silver→Gold pipeline, оркестриран с Workflows
- Внедряване на логване, одит, повторни опити и автоматизирани валидации
- Изпълнение на пълния pipeline, валидиране на резултатите и подготовка на бележки за внедряване
Операционализация, управление и готовност за производство
- Най-добри практики за управление на Unity Catalog, проследяване на произхода и контрол на достъпа
- Модели за разходи, оразмеряване на клъстери, автомащабиране и конкурентност на задачи
- Контролни списъци за внедряване, стратегии за връщане назад и създаване на runbook
Финален преглед, трансфер на знания и следващи стъпки
- Презентации на участниците за миграционната работа и научените уроци
- Анализ на пропуските, препоръчани последващи дейности и предаване на обучителните материали
- Референции, допълнителни пътеки за обучение и опции за поддръжка
Изисквания
- Разбиране на концепциите за инженеринг на данни
- Опит със SQL и съхранени процедури (Synapse / SQL Server)
- Запознатост с концепциите за ETL оркестрация (ADF или подобни)
Аудитория
- Технологични мениджъри с опит в инженеринга на данни
- Инженери по данни, преминаващи от процедурна OLAP логика към Lakehouse модели
- Платформени инженери, отговорни за внедряването на Databricks