Съдържание и теми, включени в курса
Въведение
Разбиране на големите данни
Преглед на Spark
Преглед на Python
Преглед на PySpark
- Разпределяне на данни чрез рамката Resilient Distributed Datasets
- Разпределяне на изчисления чрез оператори на Spark API
Настройка на Python със Spark
Настройка на PySpark
Използване на EC2 инстанции на Amazon Web Services (AWS) за Spark
Настройка на Databricks
Настройка на AWS EMR клъстер
Изучаване на основите на програмирането с Python
- Запознаване с Python
- Използване на Jupyter Notebook
- Използване на променливи и прости типове данни
- Работа със списъци
- Използване на if изрази
- Използване на потребителски входни данни
- Работа с while цикли
- Имплементиране на функции
- Работа с класове
- Работа с файлове и изключения
- Работа с проекти, данни и API-та
Изучаване на основите на Spark DataFrame
- Запознаване със Spark DataFrames
- Имплементиране на основни операции със Spark
- Използване на Groupby и агрегатни операции
- Работа с времеви отпечатъци и дати
Работа по проектно упражнение със Spark DataFrame
Разбиране на машинното обучение с MLlib
Работа с MLlib, Spark и Python за машинно обучение
Разбиране на регресиите
- Изучаване на теорията на линейната регресия
- Имплементиране на код за оценка на регресия
- Работа по примерно упражнение за линейна регресия
- Изучаване на теорията на логистичната регресия
- Имплементиране на код за логистична регресия
- Работа по примерно упражнение за логистична регресия
Разбиране на случайните гори и дърветата на решенията
- Изучаване на теорията на дървовидните методи
- Имплементиране на кодове за дървета на решенията и случайни гори
- Работа по примерно упражнение за класификация със случайна гора
Работа с K-means клъстеризация
- Разбиране на теорията на K-means клъстеризацията
- Имплементиране на код за K-means клъстеризация
- Работа по примерно упражнение за клъстеризация
Работа с препоръчителни системи
Имплементиране на обработка на естествен език
- Разбиране на обработката на естествен език (NLP)
- Преглед на NLP инструменти
- Работа по примерно NLP упражнение
Поточна обработка със Spark на Python
- Преглед на поточната обработка със Spark
- Примерно упражнение за поточна обработка със Spark
Заключителни бележки
Изисквания
- Общи умения за програмиране
Аудитория
- Разработчици
- ИТ специалисти
- Специалисти по данни
Отзиви от участници (6)
Ми ми допадна, че беше praktično. Обичах да прилагам теоретичните знания с практически примери.
Aurelia-Adriana - Allianz Services Romania
Курс - Python and Spark for Big Data (PySpark)
Машинен превод
Курсът беше по серия от много сложни свързани теми, а Пабло разполага с дълбока експертиза във всеки един от тях. Понякога нюансите бяха загубени при комуникацията и/или поради времеви ограничения, което вероятно предизвика не съвсем задоволаващи очаквания. Освен това имаше някои проблеми с конфигурирането на UHG/Azure Databricks, но Пабло и UHG ги разрешиха бързо веднага след като станаха очевидни - за мен това показваше високо ниво на разбиране и професионализъм между UHG и Пабло,
Michael Monks - Tech NorthWest Skillnet
Курс - Python and Spark for Big Data (PySpark)
Машинен превод
Индивидуално внимание.
ARCHANA ANILKUMAR - PPL
Курс - Python and Spark for Big Data (PySpark)
Машинен превод
Практическо обучение..
Abraham Thomas - PPL
Курс - Python and Spark for Big Data (PySpark)
Машинен превод
Уроките бяха проведени в Jupyter тетрадка. Темите бяха структурирани с логична последователност и естествено помагаха да се развиват сесиите от по-лесната част към по-сложната. Уж вече съм напреднал потребител на Python с фона в Machine Learning, затова за мен курсът беше леко по-лесен за следене, отколкото, вероятно, за някои от класните ми колеги, които участваха в обучаващия курс. Оценявам, че част от най-елементарните концепции бяха пропуснати и той се фокусираше на най-съществените въпроси.
Angela DeLaMora - ADT, LLC
Курс - Python and Spark for Big Data (PySpark)
Машинен превод
практически задания
Pawel Kozikowski - GE Medical Systems Polska Sp. Zoo
Курс - Python and Spark for Big Data (PySpark)
Машинен превод