Свържете се с нас

Съдържание и теми, включени в курса

Подробна програма на обучението

  1. Въведение в NLP
    • Разбиране на NLP
    • NLP рамки
    • Търговски приложения на NLP
    • Извличане на данни от уеб
    • Работа с различни API за извличане на текстови данни
    • Работа и съхранение на текстови корпуси, запазване на съдържание и съответни метаданни
    • Предимства от използването на Python и ускорен курс по NLTK
  2. Практическо разбиране за корпус и набор от данни
    • Защо се нуждаем от корпус?
    • Анализ на корпус
    • Видове атрибути на данни
    • Различни файлови формати за корпуси
    • Подготовка на набор от данни за NLP приложения
  3. Разбиране на структурата на изреченията
    • Компоненти на NLP
    • Разбиране на естествен език
    • Морфологичен анализ – основа, дума, токен, етикети за част на речта
    • Синтактичен анализ
    • Семантичен анализ
    • Справяне с нееднозначност
  4. Предварителна обработка на текстови данни
    • Корпус – суров текст
      • Токенизация на изречения
      • Стемиране на суров текст
      • Лематизация на суров текст
      • Премахване на стоп думи
    • Корпус – сурови изречения
      • Токенизация на думи
      • Лематизация на думи
    • Работа с матрици термин-документ / документ-термин
    • Токенизация на текст в n-грами и изречения
    • Практическа и персонализирана предварителна обработка
  5. Анализиране на текстови данни
    • Основни характеристики на NLP
      • Парсери и парсиране
      • POS тагиране и тагери
      • Разпознаване на именувани обекти
      • N-грами
      • Торба от думи (Bag of words)
    • Статистически характеристики на NLP
      • Концепции на линейната алгебра за NLP
      • Вероятностна теория за NLP
      • TF-IDF
      • Векторизация
      • Енкодери и декодери
      • Нормализация
      • Вероятностни модели
    • Разширено инженерство на характеристики и NLP
      • Основи на word2vec
      • Компоненти на модела word2vec
      • Логика на модела word2vec
      • Разширение на концепцията word2vec
      • Приложение на модела word2vec
    • Казус: Приложение на „торба от думи“: автоматично обобщаване на текст с помощта на опростен и истински алгоритми на Лухн
  6. Клъстериране на документи, класификация и тематично моделиране
    • Клъстериране на документи и извличане на модели (йерархично клъстериране, k-средни, клъстериране и др.)
    • Сравняване и класифициране на документи с помощта на TFIDF, Jaccard и косинусно разстояние
    • Класификация на документи с помощта на Наивен Бейс и Максимална ентропия
  7. Идентифициране на важни текстови елементи
    • Намаляване на размерността: Анализ на главните компоненти (PCA), Сингулярно разлагане (SVD), неотрицателна матрична факторизация
    • Тематично моделиране и извличане на информация с помощта на Латентен семантичен анализ
  8. Извличане на обекти, анализ на настроения и разширено тематично моделиране
    • Положително срещу отрицателно: степен на настроение
    • Теория на отговора на въпроса
    • Тагиране на части на речта и неговото приложение: намиране на хора, места и организации, споменати в текст
    • Разширено тематично моделиране: Латентно разпределение на Дирихле
  9. Казуси
    • Извличане на неструктурирани потребителски ревюта
    • Класификация на настроения и визуализация на данни от ревюта на продукти
    • Извличане на модели на използване от логове на търсене
    • Класификация на текст
    • Тематично моделиране

Изисквания

Познаване и осъзнаване на принципите на NLP и разбиране на приложението на изкуствения интелект в бизнеса.

 21 Часа

Брой участници


Цена за участник

Отзиви от участници (1)

Предстоящи Курсове

Свързани Kатегории