Свържете се с нас

Съдържание и теми, включени в курса

Подробна учебна програма

  1. Въведение в обработката на естествен език
    • Разбиране на обработката на естествен език
    • Рамки за обработка на естествен език
    • Търговски приложения на обработката на естествен език
    • Извличане на данни от уеб
    • Работа с различни API за извличане на текстови данни
    • Работа със и съхранение на текстови корпуси, записване на съдържание и съответните метаданни
    • Предимства на използването на Python и ускорен курс по NLTK
  2. Практическо разбиране на корпус и набор от данни
    • Защо се нуждаем от корпус?
    • Анализ на корпус
    • Видове атрибути на данните
    • Различни файлови формати за корпуси
    • Подготовка на набор от данни за приложения за обработка на естествен език
  3. Разбиране на структурата на изреченията
    • Компоненти на обработката на естествен език
    • Разбиране на естествен език
    • Морфологичен анализ – основа, дума, токен, маркери за част на речта
    • Синтактичен анализ
    • Семантичен анализ
    • Справяне с двусмислието
  4. Предварителна обработка на текстови данни
    • Корпус – необработен текст
      • Токенизация на изречения
      • Стеминг на необработен текст
      • Лематизация на необработен текст
      • Премахване на стоп думи
    • Корпус – необработени изречения
      • Токенизация на думи
      • Лематизация на думи
    • Работа с матрици термин-документ/документ-термин
    • Токенизация на текст в n-грами и изречения
    • Практическа и персонализирана предварителна обработка
  5. Анализ на текстови данни
    • Основни характеристики на обработката на естествен език
      • Парсери и парсване
      • Маркиране на части на речта и тагери
      • Разпознаване на именувани обекти
      • N-грами
      • Торба с думи
    • Статистически характеристики на обработката на естествен език
      • Концепции от линейната алгебра за обработка на естествен език
      • Теория на вероятностите за обработка на естествен език
      • TF-IDF
      • Векторизация
      • Енкодери и декодери
      • Нормализация
      • Вероятностни модели
    • Разширено инженерство на характеристики и обработка на естествен език
      • Основи на word2vec
      • Компоненти на модела word2vec
      • Логика на модела word2vec
      • Разширение на концепцията word2vec
      • Приложение на модела word2vec
    • Казус: Приложение на торбата с думи: автоматично обобщаване на текст с помощта на опростения и истинския алгоритъм на Лун
  6. Клъстериране на документи, класификация и тематично моделиране
    • Клъстериране на документи и откриване на модели (йерархично клъстериране, k-средни, клъстериране и др.)
    • Сравняване и класифициране на документи с помощта на TFIDF, разстояния на Жакард и косинусово сходство
    • Класификация на документи чрез наивен Бейс и максимална ентропия
  7. Идентифициране на важни текстови елементи
    • Намаляване на размерността: анализ на главните компоненти, разлагане по сингулярни стойности, неотрицателна матрична факторизация
    • Тематично моделиране и извличане на информация чрез латентен семантичен анализ
  8. Извличане на обекти, анализ на настроения и разширено тематично моделиране
    • Положително срещу отрицателно: степен на настроение
    • Теория на отговора на елементите
    • Маркиране на части на речта и неговото приложение: откриване на хора, места и организации, споменати в текст
    • Разширено тематично моделиране: латентно разпределение на Дирихле
  9. Казуси
    • Извличане на неструктурирани потребителски отзиви
    • Класификация на настроения и визуализация на данни от продуктови отзиви
    • Извличане на модели на използване от регистри на търсения
    • Класификация на текст
    • Тематично моделиране

Изисквания

Познания и разбиране на принципите на обработката на естествен език и оценка на приложението на изкуствения интелект в бизнеса

 21 Часа

Брой участници


Цена за участник

Отзиви от участници (1)

Предстоящи Курсове

Свързани Kатегории