Свържете се с нас

Съдържание и теми, включени в курса

Въведение в моделите за зрение и език

  • Преглед на VLM моделите и тяхната роля в мултимодалния AI
  • Популярни архитектури: CLIP, Flamingo, BLIP и др.
  • Случаи на употреба: търсене, генериране на описания, автономни системи, анализ на съдържание

Подготовка на средата за фино настройване

  • Настройка на OpenCLIP и други VLM библиотеки
  • Формати на набори от данни за двойки изображение-текст
  • Конвейери за предварителна обработка на визуални и текстови входни данни

Фино настройване на CLIP и подобни модели

  • Контрастивна загуба и съвместни пространства за вграждане
  • Практическо упражнение: фино настройване на CLIP върху персонализирани набори от данни
  • Работа с домейн-специфични и многоезични данни

Усъвършенствани техники за фино настройване

  • Използване на LoRA и методи, базирани на адаптери, за ефективност
  • Настройка на промптове и визуално инжектиране на промптове
  • Компромиси между zero-shot и фино настроена оценка

Оценка и бенчмаркинг

  • Метрики за VLM: точност на извличане, BLEU, CIDEr, обхват
  • Диагностика на визуално-текстовото подравняване
  • Визуализиране на пространства за вграждане и грешни класификации

Внедряване и използване в реални приложения

  • Експортиране на модели за извод (TorchScript, ONNX)
  • Интегриране на VLM модели в конвейери или API-та
  • Съображения за ресурси и мащабиране на модела

Казуси и приложни сценарии

  • Медиен анализ и модериране на съдържание
  • Търсене и извличане в електронната търговия и дигиталните библиотеки
  • Мултимодално взаимодействие в роботиката и автономните системи

Обобщение и следващи стъпки

Изисквания

  • Разбиране на дълбокото обучение за компютърно зрение и обработка на естествен език (NLP)
  • Опит с PyTorch и модели, базирани на трансформери
  • Запознатост с мултимодални моделни архитектури

Аудитория

  • Инженери по компютърно зрение
  • AI разработчици
 14 Часа

Брой участници


Цена за участник

Предстоящи Курсове

Свързани Kатегории