Свържете се с нас
 Продължителност 21 часa

Съдържание и теми, включени в курса

Въведение в мащабирането на Ollama

  • Архитектура на Ollama и съображения за мащабиране
  • Често срещани тесни места при многопотребителски внедрявания
  • Добри практики за готовност на инфраструктурата

Разпределение на ресурсите и оптимизация на GPU

  • Ефективни стратегии за използване на CPU/GPU
  • Съображения за памет и честотна лента
  • Ресурсни ограничения на ниво контейнер

Внедряване с контейнери и Kubernetes

  • Контейнеризиране на Ollama с Docker
  • Стартиране на Ollama в Kubernetes клъстери
  • Балансиране на натоварването и откриване на услуги

Автоматично мащабиране и пакетна обработка

  • Проектиране на политики за автоматично мащабиране за Ollama
  • Техники за пакетна инференция за оптимизиране на пропускателната способност
  • Компромиси между латентност и пропускателна способност

Оптимизация на латентността

  • Профилиране на производителността на инференцията
  • Стратегии за кеширане и загряване на модели
  • Намаляване на I/O и комуникационния overhead

Мониторинг и наблюдаемост

  • Интегриране на Prometheus за метрики
  • Изграждане на табла с Grafana
  • Известяване и реакция при инциденти за инфраструктурата на Ollama

Управление на разходите и стратегии за мащабиране

  • Разпределение на GPU с отчитане на разходите
  • Съображения за внедряване в облак срещу on-prem
  • Стратегии за устойчиво мащабиране

Обобщение и следващи стъпки

Изисквания

  • Опит с администриране на Linux системи
  • Разбиране на контейнеризацията и оркестрацията
  • Запознатост с внедряването на модели за машинно обучение

Аудитория

  • DevOps инженери
  • Екипи за ML инфраструктура
  • Инженери по надеждност на сайта (Site Reliability Engineers)

Брой участници


Цена за участник

Предстоящи Курсове

Свързани Kатегории