Благодарим ви, че изпратихте вашето запитване! Един от членовете на нашия екип ще се свърже с вас скоро.
Благодарим ви, че направихте своята резервация! Един от членовете на нашия екип ще се свърже с вас скоро.
Продължителност 21 часa
Съдържание и теми, включени в курса
Въведение в мащабирането на Ollama
- Архитектура на Ollama и съображения за мащабиране
- Често срещани тесни места при многопотребителски внедрявания
- Добри практики за готовност на инфраструктурата
Разпределение на ресурсите и оптимизация на GPU
- Ефективни стратегии за използване на CPU/GPU
- Съображения за памет и честотна лента
- Ресурсни ограничения на ниво контейнер
Внедряване с контейнери и Kubernetes
- Контейнеризиране на Ollama с Docker
- Стартиране на Ollama в Kubernetes клъстери
- Балансиране на натоварването и откриване на услуги
Автоматично мащабиране и пакетна обработка
- Проектиране на политики за автоматично мащабиране за Ollama
- Техники за пакетна инференция за оптимизиране на пропускателната способност
- Компромиси между латентност и пропускателна способност
Оптимизация на латентността
- Профилиране на производителността на инференцията
- Стратегии за кеширане и загряване на модели
- Намаляване на I/O и комуникационния overhead
Мониторинг и наблюдаемост
- Интегриране на Prometheus за метрики
- Изграждане на табла с Grafana
- Известяване и реакция при инциденти за инфраструктурата на Ollama
Управление на разходите и стратегии за мащабиране
- Разпределение на GPU с отчитане на разходите
- Съображения за внедряване в облак срещу on-prem
- Стратегии за устойчиво мащабиране
Обобщение и следващи стъпки
Изисквания
- Опит с администриране на Linux системи
- Разбиране на контейнеризацията и оркестрацията
- Запознатост с внедряването на модели за машинно обучение
Аудитория
- DevOps инженери
- Екипи за ML инфраструктура
- Инженери по надеждност на сайта (Site Reliability Engineers)