Свържете се с нас

Съдържание и теми, включени в курса

Основи на производственото внедряване на Tencent Hunyuan

  • Преглед на сценариите за предоставяне на моделите на Tencent Hunyuan
  • Характеристики на големите и MoE модели в производствена среда
  • Често срещани тесни места за латентност, капацитет и разходи
  • Дефиниране на цели за ниво на услугата (SLO) за товаровете на извеждането

Архитектура на внедряването и поток на предоставяне

  • Основни компоненти на производствения стек за извеждане
  • Избор между модели за внедряване в контейнери, локална среда и облак
  • Основи на зареждането на моделите, маршрутизирането на заявки и разпределението на GPU
  • Проектиране с оглед на надеждност и оперативна простота

Оптимизация на латентността в практиката

  • Използване на оптимизирани engines за извеждане като TensorRT, когато е приложимо
  • Концепции за KV-kеш и практическа настройка на кеша
  • Намаляване на времето за зареждане, загряване и отговор
  • Измерване на времето до първия токен и скоростта на генериране на токени

Капацитет, батчиране и ефективност на GPU

  • Стратегии за непрекъснато батчиране и батчиране на заявки
  • Управление на едновременността и поведението на опашките
  • Подобряване на заетостта на GPU без влошаване на потребителското изживяване
  • Работа с заявки за дълъг контекст и смесени товарове

Квантизация и контрол на разходите

  • Защо квантизацията е важна за производственото предоставяне
  • Практически компромиси между FP16, INT8 и други общи опции за точност
  • Балансиране на качеството на модела, латентността и инфраструктурните разходи
  • Създаване на прост чеклист за оптимизация на разходите

Операции, мониторинг и преглед на готовността

  • Тригери за автоскейлинг на услугите за извеждане
  • Мониторинг на латентността, капацитета, заетостта на кеша и здравето на GPU
  • Основи на логването, предупредителните системи и реакцията на инциденти
  • Преглед на референтно внедряване и създаване на план за подобрение

Изисквания

  • Основно разбиране на внедряването и работните потоци за извеждане на големи езикови модели
  • Опит с контейнери, облачна или локална инфраструктура и услуги на базата на API
  • Работни познания по Python или задачи в областта на системен инженеринг

Целева аудитория

  • ML инженери, внедряващи големи езикови модели в производствена среда
  • Platform инженери, отговарящи за услугите за извеждане на база GPU
  • Съ architects, проектиращи мащабируеми AI платформи за предоставяне на услуги
 14 Часа

Брой участници


Цена за участник

Предстоящи Курсове

Свързани Kатегории