Благодарим ви, че изпратихте вашето запитване! Един от членовете на нашия екип ще се свърже с вас скоро.
Благодарим ви, че направихте своята резервация! Един от членовете на нашия екип ще се свърже с вас скоро.
Продължителност 14 часa
Съдържание и теми, включени в курса
Основи на производственото внедряване на Tencent Hunyuan
- Преглед на сценариите за предоставяне на моделите на Tencent Hunyuan
- Характеристики на големите и MoE модели в производствена среда
- Често срещани тесни места за латентност, капацитет и разходи
- Дефиниране на цели за ниво на услугата (SLO) за товаровете на извеждането
Архитектура на внедряването и поток на предоставяне
- Основни компоненти на производствения стек за извеждане
- Избор между модели за внедряване в контейнери, локална среда и облак
- Основи на зареждането на моделите, маршрутизирането на заявки и разпределението на GPU
- Проектиране с оглед на надеждност и оперативна простота
Оптимизация на латентността в практиката
- Използване на оптимизирани engines за извеждане като TensorRT, когато е приложимо
- Концепции за KV-kеш и практическа настройка на кеша
- Намаляване на времето за зареждане, загряване и отговор
- Измерване на времето до първия токен и скоростта на генериране на токени
Капацитет, батчиране и ефективност на GPU
- Стратегии за непрекъснато батчиране и батчиране на заявки
- Управление на едновременността и поведението на опашките
- Подобряване на заетостта на GPU без влошаване на потребителското изживяване
- Работа с заявки за дълъг контекст и смесени товарове
Квантизация и контрол на разходите
- Защо квантизацията е важна за производственото предоставяне
- Практически компромиси между FP16, INT8 и други общи опции за точност
- Балансиране на качеството на модела, латентността и инфраструктурните разходи
- Създаване на прост чеклист за оптимизация на разходите
Операции, мониторинг и преглед на готовността
- Тригери за автоскейлинг на услугите за извеждане
- Мониторинг на латентността, капацитета, заетостта на кеша и здравето на GPU
- Основи на логването, предупредителните системи и реакцията на инциденти
- Преглед на референтно внедряване и създаване на план за подобрение
Изисквания
- Основно разбиране на внедряването и работните потоци за извеждане на големи езикови модели
- Опит с контейнери, облачна или локална инфраструктура и услуги на базата на API
- Работни познания по Python или задачи в областта на системен инженеринг
Целева аудитория
- ML инженери, внедряващи големи езикови модели в производствена среда
- Platform инженери, отговарящи за услугите за извеждане на база GPU
- Съ architects, проектиращи мащабируеми AI платформи за предоставяне на услуги