Свържете се с нас

Съдържание и теми, включени в курса

EXO Инфраструктура като код

  • Преглед на моделите за внедряване на EXO: единичен възел, множество възли и клъстери с RDMA
  • Автоматизиране на инсталирането на зависимости (Xcode, uv, Node.js, Rust) чрез управление на конфигурации
  • Използване на Nix flakes за възпроизводими EXO компилации и среди за разработка
  • Писане на Ansible playbooks или shell скриптове за автоматизирано осигуряване на клъстери

Възпроизводими компилации и CI интеграция

  • Фиксиране на зависимости и изграждане на таблото за управление в CI pipelines
  • Изпълнение на EXO димни тестове в GitHub Actions или GitLab CI runners
  • Създаване на златни образи и работни потоци за връщане назад чрез снимки на състоянието за macOS и Linux виртуални машини
  • Версиониране на персонализирани моделни карти заедно с кода на приложението

Откриване на клъстери и автоматизация на мрежите

  • Конфигуриране на mDNS и статичен DNS за надеждно откриване на libp2p възли
  • Автоматизиране на създаването на мрежови профили и управлението на Thunderbolt мостове на macOS
  • Използване на персонализирани пространства от имена (EXO_LIBP2P_NAMESPACE) за разделяне на клъстери за разработка, тестване и продукция
  • Правила за защитна стена и мрежова сегментация за мултитенантни среди

Управление на съхранението и жизнения цикъл на моделите

  • Проектиране на стратегии за EXO_MODELS_DIRS и EXO_MODELS_READ_ONLY_DIRS
  • Монтиране на NFS или SAN споделени ресурси като хранилища само за четене на модели за бързо осигуряване
  • Почистване на остарели кешове и политики за задържане на версионирани тегла
  • Автоматизиране на предварителното изтегляне на модели и проверките на здравето преди поетапни актуализации

Мониторинг и известяване

  • Препращане на EXO логове към централизирано логване (ELK, Loki или Splunk)
  • Изграждане на Grafana табла от изхода на EXO_TRACING_ENABLED
  • Известяване за промени в членството на клъстера, събития с изчерпване на паметта (OOM) и пикове в латентността на изводите
  • Корелиране на хардуерна телеметрия от macmon с влошаване на производителността на моделите

Актуализация, връщане назад и възстановяване след бедствие

  • Тестване на актуализации на EXO бинарни файлове в канарeчен възел преди масово внедряване
  • Връщане назад на ниво модел: превключване между квантовани версии без повторно изтегляне
  • Архивиране и възстановяване на състоянието на клъстера, персонализираните пространства от имена и кешираните тегла
  • Документиране на ръководства за възстановяване при сценарии за пълно преизграждане на клъстера

Подсилване на сигурността и съответствие

  • Прилагане на TLS на ниво обратен прокси (nginx, traefik) за таблото за управление и API-то
  • Внедряване на ограничаване на скоростта на API заявки и бели списъци с IP адреси за EXO крайни точки
  • Изолиране на клъстери с VLAN мрежи и политики за мрежи с нулево доверие
  • Одит на достъпа и поддържане на инвентар на внедрените модели и версии

Изисквания

  • Опит с DevOps практики (CI/CD, IaC, оркестрация на контейнери)
  • Познания по системна администрация и управление на пакети на macOS или Linux
  • Разбиране на концепции за мрежи, DNS и съхранение на данни

Аудитория

  • DevOps инженери
  • Инфраструктурни архитекти
  • SRE специалисти, отговорни за локални AI натоварвания
 21 Часа

Брой участници


Цена за участник

Отзиви от участници (2)

Предстоящи Курсове

Свързани Kатегории