Свържете се с нас

Съдържание и теми, включени в курса

Въведение в EXO и локалното AI клъстериране

  • Преглед на EXO framework-а и екосистемата exo-explore
  • Сравнение между централизирана облачна инференция и разпределена локална инференция
  • Архитектура: откриване на устройства чрез libp2p, MLX backend, табло и API слоеве
  • Хардуерни изисквания: Apple Silicon (M3 Ultra, M4 Pro/Max), Thunderbolt 5, споделено хранилище

Инсталиране на EXO на macOS

  • Настройка на Xcode, Metal ToolChain и предварителни изисквания за macOS
  • Инсталиране на uv, Node.js, Rust nightly toolchain
  • Инсталиране на фиксираното разклонение macmon за мониторинг на Apple Silicon
  • Клониране на хранилището и изграждане на таблото с npm
  • Стартиране на EXO от изходния код и верификация на таблото на localhost:52415

Инсталиране на EXO на Linux

  • Инсталиране на зависимости чрез apt или Homebrew на Linux
  • Конфигуриране на uv, Node.js 18+ и Rust nightly
  • Изграждане на таблото и стартиране на EXO в режим само с CPU
  • Структура на директориите: пътища според XDG Base Directory за конфигурация, данни, кеш и логове

Автоматично откриване на устройства и формиране на клъстер

  • Разбиране на автоматичното откриване, базирано на libp2p, в локални мрежи
  • Конфигуриране на персонализирани именни пространства с EXO_LIBP2P_NAMESPACE за изолация на клъстера
  • Верификация на членството на нодовете в изгледа за клъстера на таблото
  • Справяне с неуспехи при откриване и проблеми с мрежовата сегментация

Активиране на RDMA през Thunderbolt 5

  • RDMA архитектура и твърдението за 99 процента намаляване на латентността
  • Активиране на RDMA в macOS Recovery mode чрез rdma_ctl
  • Изисквания за кабелите и ограничения в топологията на портовете на Mac Studio
  • Съответствие на версиите на macOS на всички нодове в клъстера
  • Отстраняване на проблеми с RDMA откриването и DHCP конфигурацията

Внедряване на водещи модели

  • Използване на таблото за зареждане и шардиране на DeepSeek v3.1, Qwen3-235B и модели от фамилията Llama
  • Преглед на разположенията на инстанции чрез API крайната точка /instance/previews
  • Създаване на моделни инстанции с pipeline или tensor-parallel шардиране
  • Конфигуриране на персонализирани моделни карти от HuggingFace hub

Мониторинг и отстраняване на проблеми

  • Четене на EXO логове и разбиране на разпределеното проследяване (tracing)
  • Интерпретиране на здравето на клъстера в изгледа за клъстера на таблото
  • Диагностициране на откази на работни нодове и поведение при повторно свързване
  • Използване на EXO_TRACING_ENABLED за анализ на тесните места в производителността

Поддръжка и актуализации на клъстера

  • Актуализиране на EXO binaries и процедури за повторно изграждане на таблото
  • Мигриране на моделни кешове и управление на предварително изтеглени модели през NFS
  • Грациозно премахване на нодове и ребалансиране на натоварванията

Изисквания

  • Разбиране на основите на мрежите (IP, подмрежи, защитни стени)
  • Опит с администриране на macOS или Linux от команден ред
  • Запознатост с управление на Python пакети (pip/uv) и инструменти на Node.js

Аудитория

  • Системни администратори
  • DevOps инженери
  • Архитекти на AI инфраструктура, отговорни за локално внедряване на LLM
 21 Часа

Брой участници


Цена за участник

Предстоящи Курсове

Свързани Kатегории