Свържете се с нас

Съдържание и теми, включени в курса

AI суверенитет и локално внедряване на LLM

  • Рискове при облачните LLM: запазване на данни, обучение върху входни данни, чужда юрисдикция.
  • Архитектура на Ollama: моделен сървър, регистър и API, съвместим с OpenAI.
  • Сравнение с vLLM, llama.cpp и Text Generation Inference.
  • Лицензиране на модели: условия за Llama, Mistral, Qwen и Gemma.

Инсталация и хардуерна настройка

  • Инсталиране на Ollama на Linux с поддръжка на CUDA и ROCm.
  • Резервен вариант само с CPU и AVX/AVX2 оптимизация.
  • Внедряване с Docker и мапване на постоянни обеми.
  • Настройка на множество GPU и стратегии за разпределение на VRAM.

Управление на модели

  • Изтегляне на модели от регистъра на Ollama: ollama pull llama3.
  • Импортиране на GGUF модели от HuggingFace и TheBloke.
  • Нива на квантуване: компромиси при Q4_K_M, Q5_K_M, Q8_0.
  • Превключване на модели и ограничения при едновременно зареждане.

Персонализирани Modelfiles

  • Писане на синтаксис за Modelfile: FROM, PARAMETER, SYSTEM, TEMPLATE.
  • Настройка на Temperature, top_p и repeat_penalty.
  • Инженеринг на системни промптове за специфично за роля поведение.
  • Създаване и публикуване на персонализирани модели в локалния регистър.

API интеграция

  • Endpoint /v1/chat/completions, съвместим с OpenAI.
  • Стрийминг на отговори и JSON режим.
  • Интеграция с LangChain, LlamaIndex и персонализирани приложения.
  • Удостоверяване и ограничаване на скоростта с обратен прокси.

Оптимизация на производителността

  • Оразмеряване на контекстния прозорец и управление на KV кеша.
  • Пакетно инфериране и обработка на паралелни заявки.
  • Разпределение на CPU нишки и NUMA осведоменост.
  • Мониторинг на използването на GPU и натиска върху паметта.

Сигурност и съответствие

  • Мрежова изолация за endpoints за предоставяне на модели.
  • Филтриране на входни данни и системи за модериране на изходни данни.
  • Одитно логване на промптове и завършвания.
  • Произход на моделите и проверка на хеш.

Изисквания

  • Средно ниво на познания по администриране на Linux и контейнери.
  • Разбиране на машинно обучение и трансформер модели на високо ниво.
  • Запознатост с REST API и JSON.

Аудитория

  • AI инженери и разработчици, заменящи облачни LLM API-та.
  • Организации с чувствителност на данните, възпрепятстваща използването на облачни модели.
  • Правителствени и отбранителни екипи, изискващи изолирани езикови модели.
 14 Часа

Брой участници


Цена за участник

Предстоящи Курсове

Свързани Kатегории