Bądźmy w kontakcie

Plan Szkolenia

Infrastruktura EXO jako kod

  • Przegląd wzorców wdrażania EXO: klastry jednowęzłowe, wielowęzłowe i RDMA
  • Automatyzacja instalacji zależności (Xcode, uv, Node.js, Rust) przy użyciu zarządzania konfiguracją
  • Wykorzystanie Nix flakes do powtarzalnych buildów EXO i środowisk deweloperskich
  • Pisanie playbooków Ansible lub skryptów powłoki do automatycznego provisioningu klastrów

Powtarzalne buildy i integracja z CI

  • Przypinanie zależności i budowanie dashboardu w pipeline'ach CI
  • Uruchamianie testów dymnych EXO w GitHub Actions lub GitLab CI runners
  • Tworzenie złotych obrazów i przepływów pracy opartych na snapshotach dla maszyn wirtualnych macOS i Linux
  • Wersjonowanie kart modeli wraz z kodem aplikacji

Automatyzacja wykrywania klastrów i sieci

  • Konfiguracja mDNS i statycznego DNS dla niezawodnego wykrywania węzłów libp2p
  • Automatyzacja tworzenia profili sieciowych i zarządzania mostami Thunderbolt na macOS
  • Wykorzystanie niestandardowych przestrzeni nazw (EXO_LIBP2P_NAMESPACE) do separacji klastrów dev, staging i prod
  • Reguły zapory ogniowej i segmentacja sieci dla środowisk wielodostępnych

Zarządzanie przechowywaniem i cyklem życia modeli

  • Projektowanie strategii EXO_MODELS_DIRS i EXO_MODELS_READ_ONLY_DIRS
  • Montowanie udziałów NFS lub SAN jako repozytoriów modeli tylko do odczytu dla szybkiego provisioningu
  • Zbieranie nieużywanych pamięci podręcznych i polityki przechowywania wersjonowanych wag
  • Automatyzacja wstępnego pobierania modeli i kontroli stanu przed aktualizacjami

Monitorowanie i alerty

  • Przesyłanie logów EXO do scentralizowanego logowania (ELK, Loki lub Splunk)
  • Tworzenie dashboardów Grafana na podstawie wyjścia EXO_TRACING_ENABLED
  • Alerty dotyczące zmian w członkostwie klastra, zdarzeń OOM i skoków opóźnień inferencji
  • Korelacja telemetrii sprzętowej macmon z regresjami wydajności modeli

Aktualizacje, wycofywanie i odzyskiwanie po awarii

  • Testowanie aktualizacji binariów EXO na węźle canary przed wdrożeniem na całą flotę
  • Wycofywanie na poziomie modelu: przełączanie między skwantowanymi wersjami bez ponownego pobierania
  • Tworzenie kopii zapasowych i przywracanie stanu klastra, niestandardowych przestrzeni nazw i pamięci podręcznych wag
  • Dokumentowanie procedur odzyskiwania dla scenariuszy całkowitej przebudowy klastra

Zabezpieczenia i zgodność

  • Wdrażanie TLS na warstwie reverse proxy (nginx, traefik) dla dashboardu i API
  • Implementacja ograniczeń szybkości API i białych list IP dla endpointów EXO
  • Izolowanie klastrów za pomocą VLAN i polityk sieciowych zero-trust
  • Audyt dostępu i utrzymywanie inwentarza wdrożonych modeli i wersji

Wymagania

  • Doświadczenie w praktykach DevOps (CI/CD, IaC, orchestracja kontenerów)
  • Znajomość administracji systemami macOS lub Linux oraz zarządzania pakietami
  • Zrozumienie pojęć związanych z sieciami, DNS i przechowywaniem danych

Odbiorcy

  • Inżynierowie DevOps
  • Architekci infrastruktury
  • SRE odpowiedzialni za obciążenia AI w środowiskach on-premise
 21 godzin

Liczba uczestników


Cena za uczestnika (netto)

Opinie uczestników (2)

Propozycje terminów

Powiązane Kategorie