Dziękujemy za wysłanie zapytania! Jeden z członków naszego zespołu skontaktuje się z Państwem wkrótce.
Dziękujemy za wysłanie rezerwacji! Jeden z członków naszego zespołu skontaktuje się z Państwem wkrótce.
Plan Szkolenia
Infrastruktura EXO jako kod
- Przegląd wzorców wdrażania EXO: klastry jednowęzłowe, wielowęzłowe i RDMA
- Automatyzacja instalacji zależności (Xcode, uv, Node.js, Rust) przy użyciu zarządzania konfiguracją
- Wykorzystanie Nix flakes do powtarzalnych buildów EXO i środowisk deweloperskich
- Pisanie playbooków Ansible lub skryptów powłoki do automatycznego provisioningu klastrów
Powtarzalne buildy i integracja z CI
- Przypinanie zależności i budowanie dashboardu w pipeline'ach CI
- Uruchamianie testów dymnych EXO w GitHub Actions lub GitLab CI runners
- Tworzenie złotych obrazów i przepływów pracy opartych na snapshotach dla maszyn wirtualnych macOS i Linux
- Wersjonowanie kart modeli wraz z kodem aplikacji
Automatyzacja wykrywania klastrów i sieci
- Konfiguracja mDNS i statycznego DNS dla niezawodnego wykrywania węzłów libp2p
- Automatyzacja tworzenia profili sieciowych i zarządzania mostami Thunderbolt na macOS
- Wykorzystanie niestandardowych przestrzeni nazw (EXO_LIBP2P_NAMESPACE) do separacji klastrów dev, staging i prod
- Reguły zapory ogniowej i segmentacja sieci dla środowisk wielodostępnych
Zarządzanie przechowywaniem i cyklem życia modeli
- Projektowanie strategii EXO_MODELS_DIRS i EXO_MODELS_READ_ONLY_DIRS
- Montowanie udziałów NFS lub SAN jako repozytoriów modeli tylko do odczytu dla szybkiego provisioningu
- Zbieranie nieużywanych pamięci podręcznych i polityki przechowywania wersjonowanych wag
- Automatyzacja wstępnego pobierania modeli i kontroli stanu przed aktualizacjami
Monitorowanie i alerty
- Przesyłanie logów EXO do scentralizowanego logowania (ELK, Loki lub Splunk)
- Tworzenie dashboardów Grafana na podstawie wyjścia EXO_TRACING_ENABLED
- Alerty dotyczące zmian w członkostwie klastra, zdarzeń OOM i skoków opóźnień inferencji
- Korelacja telemetrii sprzętowej macmon z regresjami wydajności modeli
Aktualizacje, wycofywanie i odzyskiwanie po awarii
- Testowanie aktualizacji binariów EXO na węźle canary przed wdrożeniem na całą flotę
- Wycofywanie na poziomie modelu: przełączanie między skwantowanymi wersjami bez ponownego pobierania
- Tworzenie kopii zapasowych i przywracanie stanu klastra, niestandardowych przestrzeni nazw i pamięci podręcznych wag
- Dokumentowanie procedur odzyskiwania dla scenariuszy całkowitej przebudowy klastra
Zabezpieczenia i zgodność
- Wdrażanie TLS na warstwie reverse proxy (nginx, traefik) dla dashboardu i API
- Implementacja ograniczeń szybkości API i białych list IP dla endpointów EXO
- Izolowanie klastrów za pomocą VLAN i polityk sieciowych zero-trust
- Audyt dostępu i utrzymywanie inwentarza wdrożonych modeli i wersji
Wymagania
- Doświadczenie w praktykach DevOps (CI/CD, IaC, orchestracja kontenerów)
- Znajomość administracji systemami macOS lub Linux oraz zarządzania pakietami
- Zrozumienie pojęć związanych z sieciami, DNS i przechowywaniem danych
Odbiorcy
- Inżynierowie DevOps
- Architekci infrastruktury
- SRE odpowiedzialni za obciążenia AI w środowiskach on-premise
21 godzin
Opinie uczestników (2)
Craig był bardzo zaangażowany w szkolenie, zawsze zapewniał, że jesteśmy skupieni, dostosowywał przykłady do naszej codziennej pracy i zawsze udzielał odpowiedzi na zadane pytania, nawet jeśli informacja nie była zawarta w prezentacji.
Ecaterina Ioana Nicoale - BOOKING HOLDINGS ROMANIA SRL
Szkolenie - DevOps Foundation®
Przetłumaczone przez sztuczną inteligencję
Wysoki poziom zaangażowania i wiedzy trenera
Jacek - Softsystem
Szkolenie - DevOps Engineering Foundation (DOEF)®
Przetłumaczone przez sztuczną inteligencję