Dziękujemy za wysłanie zapytania! Jeden z członków naszego zespołu skontaktuje się z Państwem wkrótce.
Dziękujemy za wysłanie rezerwacji! Jeden z członków naszego zespołu skontaktuje się z Państwem wkrótce.
Plan Szkolenia
Wprowadzenie do EXO i lokalnego klastrowania AI
- Przegląd platformy EXO i ekosystemu exo-explore
- Porównanie scentralizowanego wnioskowania w chmurze a rozproszonego wnioskowania lokalnego
- Architektura: libp2p do wykrywania urządzeń, backend MLX, dashboard i warstwy API
- Wymagania sprzętowe: Apple Silicon (M3 Ultra, M4 Pro/Max), Thunderbolt 5, współdzielona pamięć masowa
Instalacja EXO na macOS
- Konfiguracja Xcode, Metal ToolChain i wymagań wstępnych macOS
- Instalacja uv, Node.js, Rust nightly toolchain
- Instalacja rozwidlenia macmon do monitorowania Apple Silicon
- Klonowanie repozytorium i budowanie dashboardu za pomocą npm
- Uruchamianie EXO ze źródeł i weryfikacja dashboardu na localhost:52415
Instalacja EXO na Linux
- Instalacja zależności za pomocą apt lub Homebrew na Linuxie
- Konfiguracja uv, Node.js 18+ i Rust nightly
- Budowanie dashboardu i uruchamianie EXO w trybie tylko CPU
- Struktura katalogów: ścieżki XDG Base Directory dla konfiguracji, danych, pamięci podręcznej i logów
Automatyczne wykrywanie urządzeń i tworzenie klastra
- Zrozumienie automatycznego wykrywania opartego na libp2p w sieciach lokalnych
- Konfiguracja niestandardowych przestrzeni nazw za pomocą EXO_LIBP2P_NAMESPACE do izolacji klastra
- Weryfikacja członkostwa węzłów w widoku klastra dashboardu
- Rozwiązywanie problemów z wykrywaniem i segmentacją sieci
Włączanie RDMA przez Thunderbolt 5
- Architektura RDMA i twierdzenie o 99-procentowej redukcji opóźnień
- Włączanie RDMA w trybie odzyskiwania macOS za pomocą rdma_ctl
- Wymagania dotyczące kabli i ograniczenia topologii portów na Mac Studio
- Dopasowanie wersji macOS na wszystkich węzłach klastra
- Rozwiązywanie problemów z wykrywaniem RDMA i konfiguracją DHCP
Wdrażanie modeli granicznych
- Korzystanie z dashboardu do ładowania i dzielenia modeli DeepSeek v3.1, Qwen3-235B i rodziny Llama
- Podgląd rozmieszczenia instancji za pomocą punktu końcowego API /instance/previews
- Tworzenie instancji modeli z podziałem na potoki lub równoległość tensorową
- Konfiguracja niestandardowych kart modeli z huba HuggingFace
Monitorowanie i rozwiązywanie problemów
- Czytanie logów EXO i zrozumienie rozproszonego śledzenia
- Interpretacja stanu klastra w widoku klastra dashboardu
- Diagnozowanie awarii węzłów roboczych i zachowania przy ponownym łączeniu
- Korzystanie z EXO_TRACING_ENABLED do analizy wąskich gardeł wydajności
Konserwacja i aktualizacje klastra
- Aktualizacja plików binarnych EXO i procedur przebudowy dashboardu
- Migracja pamięci podręcznej modeli i zarządzanie wcześniej pobranymi modelami przez NFS
- Bezpieczne usuwanie węzłów i równoważenie obciążenia
Wymagania
- Znajomość podstaw sieciowych (IP, podsieci, zapory ogniowe)
- Doświadczenie w administracji z poziomu wiersza poleceń macOS lub Linux
- Znajomość zarządzania pakietami Python (pip/uv) i narzędzi Node.js
Grupa docelowa
- Administratorzy systemów
- Inżynierowie DevOps
- Architekci infrastruktury AI odpowiedzialni za lokalne wdrażanie LLM
21 godzin