Dziękujemy za wysłanie zapytania! Jeden z członków naszego zespołu skontaktuje się z Państwem wkrótce.
Dziękujemy za wysłanie rezerwacji! Jeden z członków naszego zespołu skontaktuje się z Państwem wkrótce.
Czas trwania 21 godzin
Plan Szkolenia
Wprowadzenie do skalowania Ollama
- Architektura Ollama i kwestie związane ze skalowaniem
- Typowe wąskie gardła we wdrożeniach wieloużytkownikowych
- Najlepsze praktyki gotowości infrastruktury
Alokacja zasobów i optymalizacja GPU
- Efektywne strategie wykorzystania CPU/GPU
- Kwestie pamięci i przepustowości
- Ograniczenia zasobów na poziomie kontenerów
Wdrażanie z kontenerami i Kubernetes
- Konteneryzacja Ollama za pomocą Docker
- Uruchamianie Ollama w klastrach Kubernetes
- Równoważenie obciążenia i wykrywanie usług
Automatyczne skalowanie i przetwarzanie wsadowe
- Projektowanie zasad automatycznego skalowania dla Ollama
- Techniki wnioskowania wsadowego w celu optymalizacji przepustowości
- Kompromisy między opóźnieniem a przepustowością
Optymalizacja opóźnień
- Profilowanie wydajności wnioskowania
- Strategie buforowania i rozgrzewanie modelu
- Redukcja obciążenia związanego z operacjami wejścia/wyjścia i komunikacją
Monitorowanie i obserwowalność
- Integracja Prometheus do zbierania metryk
- Tworzenie pulpitów nawigacyjnych w Grafanie
- Alerty i reagowanie na incydenty w infrastrukturze Ollama
Zarządzanie kosztami i strategie skalowania
- Alokacja GPU z uwzględnieniem kosztów
- Kwestie wdrożeń w chmurze vs. lokalnie
- Strategie zrównoważonego skalowania
Podsumowanie i kolejne kroki
Wymagania
- Doświadczenie w administrowaniu systemem Linux
- Zrozumienie konteneryzacji i orkiestracji
- Znajomość wdrażania modeli uczenia maszynowego
Grupa docelowa
- Inżynierowie DevOps
- Zespoły infrastruktury ML
- Inżynierowie niezawodności systemów (SRE)