Bądźmy w kontakcie
 Czas trwania 21 godzin

Plan Szkolenia

Wprowadzenie do skalowania Ollama

  • Architektura Ollama i kwestie związane ze skalowaniem
  • Typowe wąskie gardła we wdrożeniach wieloużytkownikowych
  • Najlepsze praktyki gotowości infrastruktury

Alokacja zasobów i optymalizacja GPU

  • Efektywne strategie wykorzystania CPU/GPU
  • Kwestie pamięci i przepustowości
  • Ograniczenia zasobów na poziomie kontenerów

Wdrażanie z kontenerami i Kubernetes

  • Konteneryzacja Ollama za pomocą Docker
  • Uruchamianie Ollama w klastrach Kubernetes
  • Równoważenie obciążenia i wykrywanie usług

Automatyczne skalowanie i przetwarzanie wsadowe

  • Projektowanie zasad automatycznego skalowania dla Ollama
  • Techniki wnioskowania wsadowego w celu optymalizacji przepustowości
  • Kompromisy między opóźnieniem a przepustowością

Optymalizacja opóźnień

  • Profilowanie wydajności wnioskowania
  • Strategie buforowania i rozgrzewanie modelu
  • Redukcja obciążenia związanego z operacjami wejścia/wyjścia i komunikacją

Monitorowanie i obserwowalność

  • Integracja Prometheus do zbierania metryk
  • Tworzenie pulpitów nawigacyjnych w Grafanie
  • Alerty i reagowanie na incydenty w infrastrukturze Ollama

Zarządzanie kosztami i strategie skalowania

  • Alokacja GPU z uwzględnieniem kosztów
  • Kwestie wdrożeń w chmurze vs. lokalnie
  • Strategie zrównoważonego skalowania

Podsumowanie i kolejne kroki

Wymagania

  • Doświadczenie w administrowaniu systemem Linux
  • Zrozumienie konteneryzacji i orkiestracji
  • Znajomość wdrażania modeli uczenia maszynowego

Grupa docelowa

  • Inżynierowie DevOps
  • Zespoły infrastruktury ML
  • Inżynierowie niezawodności systemów (SRE)

Liczba uczestników


Cena za uczestnika (netto)

Propozycje terminów

Powiązane Kategorie