Bądźmy w kontakcie

Plan Szkolenia

Podstawy wdrożeń produkcyjnych Tencent Hunyuan

  • Zarys scenariuszy udostępniania modeli Tencent Hunyuan.
  • Cechy charakterystyczne dużych modeli oraz modeli MoE w środowisku produkcyjnym.
  • Powszechne wąskie gardła dotyczące opóźnienia, throughputu i kosztów.
  • Definiowanie celów poziomu usługi (SLO) dla obciążeń wnioskowania.

Architektura wdrożenia i przepływ serwingu

  • Komponenty stosu produkcyjnego do wnioskowania.
  • Wybór między modelem wdrożeniowym opartym na kontenerach, on-premise a chmurowym.
  • Podstawy ładowania modeli, trasowania żądań i alokacji GPU.
  • Projektowanie pod kątem niezawodności i operacyjnej prostoty.

Optymalizacja opóźnienia w praktyce

  • Korzystanie z zoptymalizowanych silników wnioskowania, takich jak TensorRT, tam gdzie to stosowne.
  • Zasady działania KV-cache i praktyczne dostrajanie pamięci podręcznej.
  • Ograniczanie narzutów związanych z uruchamianiem, warmupem oraz odpowiedzią.
  • Pomiar czasu do pierwszego tokena (TTFT) oraz szybkości generowania tokenów.

Throughput, grupowanie żądań (batching) i efektywność GPU

  • Strategie ciągłego batchingu oraz grupowania żądań.
  • Zarządzanie współbieżnością i zachowaniem kolejek.
  • Polepszanie wykorzystania GPU bez uszczerbku dla jakości usługi.
  • Obsługa długich kontekstów oraz mieszanych obciążeń żądań.

Kwantyzacja i kontrola kosztów

  • Dlaczego kwantyzacja ma znaczenie dla produkcyjnego serwingu.
  • Praktyczne kompromisy między FP16, INT8 a innymi powszechnymi opcjami precyzji.
  • Balansowanie jakości modelu, opóźnienia oraz kosztu infrastruktury.
  • Tworzenie prostej checklisty optymalizacji kosztów.

Operacje, monitoring i przegląd gotowości

  • Kryteria wyzwalające autoskalowanie usług wnioskowania.
  • Monitorowanie opóźnienia, throughputu, wykorzystania cache oraz zdrowia GPU.
  • Podstawy logowania, alertingu i reagowania na incydenty.
  • Przegląd wzorcowego wdrożenia i tworzenie planu poprawek.

Wymagania

  • Podstawowa wiedza na temat wdrażania i pracy z dużymi modelami językowymi (LLM) oraz workflow wnioskowania.
  • Doświadczenie z kontenerami, infrastrukturą chmurową lub on-premise oraz usługami opartymi na API.
  • Znajomość Pythona lub zagadnień inżynierii systemowej na poziomie operacyjnym.

Grupa docelowa

  • Inżynierowie ML wdrażający LLM do środowiska produkcyjnego.
  • Inżynierowie platform odpowiedzialni za usługi wnioskowania oparte na GPU.
  • Architekci rozwiązań projektujący skalowalne platformy servingu AI.
 14 godzin

Liczba uczestników


Cena za uczestnika (netto)

Propozycje terminów

Powiązane Kategorie