Dziękujemy za wysłanie zapytania! Jeden z członków naszego zespołu skontaktuje się z Państwem wkrótce.
Dziękujemy za wysłanie rezerwacji! Jeden z członków naszego zespołu skontaktuje się z Państwem wkrótce.
Czas trwania 14 godzin
Plan Szkolenia
Podstawy wdrożeń produkcyjnych Tencent Hunyuan
- Zarys scenariuszy udostępniania modeli Tencent Hunyuan.
- Cechy charakterystyczne dużych modeli oraz modeli MoE w środowisku produkcyjnym.
- Powszechne wąskie gardła dotyczące opóźnienia, throughputu i kosztów.
- Definiowanie celów poziomu usługi (SLO) dla obciążeń wnioskowania.
Architektura wdrożenia i przepływ serwingu
- Komponenty stosu produkcyjnego do wnioskowania.
- Wybór między modelem wdrożeniowym opartym na kontenerach, on-premise a chmurowym.
- Podstawy ładowania modeli, trasowania żądań i alokacji GPU.
- Projektowanie pod kątem niezawodności i operacyjnej prostoty.
Optymalizacja opóźnienia w praktyce
- Korzystanie z zoptymalizowanych silników wnioskowania, takich jak TensorRT, tam gdzie to stosowne.
- Zasady działania KV-cache i praktyczne dostrajanie pamięci podręcznej.
- Ograniczanie narzutów związanych z uruchamianiem, warmupem oraz odpowiedzią.
- Pomiar czasu do pierwszego tokena (TTFT) oraz szybkości generowania tokenów.
Throughput, grupowanie żądań (batching) i efektywność GPU
- Strategie ciągłego batchingu oraz grupowania żądań.
- Zarządzanie współbieżnością i zachowaniem kolejek.
- Polepszanie wykorzystania GPU bez uszczerbku dla jakości usługi.
- Obsługa długich kontekstów oraz mieszanych obciążeń żądań.
Kwantyzacja i kontrola kosztów
- Dlaczego kwantyzacja ma znaczenie dla produkcyjnego serwingu.
- Praktyczne kompromisy między FP16, INT8 a innymi powszechnymi opcjami precyzji.
- Balansowanie jakości modelu, opóźnienia oraz kosztu infrastruktury.
- Tworzenie prostej checklisty optymalizacji kosztów.
Operacje, monitoring i przegląd gotowości
- Kryteria wyzwalające autoskalowanie usług wnioskowania.
- Monitorowanie opóźnienia, throughputu, wykorzystania cache oraz zdrowia GPU.
- Podstawy logowania, alertingu i reagowania na incydenty.
- Przegląd wzorcowego wdrożenia i tworzenie planu poprawek.
Wymagania
- Podstawowa wiedza na temat wdrażania i pracy z dużymi modelami językowymi (LLM) oraz workflow wnioskowania.
- Doświadczenie z kontenerami, infrastrukturą chmurową lub on-premise oraz usługami opartymi na API.
- Znajomość Pythona lub zagadnień inżynierii systemowej na poziomie operacyjnym.
Grupa docelowa
- Inżynierowie ML wdrażający LLM do środowiska produkcyjnego.
- Inżynierowie platform odpowiedzialni za usługi wnioskowania oparte na GPU.
- Architekci rozwiązań projektujący skalowalne platformy servingu AI.