Dziękujemy za wysłanie zapytania! Jeden z członków naszego zespołu skontaktuje się z Państwem wkrótce.
Dziękujemy za wysłanie rezerwacji! Jeden z członków naszego zespołu skontaktuje się z Państwem wkrótce.
Plan Szkolenia
Suwerenność AI i lokalne wdrażanie modeli LLM
- Ryzyka związane z chmurowymi modelami LLM: przechowywanie danych, trenowanie na danych wejściowych, jurysdykcja zagraniczna.
- Architektura Ollamy: serwer modelu, rejestr i kompatybilne z OpenAI API.
- Porównanie z vLLM, llama.cpp i Text Generation Inference.
- Licencjonowanie modeli: warunki Llama, Mistral, Qwen i Gemma.
Instalacja i konfiguracja sprzętu
- Instalacja Ollamy na Linuxie z obsługą CUDA i ROCm.
- Tryb awaryjny tylko z CPU i optymalizacja AVX/AVX2.
- Wdrażanie za pomocą Dockera i mapowanie trwałych woluminów.
- Konfiguracja wieloprocesorowa GPU i strategie alokacji VRAM.
Zarządzanie modelami
- Pobieranie modeli z rejestru Ollama: ollama pull llama3.
- Importowanie modeli GGUF z HuggingFace i TheBloke.
- Poziomy kwantyzacji: kompromisy Q4_K_M, Q5_K_M, Q8_0.
- Przełączanie modeli i limity jednoczesnego ładowania modeli.
Niestandardowe pliki Modelfile
- Składnia pisania plików Modelfile: FROM, PARAMETER, SYSTEM, TEMPLATE.
- Dostrajanie temperatury, top_p i repeat_penalty.
- Inżynieria systemowych promptów dla zachowań specyficznych dla roli.
- Tworzenie i publikowanie niestandardowych modeli w lokalnym rejestrze.
Integracja API
- Kompatybilny z OpenAI endpoint /v1/chat/completions.
- Przesyłanie odpowiedzi strumieniowo i tryb JSON.
- Integracja z LangChain, LlamaIndex i niestandardowymi aplikacjami.
- Uwierzytelnianie i ograniczanie szybkości za pomocą odwrotnego proxy.
Optymalizacja wydajności
- Rozmiar okna kontekstu i zarządzanie pamięcią podręczną KV.
- Przetwarzanie wsadowe i obsługa równoległych żądań.
- Alokacja wątków CPU i świadomość NUMA.
- Monitorowanie wykorzystania GPU i obciążenia pamięci.
Bezpieczeństwo i zgodność
- Izolacja sieciowa dla punktów końcowych serwowania modeli.
- Filtrowanie wejść i potoki moderacji wyjść.
- Rejestrowanie audytowe promptów i odpowiedzi.
- Pochodzenie modeli i weryfikacja skrótów.
Wymagania
- Średnio zaawansowana znajomość administracji Linux i kontenerów.
- Zrozumienie podstaw uczenia maszynowego i modeli transformatorowych.
- Znajomość REST API i JSON.
Grupa docelowa
- Inżynierowie AI i deweloperzy zastępujący chmurowe API modeli LLM.
- Organizacje z wrażliwością danych uniemożliwiającą korzystanie z modeli w chmurze.
- Zespoły rządowe i obronne wymagające modeli językowych w izolacji sieciowej.
14 godzin