Dziękujemy za wysłanie zapytania! Jeden z członków naszego zespołu skontaktuje się z Państwem wkrótce.
Dziękujemy za wysłanie rezerwacji! Jeden z członków naszego zespołu skontaktuje się z Państwem wkrótce.
Czas trwania 21 godzin
Plan Szkolenia
Wprowadzenie do multimodalnej sztucznej inteligencji i Ollama
- Przegląd uczenia multimodalnego
- Kluczowe wyzwania w integracji języka i obrazu
- Możliwości i architektura Ollama
Konfiguracja środowiska Ollama
- Instalacja i konfiguracja Ollama
- Praca z lokalnym wdrażaniem modeli
- Integracja Ollama z Pythonem i Jupyterem
Praca z danymi wejściowymi multimodalnymi
- Integracja tekstu i obrazu
- Włączanie danych dźwiękowych i ustrukturyzowanych
- Projektowanie potoków przetwarzania wstępnego
Aplikacje do rozumienia dokumentów
- Wyodrębnianie ustrukturyzowanych informacji z plików PDF i obrazów
- Łączenie OCR z modelami językowymi
- Budowanie inteligentnych przepływów analizy dokumentów
Wizualne odpowiadanie na pytania (VQA)
- Konfiguracja zestawów danych i benchmarków VQA
- Trenowanie i ocena modeli multimodalnych
- Budowanie interaktywnych aplikacji VQA
Projektowanie agentów multimodalnych
- Zasady projektowania agentów z wnioskowaniem multimodalnym
- Łączenie percepcji, języka i działania
- Wdrażanie agentów w rzeczywistych przypadkach użycia
Zaawansowana integracja i optymalizacja
- Dostrajanie modeli multimodalnych w Ollama
- Optymalizacja wydajności wnioskowania
- Zagadnienia skalowalności i wdrażania
Podsumowanie i dalsze kroki
Wymagania
- Dobra znajomość koncepcji uczenia maszynowego
- Doświadczenie w pracy z frameworkami głębokiego uczenia, takimi jak PyTorch lub TensorFlow
- Znajomość przetwarzania języka naturalnego i widzenia komputerowego
Grupa docelowa
- Inżynierowie uczenia maszynowego
- Badacze AI
- Twórcy produktów integrujący przepływy pracy z obrazem i tekstem