Bądźmy w kontakcie
 Czas trwania 21 godzin

Plan Szkolenia

Wprowadzenie do multimodalnej sztucznej inteligencji i Ollama

  • Przegląd uczenia multimodalnego
  • Kluczowe wyzwania w integracji języka i obrazu
  • Możliwości i architektura Ollama

Konfiguracja środowiska Ollama

  • Instalacja i konfiguracja Ollama
  • Praca z lokalnym wdrażaniem modeli
  • Integracja Ollama z Pythonem i Jupyterem

Praca z danymi wejściowymi multimodalnymi

  • Integracja tekstu i obrazu
  • Włączanie danych dźwiękowych i ustrukturyzowanych
  • Projektowanie potoków przetwarzania wstępnego

Aplikacje do rozumienia dokumentów

  • Wyodrębnianie ustrukturyzowanych informacji z plików PDF i obrazów
  • Łączenie OCR z modelami językowymi
  • Budowanie inteligentnych przepływów analizy dokumentów

Wizualne odpowiadanie na pytania (VQA)

  • Konfiguracja zestawów danych i benchmarków VQA
  • Trenowanie i ocena modeli multimodalnych
  • Budowanie interaktywnych aplikacji VQA

Projektowanie agentów multimodalnych

  • Zasady projektowania agentów z wnioskowaniem multimodalnym
  • Łączenie percepcji, języka i działania
  • Wdrażanie agentów w rzeczywistych przypadkach użycia

Zaawansowana integracja i optymalizacja

  • Dostrajanie modeli multimodalnych w Ollama
  • Optymalizacja wydajności wnioskowania
  • Zagadnienia skalowalności i wdrażania

Podsumowanie i dalsze kroki

Wymagania

  • Dobra znajomość koncepcji uczenia maszynowego
  • Doświadczenie w pracy z frameworkami głębokiego uczenia, takimi jak PyTorch lub TensorFlow
  • Znajomość przetwarzania języka naturalnego i widzenia komputerowego

Grupa docelowa

  • Inżynierowie uczenia maszynowego
  • Badacze AI
  • Twórcy produktów integrujący przepływy pracy z obrazem i tekstem

Liczba uczestników


Cena za uczestnika (netto)

Propozycje terminów

Powiązane Kategorie