Bądźmy w kontakcie

Plan Szkolenia

Wprowadzenie do multimodalnych modeli Mistral

  • Przegląd Mistral Medium i możliwości multimodalnych
  • Modele OCR/dokumentów i przypadki użycia
  • Integracja z ekosystemami open source

Potoki OCR i wizyjne

  • Podstawy OCR z modelami Mistral
  • Wstępne przetwarzanie obrazów i zeskanowanych dokumentów
  • Wyodrębnianie ustrukturyzowanego tekstu z obrazów

Rozumienie dokumentów

  • Projektowanie potoków NLP dla dokumentów
  • Rozpoznawanie encji, streszczanie i klasyfikacja
  • Międzymodalne łączenie danych tekstowych i wizyjnych

Aplikacje wyszukiwania i wiedzy

  • Systemy wyszukiwania wizyjno-tekstowego
  • Budowanie wyszukiwania semantycznego z wykorzystaniem wyników OCR
  • Korporacyjne repozytoria dokumentów

Aplikacje wspomagające i interaktywne

  • Projektowanie interfejsu użytkownika dla asystentów multimodalnych
  • Aplikacje dostępnościowe (np. wizja-na-tekst)
  • Praktyczne narzędzia zwiększające produktywność

Wydajność i optymalizacja

  • Skalowanie potoków multimodalnych
  • Strojenie wydajności wnioskowania
  • Ocena kompromisów między dokładnością a efektywnością

Studia przypadków i kierunki rozwoju

  • Przemysłowe zastosowania multimodalnej sztucznej inteligencji
  • Trendy badawcze w OCR i sztucznej inteligencji dokumentów
  • Zagadnienia odpowiedzialnej sztucznej inteligencji w zadaniach wizyjno-tekstowych

Podsumowanie i kolejne kroki

Wymagania

  • Zrozumienie pojęć z zakresu przetwarzania języka naturalnego
  • Doświadczenie z Pythonem i frameworkami uczenia maszynowego
  • Znajomość podstaw widzenia komputerowego

Grupa docelowa

  • Zespoły produktowe
  • Badacze uczenia maszynowego
  • Inżynierowie stosowanego uczenia maszynowego
 14 godzin

Liczba uczestników


Cena za uczestnika (netto)

Propozycje terminów

Powiązane Kategorie