Bądźmy w kontakcie

Plan Szkolenia

Szczegółowy plan szkolenia

  1. Wprowadzenie do NLP
    • Zrozumienie NLP
    • Frameworki NLP
    • Komercyjne zastosowania NLP
    • Pobieranie danych z internetu
    • Praca z różnymi API do pobierania danych tekstowych
    • Praca i przechowywanie korpusów tekstowych oraz odpowiednich metadanych
    • Zalety korzystania z Pythona i krótki kurs NLTK
  2. Praktyczne zrozumienie korpusu i zbioru danych
    • Dlaczego potrzebujemy korpusu?
    • Analiza korpusu
    • Typy atrybutów danych
    • Różne formaty plików dla korpusów
    • Przygotowywanie zbioru danych do aplikacji NLP
  3. Zrozumienie struktury zdania
    • Składniki NLP
    • Zrozumienie języka naturalnego
    • Analiza morfologiczna - rdzeń, słowo, token, tagi mowy
    • Analiza składniowa
    • Analiza semantyczna
    • Radzenie sobie z niejednoznacznością
  4. Przetwarzanie wstępne danych tekstowych
    • Korpus - surowy tekst
      • Tokenizacja zdań
      • Stemming dla surowego tekstu
      • Lematyzacja surowego tekstu
      • Usuwanie słów stop
    • Korpus - surowe zdania
      • Tokenizacja słów
      • Lematyzacja słów
    • Praca z macierzami Term-Document/Document-Term
    • Tokenizacja tekstu na n-gramy i zdania
    • Praktyczne i dostosowane przetwarzanie wstępne
  5. Analiza danych tekstowych
    • Podstawowe cechy NLP
      • Parsery i parsowanie
      • Tagowanie części mowy
      • Rozpoznawanie nazwanych jednostek
      • N-gramy
      • Worek słów
    • Statystyczne cechy NLP
      • Pojęcia algebry liniowej dla NLP
      • Teoria prawdopodobieństwa dla NLP
      • TF-IDF
      • Wektoryzacja
      • Enkodery i dekodery
      • Normalizacja
      • Modele probabilistyczne
    • Zaawansowane inżynieria cech i NLP
      • Podstawy word2vec
      • Składniki modelu word2vec
      • Logika modelu word2vec
      • Rozszerzenie koncepcji word2vec
      • Zastosowanie modelu word2vec
    • Studium przypadku: Zastosowanie worka słów: automatyczne podsumowanie tekstu przy użyciu uproszczonego i prawdziwego algorytmu Luhna
  6. Grupowanie, klasyfikacja i modelowanie tematyczne dokumentów
    • Grupowanie dokumentów i wydobywanie wzorców (hierarchiczne grupowanie, k-średnie itp.)
    • Porównywanie i klasyfikowanie dokumentów przy użyciu miar TFIDF, Jaccarda i cosinusa
    • Klasyfikacja dokumentów przy użyciu naiwnego bayesa i maksymalnej entropii
  7. Identyfikowanie ważnych elementów tekstu
    • Redukcja wymiarowości: Analiza Głównych Składowych, Dekompozycja wartości osobliwych, nieujemna faktoryzacja macierzy
    • Modelowanie tematyczne i wyszukiwanie informacji przy użyciu analizy semantycznej
  8. Ekstrakcja jednostek, analiza sentymentu i zaawansowane modelowanie tematyczne
    • Pozytywne vs. negatywne: stopień sentymentu
    • Teoria odpowiedzi na pytania
    • Tagowanie części mowy i jego zastosowanie: znajdowanie osób, miejsc i organizacji w tekście
    • Zaawansowane modelowanie tematyczne: Latent Dirichlet Allocation
  9. Studia przypadków
    • Wydobywanie nieustrukturyzowanych opinii użytkowników
    • Klasyfikacja sentymentu i wizualizacja danych z recenzji produktów
    • Wydobywanie wzorców użycia z dzienników wyszukiwania
    • Klasyfikacja tekstu
    • Modelowanie tematyczne

Wymagania

Wiedza i świadomość zasad NLP oraz zrozumienie zastosowań sztucznej inteligencji w biznesie.

 21 godzin

Liczba uczestników


Cena za uczestnika (netto)

Opinie uczestników (1)

Propozycje terminów

Powiązane Kategorie