Bądźmy w kontakcie

Plan Szkolenia

Wprowadzenie do syntezy mowy i klonowania głosu

  • Przegląd syntezy tekstu na mowę (TTS) i neuronowej syntezy głosu
  • Klonowanie głosu a generowanie mowy: przypadki użycia i granice
  • Kluczowe modele: Tacotron, WaveNet, FastSpeech, VITS

Praca z platformami komercyjnymi

  • Korzystanie z ElevenLabs i Resemble AI
  • Tworzenie, klonowanie i edycja głosu
  • Dostęp do API i przepływy pracy tekst-na-mowę

Budowanie z wykorzystaniem narzędzi open source

  • Instalacja i konfiguracja Coqui TTS
  • Trenowanie niestandardowych głosów i zarządzanie zbiorami danych
  • Generowanie mowy z precyzyjną kontrolą (wysokość, prędkość, emocje)

Przygotowanie danych i zarządzanie zbiorami głosowymi

  • Zbieranie i czyszczenie próbek głosowych
  • Segmentacja, etykietowanie i dopasowywanie transkrypcji
  • Etyczne pozyskiwanie głosów i zgody na ich wykorzystanie

Integracja z aplikacjami

  • Osadzanie TTS w witrynach internetowych i aplikacjach
  • Tworzenie systemów IVR i interaktywnych botów
  • Generowanie syntetycznych dialogów do wideo i gier

Ocena jakości i realizmu

  • Testy MOS (Mean Opinion Score) i zrozumiałości
  • Kontrola ekspresyjności i prozodii
  • Porównywanie opóźnień, wierności i realizmu

Zagadnienia etyczne, prawne i związane z zarządzaniem

  • Ryzyka związane z deepfake i odpowiedzialne korzystanie
  • Zgoda, atrybucja i konsekwencje praw autorskich
  • Regulacje i polityki organizacyjne

Podsumowanie i dalsze kroki

Wymagania

  • Znajomość podstaw uczenia maszynowego
  • Znajomość formatów plików audio i narzędzi do edycji
  • Podstawowe umiejętności programowania w Pythonie

Grupa docelowa

  • Deweloperzy i inżynierowie AI zainteresowani syntezą mowy
  • Twórcy treści i technolodzy medialni eksplorujący generowanie głosu
  • Zespoły badawczo-rozwojowe budujące spersonalizowane lub dynamiczne systemy audio
 14 godzin

Liczba uczestników


Cena za uczestnika (netto)

Propozycje terminów

Powiązane Kategorie