Korpus danych studyjnych
56 godzin czystej mowy czytanej, zrealizowanej przez 317 mówców w studiu nagraniowym. Materiał nadaje się do analiz fonetycznych i uczenia modeli ASR.
Pobierz Korpus (ZIP 6.1GB)
System do pozyskiwania, archiwizacji i analizy korpusów mowy polskiej na potrzeby nauki. Realizowany w ramach konsorcjum CLARIN-PL na Polsko-Japońskiej Akademii Technik Komputerowych.
Aplikacja na system Android usprawnia zbieranie mowy w terenie. Działa bez konieczności logowania. Dane wrażliwe oraz imiona i nazwiska mówców szyfrowane są bezpośrednio w pamięci urządzenia (architektura zero-knowledge).
Platforma służy do gromadzenia, zarządzania oraz analizy setek godzin nagrań. System wyręcza z żmudnej pracy ręcznej, automatycznie obliczając obiektywne metryki jakości dźwięku (PESQ, STOI, LUFS i inne).
Dostęp do platformy udostępniamy badaczom po uprzednim nawiązaniu współpracy. Skontaktuj się z nami
Zbiory danych mowy do badań naukowych.
56 godzin czystej mowy czytanej, zrealizowanej przez 317 mówców w studiu nagraniowym. Materiał nadaje się do analiz fonetycznych i uczenia modeli ASR.
Pobierz Korpus (ZIP 6.1GB)Ponad 100 godzin polskiej mowy spontanicznej i konwersacyjnej nagrywanej w autentycznych warunkach (ulica, pub, samochód), w tym dziesiątki godzin precyzyjnej anotacji. Dostęp wymaga nawiązania współpracy.
Unikalny zbiór nagrań potocznych diaspory wietnamskiej żyjącej w Polsce. Cenne dane do badań lingwistycznych i socjologicznych. Dostęp wymaga nawiązania współpracy.
Prowadzimy badania na styku inżynierii dźwięku i uczenia maszynowego. Nagrania realizujemy m.in. w profesjonalnym, zaadaptowanym akustycznie studiu nagraniowym PJATK.
Badamy metody rozdzielania głosów wielu osób mówiących jednocześnie (tzw. cross-talk). Korzystamy z głębokich sieci neuronowych opartych na architekturze Transformer. Celem jest poprawa skuteczności systemów automatycznego rozpoznawania mowy (ASR) w warunkach rzeczywistych, gdzie nakładanie się wypowiedzi jest nieuniknione.
Budujemy modele redukcji szumów. Pracę wspiera własny zbiór PolSESS, zawierający syntetyczne próbki mowy zaszumionej (szumy otoczenia, pogłos, zdarzenia losowe), przeznaczony do treningu sieci neuronowych.