Laboratorium akustyczne

CLARIN PJATK
technologie mowy
i akwizycja danych

System do pozyskiwania, archiwizacji i analizy korpusów mowy polskiej na potrzeby nauki. Realizowany w ramach konsorcjum CLARIN-PL na Polsko-Japońskiej Akademii Technik Komputerowych.

Aplikacja mobilna:
nagrywarka mowy

Aplikacja na system Android usprawnia zbieranie mowy w terenie. Działa bez konieczności logowania. Dane wrażliwe oraz imiona i nazwiska mówców szyfrowane są bezpośrednio w pamięci urządzenia (architektura zero-knowledge).

  • Cyfrowa dokumentacja zgody: mówca składa podpis bezpośrednio na ekranie telefonu.
  • Wbudowana kontrola jakości: przed każdym nagraniem aplikacja mierzony jest poziom szumu tła i weryfikowana głośność sygnału.
  • Wsparcie dla mikrofonów stereofonicznych: możliwość podłączenia zewnętrznego mikrofonu i rejestracji rozmowy na dwóch niezależnych kanałach.
Pobierz aplikację CLARIN (plik .apk dla Androida - wersja beta w trakcie rozwoju)
Aplikacja mobilna CLARIN: trzy ekrany aplikacji Android

Platforma mowy: repozytorium danych

Platforma służy do gromadzenia, zarządzania oraz analizy setek godzin nagrań. System wyręcza z żmudnej pracy ręcznej, automatycznie obliczając obiektywne metryki jakości dźwięku (PESQ, STOI, LUFS i inne).

Panel platformy mowy CLARIN: zarządzanie nagraniami i metryki jakości

Dostęp do platformy udostępniamy badaczom po uprzednim nawiązaniu współpracy. Skontaktuj się z nami

Korpusy językowe

Zbiory danych mowy do badań naukowych.

56h
czystej mowy studyjnej

Korpus danych studyjnych

56 godzin czystej mowy czytanej, zrealizowanej przez 317 mówców w studiu nagraniowym. Materiał nadaje się do analiz fonetycznych i uczenia modeli ASR.

Pobierz Korpus (ZIP 6.1GB)
100h+
mowy spontanicznej

Korpus Spokes PL

Ponad 100 godzin polskiej mowy spontanicznej i konwersacyjnej nagrywanej w autentycznych warunkach (ulica, pub, samochód), w tym dziesiątki godzin precyzyjnej anotacji. Dostęp wymaga nawiązania współpracy.

VN
diaspora wietnamska

Korpus Spokes VN

Unikalny zbiór nagrań potocznych diaspory wietnamskiej żyjącej w Polsce. Cenne dane do badań lingwistycznych i socjologicznych. Dostęp wymaga nawiązania współpracy.

Projekty R&D

Prowadzimy badania na styku inżynierii dźwięku i uczenia maszynowego. Nagrania realizujemy m.in. w profesjonalnym, zaadaptowanym akustycznie studiu nagraniowym PJATK.

Separacja mówców

Badamy metody rozdzielania głosów wielu osób mówiących jednocześnie (tzw. cross-talk). Korzystamy z głębokich sieci neuronowych opartych na architekturze Transformer. Celem jest poprawa skuteczności systemów automatycznego rozpoznawania mowy (ASR) w warunkach rzeczywistych, gdzie nakładanie się wypowiedzi jest nieuniknione.

Poprawa jakości mowy w nagraniach

Budujemy modele redukcji szumów. Pracę wspiera własny zbiór PolSESS, zawierający syntetyczne próbki mowy zaszumionej (szumy otoczenia, pogłos, zdarzenia losowe), przeznaczony do treningu sieci neuronowych.

Wybrane publikacje

  1. Kleć, M., Szklanny, K., Wieczorkowska, A. (2025). A Solution for Developing Corpora for Polish Speech Enhancement in Complex Acoustic Environments. Advances in Information Systems Development, vol 77. Springer, Cham.
  2. Paszko, B., Szołkowski, B., Podoba, Ł., Szklanny, K. (2026). Adapting a Multilingual Zero-Shot Text-to-Speech Model for High-Fidelity Synthesis in Polish Despite Limited Training Data. ISD 2026.
  3. Kleć, M., Szklanny, K., Wieczorkowska, A. (2024). Developing a Corpus for Polish Speech Enhancement by Reducing Noise, Reverberation, and Disruptions. ISD 2024 Proceedings.