Przejdź do treści

Przewodnik · 06

Polski TTS. Posłuchaj go przez telefon, zanim wybierzesz

Ładna próbka z panelu nie mówi, jak głos odczyta nazwisko Pączkowska, kwotę 1 249,90 zł albo termin 17.08.2026. Nie pokazuje też, co zrobi z dźwiękiem centrala i operator. Dobry wybór zaczyna się od tekstów z Twojego procesu, a kończy na odsłuchu prawdziwego połączenia, sprawdzeniu umowy i policzeniu zużycia.

Autorzy · Artem Lisovtsov, Serhii Ivanchatenko

Opublikowano 17 kwietnia 2026 · aktualizacja 15 sierpnia 2026

przewodnik · 069 min
najważniejsze ustalenia
FAKT · 01ITU-T P.85 opisuje metodę subiektywnej oceny urządzeń generujących mowę. Wyniki uzyskane na innych tekstach, przez inny panel i w innych warunkach nie tworzą automatycznie wspólnego rankingu głosów.
FAKT · 02Wynik trzeba sprawdzić na tej samej treści, głośności, konfiguracji i drodze telefonicznej. Plik pobrany z panelu jest próbą wstępną, bo połączenie może zmienić pasmo i kodowanie dźwięku.
FAKT · 03Daty, kwoty, skróty, kody i nazwiska testuj w zapisie, który naprawdę wychodzi z kalendarza lub CRM. Ręczne przepisanie ich słowami może ukryć błąd normalizacji tekstu.
7 rozdziałów

Najważniejsze ustalenia

6 faktów
  1. FAKT · 01

    ITU-T P.85 opisuje metodę subiektywnej oceny urządzeń generujących mowę. Wyniki uzyskane na innych tekstach, przez inny panel i w innych warunkach nie tworzą automatycznie wspólnego rankingu głosów.

    źródło · ITU-T P.85

  2. FAKT · 02

    Wynik trzeba sprawdzić na tej samej treści, głośności, konfiguracji i drodze telefonicznej. Plik pobrany z panelu jest próbą wstępną, bo połączenie może zmienić pasmo i kodowanie dźwięku.

    źródło · ITU-T G.711

  3. FAKT · 03

    Daty, kwoty, skróty, kody i nazwiska testuj w zapisie, który naprawdę wychodzi z kalendarza lub CRM. Ręczne przepisanie ich słowami może ukryć błąd normalizacji tekstu.

  4. FAKT · 04

    SSML 1.1 przewiduje między innymi sterowanie wymową, zapisami liczb i słownikami. Trzeba jednak sprawdzić, które elementy obsługuje wybrana usługa i głos. Zgodność ze specyfikacją nie przesądza o poprawnej polskiej wymowie.

    źródło · W3C, Speech Synthesis Markup Language 1.1

  5. FAKT · 05

    Jeżeli do syntezy trafiają dane osobowe, trzeba sprawdzić rolę dostawcy, podwykonawców, regiony, retencję, użycie danych i transfery poza EOG. Art. 28 RODO dopuszcza uprzednią zgodę szczegółową albo ogólną na dalszych podwykonawców.

    źródło · RODO, art. 28

  6. FAKT · 06

    W odbierze.ai przetwarzanie w UE jest częścią każdego pakietu. Pula minut i nadwyżka obejmują syntezę mowy wraz z pozostałą pracą agenta. Wymóg przetwarzania wyłącznie w Polsce wymaga osobnego potwierdzenia przed wyborem rozwiązania.

§ 01

Ustal, co głos ma robić

Przy umawianiu wizyt błąd w nazwisku, dniu, godzinie lub nazwie placówki może unieważnić całą rozmowę. W obsłudze polisy podobnie ważne są kwota, procent i długi numer. W reklamacji liczą się krótka informacja o przekazaniu oraz ton, który nie brzmi wesoło po kolejnym błędzie.

Przed odsłuchem wypisz wartości krytyczne. Błędna godzina, kwota lub numer sprawy może blokować start niezależnie od tego, jak naturalnie brzmi reszta wypowiedzi. Ocena „podoba mi się” nie powinna przykrywać takiego błędu.

Dopisz warunki użycia: język, godziny, planowaną liczbę rozmów równoległych, rodzaj telefonii, potrzebę przerwania agentowi i drogę awaryjną. Ten sam głos może wypaść inaczej w spokojnej zapowiedzi i w szybkim dialogu z danymi z systemu.

§ 02

Zbuduj materiał z prawdziwego formatu danych

Pobierz przykładowe wartości dokładnie tak, jak zwraca je kalendarz, CRM lub system zleceń. Jeśli data ma postać 17.08.2026, testuj ten zapis najpierw. Wersja „siedemnastego sierpnia” sprawdza gotową wymowę, ale nie pokaże, czy reguła zamiany dat działa poprawnie.

Zestaw powinien zawierać polskie nazwiska, tytuły i skróty, daty z godzinami, kwoty z groszami, procenty, adresy, numery telefonów, kody oraz nazwy własne firmy. Dodaj zdania wymagające odmiany liczebników i form zależnych od płci. Nie kopiuj prawdziwych danych klientów do zewnętrznego panelu testowego.

Przygotuj również dialog, nie tylko pojedyncze pliki. Rozmówca powinien wejść agentowi w słowo, poprosić o powtórzenie numeru, poprawić nazwisko i wybrać człowieka. Wtedy widać, czy problem dotyczy samej syntezy, tekstu wygenerowanego przez scenariusz czy obsługi tury rozmowy.

Pełny jawny zestaw 30 zdań znajduje się w raporcie „Jak przetestować polski głos voicebota”. Możesz podmienić część przykładów na wartości charakterystyczne dla własnego procesu, zachowując te same grupy błędów.

§ 03

Porównaj próbki w jednej sesji

Nadaj próbkom neutralne oznaczenia. Nazwa dostawcy, cena i poprzednie doświadczenia łatwo wpływają na ocenę. Kolejność zmieniaj między słuchaczami, a wszystkie warianty odtwarzaj z tej samej głośności i urządzenia.

Osobno zapisuj poprawność wartości, zrozumiałość, naturalność, tempo i dopasowanie tonu. Nie sklejaj ich od razu w jedną średnią. Głos z przyjemną barwą, który myli godzinę, powinien przegrać w procesie rezerwacji.

Do odsłuchu zaproś osoby zbliżone do rzeczywistych rozmówców, jeśli możesz to zrobić bez zbierania danych ponad potrzebę. Zapisz liczbę osób, pytania, skalę i warunki. Wynik ma znaczenie w ramach tej sesji; nie przedstawiaj go jako uniwersalnego MOS dla całego rynku.

Najtrudniejsze zdania powtórz. Zmienny wynik jest sygnałem ryzyka nawet wtedy, gdy średnia wygląda dobrze. Na końcu odsłuchaj te same warianty przez numer i tor, które mają działać na produkcji.

§ 04

Mierz całą przerwę w rozmowie

Czas od wysłania tekstu do pierwszego fragmentu dźwięku pomaga diagnozować syntezę, lecz rozmówca czeka dłużej. W pełnej przerwie mieszczą się wykrycie końca jego wypowiedzi, rozpoznanie mowy, logika, zapytanie do systemu klienta, przygotowanie tekstu, synteza, bufor i telefonia.

Mierz od ostatniego słyszalnego dźwięku człowieka do pierwszego słyszalnego dźwięku agenta na nagraniu połączenia. Zapisuj medianę, 95. percentyl, najdłuższy przypadek i jego przyczynę. Jeden najlepszy wynik z panelu niczego nie mówi o zwykłym ruchu.

Test powtórz przy liczbie równoległych rozmów przewidzianej w projekcie. Sprawdź też, czy agent nie ucina wolniej mówiącej osoby oraz jak szybko zatrzymuje własną wypowiedź po przerwaniu. Próg akceptacji ustal dla danego zadania przed porównaniem kandydatów.

§ 05

Ustal, gdzie poprawiać wymowę

Najpierw sprawdź tekst wejściowy. Błędnej odmiany lub źle zbudowanego zdania nie naprawi inna barwa głosu. Dla dat, kwot i skrótów przygotuj kontrolowaną zamianę na tekst, jeśli surowy format daje zły wynik.

SSML może opisywać wymowę, pauzy, liczby i słowniki, ale zakres obsługi zależy od usługi. Sprawdź dokumentację konkretnego wariantu oraz zachowanie po zmianie głosu. Jeśli potrzebnego elementu nie ma, prostsza tabela zamian przed syntezą może być bardziej przewidywalna.

Przy każdym wyjątku zapisz surową wartość, tekst po przekształceniu i usłyszany wynik. Dzięki temu wiadomo, czy poprawić dane z systemu, regułę językową czy ustawienia syntezy. Bez tego zespół łatwo stroi niewłaściwe miejsce.

§ 06

Sprawdź dane, licencję i zasady wyjścia

Do syntezy może trafić nazwisko, termin wizyty albo treść sprawy. Wtedy sprawdź role z RODO, podwykonawców, faktyczne regiony, retencję, użycie danych do doskonalenia usługi i transfery poza Europejski Obszar Gospodarczy. Etykieta regionu w panelu nie zastępuje umowy i opisu przepływu.

Transfer do USA nie ma jednej odpowiedzi dla każdego dostawcy. Dla organizacji objętej ważną certyfikacją może mieć zastosowanie EU–US Data Privacy Framework. W innych układach podstawą mogą być standardowe klauzule umowne wraz z oceną i dodatkowymi środkami, jeśli są potrzebne. Sprawdza się konkretny podmiot, usługę i przepływ.

Art. 28 RODO wymaga uprzedniej zgody szczegółowej albo ogólnej na dalszych podwykonawców. Przy zgodzie ogólnej procesor informuje o planowanej zmianie, aby administrator mógł się sprzeciwić. Lista podwykonawców i tryb zmian muszą być dostępne, ale przepis nie narzuca jednego miejsca ani jednego wzoru dokumentu.

Licencja głosu powinna obejmować komercyjne rozmowy telefoniczne, planowaną skalę, próbki testowe oraz ewentualne stałe nagrania. Przy głosie stworzonym z nagrań konkretnej osoby dochodzą podstawa przetwarzania, prawo do użycia, zasady po zakończeniu współpracy, dobra osobiste i obowiązki dotyczące syntetycznego dźwięku.

§ 07

Policz koszt na własnej próbce

Dostawcy mogą rozliczać znaki, sekundy dźwięku, żądania, minuty albo kilka elementów naraz. Pobierz tekst wygenerowany w próbce rozmów i policz go według jednostki z aktualnej oferty. Dodaj opłatę minimalną, wybrany region, ruch podczas awarii oraz koszt potrzebnej infrastruktury.

Porównaj także zachowanie przy braku odpowiedzi usługi. Wcześniej przygotowany komunikat, ponowienie, przekazanie do człowieka i zakończenie rozmowy mają różny wpływ na klienta oraz koszt. Test powinien pokazać, co naprawdę usłyszy osoba przy telefonie.

W pakietach odbierze.ai synteza nie pojawia się jako osobna publiczna pozycja. Pula minut i stawka nadwyżki obejmują pracę całego agenta, w tym rozpoznanie i syntezę mowy, model językowy oraz uzgodnioną równoległość. Numer i opłaty operatora są osobno.

Wybór zapisujemy w dokumentacji projektu wraz z regionem, warunkami danych, licencją i wynikiem testu. Zmiana głosu po starcie wymaga ponownego sprawdzenia wymowy, telefonu, opóźnienia i awarii. Termin oraz koszt zależą od licencji i zakresu zmiany, dlatego ustalamy je osobno przed rozpoczęciem prac.

01pyt · p06

Który polski głos TTS jest najlepszy?

odp.

Nie ma jednego zwycięzcy dla każdej rozmowy. Wybór zależy od tekstów, błędów blokujących, toru telefonicznego, opóźnienia, licencji, danych i kosztu na Twoim użyciu. Porównaj kandydatów w jednej sesji i zapisz warunki testu.

02pyt · p06

Czy wystarczy porównać pliki dźwiękowe?

odp.

Nie. Plik pomaga odrzucić głos z błędną wymową, ale nie pokazuje wpływu centrali, operatora, kodeka, bufora ani przerwania przez rozmówcę. Finałowi kandydaci powinni przejść ten sam test przez prawdziwe połączenie.

03pyt · p06

Jak przetestować głosy bez prawdziwych danych klientów?

odp.

Użyj wymyślonych nazwisk, numerów i terminów o takiej samej budowie jak dane produkcyjne. Zachowaj format z systemu, na przykład cyfry, skróty i separatory. Nie przesyłaj do panelu testowego rekordów skopiowanych z CRM.

04pyt · p06

Czy SSML naprawi każde polskie nazwisko?

odp.

Nie. SSML udostępnia mechanizmy opisu wymowy i słowników, ale konkretna usługa może obsługiwać tylko część specyfikacji. Czasem lepiej działa jawna zamiana tekstu przed syntezą. Po każdej zmianie trzeba ponownie odsłuchać wynik przez telefon.

05pyt · p06

Co z wymową kwot, dat, numerów telefonów?

odp.

Najpierw testuj surowy zapis z systemu. Jeśli wynik jest błędny, przygotuj kontrolowaną zamianę wartości na tekst i porównaj ponownie. Numeru sprawy lub telefonu nie wolno automatycznie czytać jak zwykłej liczby, jeśli zmienia to jego znaczenie.

06pyt · p06

Czy hosting TTS w USA narusza RODO?

odp.

Nie automatycznie. Trzeba sprawdzić, czy dochodzi do transferu danych osobowych poza EOG i jaki mechanizm go obejmuje. Dla certyfikowanej organizacji może działać EU–US Data Privacy Framework. W innym układzie mogą być potrzebne standardowe klauzule umowne, ocena transferu i dodatkowe środki.

07pyt · p06

Jak odbierze.ai rozlicza TTS?

odp.

Synteza jest częścią pracy agenta. Pula minut i stawka nadwyżki obejmują rozpoznanie mowy, model językowy, syntezę oraz uzgodnioną równoległość. Numer, przeniesienie numeru i opłaty operatora pokazujemy osobno. ENTERPRISE ma wycenę indywidualną.

08pyt · p06

Czy można zmienić silnik TTS po wdrożeniu?

odp.

Można, jeśli pozwala na to licencja i architektura projektu. Zmiana wymaga ponownego testu wymowy, połączenia, opóźnienia, obciążenia i awarii oraz aktualizacji dokumentacji danych. Termin i koszt dostajesz na piśmie po określeniu zakresu.

09pyt · p06

Czy mogę użyć głosu pracownika?

odp.

Najpierw trzeba ustalić podstawę przetwarzania nagrań, zakres prawa do użycia głosu, zasady po odejściu z firmy oraz obowiązki dotyczące syntetycznego dźwięku. Podpis pracownika nie zamyka automatycznie kwestii RODO, prawa pracy i dóbr osobistych.

Co dalej

Poproś o demo jednej rozmowy z Twojej branży.

Zostaw kontakt. W ciągu 1–2 dni roboczych Daria odpowie i prześle link do działającego demo dla wskazanej branży. Nie trzeba zakładać konta, logować się ani podawać karty.

Branże i raporty

Materiały dla branż i powiązane raporty.

01 · poz.