Przejdź do treści

Biblioteka R · 05 / 08R05 · technologia

Jak przetestować polski głos voicebota

Poniższe 30 zdań pozwala sprawdzić, jak polski głos voicebota czyta nazwiska, terminy, kwoty i skróty. Podaj je w tym samym formacie, którego używa kalendarz lub CRM, a następnie odsłuchaj przez telefon. Wyjaśniamy też, jak zapisać ocenę wymowy i zmierzyć oczekiwanie na odpowiedź.

11 min czytaniapublikacja 2026-04-23aktualizacja 2026-09-08Zespół odbierze.aiwydawca Syntalith sp. z o.o.
raport · technologia11 min
trzy zdania
01Porównuj głosy na tych samych tekstach, przez ten sam numer i przy tej samej konfiguracji. Odsłuch pliku z panelu dostawcy jest tylko próbą wstępną.
02Testuj dokładnie taki zapis, jaki wychodzi z kalendarza lub CRM: 8:30, 1 249,90 zł, dr n. med. i nazwiska z polskimi znakami. Wersja zapisana słowami nie wykryje błędów normalizacji.
03Nie ma jednego wiarygodnego progu MOS ani opóźnienia dla każdego procesu. Zapisz błędy krytyczne, oceny jednego panelu oraz medianę i 95. percentyl czasu całej odpowiedzi.
publikacja · 2026-04-23
Zestaw
30 zdań

Dziewięć grup: nazwiska, skróty, daty, liczby, adresy, odmiana, nazwy własne, dialog i słownictwo branżowe.

Dwa zapisy
surowy i rozwinięty

Najpierw podaj tekst dokładnie z systemu źródłowego. Potem sprawdź, czy kontrolowane rozwinięcie dat, kwot i skrótów usuwa błąd.

Warunki
plik, telefon, przerwanie

Osobno oceń plik źródłowy, realne połączenie oraz zachowanie po wejściu rozmówcy w słowo.

Opóźnienie
mediana i p95

Mierz całą przerwę od końca wypowiedzi człowieka do pierwszego słyszalnego dźwięku odpowiedzi.

Wynik
błędy krytyczne i oceny

Przed testem ustal, które pomyłki blokują start, na przykład błędna kwota, data, nazwisko lub numer telefonu.

Trzy zdania, jeśli nie masz czasu

  1. 01Porównuj głosy na tych samych tekstach, przez ten sam numer i przy tej samej konfiguracji. Odsłuch pliku z panelu dostawcy jest tylko próbą wstępną.
  2. 02Testuj dokładnie taki zapis, jaki wychodzi z kalendarza lub CRM: 8:30, 1 249,90 zł, dr n. med. i nazwiska z polskimi znakami. Wersja zapisana słowami nie wykryje błędów normalizacji.
  3. 03Nie ma jednego wiarygodnego progu MOS ani opóźnienia dla każdego procesu. Zapisz błędy krytyczne, oceny jednego panelu oraz medianę i 95. percentyl czasu całej odpowiedzi.

01

Najpierw ustal, gdzie powstaje błąd

Niepoprawny odczyt może wynikać z danych bez polskich znaków, błędnej zamiany liczb na słowa lub samej syntezy mowy. W raporcie z testu zapisuj tekst wejściowy i usłyszany wynik. To ułatwi wskazanie przyczyny i sprawdzenie poprawki.

Polska odmiana ma znaczenie jeszcze przed syntezą. System musi zbudować poprawne zdanie, na przykład „dla trzydziestu pięciu pacjentów” albo „o godzinie ósmej trzydzieści”. Głos nie naprawi błędnej formy wygenerowanej przez scenariusz.

Sposób odczytania skrótu lub liczby zależy od kontekstu. „dr” może oznaczać stopień naukowy, „1.05” datę albo liczbę, a numer telefonu wymaga podziału na cyfry lub grupy cyfr. Zacznij od wartości w formacie z systemu klienta, żeby sprawdzić również reguły ich rozwijania.

02

Gdzie poprawić datę, kwotę albo nazwisko

Najpierw sprawdź wartość z systemu i zdanie przygotowane do wypowiedzenia. Jeżeli tekst jest błędny, zmiana barwy głosu go nie naprawi. Zapisz osobno wartość źródłową, tekst po kontrolowanej zamianie oraz to, co usłyszysz podczas kolejnej próby.

Przykładowa poprawka tekstu przed syntezą, bez deklaracji wyniku odsłuchu

Wizyta: 18.09.2026, 8:30

Tekst do ponownej próby
Wizyta jest osiemnastego września dwa tysiące dwudziestego szóstego roku o ósmej trzydzieści.
Co porównać po odsłuchu
Ta sama data i godzina, poprawna odmiana

Kwota: 1 249,90 zł

Tekst do ponownej próby
Do zapłaty tysiąc dwieście czterdzieści dziewięć złotych i dziewięćdziesiąt groszy.
Co porównać po odsłuchu
Zachowana część złotowa i grosze

Numer: 007421/26

Tekst do ponownej próby
Numer sprawy: zero, zero, siedem, cztery, dwa, jeden, ukośnik, dwa, sześć.
Co porównać po odsłuchu
Oba zera na początku oraz kolejność wszystkich znaków

SSML 1.1 udostępnia mechanizmy sterowania wymową, interpretacją tekstu i słownikami. Obsługiwane elementy zależą od konkretnej usługi i głosu. Gdy potrzebnego mechanizmu nie ma, można zastosować sprawdzoną regułę rozwinięcia wartości przed syntezą. Po zmianie trzeba ponowić odsłuch przez telefon, także dla podobnych danych, których reguła nie powinna zmieniać.

03

Pomiar całej odpowiedzi

Punkty pomiarowe od wypowiedzi człowieka do odpowiedzi agenta

Koniec wypowiedzi

Początek i koniec
Od ostatniego słyszalnego dźwięku rozmówcy do wykrycia końca tury
Co zapisujesz
Czas oczekiwania potrzebny, aby agent nie ucinał wolniej mówiącej osoby.

Rozpoznanie i decyzja

Początek i koniec
Od wykrycia końca tury do gotowej treści odpowiedzi
Co zapisujesz
Osobno czas rozpoznania mowy, logiki, integracji i wygenerowania tekstu.

Synteza

Początek i koniec
Od wysłania tekstu do pierwszej porcji dźwięku
Co zapisujesz
Czas pierwszego dźwięku oraz czas wygenerowania całej wypowiedzi, jeżeli system nie strumieniuje.

Telefonia

Początek i koniec
Od pierwszej porcji dźwięku do dźwięku w nagraniu połączenia
Co zapisujesz
Wpływ operatora, bufora, transkodowania i bieżących warunków sieci.

Cała odpowiedź

Początek i koniec
Od końca wypowiedzi rozmówcy do pierwszego dźwięku agenta
Co zapisujesz
Medianę, 95. percentyl, najdłuższy wynik i opis przyczyny najwolniejszych odpowiedzi.

Sam czas syntezy nie opisuje rozmowy. Jeśli systemy nie mają wspólnego zegara, użyj nagrania połączenia do pomiaru całej odpowiedzi, a logów do diagnozy etapów. Powtórz pomiar przy zwykłym obciążeniu oraz przy liczbie równoległych rozmów przewidzianej w projekcie.

Sprawdź kodek wynegocjowany w prawdziwym połączeniu. G.711 koduje pasmo telefoniczne, a G.722 szersze pasmo mowy. Sama deklaracja formatu pliku po stronie syntezy nie mówi, czy operator lub centrala nie zmieni dźwięku po drodze.

Próg akceptacji ustala się dla konkretnego procesu. Krótka odpowiedź po podaniu godziny i dłuższa odpowiedź po zapytaniu do systemu klienta nie muszą mieć tego samego czasu. Ważne, aby zespół znał rozkład wyników i zachowanie w najwolniejszych przypadkach.

04

Lista 30 zdań testowych w 9 kategoriach

Tekst należy podać w takiej postaci, w jakiej trafia do syntezy

Nazwiska i polskie znaki, 4

Zdania do testu
1) Czy rozmawiam z panią Agnieszką Pączkowską? 2) Rezerwacja jest na nazwisko Błażej Żółciński. 3) Wiadomość zostawiła Małgorzata Szcześniak. 4) Sprawę prowadzi Przemysław Wójcik.
Co sprawdzasz
ą, ę, ł, ń, ó, ś, ź, ż oraz naturalny akcent w nazwisku

Tytuły i skróty, 3

Zdania do testu
5) Konsultację prowadzi dr n. med. Joanna Łęcka. 6) Dokument podpisał mgr inż. Paweł Mróz. 7) Proszę wybrać wew. 24 i podać nr ref. 3187.
Co sprawdzasz
Rozwinięcie skrótów zależne od kontekstu oraz odczyt numeru wewnętrznego i referencji

Daty i godziny, 4

Zdania do testu
8) Wizyta: 17.08.2026, godz. 8:30. 9) Termin przeniesiono z 1 maja na 2 czerwca. 10) Oddzwonimy między 9:05 a 9:15. 11) Rezerwacja jest ważna do 31.12.2026 r.
Co sprawdzasz
Daty zapisane cyframi, liczebniki porządkowe, minuty i skrót roku

Kwoty, liczby i procenty, 4

Zdania do testu
12) Do zapłaty: 1 249,90 zł brutto. 13) Rata wynosi 327 zł i 8 gr. 14) Rabat wynosi 12,5%. 15) Numer sprawy to 007421/26.
Co sprawdzasz
Separatory, grosze, procenty, zera na początku i numery, których nie wolno czytać jako jednej liczby

Adresy, telefony i kody, 4

Zdania do testu
16) Adres: ul. Żwirki i Wigury 16A/4, 02-092 Warszawa. 17) Proszę zadzwonić pod +48 22 123 45 67. 18) Punkt znajduje się przy al. Niepodległości 208. 19) Kod odbioru to A7Q9.
Co sprawdzasz
Skróty adresowe, kod pocztowy, prefiks kraju, grupowanie telefonu i ciąg liter z cyframi

Odmiana liczebników, 3

Zdania do testu
20) Umówiono 1 wizytę, 2 wizyty i 5 wizyt. 21) Czekamy na 21 klientów i 22 klientki. 22) To druga z trzech prób kontaktu.
Co sprawdzasz
Formy po różnych liczbach, rodzaj gramatyczny i liczebniki porządkowe

Nazwy własne i miejsca, 3

Zdania do testu
23) Spotkajmy się przy Centrum Nauki Kopernik. 24) Lokal jest między placem Zbawiciela a ulicą Mokotowską. 25) Pociąg jedzie z Bielska-Białej do stacji Wrocław Główny.
Co sprawdzasz
Wielowyrazowe nazwy, łącznik oraz odmiana nazw miast i miejsc

Dialog i przerywanie, 3

Zdania do testu
26) Rozumiem. Już sprawdzam dostępne terminy. 27) Przepraszam, nie usłyszałem numeru. Powtórz proszę po trzy cyfry. 28) Mogę kontynuować, czy wolisz rozmowę z pracownikiem?
Co sprawdzasz
Pauzy między zdaniami, intonację pytania oraz bezpieczne wznowienie po wejściu rozmówcy w słowo

Słownictwo branżowe, 2

Zdania do testu
29) Badanie HbA1c zaplanowano na 7:15. 30) Numer polisy OC/AC to PL-48291-26.
Co sprawdzasz
Skrót medyczny, skróty ubezpieczeniowe oraz ciąg alfanumeryczny

Przed odsłuchem zapisz oczekiwaną wymowę każdej wartości. Te same 30 zdań odtwórz jako pliki źródłowe i w prawdziwym połączeniu. Jeżeli proces używa innych nazw, kodów lub skrótów, podmień część przykładów na dane reprezentatywne dla klienta, bez używania prawdziwych danych osób w teście.

05

Ocena wymowy i naturalności głosu

Dla każdego zdania zaznacz, czy nazwisko, data, kwota i kod zostały odczytane poprawnie. Jedna pomyłka w polu krytycznym powinna być widoczna osobno, nawet jeśli średnia ocena naturalności jest wysoka.

Próbki warto oznaczyć neutralnymi identyfikatorami, aby nazwa dostawcy nie wpływała na ocenę. Słuchacze mogą osobno ocenić zrozumiałość, naturalność, tempo i dopasowanie do sytuacji. Skala jest narzędziem wewnętrznym; zawsze publikuj ją razem z pytaniem, materiałem i warunkami.

Automatyczna transkrypcja odsłuchu może pomóc znaleźć problem, lecz dokłada błędy systemu rozpoznawania mowy. Nie traktuj jej wyniku jako niezależnego dowodu jakości syntezy bez ręcznego sprawdzenia rozbieżności.

Stabilność sprawdź przez powtórzenie najtrudniejszych zdań i test przy przewidzianej liczbie równoległych rozmów. Na koniec przeprowadź kilka pełnych dialogów z przerwaniem agentowi, powtórzeniem wartości i przejściem do pracownika.

06

Głos dobieraj do zadania

Różne procesy obciążają głos w inny sposób

Umawianie terminów

Co musi być czytelne
nazwisko, data, godzina, placówka
Próba
Poproś o powtórzenie dwóch podobnych godzin i zmianę terminu.
Błąd blokujący
Inna data lub godzina niż w systemie źródłowym

Obsługa klienta

Co musi być czytelne
numer sprawy, nazwa produktu, kolejne kroki
Próba
Przerwij agentowi w połowie numeru i poproś o powtórzenie po trzy znaki.
Błąd blokujący
Pomieszana kolejność cyfr lub utrata kontekstu po przerwaniu

Administracja w ochronie zdrowia

Co musi być czytelne
nazwiska, specjalizacje, instrukcja organizacyjna
Próba
Sprawdź rozmowę z osobą starszą i w hałaśliwym otoczeniu.
Błąd blokujący
Niezrozumiała instrukcja albo odpowiedź wykraczająca poza uzgodniony zakres administracyjny

Płatności i ubezpieczenia

Co musi być czytelne
kwota, grosze, procent, numer polisy
Próba
Porównaj odczyt kwoty przed i po ponownym potwierdzeniu.
Błąd blokujący
Błędna kwota, waluta albo identyfikator

Rozmowa wychodząca

Co musi być czytelne
nazwa firmy, informacja o AI, cel kontaktu i sposób odmowy
Próba
Odsłuchaj pierwszą wypowiedź bez znajomości scenariusza.
Błąd blokujący
Niewyraźna tożsamość firmy lub informacja o AI

Reklamacja lub pilna sprawa

Co musi być czytelne
krótka informacja o przekazaniu i dalszym kontakcie
Próba
Sprawdź ton po dwóch nieudanych próbach zrozumienia rozmówcy.
Błąd blokujący
Wesoła intonacja w nieodpowiednim momencie albo brak ustalonej drogi do człowieka

Ton głosu oceń na rozmowach typowych dla danej firmy. W odsłuchu warto uwzględnić zarówno opinię osoby odpowiedzialnej za markę, jak i osób podobnych do przyszłych rozmówców.

07

Stabilność, awaria i koszt

Test obciążenia powinien odpowiadać liczbie równoległych rozmów przewidzianej w projekcie i limitom zapisanym w umowie. Powtórz najtrudniejsze zdania, sprawdź opóźnienie oraz potwierdź, że identyfikator głosu i ustawienia nie zmieniły się między próbami.

Ustal zachowanie na wypadek braku odpowiedzi syntezy. W zależności od procesu może to być krótki, wcześniej przygotowany komunikat, ponowienie próby, przekazanie rozmowy lub zakończenie z zapowiedzią oddzwonienia. Test ma pokazać, co rzeczywiście słyszy rozmówca, również gdy niedostępna jest usługa zapasowa.

Przy samodzielnym zakupie syntezy użyj jednostki rozliczenia z oferty: znaków, sekund dźwięku lub żądań. Oblicz koszt próbki rozmów i uwzględnij opłaty minimalne oraz dodatki. W odbierze.ai synteza i standardowa telefonia krajowa są wliczone w pulę oraz nadwyżkę minut; cennik podaje koszt całego agenta.

Wcześniej przygotowany dźwięk może obniżyć liczbę wywołań dla stałych komunikatów, jeśli pozwala na to licencja i projekt danych. Nie używaj go do nazwisk, kwot, terminów ani innych wartości zmiennych. Oszczędność policz na własnym rozkładzie wypowiedzi, zamiast przyjmować stały procent.

08

Region danych, umowa i głos konkretnej osoby

Do syntezy może trafiać nazwisko, termin wizyty lub inna informacja o osobie. Dokumentacja powinna opisywać region przetwarzania, podwykonawców, okres przechowywania, użycie danych do doskonalenia usługi i ewentualny transfer poza EOG.

Licencja powinna zezwalać na komercyjne rozmowy telefoniczne w planowanej skali. Osobno sprawdź prawo do nagrywania próbek testowych, przechowywania stałych komunikatów, użycia głosu w kilku markach, tworzenia głosu na zamówienie oraz zasady po rozwiązaniu umowy. Warunki różnią się między dostawcami i planami.

Głos, na podstawie którego można rozpoznać konkretną osobę, jest daną osobową. Staje się daną biometryczną w szczególnym rozumieniu RODO wtedy, gdy wynika ze specjalnego przetwarzania technicznego i służy jednoznacznej identyfikacji lub jej potwierdzeniu. Sam plik dźwiękowy nie zawsze spełnia ten warunek.

Stworzenie głosu na podstawie nagrań pracownika wymaga ustalenia podstawy przetwarzania, zakresu zezwolenia na użycie głosu, praw po odejściu z firmy oraz wpływu relacji pracowniczej na dobrowolność decyzji. Pisemne ustalenia są potrzebnym dowodem, lecz podpis sam nie rozwiązuje wszystkich kwestii RODO, prawa pracy i dóbr osobistych. Ocena skutków dla ochrony danych zależy od ryzyka konkretnego procesu.

Opinia EROD 28/2024 dotyczy danych osobowych w modelach AI i nakazuje oceniać anonimowość oraz podstawę prawną indywidualnie. Nie jest szczegółową instrukcją klonowania głosu. Przy głosie przypominającym istniejącą osobę trzeba też sprawdzić obowiązki oznaczenia syntetycznego dźwięku i, zależnie od sposobu użycia, reguły dotyczące treści typu deepfake.

We wszystkich pakietach odbierze.ai przetwarzanie w UE jest częścią zakresu. Wymóg przetwarzania wyłącznie w Polsce trzeba potwierdzić oddzielnie przed wyborem architektury. W sektorze publicznym decydują wymagania postępowania, analiza ryzyka i umowa; otwarty kod lub lokalna instalacja nie są automatycznie jedynym dopuszczalnym rozwiązaniem.

09

Jak zapisać wynik testu

W arkuszu przeznacz jeden wiersz na każdą próbę. Zapisz numer zdania, oznaczenie głosu, tekst wejściowy, oczekiwaną wymowę, usłyszaną odpowiedź i stwierdzony błąd. W osobnych kolumnach możesz ocenić zrozumiałość, naturalność i tempo według skali ustalonej przed odsłuchem.

Do arkusza dołącz datę, ustawienia głosu, sposób połączenia i opis grupy słuchaczy. Po poprawce dopisz kolejny wynik przy tym samym zdaniu. Przy wyborze głosu pokaż zarówno oceny słuchaczy, jak i listę nierozwiązanych błędów. W odbierze.ai przygotowanie takich prób i poprawa wymowy należą do prac wdrożeniowych.

10

Metodyka i dziennik aktualizacji

Zestaw 30 zdań przygotowano jako jawny materiał testowy do tej publikacji. Nie wykorzystuje rozmów klientów. Sposób oceny oparto na zaleceniu ITU-T P.85 dotyczącym subiektywnej oceny urządzeń generujących mowę. Opis toru telefonicznego sprawdzono w dokumentacji G.711 i G.722, a część o danych i modelach w RODO, opinii EROD 28/2024 oraz aktualnym tekście AI Act. Raport nie przypisuje głosom uniwersalnego wyniku MOS, czasu odpowiedzi ani ceny. Progi akceptacji trzeba zapisać dla konkretnego procesu przed testem.

Dziennik aktualizacji

  1. 2026-09-08Włączono ze wcześniejszego poradnika wskazówki o poprawie tekstu i SSML, dodano trzy jawne przykłady normalizacji. Zachowano pełne 30 zdań bez dopisywania fikcyjnych ocen lub wyników pomiaru.
  2. 2026-09-07Uproszczono instrukcję testu 30 zdań i opis zapisywania wyników.
  3. 2026-04-23Pierwsza wersja raportu
  4. 2026-08-15Usunięto nieporównywalne wyniki MOS, arbitralne progi i ceny. Opublikowano wszystkie 30 zdań, kartę pomiaru całej odpowiedzi oraz poprawioną część o licencji, regionie i głosie konkretnej osoby.

12

FAQ

01pyt · raport

Czy najdroższy TTS jest zawsze najlepszy?

odp.

Nie da się tego ustalić z ceny ani próbki marketingowej. Porównaj kandydatów na tych samych zdaniach i w prawdziwym połączeniu, a następnie dodaj opóźnienie całej odpowiedzi, licencję, region danych, zachowanie podczas awarii i koszt na rzeczywistym zużyciu.

02pyt · raport

Czy można użyć głosu pracownika kliniki?

odp.

Najpierw trzeba ustalić podstawę przetwarzania nagrań, zakres prawa do użycia głosu, zasady po zakończeniu współpracy oraz obowiązki informacyjne i dotyczące treści syntetycznych. Relacja pracodawca–pracownik wymaga szczególnej uwagi przy ocenie dobrowolności. Potrzeba oceny skutków dla ochrony danych zależy od ryzyka konkretnego procesu; nie wynika automatycznie z samej nazwy techniki.

03pyt · raport

Czy mogę użyć tego samego głosu dla 5 różnych klientów?

odp.

Tylko jeśli pozwalają na to warunki licencji i umowa. Poza prawem użycia trzeba ocenić, czy wspólny głos pasuje do marek i procesów. Nie obiecujemy jednego modelu licencyjnego dla wszystkich dostawców, dlatego potwierdzamy zakres przed wyborem głosu.

04pyt · raport

Co z głosami open source dla sektora publicznego?

odp.

Mogą być właściwym rozwiązaniem, jeżeli licencja, jakość, bezpieczeństwo i koszt utrzymania spełniają wymagania postępowania. Lokalna instalacja daje większą kontrolę nad przepływem danych, ale przenosi na zamawiającego lub wykonawcę obowiązki związane z infrastrukturą, poprawkami, dostępnością i testami. Nie jest jedyną dopuszczalną opcją z samego faktu, że klient należy do sektora publicznego.

05pyt · raport

Jak długo testować głos przed produkcją?

odp.

Zaplanuj przejście zdań testowych, rozmów przez telefon, powtórzeń trudnych wartości, przerwań i próby awarii. Wykonawca powinien oszacować czas dla tego zakresu i przewidywanego obciążenia. Przed startem trzeba poprawić błędy blokujące oraz powtórzyć próby, w których wystąpiły.

06pyt · raport

Czy mogę zmienić głos w trakcie umowy?

odp.

Tak, jeżeli pozwala na to licencja i uzgodniony zakres. Powtórz testy wymowy, telefonu, opóźnienia i awarii, a potem zapisz wersję oraz datę zmiany. Sama zmiana barwy głosu nie zmienia automatycznie treści komunikatu z art. 50 ust. 1, lecz może wymagać aktualizacji dokumentacji technicznego oznaczania syntetycznego dźwięku.

07pyt · raport

Co jeśli pacjent prosi „tym razem proszę o człowieka”?

odp.

Agent powinien uruchomić ścieżkę uzgodnioną dla danego procesu: połączenie z pracownikiem, zapis prośby o oddzwonienie albo podanie godzin kontaktu. Nie obiecuj natychmiastowego przełączenia, jeżeli nikt nie odbiera w danym czasie. To ważna zasada obsługi i projektu rozmowy, ale nie jest osobnym wymogiem art. 50 ust. 1.

08pyt · raport

Czy SSML naprawi każde polskie nazwisko?

odp.

Nie. Zakres mechanizmów trzeba sprawdzić dla wybranej usługi i głosu. Najpierw oddziel błąd danych od błędu wymowy. Kontrolowana zmiana tekstu lub ustawienia syntezy wymaga ponownego odsłuchu; sama specyfikacja nie potwierdza poprawnego wyniku.