Ustal, co głos ma robić
Przy umawianiu wizyt błąd w nazwisku, dniu, godzinie lub nazwie placówki może unieważnić całą rozmowę. W obsłudze polisy podobnie ważne są kwota, procent i długi numer. W reklamacji liczą się krótka informacja o przekazaniu oraz ton, który nie brzmi wesoło po kolejnym błędzie.
Przed odsłuchem wypisz wartości krytyczne. Błędna godzina, kwota lub numer sprawy może blokować start niezależnie od tego, jak naturalnie brzmi reszta wypowiedzi. Ocena „podoba mi się” nie powinna przykrywać takiego błędu.
Dopisz warunki użycia: język, godziny, planowaną liczbę rozmów równoległych, rodzaj telefonii, potrzebę przerwania agentowi i drogę awaryjną. Ten sam głos może wypaść inaczej w spokojnej zapowiedzi i w szybkim dialogu z danymi z systemu.
Zbuduj materiał z prawdziwego formatu danych
Pobierz przykładowe wartości dokładnie tak, jak zwraca je kalendarz, CRM lub system zleceń. Jeśli data ma postać 17.08.2026, testuj ten zapis najpierw. Wersja „siedemnastego sierpnia” sprawdza gotową wymowę, ale nie pokaże, czy reguła zamiany dat działa poprawnie.
Zestaw powinien zawierać polskie nazwiska, tytuły i skróty, daty z godzinami, kwoty z groszami, procenty, adresy, numery telefonów, kody oraz nazwy własne firmy. Dodaj zdania wymagające odmiany liczebników i form zależnych od płci. Nie kopiuj prawdziwych danych klientów do zewnętrznego panelu testowego.
Przygotuj również dialog, nie tylko pojedyncze pliki. Rozmówca powinien wejść agentowi w słowo, poprosić o powtórzenie numeru, poprawić nazwisko i wybrać człowieka. Wtedy widać, czy problem dotyczy samej syntezy, tekstu wygenerowanego przez scenariusz czy obsługi tury rozmowy.
Pełny jawny zestaw 30 zdań znajduje się w raporcie „Jak przetestować polski głos voicebota”. Możesz podmienić część przykładów na wartości charakterystyczne dla własnego procesu, zachowując te same grupy błędów.
Porównaj próbki w jednej sesji
Nadaj próbkom neutralne oznaczenia. Nazwa dostawcy, cena i poprzednie doświadczenia łatwo wpływają na ocenę. Kolejność zmieniaj między słuchaczami, a wszystkie warianty odtwarzaj z tej samej głośności i urządzenia.
Osobno zapisuj poprawność wartości, zrozumiałość, naturalność, tempo i dopasowanie tonu. Nie sklejaj ich od razu w jedną średnią. Głos z przyjemną barwą, który myli godzinę, powinien przegrać w procesie rezerwacji.
Do odsłuchu zaproś osoby zbliżone do rzeczywistych rozmówców, jeśli możesz to zrobić bez zbierania danych ponad potrzebę. Zapisz liczbę osób, pytania, skalę i warunki. Wynik ma znaczenie w ramach tej sesji; nie przedstawiaj go jako uniwersalnego MOS dla całego rynku.
Najtrudniejsze zdania powtórz. Zmienny wynik jest sygnałem ryzyka nawet wtedy, gdy średnia wygląda dobrze. Na końcu odsłuchaj te same warianty przez numer i tor, które mają działać na produkcji.
Mierz całą przerwę w rozmowie
Czas od wysłania tekstu do pierwszego fragmentu dźwięku pomaga diagnozować syntezę, lecz rozmówca czeka dłużej. W pełnej przerwie mieszczą się wykrycie końca jego wypowiedzi, rozpoznanie mowy, logika, zapytanie do systemu klienta, przygotowanie tekstu, synteza, bufor i telefonia.
Mierz od ostatniego słyszalnego dźwięku człowieka do pierwszego słyszalnego dźwięku agenta na nagraniu połączenia. Zapisuj medianę, 95. percentyl, najdłuższy przypadek i jego przyczynę. Jeden najlepszy wynik z panelu niczego nie mówi o zwykłym ruchu.
Test powtórz przy liczbie równoległych rozmów przewidzianej w projekcie. Sprawdź też, czy agent nie ucina wolniej mówiącej osoby oraz jak szybko zatrzymuje własną wypowiedź po przerwaniu. Próg akceptacji ustal dla danego zadania przed porównaniem kandydatów.
Ustal, gdzie poprawiać wymowę
Najpierw sprawdź tekst wejściowy. Błędnej odmiany lub źle zbudowanego zdania nie naprawi inna barwa głosu. Dla dat, kwot i skrótów przygotuj kontrolowaną zamianę na tekst, jeśli surowy format daje zły wynik.
SSML może opisywać wymowę, pauzy, liczby i słowniki, ale zakres obsługi zależy od usługi. Sprawdź dokumentację konkretnego wariantu oraz zachowanie po zmianie głosu. Jeśli potrzebnego elementu nie ma, prostsza tabela zamian przed syntezą może być bardziej przewidywalna.
Przy każdym wyjątku zapisz surową wartość, tekst po przekształceniu i usłyszany wynik. Dzięki temu wiadomo, czy poprawić dane z systemu, regułę językową czy ustawienia syntezy. Bez tego zespół łatwo stroi niewłaściwe miejsce.
Sprawdź dane, licencję i zasady wyjścia
Do syntezy może trafić nazwisko, termin wizyty albo treść sprawy. Wtedy sprawdź role z RODO, podwykonawców, faktyczne regiony, retencję, użycie danych do doskonalenia usługi i transfery poza Europejski Obszar Gospodarczy. Etykieta regionu w panelu nie zastępuje umowy i opisu przepływu.
Transfer do USA nie ma jednej odpowiedzi dla każdego dostawcy. Dla organizacji objętej ważną certyfikacją może mieć zastosowanie EU–US Data Privacy Framework. W innych układach podstawą mogą być standardowe klauzule umowne wraz z oceną i dodatkowymi środkami, jeśli są potrzebne. Sprawdza się konkretny podmiot, usługę i przepływ.
Art. 28 RODO wymaga uprzedniej zgody szczegółowej albo ogólnej na dalszych podwykonawców. Przy zgodzie ogólnej procesor informuje o planowanej zmianie, aby administrator mógł się sprzeciwić. Lista podwykonawców i tryb zmian muszą być dostępne, ale przepis nie narzuca jednego miejsca ani jednego wzoru dokumentu.
Licencja głosu powinna obejmować komercyjne rozmowy telefoniczne, planowaną skalę, próbki testowe oraz ewentualne stałe nagrania. Przy głosie stworzonym z nagrań konkretnej osoby dochodzą podstawa przetwarzania, prawo do użycia, zasady po zakończeniu współpracy, dobra osobiste i obowiązki dotyczące syntetycznego dźwięku.
Policz koszt na własnej próbce
Dostawcy mogą rozliczać znaki, sekundy dźwięku, żądania, minuty albo kilka elementów naraz. Pobierz tekst wygenerowany w próbce rozmów i policz go według jednostki z aktualnej oferty. Dodaj opłatę minimalną, wybrany region, ruch podczas awarii oraz koszt potrzebnej infrastruktury.
Porównaj także zachowanie przy braku odpowiedzi usługi. Wcześniej przygotowany komunikat, ponowienie, przekazanie do człowieka i zakończenie rozmowy mają różny wpływ na klienta oraz koszt. Test powinien pokazać, co naprawdę usłyszy osoba przy telefonie.
W pakietach odbierze.ai synteza nie pojawia się jako osobna publiczna pozycja. Pula minut i stawka nadwyżki obejmują pracę całego agenta, w tym rozpoznanie i syntezę mowy, model językowy oraz uzgodnioną równoległość. Numer i opłaty operatora są osobno.
Wybór zapisujemy w dokumentacji projektu wraz z regionem, warunkami danych, licencją i wynikiem testu. Zmiana głosu po starcie wymaga ponownego sprawdzenia wymowy, telefonu, opóźnienia i awarii. Termin oraz koszt zależą od licencji i zakresu zmiany, dlatego ustalamy je osobno przed rozpoczęciem prac.
Źródła
Materiały użyte w tym przewodniku.
- [01]ITU-T P.85, subiektywna ocena urządzeń generujących mowę
- [02]ITU-T G.711, kodowanie mowy w telefonii
- [03]ITU-T G.722, kodowanie dźwięku o paśmie 7 kHz
- [04]W3C, Speech Synthesis Markup Language 1.1
- [05]RODO, art. 28 i rozdział V
- [06]EROD, zalecenia 01/2020 dotyczące narzędzi transferowych
- [07]Decyzja wykonawcza Komisji (UE) 2023/1795, EU–US Data Privacy Framework
- [08]Pełny zestaw 30 zdań do testu polskiego TTS