Raz w miesiącu nasz zespół produktowy pokazuje reszcie firmy, co faktycznie trafiło na produkcję. W minionym miesiącu pojawiły się dwie rzeczy warte opisania. Wersja on-premise naszej platformy głosowej jest gotowa i trafia do wdrożeń u klientów. Dodaliśmy też silnik syntezy mowy dla języka niemieckiego, wytrenowany i hostowany wewnątrz Unii Europejskiej.
Dlaczego klienci chcą Voice AI wewnątrz własnego perymetru
Chmura jest domyślnym wyborem nie bez powodu i większość naszego ruchu działa właśnie tam. W rozmowach z dużymi organizacjami wracają jednak z grubsza trzy sytuacje, które rzadko pojawiają się pojedynczo.
Wewnętrzna polityka bezpieczeństwa. Banki, duzi dostawcy usług medycznych i organizacje rządowe często mają zasady zabraniające uruchamiania oprogramowania firm trzecich poza własną siecią. Żadna funkcja nie wygra tego argumentu. Albo oprogramowanie instaluje się wewnątrz perymetru, albo projekt nie dochodzi do skutku.
Prawo dotyczące rezydencji danych. W niektórych krajach obowiązuje zakaz opuszczania przez dane obywateli granic kraju. Wybór bliższego regionu chmury nie rozwiązuje kwestii prawnej.
Opóźnienie. Głos nie wybacza błędów. Gdy dźwięk musi pokonać długi dystans do zagranicznego serwera i z powrotem, opóźnienie staje się słyszalne. Klient końcowy słyszy lukę, zanim odpowie AI Agent, a rozmowa przestaje przypominać rozmowę. Przeniesienie przetwarzania bliżej ruchu usuwa problem, zamiast go maskować.
Co on-premise oznacza teraz w praktyce
Do tego roku każdy projekt on-premise oznaczał pracę szytą na miarę i miesiące inżynierii w tle. Ten etap mamy już za sobą. Pakiet wdrożeniowy składa się z czterech elementów:
- Gotowa dystrybucja platformy głosowej, przygotowana do instalacji
- Dokumentacja integracyjna obejmująca API
- Dwa modele doboru wielkości infrastruktury – jeden dla infrastruktury chmurowej, drugi dla sprzętu fizycznego – wyliczane na podstawie wolumenu połączeń i wymaganego okresu przechowywania danych
- 11-sekcyjna lista kontrolna gotowości, licząca kilkadziesiąt pytań
To właśnie ta lista kontrolna zmienia ekonomikę projektu. Klient wypełnia ją wspólnie z naszym zespołem w ciągu jednego lub dwóch dni. Efektem jest lista luk infrastrukturalnych oraz decyzja, kto zamknie każdą z nich – w tym wszelkie elementy niestandardowe, takie jak konkretny stack monitoringu czy baza danych. Od tego momentu typowe wdrożenie trwa od trzech do ośmiu tygodni.
Instalacje regionalne dla klientów, którzy nie potrzebują własnej serwerowni
Pełne on-premise nie jest jedyną odpowiedzią na kwestię rezydencji danych. Dla tych, którzy nie chcą chmury publicznej, ale też nie chcą samodzielnie obsługiwać platformy, prowadzimy instalacje na poziomie krajowym i przydzielamy każdemu klientowi osobny tenant.
Takie rozwiązanie działa już w Niemczech i w Polsce. Zaplanowano instalacje w Kazachstanie i Uzbekistanie. Każdą z nich można następnie wykorzystać ponownie, aby podłączyć kolejnego klienta z tego samego regionu, bez ponownego otwierania dyskusji prawnej ani dyskusji o opóźnieniach.
Jedno wyjaśnienie, które padało już wcześniej: platforma głosowa i stojące za nią silniki AI (model językowy, synteza mowy i rozpoznawanie mowy) to osobne projekty. Klient może hostować platformę lokalnie i nadal korzystać z zewnętrznych silników, albo hostować lokalnie także same silniki. Ta druga opcja jest możliwa i została już zrealizowana, ale wiąże się z własnymi wymaganiami infrastrukturalnymi i jest szacowana osobno.
Pierwsze wdrożenia
Prace rozwojowe zakończyły się zgodnie z harmonogramem w połowie sierpnia. Najpierw wdrożyliśmy rozwiązanie sami, wewnątrz własnego perymetru, zanim zaproponowaliśmy je komukolwiek innemu.
Pierwszym zewnętrznym klientem komercyjnym jest krajowy operator sieci mobilnej i szerokopasmowej w Uzbekistanie, obsługujący rynek liczący około 37 milionów ludzi. Ich contact center obsługuje około 1,1 miliona połączeń przychodzących miesięcznie przy 1,5 miliona minut rozmów, z czasem oczekiwania w kolejce od ośmiu do dziesięciu minut. Około 400 000 z tych połączeń jest porzucanych, zanim ktokolwiek odbierze.
Plan zakłada automatyzację około 30% ruchu, czyli blisko 500 000 minut rozmów miesięcznie, poprzez ponowne wykorzystanie scenariusza, który już prowadzimy dla innego operatora w regionie. Celem projektu nie jest redukcja etatów. Ich 2 000 konsultantów pozostaje na swoich miejscach. Celem jest 400 000 rozmów, które obecnie w ogóle się nie odbywają.
Niemiecki głos, który brzmi po niemiecku
Druga rzecz jest mniejsza, ale dobrze się przyjęła. Zintegrowaliśmy silnik syntezy mowy od berlińskiej firmy, która trenuje i hostuje natywne modele niemieckie wewnątrz Europy.
Wyróżniają go trzy rzeczy.
Może działać wewnątrz perymetru klienta, co czyni go naturalnym uzupełnieniem opisanego wyżej podejścia on-premise, tam gdzie ma to zastosowanie. Zwraca pierwszy dźwięk w ciągu dziesiątek milisekund – o rząd wielkości mniej niż w przypadku szeroko stosowanych silników komercyjnych, do których jesteśmy przyzwyczajeni – a w głosie ta różnica jest słyszalna, nie tylko mierzalna. Jest też w pełni europejski, zarówno pod względem własności, jak i zgodności z przepisami.
Osoby z naszego zespołu, które słuchały go jako pierwsze, niezależnie od siebie powiedziały to samo: brzmi zdecydowanie jak native speaker, a nie jak imitacja native speakera.
Obie historie łączy ten sam wątek, do którego wciąż wracamy. To, gdzie działa oprogramowanie, gdzie znajdują się dane i gdzie generowany jest głos, nie jest szczegółem implementacyjnym dla klientów z branż regulowanych. To jest decyzja.
Apifonica działa na platformie obsługiwanej w ramach Systemu Zarządzania Bezpieczeństwem Informacji certyfikowanego zgodnie z ISO/IEC 27001:2022. Dane domyślnie pozostają w infrastrukturze UE/EOG, a dane klientów nigdy nie są wykorzystywane do trenowania modeli AI.
