Storie dei clienti

Il benchmark di IA vocale di Speko consiglia Sonic 3.5 più spesso di ogni altro modello

Speko è un router per l’IA vocale. Gli sviluppatori creano ed eseguono agenti vocali tramite un’unica API Speko e la piattaforma sceglie i modelli di trascrizione vocale, LLM e sintesi vocale per ogni chiamata in base alla lingua e al caso d’uso. Le scelte derivano da un benchmark che Speko ripete ogni due o tre giorni su circa una dozzina di fornitori. Nella sintesi vocale, il modello che arriva più spesso al primo posto è Sonic 3.5 di Cartesia.

In pratica stiamo costruendo un router aperto per l’IA vocale. Cerchiamo di essere un livello neutrale che aiuti le persone a scegliere lo stack di modelli giusto.

Beknazar AbdikamalovFondatore, Speko

La sfida: tre modelli da scegliere e nessuno di neutrale a cui chiedere

Circa il 95% dell’IA vocale funziona a cascata: prima la trascrizione vocale, poi un LLM e infine la sintesi vocale. Per ogni agente bisogna quindi prendere tre decisioni distinte sui modelli e la maggior parte dei fornitori che esprime un’opinione ha un interesse nella risposta. Continuano ad arrivare nuovi fornitori, così ogni mese aumentano le opzioni senza che sia più chiaro quali reggano alla prova.

Fuori dall’inglese è ancora più difficile. Un modello che legge bene in inglese può perdere coerenza o appiattirsi in un’altra lingua e i dati pubblici su quali modelli presentino questi problemi sono pochissimi. Le aziende abbastanza grandi da svolgere valutazioni proprie sanno già quali stack funzionano nei diversi contesti. Tutte le altre scelgono basandosi sulle pagine di marketing.

La soluzione: un benchmark aggiornato ogni due o tre giorni

Speko valuta per fasi, così un nuovo modello supera controlli automatici economici prima che qualcuno vi investa somme rilevanti. Gli agenti monitorano X e Hugging Face alla ricerca di nuove versioni promettenti e tutto ciò che individuano passa prima attraverso questi controlli. I modelli che ottengono buoni risultati passano alla valutazione umana e a test con budget maggiori. In ogni momento vengono monitorati circa dodici fornitori.

Ripetere il benchmark ogni due o tre giorni mantiene i numeri riferiti alle versioni attuali dei modelli, anziché a quelle uscite il trimestre precedente. Ogni categoria ha criteri propri. La sintesi vocale ne ha tre:

  • Intelligibilità: il modello legge il testo in modo sensato, attento al contesto e utilizzabile in produzione, oltre a pronunciare correttamente le parole?
  • Deriva: la voce resta coerente durante la generazione oppure qualità, tono e tempi cambiano?
  • Naturalezza: la voce sembra umana oppure presenta caratteristiche robotiche che compromettono l’esperienza?

Valutare separatamente i tre aspetti permette di formulare una raccomandazione specifica per il caso d’uso. Abdikamalov divide la maggior parte dei clienti in due gruppi. Gli agenti di assistenza clienti danno priorità alla latenza e misurano il successo in base a completamenti rapidi e accurati. I coach IA e i prodotti per la terapia hanno bisogno di voci che sembrino umane. La maggior parte dei fornitori eccelle in uno dei due aspetti.

Perché Speko ha scelto Cartesia

Sonic 3.5 guida la classifica complessiva di sintesi vocale di Speko, con la migliore combinazione di velocità e naturalezza, e resta competitivo sul prezzo rispetto agli altri modelli monitorati. Questi due criteri coprono gran parte di ciò che creano i clienti di Speko: latenza per l’assistenza, naturalezza per coaching e terapia. Eccellere in entrambi è raro ed è per questo che Sonic 3.5 è il modello di sintesi vocale consigliato più spesso da Speko.

In questo contesto, predefinito significa consigliato più frequentemente, non selezionato automaticamente. Quando i requisiti di un cliente indicano un’altra soluzione, Speko lo indirizza altrove. La raccomandazione segue il caso d’uso; Sonic prevale in molti di questi casi sui criteri che contano.

I prossimi passi: rendere invisibile la scelta dei modelli

Speko sta lavorando a due obiettivi contemporaneamente. Il primo è fare in modo che i clienti non debbano mai pensare alla scelta dei modelli. Abdikamalov non vuole che lo stack giusto dipenda da quanto il cliente conosce i modelli sottostanti.

Fare in modo che le persone non debbano sapere nulla della selezione dei modelli, perché idealmente, credo, non dovrebbero nemmeno sapere cosa c’è sotto il cofano.

Beknazar AbdikamalovFondatore, Speko

Il secondo è diventare il benchmark di cui il settore si fida. Molte classifiche ordinano i modelli vocali senza pubblicare abbastanza dettagli metodologici per verificare i risultati; altre si basano su demo ristrette che dicono poco sul comportamento in produzione. Speko vuole un benchmark che si aggiorni regolarmente, pubblichi il proprio metodo e metta alla prova ciò che i clienti costruiscono davvero.

Abdikamalov stima che oggi circa l’1% delle aziende usi l’IA vocale. Con la crescita di questa quota aumenterà anche il numero di modelli, mentre la parte difficile resterà la stessa: capire di quali fidarsi e in quali contesti.