Sintesi vocale per agenti vocali in tempo reale

Trasforma il testo in audio parlato con Sonic, il modello di sintesi vocale di Cartesia. Prova una voce nel Playground, poi genera audio dalla tua applicazione tramite l'API.

Ascolta la voce con le tue parole

Prova una frase che la tua applicazione direbbe. Confronta le voci con le stesse parole, poi ascolta pronuncia e ritmo.

Liv
104/500

Aggiungi la voce alla tua applicazione

Sonic trasforma in audio il testo prodotto dalla tua applicazione. L'applicazione fornisce la risposta; il modello vocale la pronuncia.

Scegli una voce

Testa le voci con le parole che la tua applicazione pronuncerà davvero. Includi nomi, numeri e abbreviazioni nella valutazione, anziché affidarti solo a un saluto.

Genera audio tramite l'API

Invia testo dalla tua applicazione e ricevi audio sintetizzato. Scegli una voce e un formato di output, poi riproduci la risposta o salvala come file.

Trasmetti risposte parlate in streaming

Usa audio in streaming per la riproduzione conversazionale. Misura il tempo fino a quando gli utenti sentono il parlato nella tua applicazione, includendo trasferimento di rete e buffering di riproduzione.

Riproduzione nel browser o un'API vocale?

Entrambe trasformano testo in parlato. Scegli in base a dove vuoi eseguire la voce e a come l'applicazione deve usare l'audio.

Sintesi vocale del browser

Usa l'interfaccia SpeechSynthesis del browser per la riproduzione con le voci del dispositivo. Le voci disponibili dipendono dal browser e dal sistema operativo.

Ideale per Lettura ad alta voce del testo in una pagina web.

Leggi la guida al TTS nel browser

L'API vocale di Cartesia

Scegli una voce Sonic tramite ID e genera parlato dal backend. Trasmetti, salva o riproduci l'audio in applicazioni web, mobile e telefoniche.

Ideale per Generazione di audio per la tua applicazione.

Esplora l'API vocale

Voci realistiche ed espressive per ogni caso d'uso

Ascolta campioni di parlato per applicazioni diverse. Confronta l'interpretazione, poi prova una voce con le parole che il tuo pubblico ascolterà.

Supporto

Audio originale in inglese

Trasforma le risposte dell'assistenza clienti in risposte parlate con la sintesi vocale. Leggi aggiornamenti del servizio e passaggi di risoluzione dei problemi con una voce coerente su chiamate e applicazioni.

Videogiochi

Registrazione originale

Genera dialoghi dei personaggi dai testi del tuo gioco. Confronta le voci per ogni ruolo, poi ascolta le nuove battute nel contesto per controllare ritmo e interpretazione.

Contenuti

Registrazione originale

Crea voci fuori campo per video, tutorial e spiegazioni di prodotto dal testo. Rivedi un testo e genera nuova narrazione senza registrare di nuovo ogni battuta.

Media

Registrazione originale

Trasforma articoli e storie scritte in audio parlato. Usa la sintesi vocale per introduzioni di podcast o notizie narrate, controllando nomi e pronuncia prima di pubblicare.

Sanità

Audio originale in inglese

Leggi promemoria di appuntamenti e informazioni sui servizi ai pazienti dai testi rivisti dal tuo team. Usa una voce coerente per istruzioni ordinarie e aggiornamenti degli appuntamenti.

Vendite

Audio originale in inglese

Aggiungi narrazione parlata a dimostrazioni di prodotto e spiegazioni commerciali. Testa il testo con voci diverse, poi aggiorna l'audio quando cambia il prodotto o il messaggio.

gli agenti vocali

Audio originale in inglese

Dai agli agenti vocali IA risposte parlate generate dal testo della tua applicazione. Scegli una voce per saluti e conversazioni, poi testa come suona con risposte brevi e più lunghe.

Doppiaggio

Audio originale in giapponese

Genera parlato da testi tradotti per il tuo flusso di localizzazione. Confronta voci nelle lingue supportate e rivedi pronuncia e tempi prima di aggiungere l'audio a un video.

Avatar

Registrazione originale

Abbina un avatar digitale al parlato sintetizzato per presentazioni ed esperienze guidate. Genera dialoghi dal testo e coordina la riproduzione audio con l'animazione dell'avatar.

Logistica

Audio originale in inglese

Trasforma aggiornamenti delle spedizioni e istruzioni di smistamento in messaggi parlati. Collega la sintesi vocale alla tua applicazione affinché l'audio rifletta le informazioni di consegna più recenti.

Selezione del personale

Registrazione originale

Crea introduzioni parlate ai colloqui e messaggi di appuntamento per i candidati da testi approvati. Mantieni coerenti le istruzioni e rigenera l'audio quando cambia il processo di assunzione.

Accessibilità

Registrazione originale

Offri versioni audio di guide scritte, articoli e materiali didattici. Permetti alle persone di ascoltare i contenuti e seguire il testo originale al proprio ritmo.

Fluente e naturale, in tutto il mondo

Raggiungi i mercati internazionali con Sonic: 44 lingue e un'ampia varietà di accenti, tutti con voci di qualità madrelingua.

Località più popolari

Da una demo vocale a una conversazione

La sintesi vocale è la risposta parlata. Un agente conversazionale deve anche comprendere l'input, decidere cosa dire e gestire le interruzioni.

Crea la tua pipeline audio

Usa l'API Bytes quando la trascrizione è pronta o un WebSocket quando il testo arriva a blocchi. Allinea il formato di output al player e interrompi l'audio in attesa quando un utente interviene.

Leggi la guida WebSocket

Sviluppa con Managed Agents

Collega una voce alle istruzioni e agli strumenti del tuo agente. Usa Managed Agents quando vuoi lavorare sulla conversazione insieme alla sua voce.

Esplora Managed Agents

Domande frequenti sulla sintesi vocale

Che cos'è la sintesi vocale?

La sintesi vocale genera audio parlato dal testo. È chiamata anche text to speech o TTS. Il modello Sonic di Cartesia esegue questo passaggio in un'applicazione vocale. Il riconoscimento vocale fa il contrario: converte audio parlato in testo.

Cartesia è la stessa cosa dell'API SpeechSynthesis del browser?

No. window.speechSynthesis del browser usa le voci disponibili sul dispositivo dell'ascoltatore e gestisce lì la riproduzione. Cartesia è un'API ospitata che restituisce audio generato alla tua applicazione. Se ti serve solo la riproduzione nel browser senza una chiave API, prova il tutorial di sintesi vocale JavaScript. Le voci del browser variano in base al sistema operativo e possono usare servizi vocali locali o remoti.

Come integro la sintesi vocale in un'applicazione?

Parti dalla guida alla sintesi vocale Python per generare e salvare un file WAV. Mantieni la chiave API nel backend. Per un agente vocale servono anche riproduzione audio e gestione delle interruzioni; un esempio che salva un file non implementa queste parti. Puoi sviluppare anche con Cartesia Managed Agents.

La sintesi vocale pronuncia sempre correttamente il testo?

Testa la voce scelta con nomi, abbreviazioni e numeri della tua applicazione. Ascolta le parole nel contesto e rivedi il testo quando necessario. Un campione rappresentativo ti aiuta a scegliere una voce adatta ai contenuti.

Quali lingue supporta Cartesia?

Consulta l'attuale elenco delle lingue di Sonic e ascolta gli esempi delle lingue di destinazione. Fornisci il testo nella lingua che vuoi venga parlata; il TTS non lo traduce automaticamente.

Posso usare la sintesi vocale di Cartesia offline o gratuitamente?

L'API ospitata di Cartesia richiede una connessione Internet e l'accesso a un account. L'audio generato salvato come file può essere riprodotto offline. L'utilizzo dipende dal piano e dai limiti dell'account; consulta i prezzi attuali prima di eseguire richieste.

La sintesi vocale è la stessa cosa del riconoscimento vocale?

La sintesi vocale trasforma il testo in audio parlato. Il riconoscimento vocale trasforma l'audio in testo. Un agente vocale può usare il riconoscimento per capire il chiamante, un modello linguistico per produrre una risposta e la sintesi vocale per pronunciarla. Consulta Sonic per la sintesi vocale e Ink per la trascrizione vocale.

Posso trasmettere il parlato mentre viene generato?

Sì. Cartesia fornisce endpoint di streaming per ricevere audio in modo incrementale. La tua applicazione può avviare la riproduzione man mano che arriva l'audio. Consulta il riferimento dell'API di streaming per il formato della risposta e costruisci la riproduzione attorno alle impostazioni audio previste dall'integrazione.

Posso controllare velocità ed emozione del parlato sintetizzato?

I modelli Sonic supportati offrono controlli di velocità, volume ed emozione. Testa le impostazioni con la voce e il testo scelti per ascoltare come influenzano l'interpretazione. La guida ai controlli vocali spiega i controlli attuali e il supporto dei modelli.

La sintesi vocale può tradurre il testo in un'altra lingua?

Fornisci il testo nella lingua che vuoi venga parlata. Tradurre il testo è una fase separata dalla sintesi della voce. Rivedi nomi tradotti, numeri ed espressioni regionali prima di generare l'audio finale. Esplora gli esempi linguistici per ascoltare le voci prima di sceglierne una.

In cosa si distingue la clonazione vocale dalla sintesi vocale?

La clonazione vocale crea una voce riutilizzabile dalle registrazioni di un parlante. La sintesi vocale usa una voce per leggere nuovo testo. Puoi partire da una voce esistente o creare un clone che hai il permesso di usare, poi generare parlato con il suo ID vocale. Consulta la guida alla clonazione vocale per i requisiti di registrazione.

Inizia oggi

Parla con un esperto.

Contatta un membro del nostro team e scopri come Cartesia può aiutarti a creare esperienze vocali di altissimo livello.

Contatta il team commerciale

Inizia a sviluppare.

Accedi ai nostri modelli tramite API e porta un agente vocale in produzione in pochi minuti.

Prova Cartesia