Sintesi vocale per agenti vocali in tempo reale
Ascolta la voce con le tue parole
Prova una frase che la tua applicazione direbbe. Confronta le voci con le stesse parole, poi ascolta pronuncia e ritmo.
Aggiungi la voce alla tua applicazione
Sonic trasforma in audio il testo prodotto dalla tua applicazione. L'applicazione fornisce la risposta; il modello vocale la pronuncia.
Scegli una voce
Testa le voci con le parole che la tua applicazione pronuncerà davvero. Includi nomi, numeri e abbreviazioni nella valutazione, anziché affidarti solo a un saluto.
Genera audio tramite l'API
Invia testo dalla tua applicazione e ricevi audio sintetizzato. Scegli una voce e un formato di output, poi riproduci la risposta o salvala come file.
Trasmetti risposte parlate in streaming
Usa audio in streaming per la riproduzione conversazionale. Misura il tempo fino a quando gli utenti sentono il parlato nella tua applicazione, includendo trasferimento di rete e buffering di riproduzione.
Riproduzione nel browser o un'API vocale?
Entrambe trasformano testo in parlato. Scegli in base a dove vuoi eseguire la voce e a come l'applicazione deve usare l'audio.
Sintesi vocale del browser
Usa l'interfaccia SpeechSynthesis del browser per la riproduzione con le voci del dispositivo. Le voci disponibili dipendono dal browser e dal sistema operativo.
Ideale per Lettura ad alta voce del testo in una pagina web.
Leggi la guida al TTS nel browserL'API vocale di Cartesia
Scegli una voce Sonic tramite ID e genera parlato dal backend. Trasmetti, salva o riproduci l'audio in applicazioni web, mobile e telefoniche.
Ideale per Generazione di audio per la tua applicazione.
Esplora l'API vocaleVoci realistiche ed espressive per ogni caso d'uso
Ascolta campioni di parlato per applicazioni diverse. Confronta l'interpretazione, poi prova una voce con le parole che il tuo pubblico ascolterà.
Supporto
Audio originale in inglese
Trasforma le risposte dell'assistenza clienti in risposte parlate con la sintesi vocale. Leggi aggiornamenti del servizio e passaggi di risoluzione dei problemi con una voce coerente su chiamate e applicazioni.
Videogiochi
Registrazione originale
Genera dialoghi dei personaggi dai testi del tuo gioco. Confronta le voci per ogni ruolo, poi ascolta le nuove battute nel contesto per controllare ritmo e interpretazione.
Contenuti
Registrazione originale
Crea voci fuori campo per video, tutorial e spiegazioni di prodotto dal testo. Rivedi un testo e genera nuova narrazione senza registrare di nuovo ogni battuta.
Media
Registrazione originale
Trasforma articoli e storie scritte in audio parlato. Usa la sintesi vocale per introduzioni di podcast o notizie narrate, controllando nomi e pronuncia prima di pubblicare.
Sanità
Audio originale in inglese
Leggi promemoria di appuntamenti e informazioni sui servizi ai pazienti dai testi rivisti dal tuo team. Usa una voce coerente per istruzioni ordinarie e aggiornamenti degli appuntamenti.
Vendite
Audio originale in inglese
Aggiungi narrazione parlata a dimostrazioni di prodotto e spiegazioni commerciali. Testa il testo con voci diverse, poi aggiorna l'audio quando cambia il prodotto o il messaggio.
gli agenti vocali
Audio originale in inglese
Dai agli agenti vocali IA risposte parlate generate dal testo della tua applicazione. Scegli una voce per saluti e conversazioni, poi testa come suona con risposte brevi e più lunghe.
Doppiaggio
Audio originale in giapponese
Genera parlato da testi tradotti per il tuo flusso di localizzazione. Confronta voci nelle lingue supportate e rivedi pronuncia e tempi prima di aggiungere l'audio a un video.
Avatar
Registrazione originale
Abbina un avatar digitale al parlato sintetizzato per presentazioni ed esperienze guidate. Genera dialoghi dal testo e coordina la riproduzione audio con l'animazione dell'avatar.
Logistica
Audio originale in inglese
Trasforma aggiornamenti delle spedizioni e istruzioni di smistamento in messaggi parlati. Collega la sintesi vocale alla tua applicazione affinché l'audio rifletta le informazioni di consegna più recenti.
Selezione del personale
Registrazione originale
Crea introduzioni parlate ai colloqui e messaggi di appuntamento per i candidati da testi approvati. Mantieni coerenti le istruzioni e rigenera l'audio quando cambia il processo di assunzione.
Accessibilità
Registrazione originale
Offri versioni audio di guide scritte, articoli e materiali didattici. Permetti alle persone di ascoltare i contenuti e seguire il testo originale al proprio ritmo.
Fluente e naturale, in tutto il mondo
Raggiungi i mercati internazionali con Sonic: 44 lingue e un'ampia varietà di accenti, tutti con voci di qualità madrelingua.
Da una demo vocale a una conversazione
La sintesi vocale è la risposta parlata. Un agente conversazionale deve anche comprendere l'input, decidere cosa dire e gestire le interruzioni.
Crea la tua pipeline audio
Usa l'API Bytes quando la trascrizione è pronta o un WebSocket quando il testo arriva a blocchi. Allinea il formato di output al player e interrompi l'audio in attesa quando un utente interviene.
Leggi la guida WebSocketSviluppa con Managed Agents
Collega una voce alle istruzioni e agli strumenti del tuo agente. Usa Managed Agents quando vuoi lavorare sulla conversazione insieme alla sua voce.
Esplora Managed AgentsDomande frequenti sulla sintesi vocale
Che cos'è la sintesi vocale?
La sintesi vocale genera audio parlato dal testo. È chiamata anche text to speech o TTS. Il modello Sonic di Cartesia esegue questo passaggio in un'applicazione vocale. Il riconoscimento vocale fa il contrario: converte audio parlato in testo.
Cartesia è la stessa cosa dell'API SpeechSynthesis del browser?
No. window.speechSynthesis del browser usa le voci disponibili sul dispositivo dell'ascoltatore e gestisce lì la riproduzione. Cartesia è un'API ospitata che restituisce audio generato alla tua applicazione. Se ti serve solo la riproduzione nel browser senza una chiave API, prova il tutorial di sintesi vocale JavaScript. Le voci del browser variano in base al sistema operativo e possono usare servizi vocali locali o remoti.
Come integro la sintesi vocale in un'applicazione?
Parti dalla guida alla sintesi vocale Python per generare e salvare un file WAV. Mantieni la chiave API nel backend. Per un agente vocale servono anche riproduzione audio e gestione delle interruzioni; un esempio che salva un file non implementa queste parti. Puoi sviluppare anche con Cartesia Managed Agents.
La sintesi vocale pronuncia sempre correttamente il testo?
Testa la voce scelta con nomi, abbreviazioni e numeri della tua applicazione. Ascolta le parole nel contesto e rivedi il testo quando necessario. Un campione rappresentativo ti aiuta a scegliere una voce adatta ai contenuti.
Quali lingue supporta Cartesia?
Consulta l'attuale elenco delle lingue di Sonic e ascolta gli esempi delle lingue di destinazione. Fornisci il testo nella lingua che vuoi venga parlata; il TTS non lo traduce automaticamente.
Posso usare la sintesi vocale di Cartesia offline o gratuitamente?
L'API ospitata di Cartesia richiede una connessione Internet e l'accesso a un account. L'audio generato salvato come file può essere riprodotto offline. L'utilizzo dipende dal piano e dai limiti dell'account; consulta i prezzi attuali prima di eseguire richieste.
La sintesi vocale è la stessa cosa del riconoscimento vocale?
La sintesi vocale trasforma il testo in audio parlato. Il riconoscimento vocale trasforma l'audio in testo. Un agente vocale può usare il riconoscimento per capire il chiamante, un modello linguistico per produrre una risposta e la sintesi vocale per pronunciarla. Consulta Sonic per la sintesi vocale e Ink per la trascrizione vocale.
Posso trasmettere il parlato mentre viene generato?
Sì. Cartesia fornisce endpoint di streaming per ricevere audio in modo incrementale. La tua applicazione può avviare la riproduzione man mano che arriva l'audio. Consulta il riferimento dell'API di streaming per il formato della risposta e costruisci la riproduzione attorno alle impostazioni audio previste dall'integrazione.
Posso controllare velocità ed emozione del parlato sintetizzato?
I modelli Sonic supportati offrono controlli di velocità, volume ed emozione. Testa le impostazioni con la voce e il testo scelti per ascoltare come influenzano l'interpretazione. La guida ai controlli vocali spiega i controlli attuali e il supporto dei modelli.
La sintesi vocale può tradurre il testo in un'altra lingua?
Fornisci il testo nella lingua che vuoi venga parlata. Tradurre il testo è una fase separata dalla sintesi della voce. Rivedi nomi tradotti, numeri ed espressioni regionali prima di generare l'audio finale. Esplora gli esempi linguistici per ascoltare le voci prima di sceglierne una.
In cosa si distingue la clonazione vocale dalla sintesi vocale?
La clonazione vocale crea una voce riutilizzabile dalle registrazioni di un parlante. La sintesi vocale usa una voce per leggere nuovo testo. Puoi partire da una voce esistente o creare un clone che hai il permesso di usare, poi generare parlato con il suo ID vocale. Consulta la guida alla clonazione vocale per i requisiti di registrazione.
Inizia oggi
Parla con un esperto.
Contatta un membro del nostro team e scopri come Cartesia può aiutarti a creare esperienze vocali di altissimo livello.
Inizia a sviluppare.
Accedi ai nostri modelli tramite API e porta un agente vocale in produzione in pochi minuti.