Diagramma che mostra il modello TTS e la voce come input separati

Modello TTS e voce: non sono la stessa cosa

Un modello TTS genera parlato. Ma il modello e la voce con cui parla sono cose diverse: confonderli porta a decisioni sbagliate nella progettazione dell'IA vocale.

[Prodotto]

Una griglia 2x2 di quadrati: tre campiture ad acquerello verde salvia e grigio chiaro e un contorno nero

Perché precisione e richiamo contano così tanto

L'accuratezza sembra la metrica giusta finché il modello ottiene il 90% senza fare nulla. Ecco perché precisione e richiamo descrivono meglio i risultati e contano per l'IA vocale.

[Prodotto]

Un foglio di carta disegnato a mano sovrapposto a un fumetto verde ad acquerello con la scritta 3.6

Presentiamo Sonic-3.6

Sonic-3.6 migliora naturalezza e qualità rispetto a Sonic-3.5: gli ascoltatori lo preferiscono fino al 93% dei confronti diretti alla cieca in quindici varianti locali.

[Prodotto]

Nomi difficili da trascrivere come enclomiphene, zuclopenthixol e pityriasis intorno a un microfono, con aminophylline a fuoco accanto

Novità di Ink-2: termini chiave e rilevamento dei turni configurabile

Due novità di Ink-2: prompting con termini chiave per trascrivere meglio le entità di settore e rilevamento dei turni configurabile per privilegiare velocità o accuratezza.

[Prodotto]

Questo modello TTS è valido?

Questo modello TTS è valido?

Uno sguardo pratico ai limiti della valutazione della sintesi vocale quando i modelli migliorano e a come misurare ciò che conta davvero.

[Ricerca]

Una domanda parlata entra a spirale in un microfono, parola per parola, evocando la trascrizione vocale

Presentiamo Ink-2: il modello STT numero 1 per agenti vocali

Presentiamo Ink-2, il nostro modello di trascrizione per agenti vocali in tempo reale, primo nella classifica streaming di Artificial Analysis, con il rilevamento dei turni integrato più accurato tra i fornitori.

[Novità]

Una rosetta di petali verdi traslucidi sovrapposti, con tre cerchi delineati che si incrociano al centro

Guida alla scelta dei modelli di IA vocale

Un metodo pratico per valutare modelli ASR, TTS e di rilevamento dei turni sul tuo caso d'uso reale, oltre alle condizioni di laboratorio.

[Prodotto]

Sei studi verdi ad acquerello, ciascuno con blocchi dipinti e un rettangolo dal contorno disegnato a mano in una diversa disposizione

Guida introduttiva alla terminologia dell'IA vocale

Un glossario chiaro dei 20 termini chiave per comprendere, valutare e costruire IA vocale conversazionale.

[Prodotto]

Linee scure parallele attraversano una fascia verde dipinta e si intrecciano al centro prima di proseguire

Mamba-3: un modello a spazio di stato progettato per l'inferenza

Mamba-3 ripensa gli SSM per i moderni carichi di inferenza, migliorando la qualità e mantenendo la bassa latenza che rende interessanti i modelli lineari.

[Ricerca]

Quattro copie dello stesso simbolo a linea curva in fila, in verde chiaro, verde medio, grigio e verde scuro

Cartesia cerca un ingegnere software per creare un esercito di Claude

Scrivere codice sembra un problema risolto. Fare ingegneria no. Cerchiamo qualcuno che colmi questa distanza.

[Ingegneria]

Il marchio Cartesia sopra la dicitura ora conforme al GDPR, accanto a un cerchio di stelle ambra dell'Unione europea

Cartesia raggiunge la conformità al GDPR

La piattaforma di sintesi vocale Cartesia è ora conforme al GDPR, confermando il nostro impegno per la protezione dei dati, la privacy e un'IA responsabile centrata sulle persone.

[Novità]

Quadrati verdi traslucidi in acquerello, sovrapposti con lievi inclinazioni e più scuri al centro

Presentiamo Line: la piattaforma per sviluppare agenti vocali

Presentiamo Line di Cartesia, la piattaforma per sviluppare agenti vocali. Line mette il codice al centro, perché i prodotti migliori si costruiscono con il codice.

[Prodotto]

Tre file di blocchi in acquerello verde con contorni disegnati a mano, più larghi e scuri in alto e più stretti e chiari in basso

Modellazione gerarchica

Presentiamo H-Net, architetture gerarchiche che imparano direttamente dai dati grezzi raggruppando gli input in concetti di livello superiore e superando i limiti della tokenizzazione.

[Ricerca]

Presentiamo Ink: modelli di trascrizione vocale per conversazioni in tempo reale

Presentiamo Ink: modelli di trascrizione vocale per conversazioni in tempo reale

Oggi presentiamo Ink, una nuova famiglia di modelli di trascrizione vocale in streaming per chi sviluppa applicazioni vocali in tempo reale. Ink-Whisper è il modello STT più veloce e conveniente, progettato per agenti vocali aziendali.

[Prodotto]

Presentiamo Organizations e Dashboards

Presentiamo Organizations e Dashboards

Stiamo costruendo Cartesia per gli sviluppatori che portano l'IA vocale su larga scala. Oggi presentiamo due funzionalità per collaborare e monitorare meglio il lavoro: Organizations e Dashboards.

[Prodotto]

Presentiamo Professional Voice Cloning

Presentiamo Professional Voice Cloning

Presentiamo Professional Voice Cloning (PVC): cloni vocali di qualità professionale addestrati su Sonic, ora disponibili nei piani Startup+.

[Prodotto]

SDK Python Cartesia v2.0.0

SDK Python Cartesia v2.0.0

Annunciamo la versione v2.0.0 del nostro SDK Python, che migliora l'esperienza di sviluppo per chi usa le funzionalità di IA vocale di Cartesia con Python.

[Ingegneria]

Cartesia nella settima edizione di Enterprise Tech 30 di Wing Venture Capital

Cartesia nella settima edizione di Enterprise Tech 30 di Wing Venture Capital

Cartesia, tra i principali fornitori di modelli audio generativi, annuncia l'inserimento nella settima edizione di Enterprise Tech 30, la lista delle società tecnologiche private per le imprese più promettenti in tutte le fasi di crescita.

[Novità]

Il round di serie A e il futuro dell'IA vocale

Il round di serie A e il futuro dell'IA vocale

Annunciamo un round di serie A da $64 milioni guidato da Kleiner Perkins. I nuovi fondi ci aiuteranno ad ampliare il team e investire nella ricerca per costruire la prossima generazione di modelli.

[Novità]

Llamba: far crescere modelli ricorrenti distillati per elaborare il linguaggio in modo efficiente

Llamba: far crescere modelli ricorrenti distillati per elaborare il linguaggio in modo efficiente

I prossimi anni apriranno una nuova fase dell'IA sui dispositivi. Questi modelli supporteranno un'ampia gamma di applicazioni.

[Ricerca]

Come costruire un agente vocale IA con Cartesia

Come costruire un agente vocale IA con Cartesia

Una guida passo passo per costruire un agente vocale IA naturale e a bassa latenza con Sonic di Cartesia, dall'architettura alla distribuzione in produzione.

[Ingegneria]

Lo stato dell'IA vocale nel 2024

Lo stato dell'IA vocale nel 2024

Nel nostro primo rapporto sullo stato dell'IA vocale nel 2024 esaminiamo i progressi dell'infrastruttura e i nuovi casi d'uso che fanno avanzare il settore, guardando a ciò che arriverà nel 2025.

[Ricerca]

Annunciamo il nostro round seed

Annunciamo il nostro round seed

Annunciamo un round seed da $27M guidato da Index Ventures, con la partecipazione di Lightspeed, Factory, Conviction, General Catalyst, A*, SV Angel e 90 angel investor.

[Novità]

È la stagione degli hackathon in Cartesia

È la stagione degli hackathon in Cartesia

Ottobre 2024 è stato un mese intenso per Cartesia. Abbiamo riunito oltre 2,000 sviluppatori a San Francisco e assegnato $20,000 in premi alle idee più innovative costruite con Sonic.

[Ingegneria]

Presentiamo Voice Changer: trasforma l'audio come vuoi

Presentiamo Voice Changer: trasforma l'audio come vuoi

Voice Changer trasforma la voce di qualsiasi clip audio mantenendo interpretazione, emozione e prosodia originali, con voci di qualità da studio o clonate.

[Prodotto]

Presentiamo altre 8 lingue su Sonic Multilingual

Presentiamo altre 8 lingue su Sonic Multilingual

Oggi annunciamo la versione alfa di altre 8 lingue su Sonic Multilingual: hindi, italiano, coreano, olandese, polacco, russo, svedese e turco.

[Prodotto]

Aggiornamenti sull'intelligenza sui dispositivi

Aggiornamenti sull'intelligenza sui dispositivi

La missione di Cartesia è costruire la prossima generazione di IA: un'intelligenza interattiva e diffusa, che funzioni ovunque tu sia.

[Ricerca]

Presentiamo Sonic: un modello vocale a bassa latenza per parlato realistico

Presentiamo Sonic: un modello vocale a bassa latenza per parlato realistico

Oggi pubblichiamo Sonic, il nostro modello vocale a bassa latenza che genera parlato realistico.

[Ricerca]

Based: modelli linguistici con attenzione lineare bilanciano richiamo e throughput

Based: modelli linguistici con attenzione lineare bilanciano richiamo e throughput

Based elabora i prompt il 56% e il 44% più velocemente di FlashAttention-2 e Mamba, rispettivamente. Il throughput di generazione testuale è fino a 24 volte quello di FlashAttention-2.

[Ricerca]

Mamba‑3B-SlimPJ: modelli a spazio di stato al livello dei migliori Transformer

Mamba‑3B-SlimPJ: modelli a spazio di stato al livello dei migliori Transformer

Pubblichiamo il modello linguistico Mamba più potente finora, Mamba-3B-SlimPJ, in collaborazione con Cartesia e Together, con licenza Apache 2.0.

[Ricerca]

Inizia oggi

Parla con un esperto.

Contatta un membro del nostro team e scopri come Cartesia può aiutarti a creare esperienze vocali di altissimo livello.

Contatta il team commerciale

Inizia a sviluppare.

Accedi ai nostri modelli tramite API e porta un agente vocale in produzione in pochi minuti.

Prova Cartesia