
Modello TTS e voce: non sono la stessa cosa
Un modello TTS genera parlato. Ma il modello e la voce con cui parla sono cose diverse: confonderli porta a decisioni sbagliate nella progettazione dell'IA vocale.
[Prodotto]

Perché precisione e richiamo contano così tanto
L'accuratezza sembra la metrica giusta finché il modello ottiene il 90% senza fare nulla. Ecco perché precisione e richiamo descrivono meglio i risultati e contano per l'IA vocale.
[Prodotto]

Presentiamo Sonic-3.6
Sonic-3.6 migliora naturalezza e qualità rispetto a Sonic-3.5: gli ascoltatori lo preferiscono fino al 93% dei confronti diretti alla cieca in quindici varianti locali.
[Prodotto]

Novità di Ink-2: termini chiave e rilevamento dei turni configurabile
Due novità di Ink-2: prompting con termini chiave per trascrivere meglio le entità di settore e rilevamento dei turni configurabile per privilegiare velocità o accuratezza.
[Prodotto]

Questo modello TTS è valido?
Uno sguardo pratico ai limiti della valutazione della sintesi vocale quando i modelli migliorano e a come misurare ciò che conta davvero.
[Ricerca]

Presentiamo Ink-2: il modello STT numero 1 per agenti vocali
Presentiamo Ink-2, il nostro modello di trascrizione per agenti vocali in tempo reale, primo nella classifica streaming di Artificial Analysis, con il rilevamento dei turni integrato più accurato tra i fornitori.
[Novità]

Guida alla scelta dei modelli di IA vocale
Un metodo pratico per valutare modelli ASR, TTS e di rilevamento dei turni sul tuo caso d'uso reale, oltre alle condizioni di laboratorio.
[Prodotto]

Guida introduttiva alla terminologia dell'IA vocale
Un glossario chiaro dei 20 termini chiave per comprendere, valutare e costruire IA vocale conversazionale.
[Prodotto]

Mamba-3: un modello a spazio di stato progettato per l'inferenza
Mamba-3 ripensa gli SSM per i moderni carichi di inferenza, migliorando la qualità e mantenendo la bassa latenza che rende interessanti i modelli lineari.
[Ricerca]

Cartesia cerca un ingegnere software per creare un esercito di Claude
Scrivere codice sembra un problema risolto. Fare ingegneria no. Cerchiamo qualcuno che colmi questa distanza.
[Ingegneria]

Cartesia raggiunge la conformità al GDPR
La piattaforma di sintesi vocale Cartesia è ora conforme al GDPR, confermando il nostro impegno per la protezione dei dati, la privacy e un'IA responsabile centrata sulle persone.
[Novità]

Presentiamo Line: la piattaforma per sviluppare agenti vocali
Presentiamo Line di Cartesia, la piattaforma per sviluppare agenti vocali. Line mette il codice al centro, perché i prodotti migliori si costruiscono con il codice.
[Prodotto]

Modellazione gerarchica
Presentiamo H-Net, architetture gerarchiche che imparano direttamente dai dati grezzi raggruppando gli input in concetti di livello superiore e superando i limiti della tokenizzazione.
[Ricerca]

Presentiamo Ink: modelli di trascrizione vocale per conversazioni in tempo reale
Oggi presentiamo Ink, una nuova famiglia di modelli di trascrizione vocale in streaming per chi sviluppa applicazioni vocali in tempo reale. Ink-Whisper è il modello STT più veloce e conveniente, progettato per agenti vocali aziendali.
[Prodotto]

Presentiamo Organizations e Dashboards
Stiamo costruendo Cartesia per gli sviluppatori che portano l'IA vocale su larga scala. Oggi presentiamo due funzionalità per collaborare e monitorare meglio il lavoro: Organizations e Dashboards.
[Prodotto]

Presentiamo Professional Voice Cloning
Presentiamo Professional Voice Cloning (PVC): cloni vocali di qualità professionale addestrati su Sonic, ora disponibili nei piani Startup+.
[Prodotto]

SDK Python Cartesia v2.0.0
Annunciamo la versione v2.0.0 del nostro SDK Python, che migliora l'esperienza di sviluppo per chi usa le funzionalità di IA vocale di Cartesia con Python.
[Ingegneria]

Cartesia nella settima edizione di Enterprise Tech 30 di Wing Venture Capital
Cartesia, tra i principali fornitori di modelli audio generativi, annuncia l'inserimento nella settima edizione di Enterprise Tech 30, la lista delle società tecnologiche private per le imprese più promettenti in tutte le fasi di crescita.
[Novità]

Il round di serie A e il futuro dell'IA vocale
Annunciamo un round di serie A da $64 milioni guidato da Kleiner Perkins. I nuovi fondi ci aiuteranno ad ampliare il team e investire nella ricerca per costruire la prossima generazione di modelli.
[Novità]

Llamba: far crescere modelli ricorrenti distillati per elaborare il linguaggio in modo efficiente
I prossimi anni apriranno una nuova fase dell'IA sui dispositivi. Questi modelli supporteranno un'ampia gamma di applicazioni.
[Ricerca]

Come costruire un agente vocale IA con Cartesia
Una guida passo passo per costruire un agente vocale IA naturale e a bassa latenza con Sonic di Cartesia, dall'architettura alla distribuzione in produzione.
[Ingegneria]

Lo stato dell'IA vocale nel 2024
Nel nostro primo rapporto sullo stato dell'IA vocale nel 2024 esaminiamo i progressi dell'infrastruttura e i nuovi casi d'uso che fanno avanzare il settore, guardando a ciò che arriverà nel 2025.
[Ricerca]

Annunciamo il nostro round seed
Annunciamo un round seed da $27M guidato da Index Ventures, con la partecipazione di Lightspeed, Factory, Conviction, General Catalyst, A*, SV Angel e 90 angel investor.
[Novità]

È la stagione degli hackathon in Cartesia
Ottobre 2024 è stato un mese intenso per Cartesia. Abbiamo riunito oltre 2,000 sviluppatori a San Francisco e assegnato $20,000 in premi alle idee più innovative costruite con Sonic.
[Ingegneria]

Presentiamo Voice Changer: trasforma l'audio come vuoi
Voice Changer trasforma la voce di qualsiasi clip audio mantenendo interpretazione, emozione e prosodia originali, con voci di qualità da studio o clonate.
[Prodotto]

Presentiamo altre 8 lingue su Sonic Multilingual
Oggi annunciamo la versione alfa di altre 8 lingue su Sonic Multilingual: hindi, italiano, coreano, olandese, polacco, russo, svedese e turco.
[Prodotto]

Aggiornamenti sull'intelligenza sui dispositivi
La missione di Cartesia è costruire la prossima generazione di IA: un'intelligenza interattiva e diffusa, che funzioni ovunque tu sia.
[Ricerca]

Presentiamo Sonic: un modello vocale a bassa latenza per parlato realistico
Oggi pubblichiamo Sonic, il nostro modello vocale a bassa latenza che genera parlato realistico.
[Ricerca]

Based: modelli linguistici con attenzione lineare bilanciano richiamo e throughput
Based elabora i prompt il 56% e il 44% più velocemente di FlashAttention-2 e Mamba, rispettivamente. Il throughput di generazione testuale è fino a 24 volte quello di FlashAttention-2.
[Ricerca]

Mamba‑3B-SlimPJ: modelli a spazio di stato al livello dei migliori Transformer
Pubblichiamo il modello linguistico Mamba più potente finora, Mamba-3B-SlimPJ, in collaborazione con Cartesia e Together, con licenza Apache 2.0.
[Ricerca]
Inizia oggi
Parla con un esperto.
Contatta un membro del nostro team e scopri come Cartesia può aiutarti a creare esperienze vocali di altissimo livello.
Inizia a sviluppare.
Accedi ai nostri modelli tramite API e porta un agente vocale in produzione in pochi minuti.
