Diagrama que muestra el modelo TTS y la voz como entradas independientes

Modelo TTS y voz: no son lo mismo

Un modelo TTS genera habla. Pero el modelo y la voz con la que habla son cosas distintas. Confundirlos lleva a tomar malas decisiones al diseñar aplicaciones de voz con IA.

[Producto]

Una cuadrícula de 2 por 2 cuadrados: tres aguadas en verde salvia y gris claro, y un cuadrado dibujado con contorno negro

Por qué importan tanto la precisión y la exhaustividad

La exactitud parece la métrica adecuada hasta que tu modelo obtiene un 90 % sin hacer nada. La precisión y la exhaustividad ofrecen una imagen más fiel. Veamos por qué importa para la voz con IA.

[Producto]

Una hoja dibujada a mano se superpone a un bocadillo verde de acuarela con el número 3.6

Presentamos Sonic-3.6

Sonic-3.6 mejora la naturalidad y la calidad frente a Sonic-3.5. Los oyentes lo prefieren en hasta el 93 % de las comparaciones ciegas directas realizadas en quince variantes regionales.

[Producto]

Nombres difíciles de transcribir, como enclomiphene, zuclopenthixol y pityriasis, rodean un micrófono, con aminophylline enfocado a su lado

Novedades de Ink-2: términos clave y detección de turnos configurable

Dos novedades de Ink-2: indicaciones de términos clave para transcribir mejor entidades especializadas y detección de turnos configurable para priorizar velocidad o exactitud.

[Producto]

¿Es bueno este modelo TTS?

¿Es bueno este modelo TTS?

Por qué la evaluación de texto a voz pierde utilidad a medida que mejoran los modelos y cómo medir lo que realmente importa.

[Investigación]

Una pregunta hablada entra palabra a palabra en espiral en un micrófono, evocando la transcripción de voz a texto

Presentamos Ink-2: el STT número 1 creado para agentes de voz

Presentamos Ink-2, nuestro modelo de voz a texto para agentes en tiempo real, número 1 en la clasificación de streaming de Artificial Analysis y con la detección de turnos integrada más precisa entre proveedores.

[Noticias]

Una roseta de pétalos verdes translúcidos superpuestos, con tres círculos de contorno que se cruzan en el centro

Guía para elegir modelos de voz con IA

Un método práctico para evaluar modelos ASR, TTS y de detección de turnos según tu caso de uso real, más allá de las condiciones de laboratorio.

[Producto]

Seis estudios en acuarela verde que combinan bloques pintados y un rectángulo de contorno dibujado a mano en distintas disposiciones

Guía de terminología de voz con IA para principiantes

Un glosario sencillo de los 20 términos clave para comprender, evaluar y crear IA conversacional de voz.

[Producto]

Líneas oscuras paralelas recorren una franja verde pintada, se entrelazan en el centro y continúan

Mamba-3: un modelo de espacio de estados centrado en la inferencia

Mamba-3 orienta los modelos de espacio de estados a las cargas modernas de inferencia y mejora la calidad conservando la baja latencia que hace atractivos los modelos lineales.

[Investigación]

Cuatro copias de un mismo símbolo de línea en bucle, dibujadas en verde claro, verde medio, gris y verde oscuro

Cartesia busca un ingeniero de software para formar un ejército de Claudes

Escribir código parece un problema resuelto. La ingeniería, no. Buscamos a alguien que cierre esa distancia.

[Ingeniería]

El logotipo de Cartesia sobre las palabras ahora cumple el RGPD, junto a un círculo de estrellas de la Unión Europea de color ámbar

Cartesia cumple el RGPD

La plataforma de texto a voz de Cartesia ya cumple el RGPD, reafirmando nuestro compromiso con la protección de datos, la privacidad y una IA responsable centrada en las personas.

[Noticias]

Varios cuadrados verdes translúcidos en acuarela, superpuestos con ligeras inclinaciones y zonas más oscuras hacia el centro

Presentamos Line: la plataforma moderna para desarrollar agentes de voz

Presentamos Line de Cartesia, la plataforma moderna para desarrollar agentes de voz. Line se creó con el código como base, porque los mejores productos se construyen con código.

[Producto]

Tres filas de bloques en acuarela verde y contorno dibujado a mano, más anchos y oscuros arriba y más estrechos y claros abajo

Modelado jerárquico

Presentamos H-Nets, arquitecturas jerárquicas que aprenden directamente de datos sin procesar al agrupar las entradas en conceptos de mayor nivel y superar las limitaciones de la tokenización.

[Investigación]

Presentamos Ink: modelos de voz a texto para conversar en tiempo real

Presentamos Ink: modelos de voz a texto para conversar en tiempo real

Presentamos Ink, una nueva familia de modelos de voz a texto en streaming para crear aplicaciones de voz en tiempo real. Ink-Whisper es el modelo STT más rápido y económico, diseñado para agentes de voz de nivel empresarial.

[Producto]

Presentamos Organizaciones y Paneles

Presentamos Organizaciones y Paneles

Estamos creando Cartesia para desarrolladores que amplían sus aplicaciones de voz con IA. Hoy presentamos dos funciones para facilitar la colaboración y el seguimiento: Organizaciones y Paneles.

[Producto]

Presentamos la clonación de voz profesional

Presentamos la clonación de voz profesional

Presentamos Professional Voice Cloning, PVC: clones de voz de calidad profesional entrenados sobre Sonic, ahora disponibles en los planes Startup+.

[Producto]

SDK de Python de Cartesia v2.0.0

SDK de Python de Cartesia v2.0.0

Presentamos la versión 2.0.0 de nuestro SDK de Python, que mejora la experiencia de desarrollo al usar las funciones de voz con IA de Cartesia en Python.

[Ingeniería]

Cartesia entra en la séptima lista anual Enterprise Tech 30 de Wing Venture Capital

Cartesia entra en la séptima lista anual Enterprise Tech 30 de Wing Venture Capital

Cartesia, proveedor líder de modelos de audio generativo, ha anunciado hoy su inclusión en la séptima edición anual de Enterprise Tech 30, una lista de las empresas tecnológicas privadas más prometedoras para el sector empresarial en todas las etapas de desarrollo.

[Noticias]

La ronda de serie A y el futuro de la voz con IA

La ronda de serie A y el futuro de la voz con IA

Anunciamos nuestra ronda de serie A de 64 millones de dólares, liderada por Kleiner Perkins. La nueva financiación nos ayudará a ampliar el equipo e invertir en investigación para crear la próxima generación de modelos.

[Noticias]

Llamba: ampliar modelos recurrentes destilados para procesar lenguaje con eficiencia

Llamba: ampliar modelos recurrentes destilados para procesar lenguaje con eficiencia

Los próximos años abrirán una nueva etapa de IA en el dispositivo. Los modelos locales permitirán una amplia variedad de aplicaciones.

[Investigación]

Cómo crear un agente de voz con IA usando Cartesia

Cómo crear un agente de voz con IA usando Cartesia

Guía paso a paso para crear un agente de voz con IA natural y de baja latencia con Sonic de Cartesia, desde la arquitectura hasta el despliegue en producción.

[Ingeniería]

El estado de la voz con IA en 2024

El estado de la voz con IA en 2024

En nuestro primer informe sobre el estado de la voz en 2024 repasamos los avances de infraestructura y los nuevos casos de uso del sector, y anticipamos lo que llegará en 2025.

[Investigación]

Anunciamos nuestra ronda semilla

Anunciamos nuestra ronda semilla

Anunciamos nuestra ronda semilla de 27 millones de dólares, liderada por Index Ventures con participación de Lightspeed, Factory, Conviction, General Catalyst, A*, SV Angel y 90 inversores ángeles.

[Noticias]

Temporada de hackatones en Cartesia

Temporada de hackatones en Cartesia

Octubre de 2024 fue un mes intenso en Cartesia. Reunimos a más de 2.000 desarrolladores en San Francisco y repartimos 20.000 dólares en premios para las ideas más innovadoras creadas con Sonic.

[Ingeniería]

Presentamos Voice Changer: transforma el audio a tu manera

Presentamos Voice Changer: transforma el audio a tu manera

Voice Changer transforma la voz de cualquier clip conservando su interpretación, emoción y prosodia originales, con voces de calidad de estudio o clones.

[Producto]

Presentamos los siguientes 8 idiomas de Sonic Multilingual

Presentamos los siguientes 8 idiomas de Sonic Multilingual

Hoy anunciamos la versión alfa de nuestros siguientes 8 idiomas en Sonic Multilingual: hindi, italiano, coreano, neerlandés, polaco, ruso, sueco y turco.

[Producto]

Novedades sobre inteligencia en el dispositivo

Novedades sobre inteligencia en el dispositivo

En Cartesia, nuestra misión es crear la próxima generación de IA: inteligencia ubicua e interactiva que funcione donde estés.

[Investigación]

Presentamos Sonic: un modelo de voz de baja latencia para un habla natural

Presentamos Sonic: un modelo de voz de baja latencia para un habla natural

Hoy lanzamos Sonic, nuestro modelo de baja latencia que genera voz natural.

[Investigación]

Based: modelos de lenguaje sencillos con atención lineal equilibran memoria y capacidad de generación

Based: modelos de lenguaje sencillos con atención lineal equilibran memoria y capacidad de generación

Based procesa instrucciones un 56 % más rápido que FlashAttention-2 y un 44 % más rápido que Mamba. Su capacidad de generación de texto es 24 veces superior a la de FlashAttention-2.

[Investigación]

Mamba-3B-SlimPJ: modelos de espacio de estados que rivalizan con la mejor arquitectura Transformer

Mamba-3B-SlimPJ: modelos de espacio de estados que rivalizan con la mejor arquitectura Transformer

Publicamos Mamba-3B-SlimPJ, el modelo de lenguaje Mamba más potente hasta la fecha, en colaboración con Cartesia y Together, bajo la licencia Apache 2.0.

[Investigación]

Empieza hoy

Habla con un experto.

Habla con nuestro equipo y descubre cómo puede ayudarte Cartesia a crear experiencias de voz de primer nivel.

Contactar con ventas

Empieza a crear.

Accede a nuestros modelos mediante API y lleva un agente de voz a producción en minutos.

Probar Cartesia