
Modelo TTS y voz: no son lo mismo
Un modelo TTS genera habla. Pero el modelo y la voz con la que habla son cosas distintas. Confundirlos lleva a tomar malas decisiones al diseñar aplicaciones de voz con IA.
[Producto]

Por qué importan tanto la precisión y la exhaustividad
La exactitud parece la métrica adecuada hasta que tu modelo obtiene un 90 % sin hacer nada. La precisión y la exhaustividad ofrecen una imagen más fiel. Veamos por qué importa para la voz con IA.
[Producto]

Presentamos Sonic-3.6
Sonic-3.6 mejora la naturalidad y la calidad frente a Sonic-3.5. Los oyentes lo prefieren en hasta el 93 % de las comparaciones ciegas directas realizadas en quince variantes regionales.
[Producto]

Novedades de Ink-2: términos clave y detección de turnos configurable
Dos novedades de Ink-2: indicaciones de términos clave para transcribir mejor entidades especializadas y detección de turnos configurable para priorizar velocidad o exactitud.
[Producto]

¿Es bueno este modelo TTS?
Por qué la evaluación de texto a voz pierde utilidad a medida que mejoran los modelos y cómo medir lo que realmente importa.
[Investigación]

Presentamos Ink-2: el STT número 1 creado para agentes de voz
Presentamos Ink-2, nuestro modelo de voz a texto para agentes en tiempo real, número 1 en la clasificación de streaming de Artificial Analysis y con la detección de turnos integrada más precisa entre proveedores.
[Noticias]

Guía para elegir modelos de voz con IA
Un método práctico para evaluar modelos ASR, TTS y de detección de turnos según tu caso de uso real, más allá de las condiciones de laboratorio.
[Producto]

Guía de terminología de voz con IA para principiantes
Un glosario sencillo de los 20 términos clave para comprender, evaluar y crear IA conversacional de voz.
[Producto]

Mamba-3: un modelo de espacio de estados centrado en la inferencia
Mamba-3 orienta los modelos de espacio de estados a las cargas modernas de inferencia y mejora la calidad conservando la baja latencia que hace atractivos los modelos lineales.
[Investigación]

Cartesia busca un ingeniero de software para formar un ejército de Claudes
Escribir código parece un problema resuelto. La ingeniería, no. Buscamos a alguien que cierre esa distancia.
[Ingeniería]

Cartesia cumple el RGPD
La plataforma de texto a voz de Cartesia ya cumple el RGPD, reafirmando nuestro compromiso con la protección de datos, la privacidad y una IA responsable centrada en las personas.
[Noticias]

Presentamos Line: la plataforma moderna para desarrollar agentes de voz
Presentamos Line de Cartesia, la plataforma moderna para desarrollar agentes de voz. Line se creó con el código como base, porque los mejores productos se construyen con código.
[Producto]

Modelado jerárquico
Presentamos H-Nets, arquitecturas jerárquicas que aprenden directamente de datos sin procesar al agrupar las entradas en conceptos de mayor nivel y superar las limitaciones de la tokenización.
[Investigación]

Presentamos Ink: modelos de voz a texto para conversar en tiempo real
Presentamos Ink, una nueva familia de modelos de voz a texto en streaming para crear aplicaciones de voz en tiempo real. Ink-Whisper es el modelo STT más rápido y económico, diseñado para agentes de voz de nivel empresarial.
[Producto]

Presentamos Organizaciones y Paneles
Estamos creando Cartesia para desarrolladores que amplían sus aplicaciones de voz con IA. Hoy presentamos dos funciones para facilitar la colaboración y el seguimiento: Organizaciones y Paneles.
[Producto]

Presentamos la clonación de voz profesional
Presentamos Professional Voice Cloning, PVC: clones de voz de calidad profesional entrenados sobre Sonic, ahora disponibles en los planes Startup+.
[Producto]

SDK de Python de Cartesia v2.0.0
Presentamos la versión 2.0.0 de nuestro SDK de Python, que mejora la experiencia de desarrollo al usar las funciones de voz con IA de Cartesia en Python.
[Ingeniería]

Cartesia entra en la séptima lista anual Enterprise Tech 30 de Wing Venture Capital
Cartesia, proveedor líder de modelos de audio generativo, ha anunciado hoy su inclusión en la séptima edición anual de Enterprise Tech 30, una lista de las empresas tecnológicas privadas más prometedoras para el sector empresarial en todas las etapas de desarrollo.
[Noticias]

La ronda de serie A y el futuro de la voz con IA
Anunciamos nuestra ronda de serie A de 64 millones de dólares, liderada por Kleiner Perkins. La nueva financiación nos ayudará a ampliar el equipo e invertir en investigación para crear la próxima generación de modelos.
[Noticias]

Llamba: ampliar modelos recurrentes destilados para procesar lenguaje con eficiencia
Los próximos años abrirán una nueva etapa de IA en el dispositivo. Los modelos locales permitirán una amplia variedad de aplicaciones.
[Investigación]

Cómo crear un agente de voz con IA usando Cartesia
Guía paso a paso para crear un agente de voz con IA natural y de baja latencia con Sonic de Cartesia, desde la arquitectura hasta el despliegue en producción.
[Ingeniería]

El estado de la voz con IA en 2024
En nuestro primer informe sobre el estado de la voz en 2024 repasamos los avances de infraestructura y los nuevos casos de uso del sector, y anticipamos lo que llegará en 2025.
[Investigación]

Anunciamos nuestra ronda semilla
Anunciamos nuestra ronda semilla de 27 millones de dólares, liderada por Index Ventures con participación de Lightspeed, Factory, Conviction, General Catalyst, A*, SV Angel y 90 inversores ángeles.
[Noticias]

Temporada de hackatones en Cartesia
Octubre de 2024 fue un mes intenso en Cartesia. Reunimos a más de 2.000 desarrolladores en San Francisco y repartimos 20.000 dólares en premios para las ideas más innovadoras creadas con Sonic.
[Ingeniería]

Presentamos Voice Changer: transforma el audio a tu manera
Voice Changer transforma la voz de cualquier clip conservando su interpretación, emoción y prosodia originales, con voces de calidad de estudio o clones.
[Producto]

Presentamos los siguientes 8 idiomas de Sonic Multilingual
Hoy anunciamos la versión alfa de nuestros siguientes 8 idiomas en Sonic Multilingual: hindi, italiano, coreano, neerlandés, polaco, ruso, sueco y turco.
[Producto]

Novedades sobre inteligencia en el dispositivo
En Cartesia, nuestra misión es crear la próxima generación de IA: inteligencia ubicua e interactiva que funcione donde estés.
[Investigación]

Presentamos Sonic: un modelo de voz de baja latencia para un habla natural
Hoy lanzamos Sonic, nuestro modelo de baja latencia que genera voz natural.
[Investigación]

Based: modelos de lenguaje sencillos con atención lineal equilibran memoria y capacidad de generación
Based procesa instrucciones un 56 % más rápido que FlashAttention-2 y un 44 % más rápido que Mamba. Su capacidad de generación de texto es 24 veces superior a la de FlashAttention-2.
[Investigación]

Mamba-3B-SlimPJ: modelos de espacio de estados que rivalizan con la mejor arquitectura Transformer
Publicamos Mamba-3B-SlimPJ, el modelo de lenguaje Mamba más potente hasta la fecha, en colaboración con Cartesia y Together, bajo la licencia Apache 2.0.
[Investigación]
Empieza hoy
Habla con un experto.
Habla con nuestro equipo y descubre cómo puede ayudarte Cartesia a crear experiencias de voz de primer nivel.
Empieza a crear.
Accede a nuestros modelos mediante API y lleva un agente de voz a producción en minutos.
