Síntesis de voz para agentes de voz en tiempo real

Convierte texto en audio hablado con Sonic, el modelo de texto a voz de Cartesia. Prueba una voz en Playground y después genera audio desde tu aplicación mediante la API.

Escucha la voz con tus palabras

Prueba una frase que diría tu aplicación. Compara voces con las mismas palabras y comprueba la pronunciación y el ritmo.

146/500

Integra la voz en tu aplicación

Sonic convierte en audio el texto que produce tu aplicación. La aplicación aporta la respuesta y el modelo de voz la pronuncia.

Elige una voz

Prueba las voces con las palabras que realmente dirá tu aplicación. Incluye nombres, números y abreviaturas en la evaluación, en lugar de basarte solo en un saludo.

Genera audio mediante la API

Envía texto desde tu aplicación y recibe audio sintetizado. Elige una voz y un formato de salida, y después reproduce la respuesta o guárdala en un archivo.

Transmite respuestas habladas en streaming

Usa audio en streaming para la reproducción conversacional. Mide el tiempo que tardan los usuarios en oír la voz en tu aplicación, incluidos la transferencia por red y el almacenamiento temporal de reproducción.

¿Reproducción en el navegador o una API de voz?

Ambos convierten texto en voz. Elige según dónde quieras ejecutar la voz y cómo necesite utilizar el audio tu aplicación.

Síntesis de voz del navegador

Utiliza la interfaz SpeechSynthesis del navegador para reproducir voces del dispositivo. Las voces disponibles dependen del navegador y del sistema operativo.

Ideal para Leer texto en voz alta en una página web.

Leer la guía de síntesis de voz del navegador

API de voz de Cartesia

Elige una voz de Sonic por su ID y genera voz desde tu backend. Transmite, guarda o reproduce el audio en aplicaciones web, móviles y telefónicas.

Ideal para Generar audio para tu aplicación.

Explorar la API de voz

Voces realistas y expresivas para cada caso de uso

Escucha muestras de voz para distintas aplicaciones. Compara la interpretación y prueba una voz con las palabras que escuchará tu audiencia.

Soporte

Audio original en inglés

Convierte las respuestas de atención al cliente en respuestas habladas mediante síntesis de voz. Lee actualizaciones del servicio y pasos de resolución de problemas con una voz coherente en llamadas y aplicaciones.

Videojuegos

Grabación original

Genera diálogos de personajes a partir de los guiones de tu juego. Compara voces para cada papel y escucha las nuevas frases en contexto para comprobar el ritmo y la interpretación.

Contenido

Grabación original

Crea voces en off para vídeos, tutoriales y explicaciones de productos a partir de texto. Revisa un guion y genera una narración nueva sin volver a grabar cada frase.

Medios

Grabación original

Convierte artículos e historias escritos en audio hablado. Usa texto a voz para introducciones de pódcast o noticias narradas y comprueba los nombres y la pronunciación antes de publicar.

Atención sanitaria

Audio original en inglés

Lee recordatorios de citas e información de atención al paciente a partir de textos revisados por tu equipo. Usa una voz coherente para instrucciones rutinarias y actualizaciones de citas.

Ventas

Audio original en inglés

Añade narración hablada a demostraciones de productos y explicaciones comerciales. Prueba el guion con distintas voces y actualiza el audio cuando cambie tu producto o mensaje.

Agentes de voz

Audio original en inglés

Da a los agentes de voz con IA respuestas habladas generadas a partir del texto de tu aplicación. Elige una voz para saludos y conversaciones y prueba cómo suena en respuestas breves y largas.

Doblaje

Audio original en japonés

Genera voz a partir de guiones traducidos para tu flujo de localización. Compara voces en los idiomas compatibles y revisa la pronunciación y la sincronización antes de añadir el audio a un vídeo.

Avatares

Grabación original

Combina un avatar digital con voz sintetizada para presentaciones y experiencias guiadas. Genera diálogo a partir de texto y coordina la reproducción del audio con la animación del avatar.

Logística

Audio original en inglés

Convierte actualizaciones de envíos e instrucciones de despacho en mensajes hablados. Conecta la síntesis de voz a tu aplicación para que el audio refleje la información de entrega más reciente.

Selección de personal

Grabación original

Crea presentaciones habladas de entrevistas y mensajes de programación de citas para candidatos a partir de guiones aprobados. Mantén instrucciones coherentes y vuelve a generar el audio cuando cambie el proceso de selección.

Accesibilidad

Grabación original

Ofrece versiones de audio de guías, artículos y materiales educativos escritos. Permite que las personas escuchen el contenido y sigan el texto original a su ritmo.

Voces fluidas y nativas, en todo el mundo

Llega a mercados internacionales con Sonic: 44 idiomas y una amplia variedad de acentos, todos con voces de calidad nativa.

Idiomas y regiones más populares

De una demo de voz a una conversación

La síntesis de voz aporta la respuesta hablada. Un agente conversacional también necesita comprender la entrada, decidir qué decir y gestionar las interrupciones.

Crea tu flujo de audio

Utiliza la API Bytes cuando tengas la transcripción lista o un WebSocket cuando el texto llegue por fragmentos. Ajusta el formato de salida al reproductor y detén el audio pendiente cuando alguien interrumpa.

Leer la guía de WebSocket

Crear con Managed Agents

Conecta una voz con las instrucciones y herramientas de tu agente. Utiliza Managed Agents si quieres trabajar en la conversación junto con su voz.

Explorar Managed Agents

Preguntas frecuentes sobre síntesis de voz

¿Qué es la síntesis de voz?

La síntesis de voz genera audio hablado a partir de texto. También se llama texto a voz o TTS. El modelo Sonic de Cartesia realiza este paso en una aplicación de voz. El reconocimiento de voz hace lo contrario: convierte audio hablado en texto.

¿Cartesia es lo mismo que la API SpeechSynthesis del navegador?

No. window.speechSynthesis del navegador usa las voces disponibles en el dispositivo de quien escucha y gestiona allí la reproducción. Cartesia es una API alojada que devuelve audio generado a tu aplicación. Si solo necesitas reproducir voz en el navegador sin una clave de API, prueba el tutorial de texto a voz con JavaScript. Las voces del navegador varían según el sistema operativo y pueden usar servicios de voz locales o remotos.

¿Cómo integro la síntesis de voz en una aplicación?

Empieza con la guía de texto a voz con Python para generar y guardar un archivo WAV. Mantén la clave de API en el backend. Para un agente de voz, también necesitas reproducción de audio y gestión de interrupciones; un ejemplo que guarda archivos no implementa esas partes. También puedes crear aplicaciones con Cartesia Managed Agents.

¿La síntesis de voz siempre pronuncia correctamente el texto?

Prueba la voz elegida con los nombres, las abreviaturas y los números de tu aplicación. Escucha las palabras en contexto y revisa el guion cuando sea necesario. Una muestra representativa te ayuda a elegir una voz adecuada para tu contenido.

¿Qué idiomas admite Cartesia?

Consulta la lista actual de idiomas de Sonic y escucha ejemplos de los idiomas que necesitas. Proporciona texto en el idioma que quieres escuchar; TTS no lo traduce automáticamente.

¿Puedo utilizar la síntesis de voz de Cartesia sin conexión o gratis?

La API alojada de Cartesia requiere conexión a Internet y acceso a una cuenta. El audio generado y guardado en un archivo puede reproducirse sin conexión. El uso depende del plan y los límites de tu cuenta; consulta los precios vigentes antes de enviar solicitudes.

¿La síntesis de voz es lo mismo que el reconocimiento de voz?

La síntesis de voz convierte texto en audio hablado. El reconocimiento de voz convierte audio en texto. Un agente de voz puede usar reconocimiento para entender a quien llama, un modelo de lenguaje para producir una respuesta y síntesis de voz para pronunciarla. Consulta Sonic para texto a voz e Ink para voz a texto.

¿Puedo transmitir la voz en streaming mientras se genera?

Sí. Cartesia ofrece endpoints de streaming para recibir audio de forma incremental. Tu aplicación puede empezar a reproducirlo a medida que llega. Consulta la referencia de la API de streaming para conocer el formato de respuesta y adapta la reproducción a los parámetros de audio que espera tu integración.

¿Puedo controlar la velocidad y la emoción de la voz sintetizada?

Los modelos Sonic compatibles ofrecen controles de velocidad, volumen y emoción. Prueba los parámetros con la voz y el guion elegidos para escuchar cómo afectan a la interpretación. La guía de controles de voz explica los controles actuales y los modelos compatibles.

¿La síntesis de voz puede traducir el texto a otro idioma?

Proporciona el texto en el idioma que quieres escuchar. Traducir el guion es un paso independiente de sintetizar la voz. Revisa los nombres, los números y las expresiones regionales traducidos antes de generar el audio final. Explora los ejemplos de idiomas para escuchar voces antes de elegir una.

¿En qué se diferencia la clonación de voz de la síntesis de voz?

La clonación de voz crea una voz reutilizable a partir de grabaciones de una persona. La síntesis de voz usa una voz para leer texto nuevo. Puedes empezar con una voz existente o crear un clon que tengas permiso para usar y después generar voz con su ID. Consulta la guía de clonación de voz para conocer los requisitos de grabación.

Empieza hoy

Habla con un experto.

Habla con nuestro equipo y descubre cómo puede ayudarte Cartesia a crear experiencias de voz de primer nivel.

Contactar con ventas

Empieza a crear.

Accede a nuestros modelos mediante API y lleva un agente de voz a producción en minutos.

Probar Cartesia