Síntesis de voz para agentes de voz en tiempo real
Escucha la voz con tus palabras
Prueba una frase que diría tu aplicación. Compara voces con las mismas palabras y comprueba la pronunciación y el ritmo.
Integra la voz en tu aplicación
Sonic convierte en audio el texto que produce tu aplicación. La aplicación aporta la respuesta y el modelo de voz la pronuncia.
Elige una voz
Prueba las voces con las palabras que realmente dirá tu aplicación. Incluye nombres, números y abreviaturas en la evaluación, en lugar de basarte solo en un saludo.
Genera audio mediante la API
Envía texto desde tu aplicación y recibe audio sintetizado. Elige una voz y un formato de salida, y después reproduce la respuesta o guárdala en un archivo.
Transmite respuestas habladas en streaming
Usa audio en streaming para la reproducción conversacional. Mide el tiempo que tardan los usuarios en oír la voz en tu aplicación, incluidos la transferencia por red y el almacenamiento temporal de reproducción.
¿Reproducción en el navegador o una API de voz?
Ambos convierten texto en voz. Elige según dónde quieras ejecutar la voz y cómo necesite utilizar el audio tu aplicación.
Síntesis de voz del navegador
Utiliza la interfaz SpeechSynthesis del navegador para reproducir voces del dispositivo. Las voces disponibles dependen del navegador y del sistema operativo.
Ideal para Leer texto en voz alta en una página web.
Leer la guía de síntesis de voz del navegadorAPI de voz de Cartesia
Elige una voz de Sonic por su ID y genera voz desde tu backend. Transmite, guarda o reproduce el audio en aplicaciones web, móviles y telefónicas.
Ideal para Generar audio para tu aplicación.
Explorar la API de vozVoces realistas y expresivas para cada caso de uso
Escucha muestras de voz para distintas aplicaciones. Compara la interpretación y prueba una voz con las palabras que escuchará tu audiencia.
Soporte
Audio original en inglés
Convierte las respuestas de atención al cliente en respuestas habladas mediante síntesis de voz. Lee actualizaciones del servicio y pasos de resolución de problemas con una voz coherente en llamadas y aplicaciones.
Videojuegos
Grabación original
Genera diálogos de personajes a partir de los guiones de tu juego. Compara voces para cada papel y escucha las nuevas frases en contexto para comprobar el ritmo y la interpretación.
Contenido
Grabación original
Crea voces en off para vídeos, tutoriales y explicaciones de productos a partir de texto. Revisa un guion y genera una narración nueva sin volver a grabar cada frase.
Medios
Grabación original
Convierte artículos e historias escritos en audio hablado. Usa texto a voz para introducciones de pódcast o noticias narradas y comprueba los nombres y la pronunciación antes de publicar.
Atención sanitaria
Audio original en inglés
Lee recordatorios de citas e información de atención al paciente a partir de textos revisados por tu equipo. Usa una voz coherente para instrucciones rutinarias y actualizaciones de citas.
Ventas
Audio original en inglés
Añade narración hablada a demostraciones de productos y explicaciones comerciales. Prueba el guion con distintas voces y actualiza el audio cuando cambie tu producto o mensaje.
Agentes de voz
Audio original en inglés
Da a los agentes de voz con IA respuestas habladas generadas a partir del texto de tu aplicación. Elige una voz para saludos y conversaciones y prueba cómo suena en respuestas breves y largas.
Doblaje
Audio original en japonés
Genera voz a partir de guiones traducidos para tu flujo de localización. Compara voces en los idiomas compatibles y revisa la pronunciación y la sincronización antes de añadir el audio a un vídeo.
Avatares
Grabación original
Combina un avatar digital con voz sintetizada para presentaciones y experiencias guiadas. Genera diálogo a partir de texto y coordina la reproducción del audio con la animación del avatar.
Logística
Audio original en inglés
Convierte actualizaciones de envíos e instrucciones de despacho en mensajes hablados. Conecta la síntesis de voz a tu aplicación para que el audio refleje la información de entrega más reciente.
Selección de personal
Grabación original
Crea presentaciones habladas de entrevistas y mensajes de programación de citas para candidatos a partir de guiones aprobados. Mantén instrucciones coherentes y vuelve a generar el audio cuando cambie el proceso de selección.
Accesibilidad
Grabación original
Ofrece versiones de audio de guías, artículos y materiales educativos escritos. Permite que las personas escuchen el contenido y sigan el texto original a su ritmo.
Voces fluidas y nativas, en todo el mundo
Llega a mercados internacionales con Sonic: 44 idiomas y una amplia variedad de acentos, todos con voces de calidad nativa.
De una demo de voz a una conversación
La síntesis de voz aporta la respuesta hablada. Un agente conversacional también necesita comprender la entrada, decidir qué decir y gestionar las interrupciones.
Crea tu flujo de audio
Utiliza la API Bytes cuando tengas la transcripción lista o un WebSocket cuando el texto llegue por fragmentos. Ajusta el formato de salida al reproductor y detén el audio pendiente cuando alguien interrumpa.
Leer la guía de WebSocketCrear con Managed Agents
Conecta una voz con las instrucciones y herramientas de tu agente. Utiliza Managed Agents si quieres trabajar en la conversación junto con su voz.
Explorar Managed AgentsPreguntas frecuentes sobre síntesis de voz
¿Qué es la síntesis de voz?
La síntesis de voz genera audio hablado a partir de texto. También se llama texto a voz o TTS. El modelo Sonic de Cartesia realiza este paso en una aplicación de voz. El reconocimiento de voz hace lo contrario: convierte audio hablado en texto.
¿Cartesia es lo mismo que la API SpeechSynthesis del navegador?
No. window.speechSynthesis del navegador usa las voces disponibles en el dispositivo de quien escucha y gestiona allí la reproducción. Cartesia es una API alojada que devuelve audio generado a tu aplicación. Si solo necesitas reproducir voz en el navegador sin una clave de API, prueba el tutorial de texto a voz con JavaScript. Las voces del navegador varían según el sistema operativo y pueden usar servicios de voz locales o remotos.
¿Cómo integro la síntesis de voz en una aplicación?
Empieza con la guía de texto a voz con Python para generar y guardar un archivo WAV. Mantén la clave de API en el backend. Para un agente de voz, también necesitas reproducción de audio y gestión de interrupciones; un ejemplo que guarda archivos no implementa esas partes. También puedes crear aplicaciones con Cartesia Managed Agents.
¿La síntesis de voz siempre pronuncia correctamente el texto?
Prueba la voz elegida con los nombres, las abreviaturas y los números de tu aplicación. Escucha las palabras en contexto y revisa el guion cuando sea necesario. Una muestra representativa te ayuda a elegir una voz adecuada para tu contenido.
¿Qué idiomas admite Cartesia?
Consulta la lista actual de idiomas de Sonic y escucha ejemplos de los idiomas que necesitas. Proporciona texto en el idioma que quieres escuchar; TTS no lo traduce automáticamente.
¿Puedo utilizar la síntesis de voz de Cartesia sin conexión o gratis?
La API alojada de Cartesia requiere conexión a Internet y acceso a una cuenta. El audio generado y guardado en un archivo puede reproducirse sin conexión. El uso depende del plan y los límites de tu cuenta; consulta los precios vigentes antes de enviar solicitudes.
¿La síntesis de voz es lo mismo que el reconocimiento de voz?
La síntesis de voz convierte texto en audio hablado. El reconocimiento de voz convierte audio en texto. Un agente de voz puede usar reconocimiento para entender a quien llama, un modelo de lenguaje para producir una respuesta y síntesis de voz para pronunciarla. Consulta Sonic para texto a voz e Ink para voz a texto.
¿Puedo transmitir la voz en streaming mientras se genera?
Sí. Cartesia ofrece endpoints de streaming para recibir audio de forma incremental. Tu aplicación puede empezar a reproducirlo a medida que llega. Consulta la referencia de la API de streaming para conocer el formato de respuesta y adapta la reproducción a los parámetros de audio que espera tu integración.
¿Puedo controlar la velocidad y la emoción de la voz sintetizada?
Los modelos Sonic compatibles ofrecen controles de velocidad, volumen y emoción. Prueba los parámetros con la voz y el guion elegidos para escuchar cómo afectan a la interpretación. La guía de controles de voz explica los controles actuales y los modelos compatibles.
¿La síntesis de voz puede traducir el texto a otro idioma?
Proporciona el texto en el idioma que quieres escuchar. Traducir el guion es un paso independiente de sintetizar la voz. Revisa los nombres, los números y las expresiones regionales traducidos antes de generar el audio final. Explora los ejemplos de idiomas para escuchar voces antes de elegir una.
¿En qué se diferencia la clonación de voz de la síntesis de voz?
La clonación de voz crea una voz reutilizable a partir de grabaciones de una persona. La síntesis de voz usa una voz para leer texto nuevo. Puedes empezar con una voz existente o crear un clon que tengas permiso para usar y después generar voz con su ID. Consulta la guía de clonación de voz para conocer los requisitos de grabación.
Empieza hoy
Habla con un experto.
Habla con nuestro equipo y descubre cómo puede ayudarte Cartesia a crear experiencias de voz de primer nivel.
Empieza a crear.
Accede a nuestros modelos mediante API y lleva un agente de voz a producción en minutos.