Mejora la claridadde la voz generada con IA

Ajusta la pronunciación, el ritmo y la interpretación de voz con Cartesia Sonic. Empieza con tu guion, modifica los controles y escucha el resultado.

Cambia un ajuste y escucha la diferencia

Reproduce la frase con los ajustes predeterminados. Ajusta la velocidad o el volumen y vuelve a generarla. Mantén las mismas palabras durante la comparación.

La vista previa interactiva permite editar una frase y ajustar la velocidad y el volumen antes de generarla. También puedes utilizar estos controles en Playground.

La velocidad y el volumen orientan la generación. El efecto varía según la voz y el texto, así que escucha un pasaje representativo antes de elegir los ajustes de tu proyecto.

Empieza por lo que escuchas

Un problema de pronunciación requiere un ajuste distinto de una incompatibilidad de formato de audio. Cambia la parte del proceso que causa el problema.

Un nombre no suena bien

Añade un diccionario de pronunciación

Utiliza una indicación de cómo suena la palabra o el AFI para términos recurrentes. Escúchala dentro de una frase completa, no solo de forma aislada.

La frase suena apresurada

Ajusta la puntuación y la velocidad

Primero acorta una frase demasiado cargada. Si hace falta, reduce la velocidad y vuelve a comparar el mismo pasaje.

La interpretación suena monótona

Revisa la voz y el guion

Elige una voz adecuada para el idioma y el tono que buscas. Añade indicaciones de emoción cuando sean coherentes con el texto.

El audio suena distorsionado

Comprueba el formato de audio

Ajusta la codificación y la frecuencia de muestreo del reproductor al audio generado antes de cambiar los ajustes del modelo.

Cómo mejorar una grabación de voz con IA

Una prueba de escucha repetible te ayuda a elegir ajustes que puedas reutilizar.

Mantén el mismo texto

Elige una frase que contenga el problema que quieres corregir. Incluye los nombres, la puntuación y las expresiones que escuchará tu audiencia. Guarda el primer resultado como referencia.

Cambia un ajuste

Mantén el mismo guion y cambia un solo ajuste, como la velocidad o una entrada del diccionario. Si comparas voces, no cambies los demás controles.

Escucha en el entorno de destino

Compara la generación original con la nueva en tu reproductor o conexión telefónica. Comprueba los finales de frase y las palabras importantes antes de guardar los ajustes.

Mantén una interpretación coherente

Guarda juntos la voz, la transcripción y los ajustes. Reutiliza el mismo diccionario de pronunciación para los nombres y términos técnicos que aparecen en varias grabaciones.

Guía la interpretación

Utiliza la velocidad y el volumen para afinar una voz que ya encaja con el guion. Los controles orientan la generación, así que compara un pasaje completo sin esperar un cambio exacto de duración o intensidad.

Reutilizar pronunciaciones

Añade al diccionario los nombres o términos técnicos recurrentes. Pruébalos en contexto y aplica ese diccionario a guiones posteriores para mantener la pronunciación desde un único lugar.

Da a las palabras difíciles una pronunciación clara

Escucha los ejemplos de pronunciación de Sonic. Para los nombres y términos especializados de tus propios guiones, crea un diccionario de pronunciación y comprueba cada palabra en una frase completa.

Leer la guía de pronunciación
  • Ejemplos de pronunciación
  • charcuterie

    shar-koo-terie

  • subpoena

    /səˈpiːnə/

  • epinephrine

    /ˌɛpɪˈnɛfrɪn/

Voces realistas y expresivas para cada caso de uso

Compara voces de Sonic para narraciones, clases y conversaciones con clientes. Empieza con una voz que encaje con tu guion y ajusta la pronunciación y el ritmo utilizando el mismo pasaje.

Soporte

Audio original en inglés

Convierte las respuestas de atención al cliente en respuestas habladas mediante síntesis de voz. Lee actualizaciones del servicio y pasos de resolución de problemas con una voz coherente en llamadas y aplicaciones.

Videojuegos

Grabación original

Genera diálogos de personajes a partir de los guiones de tu juego. Compara voces para cada papel y escucha las nuevas frases en contexto para comprobar el ritmo y la interpretación.

Contenido

Grabación original

Crea voces en off para vídeos, tutoriales y explicaciones de productos a partir de texto. Revisa un guion y genera una narración nueva sin volver a grabar cada frase.

Medios

Grabación original

Convierte artículos e historias escritos en audio hablado. Usa texto a voz para introducciones de pódcast o noticias narradas y comprueba los nombres y la pronunciación antes de publicar.

Atención sanitaria

Audio original en inglés

Lee recordatorios de citas e información de atención al paciente a partir de textos revisados por tu equipo. Usa una voz coherente para instrucciones rutinarias y actualizaciones de citas.

Ventas

Audio original en inglés

Añade narración hablada a demostraciones de productos y explicaciones comerciales. Prueba el guion con distintas voces y actualiza el audio cuando cambie tu producto o mensaje.

Agentes de voz

Audio original en inglés

Da a los agentes de voz con IA respuestas habladas generadas a partir del texto de tu aplicación. Elige una voz para saludos y conversaciones y prueba cómo suena en respuestas breves y largas.

Doblaje

Audio original en japonés

Genera voz a partir de guiones traducidos para tu flujo de localización. Compara voces en los idiomas compatibles y revisa la pronunciación y la sincronización antes de añadir el audio a un vídeo.

Avatares

Grabación original

Combina un avatar digital con voz sintetizada para presentaciones y experiencias guiadas. Genera diálogo a partir de texto y coordina la reproducción del audio con la animación del avatar.

Logística

Audio original en inglés

Convierte actualizaciones de envíos e instrucciones de despacho en mensajes hablados. Conecta la síntesis de voz a tu aplicación para que el audio refleje la información de entrega más reciente.

Selección de personal

Grabación original

Crea presentaciones habladas de entrevistas y mensajes de programación de citas para candidatos a partir de guiones aprobados. Mantén instrucciones coherentes y vuelve a generar el audio cuando cambie el proceso de selección.

Accesibilidad

Grabación original

Ofrece versiones de audio de guías, artículos y materiales educativos escritos. Permite que las personas escuchen el contenido y sigan el texto original a su ritmo.

Clona una voz para leer nuevos guiones

Crea una voz reutilizable a partir de una grabación limpia mediante clonación de voz con IA. Elige audio original con el tono y la interpretación que buscas y prueba el clon con nuevos guiones antes de afinar el resultado.

Utiliza tu propia voz o una que tengas permiso para clonar. Compara la grabación original con el clon y prueba tu guion para escuchar cómo resuelve el tono, el acento y la pronunciación.

Explorar la clonación de voz con IA

Voces fluidas y nativas, en todo el mundo

Genera voz a partir de texto en 44 idiomas con Sonic. Escucha muestras de idiomas y acentos para locuciones multilingües, clases narradas y vídeos localizados. Revisa los guiones traducidos y la pronunciación antes de publicar.

Idiomas y regiones más populares

Preguntas frecuentes sobre mejora de voz con IA

¿Qué significa aquí mejorar una voz con IA?

Esta página se centra en mejorar la voz nueva generada a partir de texto con Cartesia Sonic. Puedes elegir una voz más adecuada, ajustar el guion, orientar el ritmo y el volumen y usar diccionarios de pronunciación. Estos controles actúan durante la generación de voz.

¿Puedo subir una grabación para eliminar el ruido de fondo?

Esta página no ofrece una herramienta para subir y limpiar audio. Sonic genera voz a partir de texto. Eliminar siseos, eco o sonidos de fondo de una grabación existente es una tarea de restauración de audio y requiere una herramienta diseñada para ello.

¿Qué debo cambiar si una voz generada suena apresurada?

Empieza con frases completas y puntuación natural. Divide los párrafos densos en frases claras. Si la voz sigue siendo demasiado rápida, prueba una velocidad menor y vuelve a generar el fragmento. La velocidad sirve como orientación, no como multiplicador exacto de la duración; compara el resultado con la misma voz y el mismo guion.

¿Cómo puedo mejorar la pronunciación?

Prueba la palabra dentro de una frase completa antes de cambiarla. Los diccionarios de pronunciación pueden sustituir una palabra o frase por una indicación fonética aproximada o en AFI. Crea el diccionario en Playground o mediante la API y úsalo en las solicitudes que lo necesiten. Comprueba la frase que la rodea después de cada cambio.

¿Puedo cambiar la emoción de una voz con IA?

Sonic interpreta el contexto emocional del guion y también admite indicaciones de emoción mediante Playground y la API. Actualmente, las etiquetas de emoción admiten inglés. Elige una indicación que encaje con las palabras. Una instrucción contradictoria no producirá de forma fiable la interpretación que buscas.

¿Los controles de velocidad y volumen funcionan con todas las voces?

Los controles se aplican a las voces estándar y a los clones de voz instantáneos. Los clones de voz profesionales aprenden el ritmo y el volumen de sus grabaciones de entrenamiento y no permiten cambiar esos parámetros en cada solicitud. Para un clon profesional, prepara grabaciones con la interpretación que buscas.

¿Por qué el audio no suena bien en mi aplicación?

Comprueba primero el formato de salida. El audio PCM sin procesar necesita un reproductor configurado con la misma frecuencia de muestreo y codificación que el audio generado. Si no coinciden, la velocidad de reproducción puede cambiar o el sonido puede distorsionarse. Los archivos WAV o MP3 incluyen información del formato y resultan útiles al guardar audio para un reproductor compatible.

¿Puedo conservar los mismos ajustes para futuras generaciones?

Sí. Conserva juntos el ID de voz, el guion y los parámetros de generación en tu flujo de trabajo. En una integración con la API, envía generation_config en cada solicitud que necesite esos parámetros e incluye el ID del diccionario de pronunciación cuando corresponda. La API no convierte generation_config en una preferencia para toda la cuenta.

¿Puedo mejorar las locuciones con IA de vídeos y clases?

Sí. Empieza con el guion que escuchará tu público y genera una sección breve antes de producir toda la narración. Comprueba los nombres, las pausas y el ritmo de las explicaciones junto con el montaje. Si una frase cuesta seguirla, reescríbela antes de cambiar varios parámetros de voz. Usa el mismo fragmento de prueba al comparar revisiones.

¿Cómo mantengo coherentes los nombres de productos en la síntesis de voz?

Añade los nombres recurrentes a un diccionario de pronunciación y pruébalos en frases completas. En un flujo con la API, envía el ID de ese diccionario en la solicitud. Actualiza el diccionario cuando cambie el nombre de un producto o la pronunciación preferida, en lugar de reescribir grafías fonéticas en cada guion.

¿Qué puedo ajustar en la vista previa de esta página?

La vista previa permite editar el texto y ajustar la velocidad y el volumen antes de generar voz. Mantén las mismas palabras en la comparación inicial y vuelve a escuchar después de cambiar un control. Abre Playground para explorar otras voces y diccionarios de pronunciación. La vista previa genera voz nueva a partir de texto; no procesa una grabación subida.

Empieza hoy

Habla con un experto.

Habla con nuestro equipo y descubre cómo puede ayudarte Cartesia a crear experiencias de voz de primer nivel.

Contactar con ventas

Empieza a crear.

Accede a nuestros modelos mediante API y lleva un agente de voz a producción en minutos.

Probar Cartesia