Convierte texto en voz en un archivo MP3
Escribe tu texto, elige una voz y crea tu MP3.
Tu guion, listo para reproducir
Prueba la voz con un pasaje breve y genera un archivo para tu reproductor. Conserva el guion original para poder revisar la grabación más adelante.
Prepara el guion
Escribe el texto que quieres incluir en el archivo. Desarrolla las abreviaturas poco conocidas y revisa los nombres, fechas y números antes de generar la grabación final.
Escucha una vista previa
Prueba el texto en la vista previa y compara voces. Escucha la interpretación antes de crear el archivo MP3.
Guarda el MP3
Selecciona Crear MP3 y descarga el archivo de audio. Escúchalo una vez más en el reproductor que utilizará tu audiencia.
Genera un MP3 mediante la API
Envía tu guion a Sonic y guarda la respuesta en MP3 para narraciones, clases o reproducción en aplicaciones.
Configura tu solicitud
Elige salida MP3 e incluye la transcripción, la voz y el modelo en una solicitud a la API Bytes. Envía la solicitud desde tu backend para mantener privada la clave de API.
Guarda la respuesta de audio
Comprueba que la solicitud haya tenido éxito antes de guardar los bytes de la respuesta como archivo MP3. Gestiona primero los errores de la API y reproduce después el audio guardado para comprobar el resultado.
- Formato
- MP3
- Frecuencia de muestreo
- 44.1 kHz
- Tasa de bits
- 128 kbps
Elige un formato para tu destino
Empieza por los formatos que admite tu reproductor. Una integración telefónica y un archivo de narración descargable pueden necesitar ajustes distintos.
MP3
Para reproducir y compartir
Audio comprimido para narraciones, mensajes de aplicaciones y reproductores compatibles con MP3. Elige la tasa de bits y la frecuencia de muestreo en la solicitud.
WAV
Para un proceso de edición
Un contenedor de archivo para audio PCM. Resulta útil cuando tu editor o proceso de publicación requiere WAV en lugar de MP3 comprimido.
Audio sin procesar
Para una integración
Muestras de audio sin cabecera de archivo. Ajusta la codificación y la frecuencia de muestreo a tu reproductor o sistema telefónico.
Utiliza el archivo
Mensajes telefónicos fijos
Genera saludos y mensajes fuera de horario a partir de textos aprobados. Confirma que tu sistema telefónico acepte MP3 antes de subirlos; algunos sistemas requieren WAV o audio sin procesar.
Audio en la aplicación
Guarda instrucciones habladas o mensajes breves para reproducirlos en tu aplicación. Conserva el texto de origen junto a cada archivo para saber qué versión escucharán los usuarios.
Evaluación de voz
Compara voces con las mismas frases de prueba. Revisa la pronunciación y el ritmo antes de elegir una voz para un agente que atienda a clientes.
Preguntas frecuentes sobre texto a MP3
¿Cómo configuro MP3 como formato de salida de la API?
Usa el endpoint Bytes de texto a voz. Define output_format como {"container":"mp3","sample_rate":44100,"bit_rate":128000}. Incluye los demás campos obligatorios y la autenticación indicados en la referencia. Esto selecciona un MP3 de 44,1 kHz a 128 kbps; es una configuración compatible, no un requisito para todas las aplicaciones. La respuesta contiene bytes de audio, no una URL de descarga en JSON.
¿Puedo descargar el resultado como archivo MP3?
Sí. Introduce el texto en la herramienta de arriba, elige una voz y selecciona Crear MP3. Cuando el archivo esté listo, selecciona Descargar MP3. Para una aplicación, solicita MP3 a la API Bytes y guarda la respuesta correcta como archivo .mp3.
¿Es gratuita la conversión de texto a voz en MP3?
Puedes escuchar y descargar muestras breves de MP3 en esta página sin una cuenta. La generación mediante API consume los créditos de tu cuenta. Consulta los planes actuales de Cartesia para conocer los créditos incluidos, el uso adicional y las condiciones de uso comercial.
¿Debo utilizar MP3 o PCM para un agente de voz en tiempo real?
Usa el formato que espere la integración receptora. MP3 comprime el audio para reproducir archivos; PCM representa muestras de audio sin compresión MP3. Una llamada en directo puede requerir una codificación sin procesar y una frecuencia de muestreo específicas en lugar de MP3. Consulta la guía de integración de audio antes de elegir los parámetros de salida. Una descarga rápida de archivos no mide la latencia de extremo a extremo de una conversación.
¿Qué idiomas y controles de voz puedo utilizar?
Consulta la documentación actual del modelo Sonic para conocer los idiomas disponibles. Los modelos compatibles tienen controles de volumen, velocidad y emoción. Prueba la voz elegida en cada idioma de destino. Presta atención a los nombres, las abreviaturas y los números; la generación de voz sigue necesitando revisión para tu caso de uso.
¿Puedo utilizar voz generada para un saludo de IVR?
Sí, si tu sistema telefónico acepta el formato del archivo y tienes los derechos necesarios sobre la voz y el texto. Genera saludos fijos a partir de guiones aprobados y pruébalos mediante una conexión telefónica. Un saludo pregrabado no interpreta la respuesta de quien llama. Para llamadas interactivas, explora Cartesia Managed Agents.
¿La vista previa de esta página descarga un MP3?
Sí. Crear MP3 genera un archivo con el texto, la voz y el idioma seleccionados. Descargar MP3 aparece cuando termina la generación. Al editar el texto o cambiar la voz, se elimina la descarga anterior para que puedas crear un archivo nuevo con la selección actualizada.
¿Qué diferencia hay entre la frecuencia de muestreo y la tasa de bits de un MP3?
La frecuencia de muestreo indica cuántas veces se toma una muestra de audio por segundo. La tasa de bits indica cuántos datos de audio comprimido se almacenan por segundo. Elige parámetros compatibles con tu reproductor. El ejemplo de esta página usa 44100 muestras por segundo y 128000 bits por segundo; esos parámetros no son obligatorios para todos los proyectos.
¿Puedo convertir un documento o PDF en MP3?
Copia el texto que quieres escuchar y revísalo antes de generar audio. Elimina números de página, encabezados repetidos y otros elementos que no deban leerse en voz alta. La API de voz acepta texto; no extrae el texto de un PDF subido en esta página.
¿Por qué no se reproduce el MP3 guardado?
Comprueba primero que la solicitud a la API haya tenido éxito y que hayas guardado la respuesta como audio binario. Confirma que solicitaste un contenedor MP3 y que el reproductor admita los parámetros elegidos. Cambiar el nombre de un archivo WAV para que termine en .mp3 no convierte el formato de audio.
¿Cómo preparo un guion largo para una narración en MP3?
Empieza con un fragmento breve para elegir la voz y comprobar la pronunciación. Organiza los guiones largos en secciones que puedas revisar por separado y conserva la misma voz y los mismos parámetros de salida en todas ellas. Escucha cada transición antes de montar la narración final en tu editor. Conserva una copia del texto de origen para que una corrección posterior no obligue a reescribir todo el guion.
Sigue trabajando con tu voz
Compara voces para el próximo guion o aprende a generar voz desde tu aplicación.
Encuentra una voz para tu guion
Compara voces con un pasaje breve antes de producir el archivo final. Utiliza el generador para escuchar cómo interpreta cada voz tus palabras.
Probar el generador de vozGenerar audio con Python
Configura el SDK de Python y realiza tu primera solicitud de síntesis de voz. Empieza con el ejemplo completo y elige el formato de salida que necesita tu proyecto.
Crear con PythonEmpieza hoy
Habla con un experto.
Habla con nuestro equipo y descubre cómo puede ayudarte Cartesia a crear experiencias de voz de primer nivel.
Empieza a crear.
Accede a nuestros modelos mediante API y lleva un agente de voz a producción en minutos.