Herramientas / Reconocimiento de voz
Reconocimiento de voz, en directo en tu navegador
Únete a los equipos que dan el salto a Cartesia
Con Ink-2, n.º 1 en precisión de transcripción en streaming
La demo anterior utiliza Ink-2, nuestro modelo de reconocimiento de voz en streaming. Ocupa el primer puesto en Clasificación de inglés estadounidense de VoiceArena y prueba comparativa de streaming de Artificial Analysis, y transcribe correctamente a la primera datos estructurados como números de teléfono, correos electrónicos y UUID. La detección de turnos está integrada, por lo que la transcripción se divide en turnos automáticamente, y mantiene la precisión con ruido de fondo sin un filtro de limpieza independiente.
Ideal para
- Agentes de voz
- Subtítulos en directo
- Dictado
- Notas de reuniones
- Análisis de llamadas
Cómo funciona
Haz clic en el micrófono y habla. Las palabras aparecen mientras hablas, sin necesidad de registrarte.
Haz pausas o cambia de tema durante la transmisión. Ink-2 marca dónde empiezan y terminan los turnos para que la transcripción se lea como una conversación.
Copia la transcripción o utiliza el mismo modelo en streaming desde tu aplicación mediante la API.
Llévalo a producción
El modelo de esta página es el mismo Ink-2 disponible en nuestra API y nuestros SDK. Transmite audio en directo por WebSocket para uso en tiempo real o envía archivos terminados al endpoint por lotes. Indicación de términos clave orienta el reconocimiento hacia los nombres y la jerga que más escucha tu producto. Los planes Enterprise añaden despliegues locales, VPC y OEM sin conservación de datos.
Explorar más herramientas de voz
Preguntas frecuentes
¿Qué es el reconocimiento de voz?
El reconocimiento de voz, también llamado STT, ASR o transcripción, convierte audio hablado en palabras escritas. La versión de Cartesia utiliza Ink-2, un modelo en streaming, de modo que la transcripción aparece mientras sigues hablando, no después de terminar.
¿Es gratuita esta herramienta de reconocimiento de voz?
Sí. La demo de esta página transcribe el micrófono sin necesidad de cuenta. Una cuenta gratuita de Cartesia amplía los límites y los planes de pago añaden volumen de API para producción.
¿Qué idiomas admite?
Ink-2 transcribe inglés, francés, hindi, japonés y español, y detecta el idioma automáticamente. Está diseñado para uso en tiempo real; para archivos pregrabados, la API STT por lotes utiliza ink-whisper.
¿Qué es la detección de turnos?
La detección de turnos determina cuándo termina una persona de hablar y evita que el agente interrumpa o deje silencios. La mayoría de las soluciones añaden un modelo independiente de actividad de voz para ello. Ink-2 emite directamente eventos como turn.eager_end y turn.end, lo que elimina un modelo de la arquitectura y acelera las respuestas.
¿Puedo transcribir archivos de audio en lugar de usar el micrófono?
La demo de esta página funciona en directo con el micrófono. Para grabaciones, utiliza la API STT por lotes, que recibe un archivo completo y devuelve una transcripción.
¿Puedo ejecutarlo en mi propia infraestructura?
Sí. Ink-2 puede desplegarse en tus instalaciones, incluidos entornos aislados de la red, en tu propia VPC de AWS, GCP o Azure, o mediante una licencia OEM integrada en tu producto. Estos despliegues están disponibles bajo contratos empresariales.
Empieza hoy
Habla con un experto.
Habla con nuestro equipo y descubre cómo puede ayudarte Cartesia a crear experiencias de voz de primer nivel.
Empieza a crear.
Accede a nuestros modelos mediante API y lleva un agente de voz a producción en minutos.