¿Qué es el reconocimiento de voz?
Le dices a tu móvil «qué tiempo hará mañana» y aparecen palabras en pantalla. Eso es el reconocimiento de voz (ASR). Su trabajo es fácil de enunciar y difícil de hacer: convertir las ondas sonoras del aire en líneas de texto que puedas buscar y procesar.¿Cómo se convierte el sonido en texto?
Primero se troceaEl audio entrante se corta en tramos diminutos de unas pocas decenas de milisegundos, cada uno con rasgos acústicos como frecuencia y energía.
Un modelo acústico adivina los sonidos
Un modelo lee esos tramos y adivina qué sonidos se pronunciaron, produciendo una cadena de fonemas.
Un modelo de lenguaje corrige
Los fonemas no bastan: demasiadas palabras suenan igual. El modelo de lenguaje usa el contexto para decidir entre parecidas, y saca el texto más probable.
¿Dónde ha cambiado las cosas?
Asistentes de vozSiri y Alexa entienden tus órdenes gracias al ASR.
Subtítulos automáticos
Los subtítulos de vídeos, reuniones y directos suelen generarse en tiempo real.
Transcripción
Las notas de entrevistas y reuniones ya no exigen reproducir y teclear a mano.
Accesibilidad
Permite a las personas sordas «ver» lo que otros dicen.
¿Qué sigue costando?
Los acentos, el ruido, las voces superpuestas y la jerga provocan errores. Aun así, con más datos y cómputo, la precisión ya iguala —o supera— a la de una persona promedio.En resumen: el reconocimiento de voz convierte lo que dices en texto que una máquina puede leer.
Comentarios