LuAITools.com
提交工具
🎙️AI
Convertir la voz en texto

Reconocimiento de voz

El reconocimiento de voz convierte lo que dices en texto. Es la capacidad central detrás de los asistentes de voz, los subtítulos y la transcripción: lo que deja a las máquinas «oír» el habla humana.

¿Qué es el reconocimiento de voz?

Le dices a tu móvil «qué tiempo hará mañana» y aparecen palabras en pantalla. Eso es el reconocimiento de voz (ASR). Su trabajo es fácil de enunciar y difícil de hacer: convertir las ondas sonoras del aire en líneas de texto que puedas buscar y procesar.

¿Cómo se convierte el sonido en texto?

Primero se trocea
El audio entrante se corta en tramos diminutos de unas pocas decenas de milisegundos, cada uno con rasgos acústicos como frecuencia y energía.
Un modelo acústico adivina los sonidos
Un modelo lee esos tramos y adivina qué sonidos se pronunciaron, produciendo una cadena de fonemas.
Un modelo de lenguaje corrige
Los fonemas no bastan: demasiadas palabras suenan igual. El modelo de lenguaje usa el contexto para decidir entre parecidas, y saca el texto más probable.

¿Dónde ha cambiado las cosas?

Asistentes de voz
Siri y Alexa entienden tus órdenes gracias al ASR.
Subtítulos automáticos
Los subtítulos de vídeos, reuniones y directos suelen generarse en tiempo real.
Transcripción
Las notas de entrevistas y reuniones ya no exigen reproducir y teclear a mano.
Accesibilidad
Permite a las personas sordas «ver» lo que otros dicen.

¿Qué sigue costando?

Los acentos, el ruido, las voces superpuestas y la jerga provocan errores. Aun así, con más datos y cómputo, la precisión ya iguala —o supera— a la de una persona promedio.

En resumen: el reconocimiento de voz convierte lo que dices en texto que una máquina puede leer.

Comentarios