Whisper large-v3: qué cambia en el reconocimiento automático de voz de OpenAI

OpenAI presentó Whisper large-v3 en noviembre de 2023 como la versión más avanzada de su modelo de reconocimiento automático de habla (ASR, del inglés Automatic Speech Recognition) y traducción de audio. El modelo mejora a su predecesor, large-v2, entre un 10% y un 20% en tasa de error de palabras (WER), según datos del propio equipo de OpenAI, y está disponible en Hugging Face Hub para investigadores y desarrolladores.

Whisper no es un proyecto nuevo: el modelo original se describió en el paper «Robust Speech Recognition via Large-Scale Weak Supervision» de Alec Radford y colaboradores de OpenAI. La arquitectura es un Transformer encoder-decoder entrenado con audio etiquetado y pseudoetiquetado en decenas de idiomas. large-v3 añade dos cambios técnicos destacados respecto a v2: usa 128 bins de frecuencia Mel en lugar de 80, y añade un token específico para el cantonés, que antes no tenía soporte explícito.

Cómo está entrenado Whisper large-v3

El modelo original de la familia Whisper se entrenó con 680.000 horas de audio etiquetado. large-v3 añade 1 millón de horas de audio etiquetado débilmente y 4 millones de horas de audio pseudoetiquetado, generado con Whisper large-v2 sobre nuevas grabaciones. El volumen de datos es uno de los factores que explica la mejora en generalización: el modelo funciona sin fine-tuning específico en la mayoría de dominios.

La familia Whisper tiene cinco tamaños (tiny, base, small, medium y large), con variantes monolingüe en inglés y multilingues para cada uno. Los diez checkpoints preentrenados están disponibles en Hugging Face Hub. La versión large-v3 es la más capaz pero también la que más recursos necesita en inferencia.

Velocidad y eficiencia en producción

Whisper large-v3 es compatible con la librería Transformers de Hugging Face. Puede transcribir archivos de audio de cualquier duración y, con las implementaciones optimizadas disponibles, llega a ser hasta 9 veces más rápido que el algoritmo secuencial original de OpenAI.

Para sacar el máximo rendimiento en GPU, el equipo recomienda Flash Attention 2 en hardware compatible, que mejora tanto la velocidad como el consumo de memoria. En GPUs que no soporten Flash Attention hay alternativa con BetterTransformers. La reducción en uso de memoria es especialmente relevante para despliegues con recursos ajustados. La colaboración entre Qualcomm y Hugging Face para extender modelos como este desde el móvil hasta el cloud es parte del mismo movimiento hacia la eficiencia en inferencia.

Fine-tuning y límites del modelo

Whisper large-v3 generaliza bien sin ajustes adicionales en la mayoría de casos, pero el fine-tuning en datos de dominio específico (jerga médica, idiomas con poca representación en el conjunto de entrenamiento) puede mejorar el rendimiento de forma notable. OpenAI recomienda evaluar el modelo en el contexto de aplicación concreto antes de desplegarlo en producción.

El modelo tiene dos limitaciones conocidas. La primera son las repeticiones: en ciertos audios, especialmente con silencios o ruido de fondo, Whisper puede generar texto repetido en bucle. La segunda son las alucinaciones: el modelo puede inventar palabras o frases no presentes en el audio original cuando el contexto acústico es ambiguo. Estas limitaciones no son nuevas en la familia Whisper, aunque la v3 las reduce en comparación con versiones anteriores.

Aplicaciones reales y uso responsable

Los usos más directos de Whisper son la transcripción de podcasts, reuniones y material audiovisual, la generación de subtítulos automáticos y la traducción de audio a otro idioma. La mejora en accesibilidad es uno de los casos de uso con más impacto potencial: subtitular en tiempo cercano al real contenido que antes requireía transcriptores humanos.

El propio OpenAI señala que Whisper no está diseñado para transcripción en tiempo real estricto, aunque su velocidad optimizada lo acerca a ese caso de uso en determinados hardware. También advierte sobre el uso dual: las mismas capacidades que sirven para accesibilidad pueden usarse para reconocimiento de habla de individuos en entornos de vigilancia. La decisión de publicar los pesos del modelo de forma abierta implica que OpenAI no controla estos usos una vez publicado. La evolución de la infraestructura de OpenAI para abaratar la inferencia afecta directamente a cuán accesibles son modelos como Whisper a gran escala.

Preguntas frecuentes

¿Qué es Whisper de OpenAI?

Whisper es un modelo de reconocimiento automático de habla (ASR) y traducción de audio desarrollado por OpenAI. Está entrenado con más de 680.000 horas de audio etiquetado y soporta docenas de idiomas con capacidad de transcripción y traducción sin fine-tuning previo.

¿Qué mejora Whisper large-v3 respecto a large-v2?

Large-v3 reduce la tasa de error de palabras (WER) entre un 10% y un 20% respecto a large-v2, usa 128 bins de frecuencia Mel (frente a 80) y añade soporte explícito para el cantonés con un nuevo token de idioma.

¿Cómo se puede usar Whisper large-v3?

El modelo está disponible en Hugging Face Hub y es compatible con la librería Transformers. Se puede usar directamente para transcribir audio o ajustar con fine-tuning en datos de dominio específico para mejorar su rendimiento en casos de uso concretos.

¿Cuáles son las limitaciones conocidas de Whisper?

El modelo puede generar texto repetido en audios con silencios o ruido de fondo, y puede alucinar (inventar) palabras no presentes en el audio cuando el contexto acústico es ambiguo. Tampoco está optimizado para transcripción estrictamente en tiempo real.

¿Puedo hacer fine-tuning de Whisper large-v3?

Sí. El fine-tuning en datos de dominio específico puede mejorar el rendimiento, especialmente en idiomas con poca representación en el conjunto de entrenamiento o en vocabulario técnico. OpenAI recomienda evaluar el modelo en el contexto de uso concreto antes del despliegue.

Scroll al inicio