Voicebox convierte Claude en un asistente de voz local mediante MCP

Voicebox, el proyecto abierto creado por Jamie Pine, reúne clonación de voz, síntesis de habla, dictado y conexión con agentes de inteligencia artificial en una aplicación que procesa el audio en el dispositivo. Su repositorio supera las 42.600 estrellas y 5.200 bifurcaciones en GitHub, menos de seis meses después de publicar su primera versión.

Las claves de Voicebox en 20 segundos

  • Voicebox reúne clonación, síntesis, dictado y transcripción en una aplicación local con licencia MIT.
  • Integra siete motores TTS, aunque solo Chatterbox Multilingual alcanza 23 idiomas.
  • Claude Code, Cursor, Cline y Windsurf pueden hablar mediante voicebox.speak.
  • Los modelos deben descargarse primero y el servidor MCP local aún no incorpora autenticación.

La comparación con ElevenLabs y Wispr Flow ayuda a entender su rápida popularidad, pero necesita algunos matices. Voicebox combina en una misma interfaz funciones que esos servicios ofrecen principalmente desde la nube: generación de voz, clonación, transcripción y dictado. A cambio, el usuario aporta el ordenador, el almacenamiento y la capacidad de cálculo.

El proyecto está publicado bajo licencia MIT y su código puede utilizarse, modificarse e integrarse en otras aplicaciones. Esto no significa que todos los modelos incluidos compartan automáticamente esa misma licencia: cada motor de voz mantiene sus propias condiciones, que deben revisarse antes de emplearlo en productos comerciales.

Siete motores de voz detrás de una sola interfaz

Voicebox no ha desarrollado desde cero un nuevo modelo capaz de reemplazar a ElevenLabs. Su aportación consiste en reunir diferentes tecnologías abiertas detrás de una aplicación común, con perfiles de voz, gestión de modelos, efectos, transcripción, una API REST y un servidor basado en Model Context Protocol (MCP).

La plataforma admite siete motores de texto a voz o TTS, siglas de text to speech. Cinco pueden clonar una voz a partir de una grabación de referencia. Kokoro y Qwen CustomVoice trabajan principalmente con voces prediseñadas.

MotorIdiomasUso principal
Qwen3-TTS10Clonación multilingüe y control de la forma de hablar
Qwen CustomVoice10Voces prediseñadas sin audio de referencia
LuxTTS1Generación ligera en inglés, incluso mediante CPU
Chatterbox Multilingual23Mayor cobertura lingüística
Chatterbox Turbo1Voz expresiva con risas, suspiros y otros sonidos
TADAHasta 10Generación prolongada y coherente
Kokoro8Más de 50 voces prediseñadas y bajo consumo

Por tanto, la afirmación de que Voicebox clona cualquier voz en 23 idiomas simplifica su funcionamiento. La cifra máxima corresponde a Chatterbox Multilingual. Qwen3-TTS y TADA cubren menos lenguas, mientras LuxTTS y Chatterbox Turbo están centrados en inglés.

Para crear un perfil se recomienda aportar entre 10 y 30 segundos de voz clara, sin música, ruido de fondo ni otras personas hablando. Las grabaciones inferiores a cinco segundos pueden funcionar, pero el propio proyecto avisa de que suelen producir peores resultados. También permite añadir varias muestras para mejorar la representación de una voz.

La aplicación utiliza Tauri y Rust para la capa de escritorio, React y TypeScript para la interfaz, y un servidor FastAPI escrito en Python para los procesos de inteligencia artificial. La inferencia se ejecuta con MLX en los Mac con Apple Silicon o mediante PyTorch, CUDA, ROCm, DirectML, Intel XPU y CPU en otros equipos. Los perfiles, audios y transcripciones se guardan en una base de datos SQLite y en el directorio local de la aplicación.

Voicebox incorpora además Whisper para convertir voz en texto. Un atajo global permite mantener una combinación de teclas, hablar y pegar la transcripción en el campo que estuviera seleccionado. En macOS y Windows puede restaurar el contenido anterior del portapapeles después de insertar el texto.

La herramienta también incluye un editor multipista para conversaciones y pódcast, generación de textos de hasta 50.000 caracteres mediante fragmentación automática y efectos como reverberación, compresión, cambio de tono, retardo y filtros.

Cómo Claude Code habla mediante una llamada a MCP

La versión 0.5.0 añadió un servidor MCP integrado. Este protocolo permite que un agente descubra y utilice herramientas externas mediante una interfaz estructurada, sin que cada integración necesite un conector completamente distinto.

Voicebox expone cuatro herramientas:

Herramienta MCPFunción
voicebox.speakReproduce un texto con un perfil de voz
voicebox.transcribeConvierte un archivo de audio en texto
voicebox.list_profilesEnumera las voces disponibles
voicebox.list_capturesConsulta grabaciones y dictados anteriores

Cuando Claude Code ejecuta voicebox.speak, no recibe el modelo de voz ni realiza directamente la clonación. Envía el texto al servidor local de Voicebox, que selecciona el perfil, genera el audio con el motor configurado y lo reproduce en el ordenador.

El usuario puede asignar voces diferentes a cada agente. Claude Code podría utilizar un perfil, Cursor otro y Cline un tercero. Una pequeña ventana flotante muestra qué voz está hablando durante toda la reproducción, una medida pensada para evitar que los agentes generen audio en segundo plano sin una indicación visible.

La conexión puede configurarse mediante HTTP en 127.0.0.1:17493/mcp o mediante el ejecutable local incluido para clientes que utilizan el transporte estándar de entrada y salida. El repositorio también incorpora una configuración preparada para que Claude Code detecte las herramientas cuando se ejecuta dentro del proyecto.

La expresión “Claude puede hablar sin conexión” tampoco es completamente exacta. Voicebox puede generar el audio sin conectarse a la nube una vez descargados los modelos, pero Claude Code normalmente necesita internet para comunicarse con los sistemas de Anthropic. La parte de síntesis es local; el agente que decide qué decir puede continuar dependiendo de un servicio remoto.

Lo mismo ocurre con Cursor y otras aplicaciones. Voicebox mantiene las muestras y el procesamiento de voz en el equipo, pero no controla los datos que cada agente envía a su propio proveedor.

Gratuito no significa que no tenga costes

Voicebox no cobra una cuota ni limita la cantidad de audio generado. El coste se traslada al hardware, el almacenamiento y la electricidad del equipo.

Los modelos se descargan desde Hugging Face durante su primer uso. Kokoro ocupa unos 350 MB, Qwen3-TTS 1.7B alrededor de 3,5 GB y TADA 3B llega a unos 8 GB. La documentación fija un mínimo de 8 GB de RAM y 5 GB libres, aunque recomienda 16 GB de memoria, al menos 10 GB de almacenamiento y una GPU compatible para trabajar con mayor velocidad.

La CPU puede ejecutar varios motores, pero la generación será más lenta. LuxTTS y Kokoro están mejor adaptados a equipos modestos, mientras los modelos de mayor tamaño necesitan más memoria gráfica.

Existen instaladores para macOS y Windows, además de una imagen Docker. Linux todavía no dispone de paquetes binarios oficiales y requiere compilar desde el código fuente o utilizar contenedores. El repositorio acumula cientos de incidencias y solicitudes abiertas, algo habitual en un proyecto joven que ha crecido con rapidez.

La comparación económica también ha cambiado respecto a las cifras difundidas inicialmente:

ServicioPrecio individual actualModelo de ejecución
VoiceboxGratuitoLocal
ElevenLabs Starter6 dólares al mesNube
ElevenLabs Creator22 dólares al mesNube
ElevenLabs Pro99 dólares al mesNube
ElevenLabs Scale299 dólares al mesNube
ElevenLabs Business990 dólares al mesNube
Wispr Flow BasicGratuito, con límitesNube y aplicaciones
Wispr Flow Pro15 dólares al mes o 12 con pago anualNube y aplicaciones

ElevenLabs también mantiene una modalidad gratuita. Sus planes incluyen créditos mensuales, infraestructura gestionada, API, modelos propios y opciones empresariales. Wispr Flow ofrece dictado en más de 100 idiomas, aplicaciones móviles, soporte y controles corporativos. Voicebox no reproduce necesariamente su calidad, latencia, escalabilidad o garantías de servicio.

Su ventaja está en otro lugar: permite trabajar sin enviar las muestras de voz a un proveedor, no establece cuotas de caracteres y ofrece acceso al código. Resulta atractivo para desarrolladores, estudios independientes, aplicaciones de accesibilidad, videojuegos, producción de pódcast y entornos donde la privacidad pesa más que la comodidad de una API gestionada.

El servidor MCP local todavía confía en todos los procesos del equipo

El procesamiento local reduce la exposición a terceros, pero no elimina los riesgos de seguridad. La documentación reconoce que el servidor MCP no utiliza autenticación en la versión 0.5.0.

El servicio escucha únicamente en la dirección local 127.0.0.1, así que no debería ser accesible directamente desde internet. Sin embargo, cualquier proceso que pueda conectarse a ese puerto dentro del ordenador puede llamar a sus herramientas.

Esto significa que una aplicación maliciosa ejecutada con los permisos del usuario podría pedir a Voicebox que reproduzca un audio, enumere perfiles o consulte capturas. La incorporación de un token de autenticación está prevista, pero todavía figura en la lista de trabajo pendiente.

La exposición puede aumentar cuando el servidor se configura para escuchar en una interfaz de red distinta de localhost. Ese uso requiere cortafuegos, autenticación y una red de confianza, aunque la configuración inicial no proporcione todas esas medidas automáticamente.

La clonación de voz plantea además problemas que no se resuelven técnicamente mediante la ejecución local. Voicebox no puede verificar que la persona que instala el programa tenga permiso para utilizar una grabación.

El documento de uso responsable permite clonar la voz propia, una voz autorizada o material con licencia. Rechaza expresamente la suplantación, el fraude, el phishing, eludir sistemas de autenticación vocal y crear comunicaciones políticas, médicas, financieras o de emergencia engañosas. Son normas declarativas: una aplicación local no puede comprobar por sí sola la procedencia de cada muestra.

Voicebox no ha reemplazado de golpe a las plataformas comerciales de voz. Ha demostrado algo más concreto: las piezas abiertas disponibles ya permiten construir en un ordenador personal un flujo completo que hace unos años requería contratar varios servicios.

Su éxito en GitHub responde a esa combinación. No ofrece únicamente un clonador, sino una capa local de entrada y salida de voz para aplicaciones y agentes. La llamada voicebox.speak es la función más llamativa, pero el cambio técnico está en que Claude, Cursor o cualquier cliente MCP pueden tratar una voz como otra herramienta disponible en el sistema.

Preguntas frecuentes

¿Voicebox puede clonar una voz con diez segundos de audio?

Sí, aunque recomienda entre 10 y 30 segundos de grabación clara. La calidad depende del ruido, la pronunciación, el motor elegido y la semejanza entre el idioma de la muestra y el texto generado.

¿Claude recibe la grabación o el perfil de voz?

No en el flujo normal de voicebox.speak. Claude envía el texto al servidor local y Voicebox genera el audio en el equipo.

¿Voicebox funciona completamente sin internet?

La síntesis y la transcripción pueden funcionar sin conexión después de descargar los modelos. El primer uso necesita internet y agentes cloud como Claude Code seguirán requiriendo conexión para generar sus respuestas.

¿Es una alternativa directa a ElevenLabs y Wispr Flow?

Reúne parte de sus funciones, pero no ofrece la misma infraestructura gestionada, soporte, aplicaciones móviles o garantías empresariales. Su principal diferencia es la ejecución local y el acceso abierto al código.

Scroll al inicio