Google publica un traductor de bolsillo con IA que funciona sin Internet

Un pequeño equipo de Google Creative Lab ha publicado Gemma Translator, un traductor de voz experimental capaz de funcionar completamente en local sobre una Raspberry Pi 5, sin enviar conversaciones a servidores externos y sin necesitar conexión a Internet después de completar la instalación inicial. El proyecto utiliza Gemma 4 E2B mediante LiteRT-LM y Google ha publicado tanto el código como los archivos STL necesarios para imprimir una carcasa en 3D. No es un producto comercial de Google, sino un proyecto experimental y abierto que cualquiera puede estudiar, modificar y montar por su cuenta.

Las claves de Gemma Translator en 30 segundos

  • Gemma Translator ejecuta Gemma 4 E2B directamente en una Raspberry Pi 5, sin depender de servicios cloud después de descargar el modelo.
  • Necesita 8 GB de RAM, micrófono, altavoz o auriculares y una pequeña pantalla.
  • Moonshine se encarga del reconocimiento de voz y moonshine-voice de convertir nuevamente el texto en audio.
  • La interfaz está desarrollada con React y puede funcionar como un pequeño dispositivo autónomo.
  • Google Creative Lab ha publicado código, scripts de instalación y archivos para imprimir la carcasa en 3D.

Lo realmente interesante del proyecto no está tanto en fabricar otro dispositivo portátil como en demostrar hasta qué punto un modelo generativo moderno puede empezar a abandonar el centro de datos. La traducción puede realizarse en el propio aparato y, una vez descargados los componentes necesarios, una conversación no necesita viajar hasta Google Cloud ni hasta ninguna otra API para ser procesada.

Este planteamiento abre casos de uso que van más allá de viajar sin cobertura. Ejecutar la inteligencia artificial localmente permite utilizarla en lugares con conectividad limitada, reduce la dependencia de un proveedor cloud y evita que el audio tenga que salir necesariamente del dispositivo para completar el proceso.

Una Raspberry Pi 5 ejecutando Gemma 4 en local

La configuración de referencia de Gemma Translator utiliza una Raspberry Pi 5 con 8 GB de memoria RAM. A ella se conectan un micrófono o interfaz de captura de audio, un altavoz o salida de auriculares y una pantalla, que puede ser táctil y de pequeño formato. El repositorio utiliza como ejemplo resoluciones de 480 x 320 píxeles.

El dispositivo funciona como una cadena de varios componentes especializados.

Primero captura la voz del usuario. Moonshine realiza el reconocimiento de voz, el texto resultante pasa a Gemma para generar la traducción y posteriormente moonshine-voice produce el audio que escucha la otra persona. El propio repositorio describe ese proceso como transcripción mediante Moonshine STT, traducción mediante Gemma y síntesis mediante moonshine-voice TTS.

Gemma Translator: offline DIY translation device built with Gemma 4 + Antigravity

Este punto permite corregir un detalle que está circulando en algunas descripciones del proyecto: la versión pública actual del repositorio no documenta Kokoro como motor de síntesis de voz. La documentación disponible identifica Moonshine para reconocimiento y moonshine-voice para TTS.

La interfaz está desarrollada con React y Vite, mientras que el backend utiliza Python. Un servidor API local comunica la aplicación con Gemma y LiteRT-LM. El proyecto puede iniciarse mediante un único script que levanta el servidor del modelo, la API y la interfaz web.

El resultado se parece más a un pequeño electrodoméstico de IA que a una aplicación web tradicional.

Gemma 4 E2B permite llevar un LLM hasta el edge

La pieza fundamental es Gemma 4 E2B, una de las variantes pequeñas de la nueva generación de modelos abiertos de Google.

Google diseñó E2B y E4B específicamente para dispositivos móviles y sistemas edge, mientras que las versiones mayores de Gemma 4 están orientadas a GPU de consumo y estaciones de trabajo. LiteRT-LM soporta actualmente las variantes E2B y E4B y proporciona APIs para Android, iOS, web, escritorio y Raspberry Pi.

El modelo E2B distribuido para LiteRT-LM ocupa aproximadamente 2,58 GB. Google ha publicado además mediciones sobre Raspberry Pi 5 que muestran hasta qué punto empieza a ser viable ejecutar este tipo de modelos sin una GPU dedicada de centro de datos.

En una Raspberry Pi 5 de 16 GB, la documentación de LiteRT-LM sitúa Gemma 4 E2B alrededor de 133 tokens por segundo durante la fase de prefill y unos 8 tokens por segundo de generación, con aproximadamente 7,8 segundos hasta el primer token en las pruebas de Google. Son mediciones concretas de laboratorio y no deben interpretarse como rendimiento garantizado para Gemma Translator, que además incorpora reconocimiento de voz, traducción y síntesis.

Lo importante es otra cosa: un dispositivo de consumo de bajo coste puede mantener un modelo lingüístico moderno funcionando sin una conexión permanente con un centro de datos.

LiteRT-LM es la capa que hace posible esta ejecución. Google la define como un sistema de orquestación para ejecutar modelos de lenguaje mediante LiteRT con aceleración de hardware y soporte multiplataforma. También está disponible para Raspberry Pi mediante sus APIs Python.

Sin Internet después de instalarlo

Gemma Translator necesita conectividad durante la preparación inicial.

Uno de los scripts incluidos descarga gemma4-e2b desde Hugging Face y lo importa al formato utilizado por LiteRT-LM. También hay que instalar previamente las dependencias de Python y Node.js.

Una vez completado ese proceso, la inferencia se realiza localmente y el proyecto no necesita Internet para traducir. Esa es precisamente una de sus características principales según la documentación oficial del repositorio.

La diferencia respecto a muchos traductores basados en inteligencia artificial es importante.

Un servicio cloud suele enviar el audio o el texto a un servidor remoto, donde modelos mucho mayores procesan la solicitud. Eso permite ofrecer mayor capacidad y actualizar el modelo de forma centralizada, pero introduce dependencia de la conexión y obliga a transmitir la información fuera del dispositivo.

Con una arquitectura local el intercambio cambia.

Traducción cloudGemma Translator
Requiere conectividadFunciona sin Internet tras la instalación
Procesamiento remotoInferencia en Raspberry Pi
Audio/texto puede salir del dispositivoProcesamiento local
Modelo gestionado por proveedorModelo descargado localmente
Infraestructura cloudHardware propio

La ejecución local tampoco significa privacidad absoluta por definición. El propio dispositivo debe estar bien protegido y cualquier modificación del software puede alterar su comportamiento. Pero evita una de las exposiciones más evidentes: enviar automáticamente cada conversación a un servicio externo para poder traducirla.

Dos personas pueden hablar utilizando el mismo dispositivo

La interfaz está pensada específicamente para conversaciones entre dos personas.

Gemma Translator muestra dos áreas, una para cada interlocutor. Cada una dispone de su propio idioma y el sistema permite capturar alternativamente la voz, traducirla y reproducir el resultado en la otra lengua.

El proyecto incorpora dos modos de control.

En horizontal se selecciona primero cuál de las dos personas está activa. La barra espaciadora cambia de interlocutor, la tecla Z funciona como push-to-talk y las flechas permiten cambiar el idioma.

El modo vertical asigna directamente diferentes controles a cada usuario.

Aunque el diseño incluye una pantalla que puede ser táctil, la implementación pública actual utiliza el teclado para iniciar las grabaciones y cambiar idiomas. El repositorio señala expresamente que los controles táctiles en pantalla todavía no están habilitados para esas funciones.

Esto ayuda a situar correctamente el proyecto.

Gemma Translator es una demostración funcional y reproducible, pero no un producto terminado comparable con un traductor comercial que se compra, se enciende y funciona inmediatamente.

Google también publica la carcasa para imprimirla

El repositorio incluye una carpeta stl con archivos destinados a la impresión 3D de la carcasa. Junto con el software, esto permite reproducir físicamente el prototipo utilizando componentes relativamente convencionales.

También incorpora un script específico para convertir una Raspberry Pi en un dispositivo prácticamente autónomo.

deploy-pi.sh instala los paquetes necesarios, prepara el entorno Python, construye la interfaz, descarga el modelo, registra Gemma Translator como servicio de systemd y configura Chromium para arrancar automáticamente en modo kiosco apuntando al servidor local.

De esta manera, después de encender la Raspberry Pi no hace falta abrir manualmente un IDE, iniciar varios procesos o introducir comandos continuamente.

El dispositivo se aproxima así a un aparato dedicado.

El código se distribuye bajo licencia Apache 2.0, al igual que Gemma 4 según la documentación actual de Google. Eso permite estudiar, modificar y reutilizar ampliamente el software respetando las condiciones de la licencia.

Que el software sea abierto no significa, evidentemente, que construir el aparato sea gratuito. Hay que comprar la Raspberry Pi, pantalla, almacenamiento, batería, componentes de audio y cualquier otro elemento físico necesario.

Es un experimento de Google Creative Lab, no un nuevo Pixel

También conviene matizar la autoría.

Gemma Translator se encuentra publicado dentro de la organización google-gemma de GitHub y ha sido creado por un pequeño equipo de Google Creative Lab, formado por Alan Yam, Shashwath Santosh y Dan Motzenbecker. El repositorio señala además que fue desarrollado con ayuda de Google Antigravity, la plataforma de desarrollo asistido por agentes presentada por Google.

Pero la propia documentación incluye una advertencia explícita: Gemma Translator no es un producto de Google con soporte oficial. Tampoco está incluido en el programa de recompensas por vulnerabilidades de software abierto de la compañía.

Por tanto, no existe por ahora un anuncio de que Google vaya a venderlo.

Su valor está más cerca de demostrar qué pueden construir los desarrolladores con Gemma 4, LiteRT-LM y hardware edge accesible.

Y ahí el proyecto resulta bastante más interesante que otro gadget de traducción.

La IA local empieza a competir con la nube en tareas concretas

Los grandes modelos de inteligencia artificial continúan necesitando enormes centros de datos, GPU y cantidades crecientes de electricidad. Pero al mismo tiempo está apareciendo un movimiento en la dirección contraria.

Modelos más pequeños y técnicas de ejecución optimizadas permiten trasladar ciertas tareas al móvil, al ordenador e incluso a placas como Raspberry Pi.

Gemma 4 refleja esa estrategia. Google ofrece cinco tamaños y reserva precisamente E2B y E4B para escenarios móviles y edge. La familia mantiene capacidades multimodales y soporte para más de 140 idiomas, aunque el rendimiento concreto de una tarea de traducción depende del idioma, la entrada y el dispositivo utilizado.

Google está trabajando además en optimizaciones como Multi-Token Prediction (MTP). Según sus mediciones, puede elevar hasta 2,2 veces la velocidad de decodificación en determinadas GPU móviles y hasta 1,5 veces en CPU móviles, dependiendo del modelo y la carga.

Estas mejoras tienen una consecuencia práctica.

La pregunta ya no es solamente si un modelo pequeño puede ejecutarse en local, sino qué aplicaciones dejan de necesitar realmente la nube.

Un traductor es un buen ejemplo. La tarea está acotada, la latencia importa, existen escenarios sin conexión y las conversaciones pueden contener información privada.

Otros casos pueden seguir el mismo camino: transcripción, resumen de documentos, clasificación, asistentes domésticos, análisis local de imágenes o determinadas automatizaciones.

Gemma Translator no demuestra que una Raspberry Pi vaya a sustituir a los grandes servicios de traducción online. Los modelos cloud mantienen ventajas claras en capacidad, infraestructura y posibilidad de utilizar sistemas mucho mayores.

Demuestra algo diferente: que para algunas tareas la IA ya puede viajar en el bolsillo sin necesitar enviar cada palabra a Internet.

Preguntas frecuentes

¿Qué es Gemma Translator?

Gemma Translator es un proyecto experimental de Google Creative Lab que permite construir un traductor de voz totalmente local utilizando Gemma 4, LiteRT-LM y una Raspberry Pi 5. El código y los archivos de la carcasa están publicados en GitHub.

¿Gemma Translator necesita Internet?

Necesita conexión inicialmente para instalar las dependencias y descargar el modelo. Después puede ejecutar la traducción sin conexión a Internet, ya que Gemma funciona directamente en el dispositivo.

¿Qué Raspberry Pi necesita?

La configuración documentada por el proyecto especifica una Raspberry Pi 5 con 8 GB de RAM, además de micrófono, salida de audio y una pantalla.

¿Google va a vender Gemma Translator?

No existe ningún anuncio de un producto comercial. El propio repositorio advierte de que Gemma Translator no es un producto oficialmente soportado por Google y debe considerarse un proyecto experimental.

Scroll al inicio