Gemma 4 en local con Ollama: una IA privada y sin pagar por cada consulta

Google DeepMind está llevando una parte cada vez mayor de las capacidades de sus modelos de inteligencia artificial al ordenador del usuario. Gemma 4 puede ejecutarse localmente con herramientas como Ollama, sin enviar cada consulta a un servicio cloud, sin consumir una API de pago y con versiones suficientemente pequeñas para funcionar en ordenadores personales. Google lanzó la familia en abril de 2026 y la ha ampliado posteriormente con nuevos modelos, cuantización y mejoras orientadas a la ejecución local.

Las claves de Gemma 4 en local en 30 segundos

  • Gemma 4 ofrece modelos E2B, E4B, 12B, 26B A4B y 31B para diferentes niveles de hardware.
  • Ollama permite descargarlos y ejecutarlos desde Windows, macOS y Linux con unos pocos comandos.
  • Los modelos pueden trabajar localmente con texto e imágenes; E2B, E4B y 12B también admiten audio.
  • La ejecución local evita enviar los prompts a una API externa cuando todo el flujo permanece en el equipo.
  • Ollama expone además una API local para integrar Gemma 4 en scripts, aplicaciones y herramientas para desarrolladores.

La propuesta resulta especialmente interesante para desarrolladores y administradores de sistemas. Un modelo local puede servir para revisar código, resumir documentación, interpretar logs, generar comandos, trabajar con información interna o experimentar con agentes sin que cada prueba genere consumo facturable en una API.

Eso no convierte automáticamente a Gemma 4 en sustituto de los modelos comerciales más potentes. El rendimiento depende del modelo seleccionado y, sobre todo, del hardware disponible. La diferencia es que la IA local ha alcanzado un nivel en el que ya puede cubrir una parte relevante del trabajo cotidiano.

Qué es Gemma 4 y qué modelo elegir

Gemma 4 es la generación presentada por Google DeepMind en abril de 2026 como sucesora de Gemma 3. La familia utiliza modelos de pesos abiertos y está disponible bajo licencia Apache 2.0. Google señala además compatibilidad con más de 140 idiomas y una ventana de contexto que puede alcanzar los 256.000 tokens dependiendo de la variante.

La gama actual tiene cinco tamaños principales:

ModeloArquitecturaContextoOrientación
Gemma 4 E2BEdge128KEquipos con recursos limitados
Gemma 4 E4BEdge128KPortátiles y equipos personales
Gemma 4 12BDensa unificada256KPC con más memoria/GPU
Gemma 4 26B A4BMoE256KGPU y estaciones de trabajo
Gemma 4 31BDensa256KHardware de mayores prestaciones

La letra E de E2B y E4B hace referencia a parámetros «efectivos». Google especifica que E4B tiene aproximadamente 4.500 millones de parámetros efectivos y 8.000 millones contando embeddings, mientras que E2B alcanza 2.300 millones efectivos.

Para comenzar no es necesario descargar el modelo más grande. E4B tiene bastante sentido como primera prueba en un ordenador moderno, mientras que E2B reduce las exigencias para equipos más modestos.

Los modelos superiores permiten ir más lejos, pero también incrementan el consumo de RAM o VRAM y almacenamiento. El 26B resulta especialmente interesante porque utiliza una arquitectura Mixture of Experts (MoE) con unos 4.000 millones de parámetros activos.

Cómo instalar Gemma 4 con Ollama

Una de las formas más sencillas de ejecutar Gemma 4 es Ollama. El proyecto abstrae buena parte de la complejidad que normalmente acompaña a la descarga, configuración y ejecución de un modelo.

Después de instalar Ollama puede comprobarse desde el terminal:

ollama --version

En Linux el instalador oficial puede ejecutarse con:

curl-fsSL https://ollama.com/install.sh | sh

Una vez instalado, descargar y ejecutar Gemma 4 E4B requiere básicamente:

ollama run gemma4:e4b

Ollama descargará los archivos necesarios si todavía no existen localmente y abrirá una conversación interactiva.

También pueden descargarse previamente:

ollama pull gemma4:e4b

Para comprobar los modelos disponibles:

ollama list

Y para lanzar posteriormente Gemma:

ollama run gemma4:e4b

Ollama ofrece actualmente etiquetas para E2B, E4B, 12B, 26B y 31B.

El resultado es parecido al de utilizar un chatbot convencional, pero la inferencia se produce en el hardware local.

Esto permite, por ejemplo, pedir:

Explica este error de systemd y propón tres comprobaciones.

O algo más propio del trabajo diario de un administrador:

Escribe un comando Bash para localizar archivos de más de 100 MB.

También puede utilizarse para programación:

Revisa esta función Python, busca errores y propón una versión más eficiente.

Gemma 4 está específicamente orientado también a programación, razonamiento, uso de herramientas y flujos de trabajo con agentes.

La ventaja más importante puede ser la privacidad

Ejecutar un LLM local cambia bastante el tratamiento de determinados datos.

Un administrador podría analizar un fragmento de un log interno sin enviarlo necesariamente a un servicio externo. Un desarrollador puede consultar código propietario y una empresa puede crear pequeñas automatizaciones sobre documentación privada manteniendo el procesamiento dentro de su infraestructura.

Eso sí, usar un modelo local no convierte automáticamente toda una aplicación en privada. Si posteriormente el software envía resultados, telemetría, documentos o prompts a otros servicios externos, esa ventaja desaparece parcialmente. La privacidad depende del flujo completo.

También existe otra diferencia práctica: no hay facturación por token cuando la inferencia se realiza exclusivamente en el hardware propio.

No significa que ejecutar IA sea literalmente gratis. Hay consumo eléctrico, almacenamiento, memoria y coste del propio equipo. En despliegues profesionales, además, existen costes de administración y mantenimiento.

Para un desarrollador que ya dispone de un portátil o workstation, sin embargo, el coste marginal de realizar otra consulta puede ser prácticamente irrelevante.

Una API de IA funcionando en localhost

Para sysadmins y desarrolladores posiblemente la característica más interesante de Ollama no sea su interfaz de chat.

Ollama ejecuta un servicio local que permite comunicarse con los modelos mediante API. Por defecto utiliza el puerto 11434.

Una aplicación puede enviar una petición a:

http://localhost:11434/api/generate

Esto permite integrar Gemma 4 en scripts propios.

Por ejemplo, una organización podría crear un proceso que recogiese errores de una aplicación, eliminase previamente información sensible y pidiese al modelo una primera clasificación.

También podrían construirse herramientas para:

  • resumir logs;
  • explicar errores;
  • generar documentación;
  • clasificar incidencias;
  • revisar configuraciones;
  • generar consultas SQL;
  • analizar código;
  • crear borradores de scripts;
  • procesar documentación interna.

Aquí es donde un LLM local deja de ser simplemente otro chatbot y empieza a convertirse en un servicio de infraestructura.

Una aplicación puede consumir el modelo de forma parecida a una API cloud, con la diferencia de que el endpoint se encuentra dentro del propio ordenador o servidor.

Gemma 4 también puede analizar imágenes

Otra diferencia respecto a muchos pequeños modelos locales anteriores es la multimodalidad.

Google especifica que toda la familia Gemma 4 admite texto e imágenes como entrada, mientras que E2B, E4B y 12B incorporan además entrada de audio. La salida es textual.

Eso permite utilizar una captura de pantalla como parte de una consulta.

Un administrador podría proporcionar la imagen de un dashboard y pedir que identifique qué información aparece. Un desarrollador podría analizar una captura de un error o una interfaz.

La capacidad resulta especialmente útil cuando la información que se quiere interpretar no está disponible cómodamente como texto.

Google ha llevado esta filosofía incluso a dispositivos pequeños. El proyecto experimental Gemma Translator presentado recientemente utiliza Gemma 4 E2B sobre una Raspberry Pi 5 de 8 GB para realizar traducción sin depender de Internet, acompañado por otros modelos locales para reconocimiento y síntesis de voz.

Apple Silicon se está convirtiendo en una plataforma interesante para IA local

Los Mac con Apple Silicon también están recibiendo bastante atención dentro de Ollama.

En junio de 2026 el proyecto anunció mejoras para Gemma 4 mediante MLX y Multi-Token Prediction (MTP). Según las pruebas publicadas por Ollama, esta combinación puede mejorar hasta un 90 % el rendimiento en determinados escenarios con agentes de programación, aunque esa cifra corresponde a sus propias mediciones con Aider Polyglot y no debe generalizarse a cualquier carga.

Es una muestra de otro cambio importante.

La carrera por los modelos locales ya no consiste únicamente en reducir parámetros. Los desarrolladores están trabajando en cuantización, arquitecturas MoE, cachés, motores específicos para cada hardware y técnicas que permiten generar varios tokens de manera más eficiente.

Google publicó precisamente en junio versiones de Gemma 4 preparadas mediante Quantization-Aware Training (QAT) para reducir los requisitos de memoria y mejorar la ejecución en dispositivos personales.

La IA local no sustituye necesariamente a ChatGPT, Claude o Gemini

Hay que evitar una comparación demasiado sencilla.

Ejecutar Gemma 4 E4B en un portátil y utilizar uno de los modelos más avanzados alojados en enormes clústeres de GPU son escenarios diferentes.

Los grandes modelos cloud pueden seguir ofreciendo ventajas importantes en razonamiento complejo, investigación, contexto, herramientas, agentes y tareas especialmente exigentes.

Pero no todas las consultas necesitan ese nivel de capacidad.

Para explicar un script Bash, resumir un fichero, generar una expresión regular, revisar una función, clasificar un log o analizar documentación interna, un modelo local puede resultar suficiente.

Y ahí aparece un modelo híbrido que probablemente tenga bastante recorrido: IA local para tareas frecuentes, privadas o automatizadas y modelos cloud para problemas que realmente necesiten más capacidad.

Para departamentos de sistemas incluso puede trasladarse el concepto del portátil al centro de datos. Ollama facilita experimentar en una máquina personal, pero los mismos modelos abiertos pueden desplegarse posteriormente utilizando infraestructuras con GPU y motores de inferencia pensados para atender múltiples usuarios.

La consecuencia es que una empresa ya no tiene que plantearse únicamente qué proveedor de IA contratar. También puede decidir qué parte de su IA quiere ejecutar dentro de su propia infraestructura.

Gemma 4 hace que experimentar con esa idea sea especialmente sencillo: instalar Ollama, descargar unos cuantos gigabytes y empezar a hablar con un modelo que funciona en el propio ordenador.

Preguntas frecuentes

¿Se puede ejecutar Gemma 4 sin Internet?

Sí. Una vez descargados Ollama y los archivos del modelo, la inferencia puede realizarse localmente sin conexión. Determinadas integraciones externas sí pueden requerir Internet.

¿Qué versión de Gemma 4 conviene instalar primero?

E4B es una opción razonable para un ordenador moderno, mientras que E2B está orientado a dispositivos con recursos más limitados. Los modelos 12B, 26B y 31B requieren progresivamente más capacidad.

¿Gemma 4 puede analizar imágenes?

Sí. Google define Gemma 4 como una familia multimodal capaz de recibir texto e imágenes. Los modelos E2B, E4B y 12B también admiten audio como entrada.

¿Gemma 4 puede integrarse en aplicaciones propias?

Sí. Ollama proporciona una API local que permite consumir los modelos desde scripts y aplicaciones, lo que hace posible utilizar Gemma 4 para automatización, programación, análisis de logs y otros procesos internos.

Scroll al inicio