Gemini 1.0: Google presenta su modelo multimodal más grande

Google DeepMind presentó el 6 de diciembre de 2023 Gemini 1.0, su nuevo modelo de IA de propósito general. La presentación, encabezada por Sundar Pichai y Demis Hassabis, lo posicionó como el modelo más capaz de Google hasta la fecha y como una respuesta directa a GPT-4 de OpenAI. Según los resultados de evaluación publicados por la compañía, Gemini Ultra supera los resultados previos del estado del arte en 30 de los 32 benchmarks académicos usados habitualmente en la evaluación de LLM (Large Language Models, modelos de lenguaje grande).

Tres tamaños para tres usos distintos

Gemini 1.0 llega en tres variantes con objetivos bien diferenciados. Gemini Ultra es el más grande: está pensado para tareas de alta complejidad en entornos de nube y centros de datos, y es el que protagoniza los resultados de benchmark. Gemini Pro, el más equilibrado, ha sido el primero en desplegarse en los productos de Google, empezando por Bard, el chatbot conversacional de la compañía. Gemini Nano opera directamente en dispositivos móviles sin necesidad de conexión al servidor, con modelos de 1.800 y 3.250 millones de parámetros, y se ha integrado en los Pixel 8 Pro.

Benchmarks: qué miden y qué hay que leer entre líneas

En el benchmark MMLU (Massive Multitask Language Understanding), que evalúa conocimientos en 57 materias distintas (matemáticas, derecho, medicina, física), Gemini Ultra obtuvo una puntuación del 90,0%, por encima del 86,4% de GPT-4 y del rendimiento humano experto, fijado en torno al 89,8%. En HumanEval, el benchmark de generación de código de OpenAI, Gemini Ultra alcanzó el 74,4% en la resolución de problemas de programación.

Con todo, los benchmarks de los propios fabricantes hay que leerlos con matices. Google seleccionó las evaluaciones en las que su modelo destaca y Gemini Ultra no estaba disponible al público en el momento del anuncio, por lo que la validación independiente a gran escala llegó semanas después. Además, el vídeo demostrativo que acompañó al lanzamiento fue criticado por mostrar interacciones editadas y aceleradas que no reflejaban el comportamiento real del modelo en tiempo real.

Capacidades multimodales

La apuesta técnica más relevante de Gemini es su naturaleza multimodal nativa: el modelo no trata el texto, la imagen, el audio y el vídeo como modalidades separadas que se conectan después del entrenamiento, sino que aprende de todas ellas de forma conjunta desde el inicio. Esto, según Google, le permite razonar de forma más integrada sobre inputs mixtos, algo que los modelos que añaden visibilidad mediante adaptadores (como los primeros GPT-4V) no hacen de la misma manera.

En código, Google presentó también AlphaCode 2, una especialización de Gemini para programación competitiva. Según los datos de la compañía, AlphaCode 2 resolvería correctamente el 43% de los problemas de la plataforma Codeforces, más del doble que su predecesor AlphaCode (8%), y superaría al 85% de los participantes humanos en esa misma plataforma.

Infraestructura y acceso

Gemini está entrenado en TPUs (Tensor Processing Units), los chips de cálculo propios de Google diseñados específicamente para cargas de trabajo de IA. La versión más reciente, la TPU v5e, ofrece hasta cuatro veces el rendimiento de sus predecesoras en tareas de entrenamiento de transformers. Esto da a Google una cierta independencia respecto a la escasez de GPUs NVIDIA que ha presionado al resto del mercado durante 2023.

Para desarrolladores y clientes empresariales, el acceso llega a través de dos vías: Google AI Studio, para prototipado rápido con la API de Gemini, y Google Cloud Vertex AI, para despliegues a escala en entornos gestionados. Gemini Ultra completa un proceso de evaluación de seguridad más extenso antes de su disponibilidad general.

La trayectoria de Gemini en los meses siguientes al lanzamiento no ha sido lineal. Los informes sobre el supuesto uso de Claude de Anthropic para mejorar Gemini muestran que el desarrollo de estos modelos no siempre sigue los caminos que las compañías presentan públicamente. Y si el debate de fondo te interesa, el trabajo de Sakana AI con su arquitectura Fugu plantea si el futuro de la IA estará en un único modelo gigante como Gemini Ultra o en sistemas de múltiples modelos especializados que colaboran.

Preguntas frecuentes sobre Gemini 1.0

¿Qué diferencia hay entre Gemini Ultra, Pro y Nano?

Gemini Ultra es el más grande y está pensado para tareas complejas en la nube. Gemini Pro es el modelo equilibrado desplegado en Bard y en servicios de Google. Gemini Nano funciona directamente en el dispositivo (como el Pixel 8 Pro) sin conectarse a la nube, con dos tamaños de 1.800 y 3.250 millones de parámetros.

¿Qué es el benchmark MMLU y qué puntuó Gemini?

MMLU (Massive Multitask Language Understanding) evalúa el conocimiento de un modelo en 57 materias académicas. Gemini Ultra obtuvo un 90,0% en este benchmark, por encima del 86,4% de GPT-4 y cerca del 89,8% que se considera rendimiento humano experto. Es una de las pruebas más usadas para comparar LLM de forma transversal.

¿Qué es AlphaCode 2?

AlphaCode 2 es una especialización de Gemini para programación competitiva. Google afirma que resuelve el 43% de los problemas de Codeforces, frente al 8% de su predecesor, y supera al 85% de los participantes humanos en esa plataforma. Mejora especialmente en problemas que requieren combinar razonamiento lógico y conocimiento de algoritmos.

¿Qué son las TPUs de Google y por qué las usan para Gemini?

Las TPUs (Tensor Processing Units) son aceleradores hardware diseñados por Google específicamente para cargas de trabajo de aprendizaje profundo. A diferencia de las GPUs genéricas, las TPUs están optimizadas para las operaciones matriciales de los transformers, lo que mejora el rendimiento por vatio gastado en entrenamiento e inferencia de modelos grandes.

¿Por dónde puedo acceder a Gemini como desarrollador?

Google ofrece dos puntos de entrada: Google AI Studio para prototipado con la API de Gemini (acceso gratuito con límites de cuota), y Google Cloud Vertex AI para despliegues en producción con soporte empresarial. La integración con Bard, luego renombrado Gemini, fue el primer punto de acceso público para usuarios no técnicos.

Scroll al inicio