IA

Google publica la ficha técnica de Nano Banana 2.1, el nuevo modelo multimodal de generación y edición de imágenes

La compañía detalla las capacidades del modelo perteneciente a la serie Gemini 3, destacando un rendimiento superior en generación de infografías, consistencia de personajes y edición frente a versiones anteriores como Nano Banana Pro.

Guardar
Compartir
Fotografía de Google DeepMind

    Google ha hecho pública la ficha técnica (Model Card) de Nano Banana 2.1, un modelo de inteligencia artificial nativamente multimodal perteneciente a la familia Gemini 3.

    Diseñado para la comprensión de entradas complejas en texto e imagen y la generación de respuestas en ambos formatos, el modelo toma como arquitectura base el desarrollo de Gemini 3.6 Flash, ofreciendo capacidades avanzadas en generación gráfica (Text-to-Image) y edición adaptada a múltiples idiomas.

    La plataforma soporta ventanas de contexto de entrada de hasta 1 millón de tokens y permite la salida de imágenes junto con respuestas de texto de hasta 64K tokens, distribuyéndose a través de los canales habituales de la compañía como la app de Gemini, Google AI Studio, Gemini API y Google Ads.

    Evaluación de rendimiento y benchmarks de generación

    Las pruebas comparativas (benchmarks) realizadas en octubre de 2026 muestran que Nano Banana 2.1 —tanto en su modalidad con razonamiento activo (Thinking) como sin él (No Thinking)— supera a sus predecesores, entre ellos Gemini 3.1 Flash Image ("Nano Banana 2") y Gemini 3 Pro Image ("Nano Banana Pro").

    En las evaluaciones a ciegas (SxS human eval), los resultados reflejan avances en categorías críticas de diseño y fidelidad:

    • Preferencia General: La versión Nano Banana 2.1 con razonamiento alcanzó una puntuación Elo de 1050, superando los 990 puntos de Nano Banana 2 y los 935 de Nano Banana Pro.
    • Diseño de Infografías: Logró una valoración de 1048 puntos frente a los 912 de la versión Pro previa, registrando a su vez una mejora sustancial en la factualidad del contenido visual (0,521 en la escala del test).
    • Consistencia en Edición: En la edición con múltiples personajes (Multi-Character Consistency), el modelo alcanzó los 1106 puntos, destacando sobre los 1011 puntos de la versión anterior, además de mostrar mejoras en la edición mediante bocetos (Mask/Ink-Based Editing) y consistencia de producto.

    Casos de uso, limitaciones conocidas y seguridad

    La compañía señala que Nano Banana 2.1 está optimizado para flujos de trabajo que exigen precisión profesional, renderizado de texto localizado en carteles o diagramas complejos e iteraciones rápidas de edición.

    Entre las limitaciones técnicas descritas en el documento figuran posibles dificultades en el renderizado de fuentes de tamaño reducido o párrafos extensos, ligeras imprecisiones en la alineación espacial (como la distinción izquierda/derecha) y casos puntuales donde se retiene la postura estructural de la imagen de origen durante la edición.

    En el apartado de seguridad, el modelo ha superado las evaluaciones de la Red de Seguridad Fronteriza (Frontier Safety Framework) y auditorías externas (red teaming), cumpliendo los umbrales de protección de menores y manteniendo las directrices éticas aplicadas a la familia Gemini 3.