Funciones básicas
- Texto → Imagen: generación completamente guiada por el prompt con fuerte adherencia al prompt.
- Imagen → Imagen (ediciones): ediciones finas y específicas manteniendo la consistencia del sujeto/personaje a lo largo de múltiples ediciones.
- Resolución máxima de salida: hasta 4K (los ejemplos y los tamaños exactos de píxeles admitidos dependen de la relación de aspecto; la API ofrece presets 1K/2K/4K).
- Planificación iterativa y autocorrección: un pipeline interno “multietapa” que detecta y corrige errores visuales comunes (perspectiva, texto, geometría fina).
- Renderizado avanzado de texto en imagen: texto multilingüe claro y legible (de subtítulos cortos a párrafos largos) adecuado para carteles, maquetas e infografías.
- 5 personajes y fidelidad para hasta 14 objetos/imágenes de referencia en un único flujo de trabajo.
- Marca de agua / procedencia: todas las imágenes generadas incluyen una marca de agua SynthID; el modelo incrusta metadatos C2PA para procedencia en algunas integraciones de producto.
Versiones y nomenclatura de Gemini 3 Pro Image
gemini-3-pro-image-previewgemini-3-pro-image
Detalles técnicos
Arquitectura
- Linaje / backbone: Nano Banana Pro está construido sobre el stack de imagen Gemini en evolución de Google — específicamente la nueva arquitectura Gemini 3 Pro Image / GEMPIX 2 (un marco multimodal imagen+texto de mayor capacidad). Es una evolución desde Gemini 2.5 Flash Image (el “nano-banana” original) hacia un modelo de imagen nativamente multimodal con capacidades ampliadas de razonamiento visión-lenguaje.
- Comportamiento del modelo: multimodalidad nativa (imagen + texto + conocimiento del mundo), pipelines explícitos para fusión multiimagen y un planificador por etapas interno que refina salidas en múltiples pasadas en lugar de producir una única muestra estática. Informes tempranos señalan un razonamiento geométrico/óptico más fuerte (vidrio, refracción) frente a versiones anteriores.
- Pensamiento / refinamiento interno: el modelo utiliza un proceso visible de “pensamiento” internamente para refinar la composición (la API documenta este comportamiento y señala que esos pasos internos no se cobran como tokens de imagen finales).
- Grounding y herramientas: admite Search grounding (puede incorporar hechos de la web en la generación de diagramas/infografías). También admite instrucciones de sistema para un control más determinista.
Parámetros clave de la API:
thinking_level(low / high) para equilibrar latencia frente a profundidad de razonamiento;media_resolution(low/medium/high) para controlar los tokens de lectura de OCR/detalle de la imagen;generationConfig.imageConfigpara controlar la relación de aspecto/resolución en las salidas de imagen.
Límites de imagen:
- Modalidades de entrada admitidas: texto e imágenes (el modelo no acepta audio ni video como entradas para generación de imágenes).
- Máximo de imágenes por prompt: 14 (para la vista previa de Gemini 3 Pro Image).
- Tamaño máximo de imagen (carga): 7 MB por imagen de entrada.
- Relaciones de aspecto admitidas: 1:1, 3:2, 16:9, 9:16, 21:9, etc.
Imágenes de salida / tokens: límites altos, con 4K/4096px admitidos.
Rendimiento en benchmarks
Resumen breve: los benchmarks públicos/tempranos hasta ahora son mayormente cualitativos / impulsados por la comunidad, pero reportan de forma consistente mejoras sustanciales en resolución, reducción de artefactos y fidelidad física frente al nano-banana original (Gemini 2.5 Flash Image). “Retos” específicos nombrados han mostrado claros avances visuales, pero aún no hay tablas numéricas estandarizadas (públicas) de Google comparando v1 → v2 en métricas estándar de generación de imágenes.
- Pruebas cualitativas de la comunidad: bordes más limpios, microdetalles más nítidos, colores más fieles y mayor adherencia al prompt (menos accesorios alucinados, personajes más consistentes). Pruebas informales populares incluyen la llamada “Wine Glass Test” y “Glass Burger Challenge”, donde GEMPIX2 (Nano Banana Pro) maneja transparencia y refracción marcadamente mejor que compilaciones anteriores.
- Manejo de texto: Nano Banana Pro muestra mejoras visibles en tipografía y colocación de texto dentro de las imágenes (una debilidad persistente para muchos modelos de imagen). Comparativas comunitarias indican menos glifos renderizados de forma ilegible.
- Rendimiento / UX: mayor velocidad de iteración y una UX que realiza refinamiento multietapa en el back end para que los usuarios vean resultados de primera pasada más confiables (reduciendo reintentos manuales).
Limitaciones y riesgos
- Filtros y detección de contenido: las plataformas que integran el modelo (p. ej., Whisk/aplicaciones de terceros) pueden habilitar detección estricta de celebridades o parecidos y bloquear ciertos resultados, lo que afecta a flujos creativos que dependen de parecidos realistas de celebridades.
- Alucinaciones / casos límite de razonamiento: aunque mejorado, el modelo aún puede producir artefactos físicamente poco realistas, especialmente con texto simbólico denso dentro de imágenes o diagramas altamente técnicos — si bien NB2 parece reducir estos errores respecto a versiones anteriores.
- Seguridad y uso indebido: los modelos generativos de imagen pueden usarse para crear contenido problemático o dañino. Google aplica restricciones, filtros de contenido y la marca de agua SynthID para ayudar con la procedencia; no obstante, se han producido usos indebidos (controversia de alto perfil vinculada a una imagen generada por Nano Banana en un contexto políticamente sensible).
Cómo se compara Nano Banana Pro con otros modelos
- Nano Banana Pro (GEMPIX 2 / Gemini 3 Pro Image) — fuerte integración móvil, fusión multiimagen, autocorrección iterativa, 2K nativo/escalado a 4K, estrechamente integrado en las apps de Google (Search, Photos, Workspace/Gemini). Ideal para flujos que requieren ediciones confiables, continuidad e integración con servicios de Google.
- Midjourney — destaca en salidas artísticas estilizadas y en ingeniería de prompts impulsada por la comunidad; normalmente no se orienta a fusión multiimagen foto-precisa ni a pipelines de edición multimodal profundos.
- Stable Diffusion / pesos abiertos — totalmente abierto, altamente personalizable y hospedable localmente; el ecosistema de checkpoints y fine-tuning es una ventaja decisiva para investigación y uso sin conexión. Menos integración móvil “one‑click” y menos coherencia de edición multiimagen out‑of‑the‑box que Nano Banana Pro.
- Seedream 4.0 (ByteDance) — recientemente posicionado explícitamente como competidor de Nano Banana, enfatizando renderizado ultrarrápido, salida 2K y soporte para muchas imágenes de referencia (hasta seis). Posicionado como alternativa para profesionales/creadores.
(Estas comparativas son de alto nivel; elige la herramienta que se ajuste a tu flujo de trabajo: apertura/personalización → Stable Diffusion; arte estilizado → Midjourney; edición móvil integrada y consistente con iteración agresiva → familia Nano Banana Pro/Gemini 3 Pro Image).
Casos de uso reales
- Edición de fotos móviles y filtros creativos (integraciones con Google Photos — restyling, fusión de fondo, recomposición de retratos).
- Marketing y recursos publicitarios — generación rápida de conceptos, personajes de marca consistentes en múltiples fotogramas/ángulos.
- Arte conceptual y storyboard — la fusión multiimagen ayuda a mantener la continuidad de personajes entre paneles.
- Comercio electrónico / maquetas de producto — genera tomas de producto consistentes en distintos contextos/condiciones de iluminación.
- Prototipado rápido para recursos de AR/VR — salidas 2K/4K de alta calidad que pueden escalarse para usos inmersivos.
- Cómo acceder a la API de gemini-3-pro-image (Nano Banana Pro)
Pasos necesarios
- Inicia sesión en cometapi.com. Si aún no eres usuario, regístrate primero
- Obtén la clave API de credenciales de acceso de la interfaz. Haz clic en “Add Token” en el token de API en el centro personal, obtén la clave del token: sk-xxxxx y envíala.
- Obtén la URL de este sitio:
https://api.cometapi.com/
Método de uso
- Selecciona el endpoint “
gemini-3-pro-image” para enviar la solicitud a la API y configura el cuerpo de la solicitud. El método y el cuerpo de la solicitud se obtienen de la documentación de la API en nuestro sitio web. Nuestro sitio también proporciona pruebas en Apifox para tu comodidad. - Sustituye <YOUR_API_KEY> por tu clave real de CometAPI de tu cuenta.
- Inserta tu pregunta o solicitud en el campo de contenido — esto es a lo que responderá el modelo.
- Procesa la respuesta de la API para obtener la respuesta generada.
CometAPI proporciona una API REST totalmente compatible — para una migración sin fricciones. Detalles clave:
- Base URL: https://api.cometapi.com/v1beta/models/gemini-3-pro-image-preview:generateContent
- Nombres de modelo:
gemini-3-pro-image - Autenticación: encabezado
Bearer YOUR_CometAPI_API_KEY - Content-Type:
application/json.