Recursos básicos
- Texto → Imagem: geração totalmente guiada por prompt, com forte aderência ao prompt.
- Imagem → Imagem (edições): edições precisas e direcionadas, mantendo a consistência de sujeito/personagem ao longo de múltiplas edições.
- Resolução máxima de saída: até 4K (os exemplos e tamanhos exatos de pixels suportados dependem da proporção; a API expõe predefinições de 1K/2K/4K)
- Planejamento iterativo e autocorreção: um pipeline interno “multifásico” que detecta e corrige erros visuais comuns (perspectiva, texto, geometria fina).
- Renderização avançada de texto na imagem: texto multilíngue nítido e legível (de legendas curtas a parágrafos longos) adequado para pôsteres, mockups e infográficos.
- 5 personagens e fidelidade para até 14 objetos/imagens de referência em um único fluxo de trabalho.
- Marca d'água / proveniência: todas as imagens geradas incluem uma marca d'água SynthID; o modelo incorpora metadados C2PA para proveniência em algumas integrações de produto.
Versões e nomenclatura do Gemini 3 Pro Image
gemini-3-pro-image-previewgemini-3-pro-image
Detalhes técnicos
Arquitetura
- Linagem / backbone: Nano Banana Pro é construído sobre a stack de imagens Gemini em evolução do Google — especificamente a nova arquitetura Gemini 3 Pro Image / GEMPIX 2 (um framework multimodal imagem+texto de maior capacidade). Isso é uma evolução do Gemini 2.5 Flash Image (o “nano-banana” original) para um modelo de imagem nativamente multimodal com capacidades ampliadas de raciocínio visão‑linguagem.
- Comportamento do modelo: multimodalidade nativa (imagem + texto + conhecimento de mundo), pipelines explícitos para fusão de múltiplas imagens e um planejador interno em estágios que refina as saídas em múltiplas passagens em vez de produzir uma única amostra estática. Relatos iniciais indicam raciocínio geométrico/óptico mais forte (vidro, refração) em comparação com versões anteriores.
- Pensamento / refinamento interno: o modelo usa um processo de “pensamento” visível internamente para refinar a composição (a API documenta esse comportamento e observa que essas etapas internas não são cobradas como tokens de imagem finais).
- Grounding e ferramentas: Suporta Search grounding (pode incorporar fatos da web na geração de diagramas/infográficos). Também suporta instruções de sistema para um controle mais determinístico.
Parâmetros principais da API:
thinking_level(low / high) para equilibrar latência vs profundidade de raciocínio;media_resolution(low/medium/high) para controlar os tokens de leitura de OCR/detalhes de imagem;generationConfig.imageConfigpara controlar proporção/resolução nas saídas de imagem.
Limites de imagem:
- Modalidades de entrada suportadas: texto e imagens (o modelo não aceita áudio ou vídeo como entradas para geração de imagens).
- Máximo de imagens por prompt: 14 (para o preview do Gemini 3 Pro Image).
- Tamanho máximo da imagem (upload): 7 MB por imagem de entrada.
- Proporções suportadas: 1:1, 3:2, 16:9, 9:16, 21:9 etc.
Imagens / tokens de saída: limites altos, com suporte a 4K/4096px.
Desempenho em benchmarks
Resumo breve: benchmarks públicos/iniciais até agora são majoritariamente qualitativos/dirigidos pela comunidade, mas relatam consistentemente melhorias substanciais em resolução, redução de artefatos e fidelidade física em relação ao nano-banana original (Gemini 2.5 Flash Image). “Desafios” específicos mostraram ganhos visuais claros, mas ainda não há (publicamente) tabelas padronizadas de benchmarks numéricos do Google comparando v1 → v2 em métricas padrão de geração de imagens.
- Testes qualitativos da comunidade: bordas mais limpas, microdetalhes mais nítidos, cores mais fiéis e maior aderência ao prompt (menos objetos alucinados, personagens mais consistentes). Testes informais populares incluem o chamado “Wine Glass Test” e o “Glass Burger Challenge”, nos quais o GEMPIX2 (Nano Banana Pro) lida com transparência e refração substancialmente melhor do que versões anteriores.
- Manipulação de texto: o Nano Banana Pro mostra tipografia e posicionamento de texto visivelmente melhores dentro das imagens (uma fraqueza persistente em muitos modelos de imagem). Comparações da comunidade indicam menos glifos renderizados embaralhados.
- Throughput / UX: velocidade de iteração mais alta e uma UX que realiza refinamento em múltiplas etapas no back-end, de modo que os usuários veem resultados mais confiáveis já no primeiro passe (reduzindo rerolls manuais).
Limitações e riscos
- Filtros de conteúdo e detecção: Plataformas que integram o modelo (por exemplo, Whisk/apps de terceiros) podem habilitar detecção rigorosa de celebridades ou semelhanças e bloquear certas saídas, o que afeta fluxos criativos que dependem de semelhanças realistas de celebridades.
- Alucinação / casos-limite de raciocínio: embora melhorado, o modelo ainda pode produzir artefatos fisicamente irreais, especialmente com texto simbólico denso dentro das imagens ou diagramas altamente técnicos — embora o NB2 pareça reduzir esses erros em relação a versões anteriores.
- Segurança e uso indevido: modelos generativos de imagem podem ser usados para criar conteúdo problemático ou prejudicial. O Google aplica restrições, filtros de conteúdo e a marca d'água SynthID para ajudar na proveniência; ainda assim, já ocorreram usos indevidos (polêmica de alto perfil ligada a uma imagem gerada pelo Nano Banana em um contexto politicamente sensível).
Como o Nano Banana Pro se compara a outros modelos
- Nano Banana Pro (GEMPIX 2 / Gemini 3 Pro Image) — forte integração móvel, fusão de múltiplas imagens, autocorreção iterativa, 2K nativo/upsampling para 4K, integração estreita nos apps do Google (Search, Photos, Workspace/Gemini). Ideal para fluxos que exigem edições confiáveis, continuidade e integração com serviços do Google.
- Midjourney — excelente em saídas artísticas estilizadas e engenharia de prompt orientada pela comunidade; normalmente não é voltado para fusão multi-imagem foto-realista ou pipelines de edição multimodal profunda.
- Stable Diffusion / pesos abertos — totalmente aberto, altamente personalizável e hospedável localmente; ecossistema de checkpoints e fine-tuning é uma vantagem decisiva para pesquisa e uso offline. Menos integração móvel “one‑click” e menos coerência de edição multi-imagem pronta para uso do que o Nano Banana Pro.
- Seedream 4.0 (ByteDance) — recentemente posicionada explicitamente como um concorrente do Nano Banana, enfatizando renderização ultrarrápida, saída 2K e suporte a muitas imagens de referência (até seis). Posicionada como uma alternativa para profissionais/criadores.
(Estas comparações são de alto nível; escolha a melhor opção alinhando a ferramenta ao seu fluxo de trabalho: abertura/personalização → Stable Diffusion; arte estilizada → Midjourney; edição móvel integrada e consistente com iteração agressiva → família Nano Banana Pro/Gemini 3 Pro Image.)
Casos de uso no mundo real
- Edição de fotos móvel e filtros criativos (integrações com o Google Photos — mudança de estilo, fusão de plano de fundo, recomposição de retratos).
- Ativos de marketing e anúncios — geração rápida de conceitos, personagens de marca consistentes em múltiplos quadros/ângulos.
- Concept art e storyboard — a fusão de múltiplas imagens ajuda a manter a continuidade dos personagens entre os painéis.
- E-commerce / mockups de produto — gere fotos de produto consistentes em diferentes contextos/condições de iluminação.
- Prototipagem rápida para ativos de AR/VR — saídas 2K/4K de alta qualidade que podem ser ampliadas para usos imersivos.
- Como acessar a API gemini-3-pro-image(Nano Banana Pro)
Etapas necessárias
- Faça login em cometapi.com. Se você ainda não é nosso usuário, registre-se primeiro
- Obtenha a chave de API de credencial de acesso da interface. Clique em “Add Token” no token de API no centro pessoal, obtenha a chave do token: sk-xxxxx e envie.
- Obtenha a URL deste site:
https://api.cometapi.com/
Método de uso
- Selecione o endpoint “
gemini-3-pro-image” para enviar a solicitação à API e defina o corpo da requisição. O método e o corpo da requisição são obtidos na nossa documentação de API no site. Nosso site também oferece teste no Apifox para sua conveniência. - Substitua <YOUR_API_KEY> pela sua chave real da CometAPI, obtida na sua conta.
- Insira sua pergunta ou solicitação no campo content — é a isso que o modelo responderá.
- . Processe a resposta da API para obter a resposta gerada.
A CometAPI fornece uma API REST totalmente compatível — para migração sem atritos. Detalhes principais :
- Base URL: https://api.cometapi.com/v1beta/models/gemini-3-pro-image-preview:generateContent
- Nomes dos modelos:
gemini-3-pro-image - Autenticação:
Bearer YOUR_CometAPI_API_KEYcabeçalho - Content-Type:
application/json.