Grundlæggende funktioner
- Tekst → Billede: fuldt promptstyret generering med stærk efterlevelse af prompten.
- Billede → Billede (redigeringer): fine, målrettede redigeringer med bevaret motiv-/karakterkonsistens på tværs af flere redigeringer.
- Maksimal outputopløsning: op til 4K (eksempler og understøttede præcise pixelstørrelser afhænger af billedformat; API’et tilbyder 1K/2K/4K-forudindstillinger)
- Iterativ planlægning og selvkorrektion: en intern “flertrins”-pipeline, der opdager og retter almindelige visuelle fejl (perspektiv, tekst, fin geometri).
- Avanceret tekstgengivelse i billedet: klar, læsbar flersproget tekst (fra korte billedtekster til lange afsnit) egnet til plakater, mockups og infografikker.
- 5 figurer og nøjagtighed for op til 14 objekter/referencebilleder i ét workflow.
- Vandmærkning/oprindelse: alle genererede billeder inkluderer et SynthID-vandmærke; modellen indlejrer C2PA-metadata for oprindelsesdokumentation i nogle produktintegrationer.
Gemini 3 Pro Image versioner og navngivning
gemini-3-pro-image-previewgemini-3-pro-image
Tekniske detaljer
Arkitektur
- Slægtskab/rygrad: Nano Banana Pro er bygget på Googles udviklende Gemini-billedstack — specifikt den nye Gemini 3 Pro Image / GEMPIX 2-arkitektur (en højkapacitets multimodal billede+tekst-ramme). Det er en videreudvikling af Gemini 2.5 Flash Image (den oprindelige “nano-banana”) til en nativt multimodal billedmodel med udvidede vision-sprog-ræsonneringsevner.
- Modeladfærd: indfødt multimodalitet (billede + tekst + viden om verden), eksplicitte pipelines til multi-billede-fusion og en intern trinvis planlægger, der forfiner output over flere passager i stedet for at producere én enkelt statisk prøve. Tidlige rapporter indikerer stærkere geometrisk/optisk ræsonnering (glas, brydning) end tidligere versioner.
- Tænkning / intern forfinelse: Modellen bruger en synlig “tænke”-proces internt til at forfine kompositionen (API’et dokumenterer denne adfærd og bemærker, at disse interne trin ikke debiteres som endelige billed-tokens).
- Forankring og værktøjer: Understøtter Search grounding (kan indarbejde webfakta i diagram-/infografikgenerering). Den understøtter også systeminstruktioner for mere deterministisk kontrol.
Vigtige API-parametre:
thinking_level(low / high) til at afveje latenstid mod ræsonneringsdybde;media_resolution(low/medium/high) til at styre tokens til læsning af billede-OCR/detaljer;generationConfig.imageConfigtil at styre billedformat/opløsning i billedoutput.
Billedbegrænsninger:
- Understøttede inputmodaliteter: tekst og billeder (modellen accepterer ikke lyd eller video som input til billedgenerering).
- Maks. billeder pr. prompt: 14 (for Gemini 3 Pro Image preview).
- Maks. billedstørrelse (upload): 7 MB pr. inputbillede.
- Understøttede billedformater: 1:1, 3:2, 16:9, 9:16, 21:9, osv.
Outputbilleder / tokens: høje grænser, med 4K/4096px understøttet.
Benchmark-ydeevne
Kort resume: offentlige/tidlige benchmarks er indtil videre mest kvalitative/community-drevne, men rapporterer konsekvent betydelige forbedringer i opløsning, reduktion af artefakter og fysisk trofasthed sammenlignet med den oprindelige nano-banana (Gemini 2.5 Flash Image). Specifikke navngivne “udfordringer” har vist klare visuelle gevinster, men der findes endnu ikke (offentlige) standardiserede numeriske benchmarktabeller fra Google, der sammenligner v1 → v2 på tværs af standardmål for billedgenerering.
- Kvalitative community-tests: renere kanter, skarpere mikrodetaljer, mere naturtro farver og mere trofast efterlevelse af prompten (færre hallucinerede rekvisitter, mere konsistente karakterer). Populære uformelle tests inkluderer den såkaldte “Wine Glass Test” og “Glass Burger Challenge”, hvor GEMPIX2 (Nano Banana Pro) håndterer transparens og brydning markant bedre end tidligere builds.
- Teksthåndtering: Nano Banana Pro viser synligt forbedret typografi og tekstplacering i billeder (en vedvarende svaghed for mange billedmodeller). Community-sammenligninger indikerer færre forvredne gengivne tegn.
- Gennemløb/UX: hurtigere iterationshastighed og en UX, der udfører flertrins forfinelse på backend, så brugere ser mere pålidelige førstegangsresultater (reducerer manuelle re-rolls).
Begrænsninger og risici
- Indholdsfiltre og detektion: Platforme, der integrerer modellen (f.eks. Whisk/tredjepartsapps), kan aktivere streng berømtheds- eller lighedsdetektion og blokere visse output, hvilket påvirker kreative arbejdsgange, der er afhængige af realistiske berømthedsligheder.
- Hallucination/ræsonneringens kanttilfælde: selv om forbedret, kan modellen stadig producere fysisk urealistiske artefakter, især med tæt symbolsk tekst i billeder eller meget tekniske diagrammer — dog synes NB2 at reducere disse fejl i forhold til tidligere versioner.
- Sikkerhed og misbrug: generative billedmodeller kan bruges til at skabe problematisk eller skadeligt indhold. Google anvender begrænsninger, indholdsfiltre og SynthID-vandmærket for at hjælpe med oprindelsesdokumentation; ikke desto mindre er misbrug forekommet (højprofilkontrovers knyttet til et Nano Banana-genereret billede i en politisk følsom sammenhæng).
Sådan klarer Nano Banana Pro sig i forhold til andre modeller
- Nano Banana Pro (GEMPIX 2 / Gemini 3 Pro Image) — stærk mobilintegration, multi-billede-fusion, iterativ selvkorrektion, 2K native/4K opskalering, tæt integreret i Google-apps (Search, Photos, Workspace/Gemini). Bedst til arbejdsgange, der kræver pålidelige redigeringer, kontinuitet og integration med Google-tjenester.
- Midjourney — excellerer i stiliserede kunstneriske output og community-drevet prompt engineering; er typisk ikke målrettet foto-præcis multi-billede-fusion eller dybe multimodale redigeringspipelines.
- Stable Diffusion / åbne vægte — fuldt åbent, stærkt tilpasningsbart og kan hostes lokalt; økosystemet af checkpoints og finjustering er en afgørende fordel for forskning og offline brug. Mindre “one-click” mobilintegration og mindre konsistent kohærens ved multi-billederedigering out-of-the-box end Nano Banana Pro.
- Seedream 4.0 (ByteDance) — for nylig positioneret eksplicit som en Nano Banana-konkurrent, med vægt på ultrahurtig rendering, 2K output og støtte til mange referencebilleder (op til seks). Positioneret som et pro-/creator-alternativ.
(Disse sammenligninger er på højt niveau; vælg en vinder ved at matche værktøjet til din arbejdsgang: åbenhed/tilpasningsevne → Stable Diffusion; stiliseret kunst → Midjourney; integreret, konsistent mobilredigering med aggressiv iteration → Nano Banana Pro/Gemini 3 Pro image-familien.)
Anvendelser i den virkelige verden
- Mobil fotoredigering og kreative filtre (Google Photos-integrationer — restyling, baggrundsfusion, portræt-omkomposition).
- Marketing- og annoncematerialer — hurtig konceptgenerering, konsistente brandkarakterer på tværs af flere frames/vinkler.
- Konceptkunst og storyboard — multi-billede-fusion hjælper med at bevare karakterkontinuitet på tværs af paneler.
- E-handel / produktmockups — generér konsistente produktbilleder i forskellige kontekster/lysforhold.
- Hurtig prototyping af AR/VR-aktiver — høj kvalitet 2K/4K outputs, som kan opskaleres til immersive brug.
- Sådan får du adgang til gemini-3-pro-image (Nano Banana Pro) API
Påkrævede trin
- Log ind på cometapi.com. Hvis du ikke er bruger endnu, skal du registrere dig først
- Hent adgangslegitimations-API-nøglen til interfacet. Klik på “Add Token” ved API token i personcentret, få token-nøglen: sk-xxxxx og indsend.
- Hent URL’en til dette site:
https://api.cometapi.com/
Brugsmåde
- Vælg “
gemini-3-pro-image”-endpointet for at sende API-anmodningen og angiv request body. Anmodningsmetode og request body fås fra vores websteds API-dokumentation. Vores websted tilbyder også Apifox-test for din bekvemmelighed. - Erstat <YOUR_API_KEY> med din faktiske CometAPI-nøgle fra din konto.
- Indsæt dit spørgsmål eller din anmodning i content-feltet — det er det, modellen svarer på.
- . Behandl API-svaret for at få det genererede svar.
CometAPI leverer en fuldt kompatibel REST API — for problemfri migration. Nøgleoplysninger :
- Base URL: https://api.cometapi.com/v1beta/models/gemini-3-pro-image-preview:generateContent
- Model Names:
gemini-3-pro-image - Authentication:
Bearer YOUR_CometAPI_API_KEYheader - Content-Type:
application/json.