Podstawowe funkcje
- Tekst → Obraz: pełne generowanie sterowane promptem z silną zgodnością z promptem.
- Obraz → Obraz (edycje): precyzyjne, ukierunkowane edycje z zachowaniem spójności obiektu/postaci w wielu edycjach.
- Maksymalna rozdzielczość wyjściowa: do 4K (przykłady i obsługiwane dokładne rozmiary w pikselach zależą od proporcji; API udostępnia presety 1K/2K/4K)
- Planowanie iteracyjne i autokorekta: wewnętrzny „wielostopniowy” pipeline, który wykrywa i koryguje typowe błędy wizualne (perspektywa, tekst, drobna geometria).
- Zaawansowane renderowanie tekstu w obrazie: wyraźny, czytelny, wielojęzyczny tekst (od krótkich podpisów po długie akapity), odpowiedni do plakatów, makiet i infografik.
- 5 postaci oraz wierność do 14 obiektów/obrazów referencyjnych w jednym przebiegu.
- Znakowanie wodne / pochodzenie: wszystkie generowane obrazy zawierają znak wodny SynthID; model osadza metadane C2PA dla pochodzenia w niektórych integracjach produktowych.
Wersje i nazewnictwo Gemini 3 Pro Image
gemini-3-pro-image-previewgemini-3-pro-image
Szczegóły techniczne
Architektura
- Pochodzenie / backbone: Nano Banana Pro jest zbudowany na rozwijanym przez Google stosie obrazowym Gemini — konkretnie na nowej architekturze Gemini 3 Pro Image / GEMPIX 2 (wyżej pojemnościowy wielomodalny framework obraz+tekst). To ewolucja z Gemini 2.5 Flash Image (oryginalnego „nano-banana”) w natywnie wielomodalny model obrazu z rozszerzonymi możliwościami rozumowania wizji i języka.
- Zachowanie modelu: natywna multimodalność (obraz + tekst + wiedza o świecie), jawne pipeline’y do fuzji wielu obrazów oraz wewnętrzny, etapowy planer, który udoskonala wyniki w wielu przebiegach zamiast produkować pojedynczą statyczną próbkę. Wczesne doniesienia wskazują na silniejsze rozumienie geometrii/optyki (szkło, refrakcja) względem wcześniejszych wersji.
- Myślenie / wewnętrzne udoskonalanie: model używa widocznego procesu „myślenia” wewnętrznie do dopracowania kompozycji (API dokumentuje to zachowanie i zaznacza, że te wewnętrzne kroki nie są naliczane jako końcowe tokeny obrazu).
- Grounding i narzędzia: wspiera Search grounding (może włączać fakty z sieci do generowania diagramów/infografik). Wspiera też instrukcje systemowe dla bardziej deterministycznej kontroli.
Kluczowe parametry API:
thinking_level(low / high) do równoważenia opóźnienia względem głębokości rozumowania;media_resolution(low/medium/high) do kontroli tokenów odczytu OCR/szczegółów z obrazu;generationConfig.imageConfigdo kontroli proporcji i rozdzielczości w wynikowych obrazach.
Ograniczenia obrazów:
- Obsługiwane modalności wejściowe: tekst i obrazy (model nie akceptuje dźwięku ani wideo jako wejść do generowania obrazu).
- Maks. liczba obrazów na prompt: 14 (dla wersji preview Gemini 3 Pro Image).
- Maks. rozmiar obrazu (przesyłanie): 7 MB na obraz wejściowy.
- Obsługiwane proporcje: 1:1, 3:2, 16:9, 9:16, 21:9 itd.
Obrazy / tokeny wyjściowe: wysokie limity, z obsługą 4K/4096 px.
Wydajność w benchmarkach
Krótki opis: publiczne/wczesne benchmarki są w większości jakościowe / tworzone przez społeczność, ale konsekwentnie odnotowują znaczące ulepszenia w rozdzielczości, redukcji artefaktów i zgodności fizycznej względem oryginalnego nano-banana (Gemini 2.5 Flash Image). Określone „wyzwania” pokazały wyraźne zyski wizualne, ale nie ma jeszcze (publicznych) zestandaryzowanych tabel liczbowych od Google porównujących v1 → v2 w standardowych metrykach generowania obrazów.
- Jakościowe testy społeczności: czystsze krawędzie, ostrzejsze mikrodetale, wierniejsze kolory i bardziej posłuszne trzymanie się promptu (mniej halucynowanych rekwizytów, bardziej spójne postaci). Popularne nieformalne testy obejmują tzw. „Wine Glass Test” i „Glass Burger Challenge”, gdzie GEMPIX2 (Nano Banana Pro) znacznie lepiej radzi sobie z przezroczystością i refrakcją niż wcześniejsze wersje.
- Obsługa tekstu: Nano Banana Pro pokazuje widocznie lepszą typografię i umieszczanie tekstu wewnątrz obrazów (trwała słabość wielu modeli obrazowych). Porównania społeczności wskazują mniej zniekształconych glifów.
- Przepustowość / UX: szybsze tempo iteracji i backendowy wieloetapowy refinement, dzięki czemu użytkownicy widzą bardziej niezawodne wyniki już w pierwszym przebiegu (mniej ręcznych powtórek).
Ograniczenia i ryzyka
- Filtry treści i wykrywanie: platformy integrujące model (np. Whisk/aplikacje firm trzecich) mogą włączać rygorystyczne wykrywanie celebrytów lub podobizn i blokować niektóre wyniki, co wpływa na przepływy pracy kreatywne polegające na realistycznych podobiznach celebrytów.
- Halucynacje / skrajne przypadki rozumowania: mimo ulepszeń model może wciąż tworzyć fizycznie nierealistyczne artefakty, zwłaszcza przy gęstym tekście symbolicznym w obrazach lub bardzo technicznych diagramach — choć NB2 zdaje się ograniczać te błędy względem wcześniejszych wersji.
- Bezpieczeństwo i nadużycia: generatywne modele obrazowe mogą być używane do tworzenia problematycznych lub szkodliwych treści. Google stosuje ograniczenia, filtry treści i znak wodny SynthID, by wesprzeć pochodzenie; niemniej dochodziło do nadużyć (głośny incydent powiązany z obrazem Nano Banana wygenerowanym w politycznie wrażliwym kontekście).
Jak Nano Banana Pro wypada na tle innych modeli
- Nano Banana Pro (GEMPIX 2 / Gemini 3 Pro Image) — silna integracja mobilna, fuzja wielu obrazów, iteracyjna autokorekta, natywne 2K/skalowanie do 4K, ścisła integracja z aplikacjami Google (Search, Photos, Workspace/Gemini). Najlepszy do przepływów pracy wymagających niezawodnych edycji, ciągłości i integracji z usługami Google.
- Midjourney — wyróżnia się stylizowanymi, artystycznymi wynikami i społecznościowym inżynierią promptów; zwykle nie jest kierowany na foto-realną fuzję wielu obrazów ani głębokie, wielomodalne pipeline’y edycyjne.
- Stable Diffusion / otwarte wagi — w pełni otwarty, wysoce konfigurowalny i możliwy do hostowania lokalnie; ekosystem checkpointów i fine-tuningu to decydująca przewaga dla badań i pracy offline. Mniej „jednoklikowej” integracji mobilnej i mniejsza spójność edycji wielu obrazów out‑of‑the‑box niż w Nano Banana Pro.
- Seedream 4.0 (ByteDance) — ostatnio pozycjonowany wprost jako konkurent Nano Banana, podkreśla ultra-szybkie renderowanie, wyjście 2K oraz wsparcie dla wielu obrazów referencyjnych (do sześciu). Pozycjonowany jako alternatywa dla profesjonalistów/kreatorów.
(Te porównania są na wysokim poziomie; wybierz rozwiązanie, dopasowując narzędzie do swojego workflow: otwartość/dostosowywalność → Stable Diffusion; stylizowana sztuka → Midjourney; zintegrowana, spójna edycja mobilna z agresywną iteracją → rodzina Nano Banana Pro / Gemini 3 Pro Image.)
Przypadki użycia w realnym świecie
- Mobilna edycja zdjęć i kreatywne filtry (integracje Google Photos — restylizacja, łączenie tła, rekonstrukcja portretów).
- Materiały marketingowe i reklamowe — szybkie generowanie koncepcji, spójne postaci brandowe w wielu kadrach/kątach.
- Koncept art i storyboardy — fuzja wielu obrazów pomaga zachować ciągłość postaci w kadrach.
- E-commerce / mockupy produktów — generowanie spójnych ujęć produktu w różnych kontekstach/warunkach oświetleniowych.
- Szybkie prototypowanie zasobów AR/VR — wysokiej jakości wyjścia 2K/4K, które można skalować do zastosowań immersyjnych.
- Jak uzyskać dostęp do API gemini-3-pro-image (Nano Banana Pro)
Wymagane kroki
- Zaloguj się na cometapi.com. Jeśli nie jesteś jeszcze naszym użytkownikiem, najpierw się zarejestruj
- Uzyskaj klucz API poświadczeń dostępu do interfejsu. Kliknij „Add Token” w tokenie API w centrum osobistym, uzyskaj klucz tokena: sk-xxxxx i wyślij.
- Uzyskaj adres URL tej witryny:
https://api.cometapi.com/
Metoda użycia
- Wybierz endpoint „
gemini-3-pro-image”, wyślij żądanie do API i ustaw body żądania. Metodę żądania i body żądania znajdziesz w dokumentacji API na naszej stronie. Dla wygody udostępniamy też test w Apifox. - Zastąp <YOUR_API_KEY> swoim rzeczywistym kluczem CometAPI z konta.
- Wstaw swoje pytanie lub prośbę do pola content — na to odpowie model.
- Przetwórz odpowiedź API, aby uzyskać wygenerowany wynik.
CometAPI udostępnia w pełni kompatybilne REST API — dla płynnej migracji. Kluczowe szczegóły :
- Podstawowy adres URL: https://api.cometapi.com/v1beta/models/gemini-3-pro-image-preview:generateContent
- Nazwy modeli:
gemini-3-pro-image - Uwierzytelnianie: nagłówek
Bearer YOUR_CometAPI_API_KEY - Content-Type:
application/json.