기본 기능
- 텍스트 → 이미지: 프롬프트 기반의 전체 생성, 높은 프롬프트 준수도.
- 이미지 → 이미지(편집): 대상에 정확히 초점을 맞춘 정교한 편집, 여러 차례 편집에서도 주제/캐릭터 일관성 유지.
- 최대 출력 해상도: 최대 4K(예시 및 지원되는 정확한 픽셀 크기는 종횡비에 따라 달라집니다; API는 1K/2K/4K 프리셋을 제공합니다)
- 반복적 계획 수립 및 자기 교정: 일반적인 시각적 오류(원근, 텍스트, 미세 기하)를 탐지하고 수정하는 내부 “다단계” 파이프라인.
- 고급 이미지 내 텍스트 렌더링: 포스터, 목업, 인포그래픽에 적합한 명확하고 가독성 높은 다국어 텍스트(짧은 캡션부터 긴 문단까지).
- 캐릭터 5명 및 단일 워크플로에서 최대 14개의 객체/참조 이미지에 대한 충실도.
- 워터마킹/출처: 생성된 모든 이미지에는 SynthID 워터마크가 포함되며, 일부 제품 통합에서는 출처를 위해 모델이 C2PA 메타데이터를 임베드합니다.
Gemini 3 Pro Image 버전 및 명명
gemini-3-pro-image-previewgemini-3-pro-image
기술 세부정보
아키텍처
- 계보/백본: Nano Banana Pro는 Google의 발전 중인 Gemini 이미지 스택 — 구체적으로 새로운 Gemini 3 Pro Image / GEMPIX 2 아키텍처(더 높은 용량의 멀티모달 이미지+텍스트 프레임워크) 위에 구축되었습니다. 이는 Gemini 2.5 Flash Image(원래의 “nano-banana”)에서 확장된 시각-언어 추론 능력을 갖춘 네이티브 멀티모달 이미지 모델로의 진화입니다.
- 모델 동작: 네이티브 멀티모달리티(이미지 + 텍스트 + 세계 지식), 다중 이미지 융합을 위한 명시적 파이프라인, 단일 정적 샘플을 생성하는 대신 여러 패스를 거쳐 출력을 정련하는 내부 단계형 플래너. 초기 보고에 따르면 이전 버전 대비 기하/광학 추론(유리, 굴절)이 더 강력합니다.
- 사고/내부 정련: 모델은 구성을 정제하기 위해 내부적으로 가시적인 “생각” 과정을 사용합니다(API 문서에 이 동작이 명시되어 있으며, 해당 내부 단계는 최종 이미지 토큰으로 과금되지 않는다고 명시되어 있습니다).
- 그라운딩 및 도구: Search grounding을 지원하며(다이어그램/인포그래픽 생성에 웹 사실을 포함할 수 있음). 또한 보다 결정적인 제어를 위한 시스템 지시도 지원합니다.
주요 API 매개변수:
thinking_level(low / high): 지연 시간과 추론 깊이 간의 트레이드오프를 제어media_resolution(low/medium/high): 이미지 OCR/세부 읽기 토큰을 제어generationConfig.imageConfig: 이미지 출력의 종횡비/해상도 제어
이미지 제한:
- 지원되는 입력 모달리티: 텍스트와 이미지(모델은 이미지 생성 입력으로 오디오나 비디오를 받지 않습니다).
- 프롬프트당 최대 이미지 수: 14개(Gemini 3 Pro Image 프리뷰 기준).
- 최대 이미지 크기(업로드): 입력 이미지당 7 MB.
- 지원되는 종횡비: 1:1, 3:2, 16:9, 9:16, 21:9 등.
- 출력 이미지/토큰: 상한이 높으며 4K/4096px 지원.
벤치마크 성능
간단 요약: 현재까지의 공개/초기 벤치마크는 대체로 정성적·커뮤니티 주도이지만, 원래의 nano-banana (Gemini 2.5 Flash Image) 대비 해상도, 아티팩트 감소, 물리적 충실도에서 상당한 향상을 지속적으로 보고합니다. 특정 명명된 “챌린지”에서 뚜렷한 시각적 개선이 확인되었으나, 표준 이미지 생성 지표 전반에 걸쳐 v1 → v2를 비교한 Google의 (공개) 표준화된 수치 벤치마크 표는 아직 없습니다.
- 정성적 커뮤니티 테스트: 더 깔끔한 에지, 더 선명한 미세 디테일, 더 사실적인 색상, 더 높은 프롬프트 충실도(환각 소품 감소, 캐릭터 일관성 향상). 널리 알려진 비공식 테스트로는 “Wine Glass Test”와 “Glass Burger Challenge”가 있으며, 여기서 GEMPIX2 (Nano Banana Pro)는 이전 빌드 대비 투명도와 굴절을 현저히 더 잘 처리합니다.
- 텍스트 처리: Nano Banana Pro는 이미지 내부의 타이포그래피와 텍스트 배치에서 눈에 띄는 개선을 보입니다(많은 이미지 모델의 지속적인 약점). 커뮤니티 비교에서는 깨진 렌더링 글리프가 줄어든 것으로 나타납니다.
- 처리량/UX: 더 빠른 반복 속도와, 백엔드에서 다단계 정련을 수행하여 사용자가 더 신뢰할 수 있는 1차 결과를 보도록 하는 UX(수동 재생성 감소).
제한 사항 및 위험
- 콘텐츠 필터 및 감지: 모델을 통합한 플랫폼(예: Whisk/서드파티 앱)은 엄격한 유명인 또는 유사성 감지를 활성화하여 특정 출력을 차단할 수 있으며, 이는 현실적인 유명인 유사성에 의존하는 크리에이티브 워크플로에 영향을 줄 수 있습니다.
- 환각/추론 경계 사례: 개선되었지만, 특히 이미지 내부의 조밀한 기호 텍스트나 고도로 기술적인 다이어그램에서 물리적으로 비현실적인 아티팩트가 여전히 발생할 수 있습니다 — 다만 NB2는 이전 버전 대비 이러한 오류를 줄이는 것으로 보입니다.
- 안전 및 오용: 생성형 이미지 모델은 문제적이거나 해로운 콘텐츠를 만드는 데 사용될 수 있습니다. Google은 출처 확인을 돕기 위해 제약, 콘텐츠 필터, SynthID 워터마크를 적용합니다; 그럼에도 불구하고 오용 사례가 발생했습니다(정치적으로 민감한 환경에서 Nano Banana 생성 이미지와 관련된 고프로필 논란).
다른 모델 대비 Nano Banana Pro의 위치
- Nano Banana Pro (GEMPIX 2 / Gemini 3 Pro Image) — 강력한 모바일 통합, 다중 이미지 융합, 반복적 자기 교정, 2K 네이티브/4K 업스케일링, Google 앱(Search, Photos, Workspace/Gemini)과의 긴밀한 통합. 안정적인 편집, 연속성, Google 서비스와의 통합이 필요한 워크플로에 최적.
- Midjourney — 스타일화된 예술적 출력과 커뮤니티 주도의 프롬프트 엔지니어링에 강점; 사진 수준의 정확한 다중 이미지 융합이나 심층 멀티모달 편집 파이프라인을 주 타깃으로 하지는 않음.
- Stable Diffusion / 오픈 웨이트 — 완전히 개방적이며 맞춤화 수준이 높고 로컬 호스팅 가능; 체크포인트와 파인튜닝 생태계는 연구 및 오프라인 사용에 결정적 이점. Nano Banana Pro에 비해 “원클릭” 모바일 통합과 기본 제공 다중 이미지 편집 일관성은 다소 낮음.
- Seedream 4.0 (ByteDance) — 최근 Nano Banana의 경쟁자로 명시적으로 포지셔닝되었으며, 초고속 렌더링, 2K 출력, 다수의 참조 이미지 지원(최대 6개)을 강조. 프로/크리에이터 대안으로 포지셔닝.
(이 비교는 상위 수준입니다. 도구를 워크플로와 매칭해 적합한 것을 선택하세요: 개방성/맞춤화 → Stable Diffusion; 스타일화된 아트 → Midjourney; 통합적이고 일관된 모바일 편집과 적극적인 반복 → Nano Banana Pro/ Gemini 3 Pro image 패밀리.)
실제 사용 사례
- 모바일 사진 편집 및 크리에이티브 필터 (Google Photos 통합 — 리스타일링, 배경 합성, 인물 재구성).
- 마케팅 및 광고 에셋 — 빠른 콘셉트 생성, 여러 프레임/각도에서 일관된 브랜드 캐릭터.
- 컨셉 아트 및 스토리보딩 — 다중 이미지 융합을 통해 패널 전반의 캐릭터 연속성을 유지.
- 이커머스/제품 목업 — 다양한 맥락/조명 조건에서 일관된 제품 샷 생성.
- AR/VR 에셋을 위한 신속한 프로토타이핑 — 몰입형 용도로 업스케일 가능한 고품질 2K/4K 출력.
- gemini-3-pro-image(Nano Banana Pro) API에 액세스하는 방법
필수 단계
- cometapi.com에 로그인하세요. 아직 사용자이시지 않다면 먼저 등록하세요
- 인터페이스의 액세스 자격증명 API 키를 발급받으세요. 개인 센터의 API token에서 “Add Token”을 클릭하여 토큰 키: sk-xxxxx를 발급받고 제출하세요.
- 이 사이트의 url을 가져오세요:
https://api.cometapi.com/
사용 방법
- “
gemini-3-pro-image” 엔드포인트를 선택해 API 요청을 보내고 요청 본문을 설정하세요. 요청 메서드와 요청 본문은 당사 웹사이트 API 문서에서 확인할 수 있습니다. 편의를 위해 웹사이트에서 Apifox 테스트도 제공합니다. - 계정의 실제 CometAPI 키로 <YOUR_API_KEY>를 대체하세요.
- 질문이나 요청을 content 필드에 입력하세요—모델은 여기에 응답합니다.
- . API 응답을 처리하여 생성된 답변을 얻습니다.
CometAPI는 완전 호환 REST API를 제공합니다—원활한 마이그레이션을 위해. 주요 세부사항 :
- 기본 URL: https://api.cometapi.com/v1beta/models/gemini-3-pro-image-preview:generateContent
- 모델 이름:
gemini-3-pro-image - 인증:
Bearer YOUR_CometAPI_API_KEY헤더 - Content-Type:
application/json.