주요 기능
- 네이티브 이미지 생성 및 편집 — 자연어 프롬프트로 이미지를 생성하거나 기존 사진을 편집합니다. (생성 / 편집).
- 다중 이미지 융합 — 여러 입력 이미지를 하나의 사진처럼 사실적인 장면으로 결합합니다.
- 캐릭터 일관성 — 편집과 프롬프트 전반에서 동일한 피사체나 캐릭터의 외형을 유지합니다. (일관성).
- SynthID 워터마킹 — 모든 출력에는 AI 생성 콘텐츠 식별을 위한 보이지 않는 SynthID가 포함됩니다. (워터마크).
기술 세부사항
- 아키텍처 및 포지셔닝: Gemini 2.5 Flash 패밀리를 기반으로 구축되었으며, 이전 Flash 티어보다 강력한 추론을 유지하면서도 콜당 응답 속도와 비용 효율을 크게 높이기 위해 모델 크기/처리량을 다소 희생한 저지연 "Flash" 변형으로 설계되었습니다.
- 입력 형식 및 제한: 소규모 입력은 인라인 base64 이미지를, 더 큰 이미지는 File API를 통한 파일 업로드를 지원합니다(>20 MB 권장). 일반적인 MIME 타입(JPEG, PNG)을 지원합니다.
- 작동 모드: 텍스트-투-이미지, 이미지 편집(인페인팅 / 시맨틱 마스킹), 스타일 전이, 다중 이미지 합성, 그리고 인터리브드 텍스트+이미지 응답(삽화가 포함된 안내, 레시피, 또는 혼합 콘텐츠에 유용).
- 출처 추적 및 안전 메커니즘: AI 출력물에 가시 워터마크를 부여하고, 숨겨진 SynthID 마커와 정책 적용 레이어를 통해 명시적으로 금지된 콘텐츠를 제한합니다.
벤치마크 성능

한계와 알려진 위험
- 콘텐츠 정책 제약: 모델은 콘텐츠 정책을 적용합니다(예: 노골적인 성적 콘텐츠와 일부 불법 콘텐츠를 허용하지 않음), 그러나 집행이 완벽하지는 않습니다 — 일부 시나리오에서는 공인이나 논쟁적 아이콘의 이미지를 생성할 수 있으므로 정책 점검이 필수적입니다. )
- 실패 모드: 극단적인 편집에서 발생할 수 있는 정체성 드리프트, 프롬프트가 충분히 명시되지 않았을 때의 간헐적 의미적 불일치, 매우 복잡한 장면이나 극단적 시점 변화에서의 아티팩트.
- 출처 및 오용: 워터마크와 SynthID가 존재하더라도 오용을 방지하지는 못합니다 — 탐지와 출처 확인을 돕는 수단일 뿐이며, 민감한 워크플로에서는 인간 검토를 대체할 수 없습니다.
일반적인使用 사례
- 제품 및 이커머스: 다중 이미지 융합을 통해 제품을 라이프스타일 샷에 배치하거나 카탈로그화합니다.
- 크리에이티브 툴링 / 디자인: 디자인 앱에서의 빠른 이터레이션(Adobe Firefly 통합 사례 언급).
- 사진 편집 및 리터칭: 자연어로 국소 편집 수행(객체 제거, 색상/조명 변경, 리스타일링).
- 스토리텔링 / 캐릭터 에셋: 여러 패널과 장면 전반에 걸쳐 캐릭터의 일관성을 유지합니다.