關鍵功能
- 原生圖像生成與編輯 — 透過自然語言提示生成圖像或編輯現有照片。(生成 / 編輯)。
- 多圖融合 — 將多個輸入圖像合成為一個寫實場景。
- 角色一致性 — 在多次編輯與提示中保持相同主體或角色外觀。(一致性)。
- SynthID 浮水印 — 所有輸出都包含不可見的 SynthID 以識別 AI 生成內容。(浮水印)。
技術詳情
- 結構與定位:基於 Gemini 2.5 Flash 系列構建 — 設計為一種低延遲的「Flash」變體,在保留較早期 Flash 層級更強推理能力的同時,略微取捨模型大小/吞吐量,以換取更快的單次呼叫回應與成本效率。
- 輸入格式與限制:小型輸入可接受內嵌 base64 圖像,較大的圖像可透過 File API 上傳檔案(建議 >20 MB)。支援常見 MIME 類型(JPEG、PNG)。
- 運行模式:文字轉圖像、圖像編輯(圖像修補/語義遮罩)、風格遷移、多圖合成,以及交錯式文字+圖像回應(適用於帶插圖的說明、食譜或混合內容)。
- 來源溯源與安全機制:AI 輸出包含可見浮水印與隱藏的 SynthID 標記,並配合政策執行層以限制明確禁止的內容。
基準測試表現

侷限與已知風險
- 內容政策限制:模型會執行內容政策(例如禁止露骨色情內容與某些非法內容),但執行並不完美 — 在某些情境下仍可能生成公眾人物或具爭議符號的圖像,因此務必進行政策檢查。 )
- 失敗模式:在極端編輯中可能出現身分漂移、提示過於籠統時偶發語義不對齊,且在極其複雜場景或極端視角變化下可能出現偽影。
- 來源溯源與濫用:即便存在浮水印與 SynthID,它們並不能防止濫用 — 這些機制可協助檢測與歸因,但在敏感流程中不能替代人工審查。
典型使用情境
- 產品與電商:透過多圖融合將商品/型錄產品置入生活化場景照。
- 創意工具/設計:在設計應用中快速迭代(已提及與 Adobe Firefly 的整合)。
- 照片編輯與修飾:透過自然語言進行局部編輯(移除物件、變更顏色/光線、重新風格化)。
- 故事創作/角色資產:在多個分鏡與場景中保持角色一致性。