主要機能
- ネイティブな画像生成と編集 — 自然言語のプロンプトで画像を生成、または既存の写真を編集できます。 (生成 / 編集)。
- マルチ画像融合 — 複数の入力画像を1つのフォトリアリスティックなシーンに結合します。
- キャラクターの一貫性 — 編集やプロンプトをまたいでも同一の被写体やキャラクターの外観を維持します。 (一貫性)。
- SynthID ウォーターマーキング — すべての出力に、AI生成コンテンツを識別する不可視の SynthID を含めます。 (ウォーターマーク)。
技術的な詳細
- アーキテクチャとポジショニング: Gemini 2.5 Flash ファミリー上に構築 — 低遅延の“Flash”バリアントとして設計され、モデルサイズ/スループットをわずかに犠牲にする代わりに、呼び出しごとの応答を大幅に高速化し、コスト効率を高めつつ、従来の Flash ティアより強力な推論能力を維持します。
- 入力形式と制限: 小さな入力にはインライン base64 画像を受け付け、より大きな画像には File API 経由のファイルアップロードに対応(20 MB超には推奨)。一般的な MIME タイプ(JPEG、PNG)をサポートします。
- 動作モード: テキストから画像、画像編集(インペインティング / セマンティックマスキング)、スタイル転送、マルチ画像合成、そしてインターリーブされたテキスト+画像の応答(図解付き手順書、レシピ、混在コンテンツに有用)。
- 来歴と安全機構: AI出力には可視ウォーターマークを付与し、さらに不可視の SynthID マーカーとポリシー執行レイヤーにより、明示的に不許可なコンテンツを制限します。
ベンチマーク性能

制限事項と既知のリスク
- コンテンツポリシーの制約: モデルはコンテンツポリシーを適用します(例: 露骨な性的コンテンツや一部の不正コンテンツを不許可)ですが、適用は完全ではありません — 一部の状況では、公的な人物や物議を醸すアイコンの生成が可能な場合があるため、ポリシーチェックが不可欠です。 )
- 失敗モード: 極端な編集におけるアイデンティティのドリフト、(プロンプトの指定が不十分な場合の)意味の不整合が発生することがあり、非常に複雑なシーンや極端な視点変更ではアーティファクトが現れる場合があります。
- 来歴と悪用: ウォーターマークと SynthID は存在しますが、悪用を防止するものではありません — 検出と帰属の支援にはなりますが、機微なワークフローにおいて人のレビューの代替にはなりません。
代表的なユースケース
- プロダクトとEC: マルチ画像融合 により、商品をライフスタイル写真に配置/カタログ化します。
- クリエイティブツール/デザイン: 高速な反復 をデザインアプリで実現(Adobe Firefly 連携の例あり)。
- 写真編集とレタッチ: 自然言語からの部分的編集(オブジェクトの削除、色/ライティングの変更、リスタイル)。
- ストーリーテリング/キャラクターアセット: キャラクターの一貫性を維持 しながらパネルやシーンを構成。