Funzionalità principali
- Generazione ed editing di immagini nativi — genera immagini o modifica foto esistenti tramite prompt in linguaggio naturale. (Genera / Modifica).
- Fusione multi-immagine — combina più immagini di input in un'unica scena fotorealistica.
- Coerenza del personaggio — mantiene lo stesso aspetto del soggetto o del personaggio tra modifiche e prompt. (Coerenza).
- Filigrana SynthID — tutte le uscite includono una SynthID invisibile per identificare i contenuti generati dall'IA. (Filigrana).
Dettagli tecnici
- Architettura e posizionamento: basato sulla famiglia Gemini 2.5 Flash — progettato come variante "Flash" a bassa latenza che scambia un po' di dimensioni del modello/throughput per risposte per chiamata molto più rapide ed efficienza dei costi, pur mantenendo capacità di ragionamento superiori rispetto ai precedenti livelli Flash.
- Formati di input e limiti: accetta immagini base64 inline per input piccoli e caricamenti di file tramite la File API per immagini più grandi (consigliato per >20 MB). Supporta i comuni tipi MIME (JPEG, PNG).
- Modalità di funzionamento: da testo a immagine, editing di immagini (inpainting / mascheratura semantica), trasferimento di stile, composizione multi-immagine e risposte testo+immagine intercalate (utili per istruzioni illustrate, ricette o contenuti misti).
- Provenienza e meccanismi di sicurezza: filigrane visibili sugli output dell'IA, oltre a marcatori SynthID nascosti e livelli di applicazione delle policy per limitare contenuti esplicitamente non consentiti.
Prestazioni nei benchmark

Limitazioni e rischi noti
- Vincoli delle policy sui contenuti: i modelli applicano policy sui contenuti (ad es., non consentono contenuti sessuali espliciti e alcuni contenuti illeciti), ma l'applicazione non è perfetta — generare immagini di figure pubbliche o icone controverse può essere ancora possibile in alcuni scenari, quindi i controlli di policy sono essenziali. )
- Modalità di errore: possibili derive di identità in modifiche estreme, occasionali disallineamenti semantici (quando i prompt sono sottospecificati) e artefatti in scene molto complesse o con cambi estremi di punto di vista.
- Provenienza e uso improprio: sebbene siano presenti filigrane e SynthID, questi non impediscono l'uso improprio — aiutano nel rilevamento e nell'attribuzione ma non sostituiscono la revisione umana nei flussi di lavoro sensibili.
Casi d'uso tipici
- Prodotto ed e-commerce: inserire/catalogare prodotti in scatti lifestyle tramite fusione multi-immagine.
- Strumenti creativi / design: iterazioni rapide nelle app di design (integrazione con Adobe Firefly citata).
- Editing e ritocco fotografico: modifiche localizzate da linguaggio naturale (rimuovere oggetti, cambiare colore/illuminazione, restyling).
- Storytelling / asset dei personaggi: mantenere i personaggi coerenti tra pannelli e scene.