Базовые возможности
- Текст → Изображение: полная генерация по промпту с высоким уровнем следования промпту.
- Изображение → Изображение (правки): точечные, тонкие правки с сохранением консистентности сюжета/персонажей между несколькими правками.
- Максимальное разрешение вывода: до 4K (примеры и точные поддерживаемые размеры зависят от соотношения сторон; в API доступны пресеты 1K/2K/4K)
- Итеративное планирование и самокоррекция: внутренняя «многостадийная» схема, которая обнаруживает и исправляет типичные визуальные ошибки (перспектива, текст, тонкая геометрия).
- Продвинутая отрисовка текста на изображении: четкий, разборчивый мультиязычный текст (от коротких подписей до длинных абзацев), подходящий для постеров, мокапов и инфографики.
- 5 персонажей и сохранение достоверности до 14 объектов/референс‑изображений в одном рабочем процессе.
- Водяные знаки / происхождение: все сгенерированные изображения содержат водяной знак SynthID; модель встраивает метаданные C2PA для подтверждения происхождения в ряде продуктовых интеграций.
Версии и наименования Gemini 3 Pro Image
gemini-3-pro-image-previewgemini-3-pro-image
Технические детали
Архитектура
- Происхождение/базовая архитектура: Nano Banana Pro основан на развиваемом Google стеке Gemini для изображений — конкретно на новой архитектуре Gemini 3 Pro Image / GEMPIX 2 (высокоемкая мультимодальная система изображение+текст). Это эволюция от Gemini 2.5 Flash Image (оригинального «nano-banana») к нативно мультимодальной модели изображений с расширенными возможностями визуально-языкового анализа.
- Поведение модели: нативная мультимодальность (изображение + текст + знания о мире), явные конвейеры для слияния нескольких изображений и внутренний поэтапный планировщик, который уточняет результат за несколько проходов вместо единственного статического сэмпла. По ранним данным, улучшены геометрические/оптические рассуждения (стекло, преломление) по сравнению с предыдущими версиями.
- «Мышление» / внутреннее уточнение: модель использует видимый внутренний процесс «обдумывания» для уточнения композиции (это поведение описано в API; эти внутренние шаги не тарифицируются как финальные токены изображения).
- Граундинг и инструменты: поддерживает Search grounding (может включать факты из Интернета в генерацию диаграмм/инфографики). Также поддерживает системные инструкции для более детерминированного управления.
Ключевые параметры API:
thinking_level(низкий / высокий) — баланс задержки и глубины рассуждений;media_resolution(низкое/среднее/высокое) — управляет токенами чтения OCR/деталей изображения;generationConfig.imageConfig— управление соотношением сторон/разрешением выходных изображений.
Ограничения по изображениям:
- Поддерживаемые входные модальности: текст и изображения (модель не принимает аудио или видео как входы для генерации изображений).
- Макс. число изображений на промпт: 14 (для Gemini 3 Pro Image preview).
- Макс. размер изображения (загрузка): 7 MB на одно входное изображение.
- Поддерживаемые соотношения сторон: 1:1, 3:2, 16:9, 9:16, 21:9 и т. п.
Выходные изображения / токены: высокие лимиты, поддерживается 4K/4096px.
Производительность в бенчмарках
Краткое резюме: публичные/ранние бенчмарки в основном качественные и основаны на сообществе, но стабильно отмечают существенные улучшения в разрешении, уменьшении артефактов и физической достоверности по сравнению с исходным nano-banana (Gemini 2.5 Flash Image). Конкретные именованные тесты/челленджи демонстрируют явный визуальный прогресс, однако (пока) нет стандартизированных числовых таблиц бенчмарков от Google, сравнивающих v1 → v2 по стандартным метрикам генерации изображений.
- Качественные тесты сообщества: более чистые края, более резкие микродетали, более точные цвета и более верное следование промпту (меньше «галлюцинированных» объектов, более стабильные персонажи). Популярные неформальные тесты включают «Wine Glass Test» и «Glass Burger Challenge», где GEMPIX2 (Nano Banana Pro) заметно лучше справляется с прозрачностью и преломлением, чем ранние сборки.
- Работа с текстом: Nano Banana Pro заметно улучшает типографику и размещение текста внутри изображений (постоянно слабое место многих моделей). Сравнения сообщества показывают меньше испорченных/искаженных глифов.
- Пропускная способность / UX: более быстрая итерация и UX, в котором многостадийное уточнение происходит на бекенде, поэтому пользователи видят более надежные результаты первого прогона (снижается потребность в ручных перегенерациях).
Ограничения и риски
- Фильтры контента и детекция: платформы, интегрирующие модель (например, Whisk/сторонние приложения), могут включать строгую детекцию знаменитостей или внешнего сходства и блокировать определенные результаты, что влияет на творческие процессы, зависящие от реалистичных сходств с селебрити.
- Галлюцинации / крайние случаи рассуждений: хотя качество улучшено, модель все еще может допускать физически нереалистичные артефакты, особенно при плотном символическом тексте внутри изображений или в высокотехнических диаграммах — хотя NB2, по-видимому, снижает частоту таких ошибок по сравнению с ранними версиями.
- Безопасность и злоупотребления: генеративные модели изображений могут использоваться для проблемного или вредоносного контента. Google применяет ограничения, фильтры контента и водяной знак SynthID для подтверждения происхождения; тем не менее, случаи злоупотреблений были (широко обсуждавшийся инцидент, связанный с изображением, сгенерированным Nano Banana, в политически чувствительном контексте).
Как Nano Banana Pro выглядит на фоне других моделей
- Nano Banana Pro (GEMPIX 2 / Gemini 3 Pro Image) — сильная мобильная интеграция, слияние нескольких изображений, итеративная самокоррекция, нативные 2K/апскейл до 4K, тесная интеграция с приложениями Google (Search, Photos, Workspace/Gemini). Лучше всего подходит для процессов, где нужны надежные правки, непрерывность и интеграция с сервисами Google.
- Midjourney — превосходит в стилизованных художественных результатах и «инженерии промптов» в сообществе; обычно не ориентирована на фото‑точное слияние нескольких изображений или глубокие мультимодальные конвейеры редактирования.
- Stable Diffusion / открытые веса — полностью открытая, высоко настраиваемая и может хоститься локально; экосистема чекпойнтов и дообучения — решающее преимущество для исследований и офлайн‑использования. Меньше «одним кликом» мобильной интеграции и меньше консистентности мультиизображений «из коробки», чем у Nano Banana Pro.
- Seedream 4.0 (ByteDance) — недавно позиционируется как конкурент Nano Banana, делает упор на ультра‑быструю отрисовку, вывод 2K и поддержку многих референсов (до шести). Позиционируется как альтернатива для профессионалов/креаторов.
(Эти сравнения на высоком уровне; победителя выбирайте под конкретный процесс: открытость/кастомизация → Stable Diffusion; стилизованное искусство → Midjourney; интегрированное, стабильное мобильное редактирование с агрессивной итеративностью → семейство Nano Banana Pro/Gemini 3 Pro Image.)
Практические сценарии использования
- Мобильное редактирование фото и креативные фильтры (интеграции Google Photos — рестайлинг, слияние фона, реконфигурация портретов).
- Маркетинг и рекламные ассеты — быстрая генерация концептов, консистентные бренд‑персонажи в нескольких кадрах/ракурсах.
- Концепт‑арт и раскадровка — слияние нескольких изображений помогает сохранять непрерывность персонажей между кадрами.
- E‑commerce / продуктовые мокапы — генерация последовательных снимков продукта в разных контекстах/условиях освещения.
- Быстрый прототипинг для AR/VR‑ассетов — высококачественный вывод 2K/4K, который можно апскейлить для иммерсивных сценариев.
Как получить доступ к API gemini-3-pro-image (Nano Banana Pro)
Необходимые шаги
- Войдите на cometapi.com. Если вы еще не наш пользователь, сначала зарегистрируйтесь.
- Получите учетные данные — API‑ключ интерфейса. Нажмите «Add Token» в разделе API token в личном кабинете, получите ключ токена: sk-xxxxx и отправьте.
- Получите URL этого сайта:
https://api.cometapi.com/
Способ использования
- Выберите эндпоинт “
gemini-3-pro-image”, отправьте API‑запрос и задайте тело запроса. Метод и тело запроса смотрите в документации API на нашем сайте. На нашем сайте также доступен тест в Apifox для вашего удобства. - Замените <YOUR_API_KEY> на ваш реальный ключ CometAPI из аккаунта.
- Вставьте свой вопрос или запрос в поле content — на него будет отвечать модель.
- Обработайте ответ API, чтобы получить сгенерированный результат.
CometAPI предоставляет полностью совместимый REST API — для бесшовной миграции. Ключевые детали:
- Base URL: https://api.cometapi.com/v1beta/models/gemini-3-pro-image-preview:generateContent
- Model Names:
gemini-3-pro-image - Authentication:
Bearer YOUR_CometAPI_API_KEYзаголовок - Content-Type:
application/json.