Tính năng cơ bản
- Text → Image: tạo sinh dựa trên prompt đầy đủ, bám sát prompt cao.
- Image → Image (chỉnh sửa): chỉnh sửa tinh vi, có mục tiêu, duy trì tính nhất quán về chủ thể/nhân vật qua nhiều lần chỉnh sửa.
- Độ phân giải đầu ra tối đa: lên đến 4K (ví dụ và kích thước pixel chính xác được hỗ trợ phụ thuộc vào tỷ lệ khung hình; API cung cấp các preset 1K/2K/4K)
- Lập kế hoạch lặp và tự hiệu chỉnh: pipeline “đa giai đoạn” nội bộ phát hiện và sửa các lỗi thị giác thường gặp (phối cảnh, văn bản, hình học tinh vi).
- Kết xuất văn bản trong ảnh nâng cao: văn bản đa ngôn ngữ rõ ràng, dễ đọc (từ chú thích ngắn đến đoạn dài), phù hợp cho poster, mockup và infographic.
- 5 nhân vật và độ trung thực với tối đa 14 đối tượng/ảnh tham chiếu trong một quy trình.
- Watermark / nguồn gốc: mọi ảnh tạo ra đều có watermark SynthID; mô hình nhúng siêu dữ liệu C2PA cho mục đích truy xuất nguồn gốc trong một số tích hợp sản phẩm.
Các phiên bản & cách đặt tên của Gemini 3 Pro Image
gemini-3-pro-image-previewgemini-3-pro-image
Chi tiết kỹ thuật
Kiến trúc
- Dòng dõi / backbone: Nano Banana Pro được xây dựng trên ngăn xếp hình ảnh Gemini đang phát triển của Google — cụ thể là kiến trúc Gemini 3 Pro Image / GEMPIX 2 mới (một khung đa phương thức hình ảnh+văn bản dung lượng cao hơn). Đây là sự phát triển từ Gemini 2.5 Flash Image (bản “nano-banana” gốc) thành một mô hình hình ảnh đa phương thức bản địa với năng lực suy luận thị giác-ngôn ngữ mở rộng.
- Hành vi mô hình: đa phương thức bản địa (ảnh + văn bản + tri thức thế giới), pipeline rõ ràng cho hợp nhất nhiều ảnh, cùng bộ lập kế hoạch theo giai đoạn nội bộ tinh chỉnh đầu ra qua nhiều lượt thay vì tạo một mẫu tĩnh duy nhất. Báo cáo ban đầu cho thấy khả năng suy luận hình học/quang học mạnh hơn (thủy tinh, khúc xạ) so với các phiên bản trước.
- Suy nghĩ / tinh chỉnh nội bộ: Mô hình sử dụng một quy trình “thinking” hiển thị nội bộ để tinh chỉnh bố cục (API có tài liệu về hành vi này và lưu ý các bước nội bộ đó không bị tính vào token ảnh cuối).
- Grounding & công cụ: Hỗ trợ Search grounding (có thể đưa dữ kiện web vào quá trình tạo sơ đồ/infographic). Cũng hỗ trợ chỉ thị hệ thống để kiểm soát mang tính quyết định hơn.
Tham số API chính:
thinking_level(low / high) để đánh đổi giữa độ trễ và độ sâu suy luận;media_resolution(low/medium/high) để kiểm soát token đọc OCR/chi tiết ảnh;generationConfig.imageConfigđể điều khiển tỷ lệ khung hình/độ phân giải của ảnh đầu ra.
Giới hạn ảnh:
- Các phương thức đầu vào được hỗ trợ: Văn bản và hình ảnh (mô hình không chấp nhận âm thanh hoặc video làm đầu vào tạo ảnh).
- Số ảnh tối đa mỗi prompt: 14 (đối với bản xem trước Gemini 3 Pro Image).
- Kích thước ảnh tối đa (tải lên): 7 MB cho mỗi ảnh đầu vào.
- Tỷ lệ khung hình được hỗ trợ: 1:1, 3:2, 16:9, 9:16, 21:9, v.v.
Ảnh/token đầu ra: giới hạn cao, hỗ trợ 4K/4096px.
Hiệu năng benchmark
Tóm tắt ngắn: các benchmark công khai/sớm đến nay chủ yếu mang tính định tính / do cộng đồng thực hiện, nhưng nhất quán ghi nhận cải thiện đáng kể về độ phân giải, giảm artifact và độ trung thực vật lý so với nano-banana gốc (Gemini 2.5 Flash Image). Các “challenge” có tên cụ thể cho thấy mức tăng chất lượng hình ảnh rõ rệt, nhưng hiện chưa có bảng benchmark số hóa tiêu chuẩn (công khai) từ Google so sánh v1 → v2 theo các thước đo tạo ảnh chuẩn.
- Các thử nghiệm định tính từ cộng đồng: cạnh sạch hơn, chi tiết siêu nhỏ sắc nét hơn, màu sắc trung thực hơn, và tuân thủ prompt tốt hơn (ít “hallucination” đối tượng hơn, nhân vật nhất quán hơn). Các bài thử không chính thức phổ biến gồm “Wine Glass Test” và “Glass Burger Challenge”, nơi GEMPIX2 (Nano Banana Pro) xử lý độ trong suốt và khúc xạ tốt hơn đáng kể so với các bản trước.
- Xử lý văn bản: Nano Banana Pro thể hiện cải thiện rõ rệt về chữ và bố trí văn bản trong ảnh (điểm yếu dai dẳng của nhiều mô hình ảnh). So sánh từ cộng đồng cho thấy ít ký tự hiển thị bị lỗi méo hơn.
- Thông lượng / UX: tốc độ lặp nhanh hơn và UX thực hiện tinh chỉnh đa giai đoạn ở phía backend, giúp người dùng nhận kết quả lần đầu đáng tin cậy hơn (giảm phải tạo lại thủ công).
Giới hạn & rủi ro
- Bộ lọc nội dung & nhận diện: Các nền tảng tích hợp mô hình (vd. Whisk/ứng dụng bên thứ ba) có thể bật nhận diện người nổi tiếng hoặc độ giống nghiêm ngặt và chặn một số đầu ra, ảnh hưởng đến quy trình sáng tạo dựa vào khuôn mặt người nổi tiếng chân thực.
- Hallucination / ca biên về suy luận: dù đã cải thiện, mô hình vẫn có thể tạo ra hiện tượng phi thực tế về mặt vật lý, đặc biệt với văn bản ký hiệu dày đặc trong ảnh hoặc sơ đồ kỹ thuật cao — dù NB2 có vẻ giảm những lỗi này so với các phiên bản trước.
- An toàn & lạm dụng: mô hình tạo ảnh có thể bị dùng để tạo nội dung gây vấn đề hoặc gây hại. Google áp dụng các ràng buộc, bộ lọc nội dung và watermark SynthID để hỗ trợ truy xuất nguồn gốc; tuy vậy, vẫn đã xảy ra lạm dụng (tranh cãi lớn gắn với một ảnh do Nano Banana tạo trong bối cảnh nhạy cảm chính trị).
Nano Banana Pro so sánh với các mô hình khác như thế nào
- Nano Banana Pro (GEMPIX 2 / Gemini 3 Pro Image) — tích hợp di động mạnh, hợp nhất đa ảnh, tự sửa lặp, 2K gốc/nâng cấp lên 4K, tích hợp chặt chẽ vào các ứng dụng Google (Search, Photos, Workspace/Gemini). Phù hợp nhất cho quy trình cần chỉnh sửa đáng tin cậy, tính liên tục và tích hợp với dịch vụ Google.
- Midjourney — vượt trội ở đầu ra nghệ thuật phong cách hóa và prompt engineering do cộng đồng dẫn dắt; không chủ đích nhắm tới hợp nhất đa ảnh chính xác như ảnh chụp hay pipeline chỉnh sửa đa phương thức chuyên sâu.
- Stable Diffusion / open weights — hoàn toàn mở, tùy biến cao và có thể chạy cục bộ; hệ sinh thái checkpoint và fine-tuning là lợi thế quyết định cho nghiên cứu và dùng offline. Tích hợp di động “một chạm” ít hơn và độ nhất quán chỉnh sửa đa ảnh mặc định kém hơn Nano Banana Pro.
- Seedream 4.0 (ByteDance) — gần đây được định vị rõ ràng là đối thủ của Nano Banana, nhấn mạnh kết xuất siêu nhanh, đầu ra 2K và hỗ trợ nhiều ảnh tham chiếu (tối đa sáu). Được định vị như một lựa chọn thay thế cho chuyên nghiệp/creator.
(Các so sánh này ở mức khái quát; hãy chọn theo quy trình của bạn: mở/tùy biến → Stable Diffusion; nghệ thuật phong cách hóa → Midjourney; chỉnh sửa di động tích hợp, nhất quán với lặp tích cực → Nano Banana Pro/ họ Gemini 3 Pro Image.)
Trường hợp sử dụng thực tế
- Chỉnh sửa ảnh di động & bộ lọc sáng tạo (tích hợp Google Photos — đổi phong cách, hòa trộn hậu cảnh, tái bố cục chân dung).
- Tài nguyên marketing & quảng cáo — tạo ý tưởng nhanh, nhân vật thương hiệu nhất quán qua nhiều khung/góc chụp.
- Concept art & storyboard — hợp nhất đa ảnh giúp duy trì liên tục nhân vật qua các khung truyện.
- Thương mại điện tử / mockup sản phẩm — tạo ảnh sản phẩm nhất quán trong nhiều bối cảnh/điều kiện ánh sáng.
- Dựng mẫu nhanh cho tài sản AR/VR — đầu ra 2K/4K chất lượng cao có thể nâng cấp cho trải nghiệm immersive.
- Cách truy cập API gemini-3-pro-image(Nano Banana Pro)
Các bước bắt buộc
- Đăng nhập vào cometapi.com. Nếu bạn chưa là người dùng của chúng tôi, vui lòng đăng ký trước
- Lấy khóa API truy cập của giao diện. Nhấp “Add Token” tại mục API token trong trung tâm cá nhân, nhận khóa token: sk-xxxxx và gửi.
- Lấy URL của trang này:
https://api.cometapi.com/
Phương thức sử dụng
- Chọn endpoint “
gemini-3-pro-image” để gửi yêu cầu API và thiết lập phần thân yêu cầu. Phương thức và phần thân yêu cầu lấy từ tài liệu API trên trang web của chúng tôi. Trang web cũng cung cấp bài kiểm thử Apifox để bạn tiện thử nghiệm. - Thay <YOUR_API_KEY> bằng khóa CometAPI thực tế trong tài khoản của bạn.
- Chèn câu hỏi hoặc yêu cầu của bạn vào trường content — đây là phần mô hình sẽ phản hồi.
- . Xử lý phản hồi API để lấy câu trả lời đã tạo.
CometAPI cung cấp REST API hoàn toàn tương thích — giúp chuyển đổi mượt mà. Chi tiết chính :
- URL cơ sở: https://api.cometapi.com/v1beta/models/gemini-3-pro-image-preview:generateContent
- Tên mô hình:
gemini-3-pro-image - Xác thực: header
Bearer YOUR_CometAPI_API_KEY - Content-Type:
application/json.