คุณสมบัติพื้นฐาน
- ข้อความ → ภาพ: การสร้างแบบขับเคลื่อนด้วยพรอมป์เต็มรูปแบบ พร้อมการยึดตามพรอมป์อย่างเคร่งครัด
- ภาพ → ภาพ (การแก้ไข): การแก้ไขแบบละเอียด ตรงจุด พร้อมรักษาความคงเส้นคงวาของตัวแบบ/ตัวละครข้ามหลายรอบการแก้ไข
- ความละเอียดผลลัพธ์สูงสุด: สูงสุดถึง 4K (ตัวอย่างและขนาดพิกเซลที่รองรับขึ้นกับอัตราส่วนภาพ; API มีพรีเซ็ต 1K/2K/4K)
- การวางแผนแบบวนรอบและการแก้ไขตนเอง: ไปป์ไลน์ภายในแบบ “หลายสเตจ” ที่ตรวจจับและแก้ไขข้อผิดพลาดภาพที่พบบ่อย (มุมมอง, ข้อความ, เรขาคณิตละเอียด)
- การเรนเดอร์ข้อความในภาพขั้นสูง: ข้อความหลายภาษาคมชัด อ่านง่าย (ตั้งแต่คำบรรยายสั้นจนถึงย่อหน้าที่ยาว) เหมาะกับโปสเตอร์ ม็อกอัป และอินโฟกราฟิก
- ตัวละคร 5 ตัว และความคงเส้นคงวาสำหรับสูงสุด 14 วัตถุ/ภาพอ้างอิง ในเวิร์กโฟลว์เดียว
- ลายน้ำ / ที่มา: รูปภาพที่สร้างทั้งหมดมีลายน้ำ SynthID; โมเดลฝังเมทาดาทา C2PA เพื่อการระบุที่มาในบางการผสานรวมกับผลิตภัณฑ์
เวอร์ชันและการตั้งชื่อ Gemini 3 Pro Image
gemini-3-pro-image-previewgemini-3-pro-image
รายละเอียดทางเทคนิค
สถาปัตยกรรม
- สายตระกูล / แบ็กโบน: Nano Banana Pro สร้างบนสแตกภาพของ Gemini ที่กำลังพัฒนา — โดยเฉพาะสถาปัตยกรรม Gemini 3 Pro Image / GEMPIX 2 (เฟรมเวิร์กภาพ+ข้อความมัลติโหมดความจุสูงกว่า) ซึ่งวิวัฒน์มาจาก Gemini 2.5 Flash Image (“nano-banana” ต้นฉบับ) สู่โมเดลภาพแบบมัลติโหมดโดยกำเนิดที่ขยายความสามารถในการให้เหตุผลด้านการมองเห็น-ภาษา
- พฤติกรรมของโมเดล: มัลติโหมดโดยกำเนิด (ภาพ + ข้อความ + ความรู้เกี่ยวกับโลก), มีไปป์ไลน์ชัดเจนสำหรับการผสานหลายภาพ และมีตัววางแผนแบบแบ่งสเตจภายในที่ปรับแต่งผลลัพธ์หลายพาสแทนการสร้างตัวอย่างเดียวแบบคงที่ รายงานช่วงแรกชี้ว่าการให้เหตุผลด้านเรขาคณิต/ออปติก (แก้ว, การหักเห) แข็งแกร่งกว่ารุ่นก่อน
- การคิด / การปรับละเอียดภายใน: โมเดลใช้กระบวนการ “คิด” ที่มองเห็นได้ภายในเพื่อปรับองค์ประกอบ (เอกสาร API ระบุพฤติกรรมนี้ และระบุว่าขั้นตอนภายในเหล่านี้ไม่ถูกคิดเป็นโทเค็นภาพสุดท้าย)
- การกราวด์และเครื่องมือ: รองรับ Search grounding (สามารถผสานข้อเท็จจริงจากเว็บในการสร้างแผนภาพ/อินโฟกราฟิก) และรองรับ system instructions เพื่อการควบคุมที่กำหนดได้มากขึ้น
พารามิเตอร์ API หลัก:
thinking_level(ต่ำ / สูง) เพื่อแลกเปลี่ยนระหว่างเวลาแฝงกับความลึกในการให้เหตุผล;media_resolution(ต่ำ/กลาง/สูง) เพื่อควบคุมโทเค็นการอ่านรายละเอียด/OCR ของภาพ;generationConfig.imageConfigเพื่อควบคุมอัตราส่วนภาพ/ความละเอียดของผลลัพธ์ภาพ
ขีดจำกัดของภาพ:
- อินพุตที่รองรับ: ข้อความและรูปภาพ (โมเดลไม่รับเสียงหรือวิดีโอเป็นอินพุตสำหรับการสร้างภาพ)
- จำนวนรูปภาพสูงสุดต่อพรอมป์: 14 (สำหรับ Gemini 3 Pro Image preview)
- ขนาดรูปภาพสูงสุด (อัปโหลด): 7 MB ต่อรูปภาพอินพุต
- อัตราส่วนภาพที่รองรับ: 1:1, 3:2, 16:9, 9:16, 21:9, เป็นต้น
ผลลัพธ์ภาพ / โทเค็น: ขีดจำกัดสูง โดยรองรับ 4K/4096px
ประสิทธิภาพบนเบนช์มาร์ก
สรุปสั้นๆ: เบนช์มาร์กสาธารณะ/ช่วงแรกส่วนใหญ่เป็นเชิงคุณภาพ/ขับเคลื่อนโดยชุมชน แต่รายงานอย่างสม่ำเสมอว่ามีการปรับปรุงอย่างมากในด้านความละเอียด การลดอาร์ติแฟกต์ และความสมจริงทางกายภาพ เมื่อเทียบกับ nano-banana ดั้งเดิม (Gemini 2.5 Flash Image) “ความท้าทาย” ที่มีการตั้งชื่อเฉพาะแสดงให้เห็นถึงพัฒนาการด้านภาพอย่างชัดเจน แต่ยังไม่มีตารางตัวเลขมาตรฐานสาธารณะจาก Google ที่เปรียบเทียบ v1 → v2 ในเมตริกการสร้างภาพมาตรฐาน
- การทดสอบเชิงคุณภาพโดยชุมชน: ขอบสะอาด รายละเอียดจุลภาคคมชัด สีเที่ยงตรง และยึดตามพรอมป์ได้ซื่อสัตย์ยิ่งขึ้น (พร็อพที่หลอนน้อยลง ตัวละครสม่ำเสมอมากขึ้น) การทดสอบไม่เป็นทางการยอดนิยม เช่น “Wine Glass Test” และ “Glass Burger Challenge” ที่ซึ่ง GEMPIX2 (Nano Banana Pro) จัดการความโปร่งใสและการหักเหได้ดีกว่ารุ่นก่อนอย่างเห็นได้ชัด
- การจัดการข้อความ: Nano Banana Pro แสดงการปรับปรุงที่เห็นได้ชัดในด้านไทโปกราฟีและการวางข้อความภายในภาพ (ซึ่งเป็นจุดอ่อนถาวรของหลายโมเดลภาพ) การเปรียบเทียบโดยชุมชนชี้ว่าตัวอักษรที่เรนเดอร์เพี้ยนลดลง
- ปริมาณงาน / UX: ความเร็วการไอเทอเรตเร็วขึ้น และ UX ที่ทำการปรับแต่งหลายสเตจที่แบ็กเอนด์ ทำให้ผู้ใช้เห็นผลลัพธ์รอบแรกที่เชื่อถือได้มากขึ้น (ลดการต้องสุ่มใหม่ด้วยตนเอง)
ข้อจำกัดและความเสี่ยง
- ตัวกรองเนื้อหาและการตรวจจับ: แพลตฟอร์มที่ผสานโมเดล (เช่น Whisk/แอปของบุคคลที่สาม) อาจเปิดใช้งานการตรวจจับคนดังหรือความเหมือนอย่างเข้มงวดและบล็อกผลลัพธ์บางอย่าง ซึ่งส่งผลต่อเวิร์กโฟลว์สร้างสรรค์ที่พึ่งพาความเหมือนคนดังที่สมจริง
- ภาพหลอน / กรณีขอบของการให้เหตุผล: แม้จะดีขึ้น โมเดลยังคงอาจสร้างอาร์ติแฟกต์ที่ไม่สมจริงทางกายภาพ โดยเฉพาะเมื่อมีข้อความสัญลักษณ์หนาแน่นภายในภาพหรือแผนภาพทางเทคนิคขั้นสูง — แม้ว่า NB2 ดูเหมือนลดข้อผิดพลาดเหล่านี้เมื่อเทียบกับบิลด์ก่อนหน้า
- ความปลอดภัยและการใช้ในทางที่ผิด: โมเดลสร้างภาพสามารถถูกใช้เพื่อสร้างเนื้อหาที่มีปัญหาหรือเป็นอันตราย Google ใช้มาตรการจำกัด ตัวกรองเนื้อหา และลายน้ำ SynthID เพื่อช่วยด้านการระบุที่มา; อย่างไรก็ดี ยังมีกรณีการใช้งานผิดวัตถุประสงค์เกิดขึ้น (กรณีอื้อฉาวระดับสูงที่เชื่อมโยงกับภาพที่ Nano Banana สร้างในบริบทการเมืองที่อ่อนไหว)
Nano Banana Pro เทียบกับโมเดลอื่นๆ
- Nano Banana Pro (GEMPIX 2 / Gemini 3 Pro Image) — การผสานกับมือถือที่แข็งแกร่ง การผสานภาพหลายภาพ การแก้ไขตัวเองแบบไอเทอเรทีฟ เนทีฟ 2K/อัปสเกล 4K ผสานแน่นกับแอป Google (Search, Photos, Workspace/Gemini) เหมาะสำหรับเวิร์กโฟลว์ที่ต้องการการแก้ไขที่เชื่อถือได้ ความต่อเนื่อง และการผสานกับบริการของ Google
- Midjourney — เด่นด้านงานศิลป์แบบสไตล์จัดและการวิศวกรรมพรอมป์โดยชุมชน; โดยทั่วไปไม่ได้เน้นการผสานหลายภาพที่แม่นยำเหมือนภาพถ่ายหรือไปป์ไลน์การแก้ไขมัลติโหมดเชิงลึก
- Stable Diffusion / โอเพ่นเวต — เปิดเต็มรูปแบบ ปรับแต่งได้สูง และโฮสต์ได้บนเครื่อง มีระบบนิเวศเช็กพอยต์และไฟน์จูนเป็นข้อได้เปรียบเด็ดขาดสำหรับงานวิจัยและการใช้งานออฟไลน์ เริ่มต้นบนมือถือแบบ “วันคลิก” น้อยกว่า และความสอดคล้องของการแก้ไขหลายภาพนอกกล่องน้อยกว่า Nano Banana Pro
- Seedream 4.0 (ByteDance) — เพิ่งถูกวางตำแหน่งชัดเจนว่าเป็นคู่แข่งของ Nano Banana โดยเน้นการเรนเดอร์ที่รวดเร็วมาก เอาต์พุต 2K และรองรับภาพอ้างอิงจำนวนมาก (สูงสุดหกรูป) วางตำแหน่งเป็นทางเลือกสำหรับมืออาชีพ/ครีเอเตอร์
(การเปรียบเทียบเหล่านี้เป็นระดับสูง; เลือกเครื่องมือให้เหมาะกับเวิร์กโฟลว์ของคุณ: ความเปิดกว้าง/การปรับแต่ง → Stable Diffusion; งานศิลป์สไตล์จัด → Midjourney; การแก้ไขบนมือถือที่ผสานและสม่ำเสมอพร้อมการไอเทอเรชันเชิงรุก → ตระกูล Nano Banana Pro/ Gemini 3 Pro Image.)
กรณีใช้งานจริง
- การแก้ไขภาพบนมือถือและฟิลเตอร์สร้างสรรค์ (การผสานกับ Google Photos — ปรับสไตล์, ผสานพื้นหลัง, จัดองค์ประกอบภาพบุคคลใหม่)
- ทรัพย์สินการตลาดและโฆษณา — สร้างคอนเซ็ปต์รวดเร็ว ตัวละครแบรนด์ที่สม่ำเสมอข้ามหลายเฟรม/มุม
- คอนเซ็ปต์อาร์ตและการทำสตอรีบอร์ด — การผสานหลายภาพช่วยคงความต่อเนื่องของตัวละครข้ามแผง
- อีคอมเมิร์ซ / ม็อกอัปสินค้า — สร้างภาพสินค้าที่สม่ำเสมอในบริบท/แสงต่างๆ
- การสร้างต้นแบบอย่างรวดเร็วสำหรับทรัพย์สิน AR/VR — เอาต์พุตคุณภาพสูง 2K/4K ที่อัปสเกลได้สำหรับการใช้งานแบบดื่มด่ำ
- วิธีเข้าถึง API ของ gemini-3-pro-image(Nano Banana Pro)
ขั้นตอนที่ต้องทำ
- เข้าสู่ระบบที่ cometapi.com หากคุณยังไม่เป็นผู้ใช้ของเรา โปรดลงทะเบียนก่อน
- รับคีย์ API สำหรับการเข้าถึงอินเทอร์เฟซ คลิก “Add Token” ที่ API token ในศูนย์ส่วนบุคคล รับรหัสโทเค็น: sk-xxxxx และส่ง
- รับ URL ของไซต์นี้:
https://api.cometapi.com/
วิธีใช้งาน
- เลือกเอ็นด์พอยต์ “
gemini-3-pro-image” เพื่อส่งคำขอ API และตั้งค่า request body วิธีการร้องขอและ request body ได้จากเอกสาร API บนเว็บไซต์ของเรา เว็บไซต์ของเรายังมีการทดสอบผ่าน Apifox เพื่อความสะดวกของคุณ - แทนที่ <YOUR_API_KEY> ด้วย CometAPI key จริงจากบัญชีของคุณ
- ใส่คำถามหรือคำขอของคุณลงในฟิลด์ content—โมเดลจะตอบกลับเนื้อหานี้
- . ประมวลผลการตอบกลับของ API เพื่อรับคำตอบที่สร้างขึ้น
CometAPI มี REST API ที่เข้ากันได้เต็มรูปแบบ—เพื่อการย้ายใช้งานที่ไร้รอยต่อ รายละเอียดสำคัญ :
- Base URL: https://api.cometapi.com/v1beta/models/gemini-3-pro-image-preview:generateContent
- Model Names:
gemini-3-pro-image - Authentication:
Bearer YOUR_CometAPI_API_KEYส่วนหัว - Content-Type:
application/json.