Gemini 3 Pro (Preview) คือโมเดลให้เหตุผลแบบมัลติโหมดเรือธงรุ่นใหม่ล่าสุดของ Google/DeepMind ในตระกูล Gemini 3 วางตำแหน่งว่าเป็น “โมเดลที่ฉลาดที่สุดของพวกเขาในตอนนี้” ออกแบบมาสำหรับการให้เหตุผลเชิงลึก เวิร์กโฟลว์เชิงตัวแทน การเขียนโค้ดขั้นสูง และความเข้าใจแบบมัลติโหมดในบริบทยาว (ข้อความ รูปภาพ เสียง วิดีโอ โค้ด และการผสานเครื่องมือ)
คุณสมบัติหลัก
- รูปแบบสื่อ: ข้อความ รูปภาพ วิดีโอ เสียง ไฟล์ PDF (และผลลัพธ์จากเครื่องมือเชิงโครงสร้าง)
- เวิร์กโฟลว์เชิงตัวแทน/เครื่องมือ: การเรียกฟังก์ชันในตัว การค้นหาเป็นเครื่องมือ การรันโค้ด บริบทจาก URL และการประสานตัวแทนหลายขั้นตอน กลไก Thought-signature ช่วยคงการให้เหตุผลหลายขั้นตอนได้ข้ามการเรียกใช้
- Coding และ “vibe coding”: ปรับแต่งสำหรับการสร้างส่วนหน้า การสร้าง UI เชิงโต้ตอบ และการเขียนโค้ดเชิงตัวแทน (ติดอันดับสูงสุดในลีดเดอร์บอร์ดที่เกี่ยวข้องตามที่ Google รายงาน) นำเสนอว่าเป็นโมเดล “vibe-coding” ที่แข็งแกร่งที่สุดของพวกเขาจนถึงปัจจุบัน
- การควบคุมใหม่สำหรับนักพัฒนา:
thinking_level(low|high) เพื่อปรับสมดุลต้นทุน/ความหน่วงกับความลึกของการให้เหตุผล และmedia_resolutionสำหรับควบคุมความเที่ยงตรงมัลติโหมดต่อภาพหรือเฟรมวิดีโอ เพื่อช่วยปรับสมดุลประสิทธิภาพ ความหน่วง และต้นทุน
ผลการทดสอบมาตรฐาน
- The Gemini3Pro คว้าอันดับหนึ่งใน LMARE ด้วยคะแนน 1501 แซงหน้า Grok-4.1-thinking ที่ 1484 คะแนน และยังนำหน้า Claude Sonnet 4.5 และ Opus 4.1
- ได้อันดับหนึ่งในสนามโปรแกรมมิ่ง WebDevArena ด้วยคะแนน 1487
- ใน Humanity’s Last Exam ด้านเหตุผลเชิงวิชาการ ได้ 37.5% (ไม่ใช้เครื่องมือ); ใน GPQA Diamond ด้านวิทยาศาสตร์ ได้ 91.9%; และใน MathArena Apex ด้านคณิตศาสตร์ ได้ 23.4% ทำสถิติใหม่
- ด้านความสามารถมัลติโหมด ได้ MMMU-Pro 81%; และใน Video-MMMU ด้านความเข้าใจวิดีโอ ได้ 87.6%

รายละเอียดทาง技术与สถาปัตยกรรม
- พารามิเตอร์ “Thinking level”: Gemini 3 มีตัวควบคุม
thinking_levelที่ให้ผู้พัฒนาปรับสมดุลความลึกของการให้เหตุผลภายในกับความหน่วง/ต้นทุน โมเดลมองthinking_levelเป็นงบประมาณเชิงสัมพัทธ์สำหรับการให้เหตุผลหลายขั้นตอนภายใน มากกว่าจะเป็นการการันตีโทเค็น ค่าเริ่มต้นของรุ่น Pro มักเป็นhighเป็นตัวควบคุมใหม่ที่ชัดเจนเพื่อปรับความลึกของการวางแผนหลายขั้นตอนและ chain-of-thought - เอาต์พุตมีโครงสร้างและเครื่องมือ: โมเดลรองรับเอาต์พุต JSON แบบมีโครงสร้าง และสามารถใช้ร่วมกับเครื่องมือในตัว (การยึดโยงกับ Google Search บริบทจาก URL การรันโค้ด ฯลฯ) บางความสามารถ structured-output+tools เปิดให้ใช้เฉพาะแบบพรีวิวสำหรับ
gemini-3-pro-preview - การผสานมัลติโหมดและเชิงตัวแทน: สร้างขึ้นอย่างเจาะจงเพื่อเวิร์กโฟลว์เชิงตัวแทน (เครื่องมือ + ตัวแทนหลายตัวเหนือโค้ด/เทอร์มินัล/เบราว์เซอร์)
ข้อจำกัดและข้อควรระวังที่ทราบ
- ความถูกต้องของข้อเท็จจริงยังไม่สมบูรณ์ — อาจเกิดการฮัลลูซิเนชันได้ แม้จะมีการอ้างว่าปรับปรุงแล้วก็ตาม ยังจำเป็นต้องมีการตรวจสอบยึดโยงและทบทวนโดยมนุษย์ในบริบทความเสี่ยงสูง (กฎหมาย การแพทย์ การเงิน)
- ประสิทธิภาพในบริบทยาวขึ้นอยู่กับงาน แม้รองรับหน้าต่างอินพุต 1M เป็นความสามารถเชิงปริมาณ แต่ประสิทธิผลเชิงประจักษ์อาจลดลงในบางเกณฑ์เมื่อความยาวสุดขีด (พบการลดลงแบบจุดที่ 1M ในบางการทดสอบบริบทยาว)
- การแลกเปลี่ยนต้นทุนและความหน่วง บริบทขนาดใหญ่และการตั้งค่า
thinking_levelที่สูงขึ้นเพิ่มการคำนวณ ความหน่วง และต้นทุน; มีโครงสร้างราคาแยกชั้นตามปริมาณโทเค็น ใช้thinking_levelและกลยุทธ์การแบ่งชิ้นส่วนเพื่อจัดการต้นทุน - ความปลอดภัยและตัวกรองเนื้อหา Google ยังคงใช้แนวทางความปลอดภัยและชั้นการกลั่นกรอง; เนื้อหาและการกระทำบางอย่างยังถูกจำกัดหรืออาจทริกเกอร์โหมดปฏิเสธ
การเปรียบเทียบ Gemini 3 Pro Preview กับโมเดลชั้นนำอื่นๆ
ภาพรวมระดับสูง (เวอร์ชันพรีวิว → เชิงคุณภาพ):
เมื่อเทียบกับ Gemini 2.5 Pro: ก้าวกระโดดในด้านการให้เหตุผล การใช้เครื่องมือเชิงตัวแทน และการผสานมัลติโหมด; รองรับบริบทขนาดใหญ่กว่าและความเข้าใจงานระยะยาวที่ดีขึ้น DeepMind แสดงผลลัพธ์เพิ่มขึ้นอย่างสม่ำเสมอในเหตุผลเชิงวิชาการ การเขียนโค้ด และงานมัลติโหมด
เมื่อเทียบกับ GPT-5.1 และ Claude Sonnet 4.5 (ตามที่รายงาน): บนชุดเกณฑ์ของ Google/DeepMind นำเสนอว่า Gemini 3 Pro นำหน้าในหลายมิติของงานเชิงตัวแทน มัลติโหมด และบริบทยาว (ดู Terminal-Bench, MMMU-Pro, AIME) โดยผลเปรียบเทียบต่างกันไปตามงาน
กรณีการใช้งานทั่วไปและมูลค่าสูง
- การสรุปเอกสาร/หนังสือขนาดใหญ่ & Q&A: การรองรับบริบทยาวทำให้เหมาะกับทีมกฎหมาย วิจัย และกำกับดูแลการปฏิบัติตามข้อกำหนด
- การทำความเข้าใจและสร้างโค้ดในระดับรีโป: การผสานกับสายเครื่องมือสำหรับโค้ดและการให้เหตุผลที่ดีขึ้นช่วยรีแฟกเตอร์โค้ดเบสขนาดใหญ่และเวิร์กโฟลว์รีวิวโค้ดอัตโนมัติ
- ผู้ช่วยผลิตภัณฑ์แบบมัลติโหมด: เวิร์กโฟลว์ภาพ + ข้อความ + เสียง (ระบบช่วยลูกค้าที่รับข้อมูลจากสกรีนช็อต ส่วนตัดการสนทนาทางโทรศัพท์ และเอกสาร)
- การสร้างและแก้ไขสื่อ (photo → video): ความสามารถจากตระกูล Gemini ก่อนหน้า เช่น Veo / Flow-style สำหรับ photo→video ปัจจุบันถูกรวมไว้; พรีวิวบ่งชี้ถึงการสร้างสื่อมัลติมีเดียที่ลึกขึ้นสำหรับต้นแบบและเวิร์กโฟลว์สื่อ