Gemini 3 Pro (Preview) هو أحدث نموذج رائد متعدد الوسائط للاستدلال من Google/DeepMind ضمن عائلة Gemini 3. يتم تقديمه على أنه "أذكى نموذج لديهم حتى الآن"، ومصمم للاستدلال العميق، وسير عمل وكيلية، والبرمجة المتقدمة، وفهم متعدد الوسائط طويل السياق (نص، صور، صوت، فيديو، شيفرة وعمليات تكامل الأدوات).
الميزات الرئيسية
- الوسائط: نص، صورة، فيديو، صوت، ملفات PDF (ومخرجات أدوات مُهيكلة).
- الوكيلية/الأدوات: استدعاء الدوال المدمج، البحث كأداة، تنفيذ الشيفرة، سياق URL، ودعم تنسيق وكلاء متعددة الخطوات. آلية بصمة التفكير تحفظ الاستدلال متعدد الخطوات عبر الاستدعاءات.
- البرمجة و“vibe coding”: محسّن لتوليد الواجهة الأمامية، وتوليد واجهات تفاعلية، والبرمجة الوكيلية (يتصدر لوائح المتصدرين ذات الصلة بحسب ما أبلغت به Google). يُسوَّق على أنه أقوى نموذج “vibe-coding” لديهم حتى الآن.
- عناصر تحكم جديدة للمطورين:
thinking_level(low|high) للموازنة بين التكلفة/الكمون وعمق الاستدلال، وmedia_resolutionتتحكم بجودة الوسائط المتعددة لكل صورة أو إطار فيديو. هذه تساعد على موازنة الأداء والكمون والتكلفة.
أداء المعايير القياسية
- حقق Gemini3Pro المركز الأول في LMARE بدرجة 1501، متجاوزًا 1484 نقطة لـ Grok-4.1-thinking ومتقدمًا أيضًا على Claude Sonnet 4.5 و Opus 4.1.
- كما حقق المركز الأول في ساحة البرمجة WebDevArena بدرجة 1487.
- في اختبار Humanity’s Last Exam للاستدلال الأكاديمي، حقق 37.5% (من دون أدوات)؛ وفي GPQA Diamond للعلوم، 91.9%؛ وفي مسابقة الرياضيات MathArena Apex، 23.4%، محققًا رقمًا قياسيًا جديدًا.
- في القدرات متعددة الوسائط، حقق MMMU-Pro نسبة 81%؛ وفي فهم الفيديو Video-MMMU، 87.6%.

التفاصيل التقنية والبنية
- معامل “Thinking level”: يوفّر Gemini 3 عنصر التحكم
thinking_levelالذي يتيح للمطورين الموازنة بين عمق الاستدلال الداخلي مقابل الكمون/التكلفة. يتعامل النموذج معthinking_levelكبدل نسبي للسماح بالاستدلال الداخلي متعدد الخطوات، لا كضمان صارم لعدد الرموز. يكون الإعداد الافتراضي عادةًhighفي إصدار Pro. هذا عنصر تحكم جديد وصريح لتمكين المطورين من ضبط تخطيط متعدد الخطوات وعمق سلسلة الأفكار. - المخرجات المهيكلة والأدوات: يدعم النموذج مخرجات JSON مهيكلة ويمكن دمجه مع أدوات مدمجة (تأصيل Google Search، سياق URL، تنفيذ الشيفرة، إلخ). بعض ميزات المخرجات المهيكلة+الأدوات متاحة بوضع المعاينة فقط لـ
gemini-3-pro-preview. - تكاملات متعددة الوسائط ووكيلية: تم بناء Gemini 3 Pro صراحةً لسير عمل وكيلية (أدوات + وكلاء متعددون عبر الشيفرة/الطرفيات/المتصفح).
القيود والمحاذير المعروفة
- ليست واقعيته مثالية — ما زالت الهلوسات ممكنة. رغم التحسينات الكبيرة في الواقعية التي أعلنتها Google، تبقى المراجعة المبنية على مصادر والمراجعة البشرية ضرورية في البيئات عالية المخاطر (القانونية، الطبية، المالية).
- أداء السياقات الطويلة يختلف باختلاف المهمة. دعم نافذة إدخال بحجم 1M هو قدرة صلبة، لكن الفعالية التجريبية قد تنخفض في بعض المقاييس عند الأطوال القصوى (لوحظت انخفاضات نقطية عند 1M في بعض اختبارات السياق الطويل).
- مفاضلات بين التكلفة والكمون. تؤدي السياقات الكبيرة وإعدادات
thinking_levelالأعلى إلى زيادة الحساب والكمون والتكلفة؛ تُطبَّق شرائح التسعير بحسب أحجام الرموز. استخدمthinking_levelواستراتيجيات التقسيم إلى كتل لإدارة التكاليف. - السلامة ومرشحات المحتوى. تواصل Google تطبيق سياسات السلامة وطبقات الإشراف؛ يظل بعض المحتوى والإجراءات مقيدًا أو يفعّل أوضاع الرفض.
كيف يقارن Gemini 3 Pro Preview بنماذج القمة الأخرى
مقارنة على مستوى عالٍ (معاينة → نوعية):
مقارنةً بـ Gemini 2.5 Pro: تحسينات قفزية في الاستدلال، واستخدام الأدوات الوكيلية، والتكامل متعدد الوسائط؛ تعامل أفضل بكثير مع السياقات الأكبر وفهم أفضل للنصوص الطويلة. تُظهر DeepMind مكاسب متسقة عبر الاستدلال الأكاديمي والبرمجة والمهام متعددة الوسائط.
مقارنةً بـ GPT-5.1 و Claude Sonnet 4.5 (بحسب التقارير): على مجموعة مقاييس Google/DeepMind يُقدَّم Gemini 3 Pro بوصفه متصدرًا في عدة مقاييس وكيلية ومتعددة الوسائط وطويلة السياق (انظر Terminal-Bench و MMMU-Pro و AIME). تختلف النتائج المقارنة حسب المهمة.
حالات الاستخدام النموذجية وعالية القيمة
- تلخيص المستندات/الكتب الكبيرة وسؤال وجواب: يجعل دعم السياق الطويل منه خيارًا جذابًا لفرق الشؤون القانونية والبحث والامتثال.
- فهم الشيفرة وتوليدها على مستوى المستودع: يسهّل التكامل مع سلاسل أدوات البرمجة وتحسّن الاستدلال عمليات إعادة الهيكلة لمستودعات كبيرة وسير عمل المراجعة الآلية للشيفرة.
- مساعدات منتجات متعددة الوسائط: تدفقات عمل صورة + نص + صوت (دعم العملاء الذي يستوعب لقطات شاشة ومقتطفات مكالمات ومستندات).
- توليد الوسائط وتحريرها (صورة → فيديو): باتت ميزات عائلة Gemini السابقة تشمل قدرات تحويل الصور إلى فيديو بأسلوب Veo / Flow؛ وتشير المعاينة إلى توليد وسائط متعددة أعمق للنماذج الأولية وتدفقات عمل الوسائط.