Gemini 3 Pro (предварительная версия) — новейшая флагманская многомодальная модель рассуждений из семейства Gemini 3 от Google/DeepMind. Она позиционируется как «самая интеллектуальная модель на сегодняшний день», созданная для глубоких рассуждений, агентных процессов, продвинутого кодинга и долгого контекста в мультимодальном понимании (текст, изображения, аудио, видео, код и интеграции с инструментами).
Ключевые возможности
- Модальности: текст, изображение, видео, аудио, PDF (и структурированные выходы инструментов).
- Агентность/инструменты: встроенные вызовы функций, поиск как инструмент, выполнение кода, контекст URL и поддержка оркестрации многошаговых агентов. Механизм thought-signature сохраняет многошаговые рассуждения между вызовами.
- Кодинг и «vibe coding»: оптимизирована для генерации фронтенда, интерактивной генерации UI и агентного программирования (по данным Google, возглавляет соответствующие рейтинги). Продвигается как их самая сильная на сегодня модель для «vibe‑coding».
- Новые настройки для разработчиков:
thinking_level(low|high) для выбора между стоимостью/задержкой и глубиной рассуждений, а такжеmedia_resolutionдля управления мультимодальной детализацией на кадр изображения или видео. Это помогает балансировать производительность, задержку и стоимость.
Результаты в бенчмарках
- Gemini3Pro заняла первое место в LMARE с результатом 1501, превзойдя 1484 балла у Grok-4.1-thinking, а также опередив Claude Sonnet 4.5 и Opus 4.1.
- Также заняла первое место в программинг-арене WebDevArena с результатом 1487.
- В Humanity’s Last Exam по академическим рассуждениям — 37.5% (без инструментов); в GPQA Diamond по науке — 91.9%; в математическом соревновании MathArena Apex — 23.4%, установив новый рекорд.
- В мультимодальных возможностях: по MMMU-Pro — 81%; по Video-MMMU (понимание видео) — 87.6%.

Технические детали и архитектура
- Параметр «уровень мышления»: в Gemini 3 доступен контроль
thinking_level, который позволяет разработчикам выбирать глубину внутреннего многошагового рассуждения в обмен на задержку/стоимость. Модель трактуетthinking_levelкак относительное разрешение на внутренние многошаговые рассуждения, а не как строгую гарантию по токенам. По умолчанию для Pro обычно стоитhigh. Это явный новый рычаг для настройки глубины многошагового планирования и «цепочки рассуждений». - Структурированные выходы и инструменты: модель поддерживает структурированные JSON-выводы и может сочетаться со встроенными инструментами (привязка к Google Search, контекст URL, выполнение кода и т. д.). Некоторые функции сочетания структурированных выводов с инструментами доступны только в режиме предварительной версии для
gemini-3-pro-preview. - Мультимодальные и агентные интеграции: Gemini 3 Pro напрямую ориентирована на агентные процессы (инструменты + несколько агентов поверх кода/терминалов/браузера).
Ограничения и известные нюансы
- Фактичность не идеальна — возможны галлюцинации. Несмотря на заявленные улучшения, в ответственных областях (право, медицина, финансы) необходима верификация и человеческая проверка.
- Производительность на длинных контекстах зависит от задачи. Поддержка окна ввода 1M — это твёрдая возможность, но эмпирическая эффективность может снижаться на некоторых бенчмарках при экстремальной длине (отмечены точечные снижения на 1M в ряде долгоконтекстных тестов).
- Компромиссы по стоимости и задержке. Большие контексты и повышенный
thinking_levelувеличивают вычисления, задержку и стоимость; действуют ценовые уровни в зависимости от объёмов токенов. Используйтеthinking_levelи стратегии разбиения на части для управления затратами. - Безопасность и фильтры контента. Google продолжает применять политики безопасности и слои модерации; определённый контент и действия останутся ограниченными или приведут к отказам.
Сравнение Gemini 3 Pro Preview с другими топ-моделями
Общее сравнение (предварительно → качественно):
Против Gemini 2.5 Pro: скачкообразные улучшения в рассуждениях, использовании инструментов и мультимодальной интеграции; существенно более длинный контекст и лучшее понимание длинных форм. DeepMind демонстрирует устойчивый рост в академических рассуждениях, кодинге и мультимодальных задачах.
Против GPT-5.1 и Claude Sonnet 4.5 (по данным): на наборах бенчмарков Google/DeepMind Gemini 3 Pro представляется лидирующей по ряду показателей агентности, мультимодальности и длинного контекста (см. Terminal-Bench, MMMU-Pro, AIME). Сравнительные результаты зависят от задачи.
Типичные и высокоценные сценарии использования
- Суммаризация больших документов/книг и вопросы-ответы: поддержка длинного контекста делает модель привлекательной для юристов, исследовательских и комплаенс-команд.
- Понимание и генерация кода на масштабе репозитория: интеграция с инструментальными цепочками для кодинга и улучшенные рассуждения помогают в рефакторинге больших кодовых баз и автоматизации ревью.
- Мультимодальные продуктовые ассистенты: workflows с изображениями + текстом + аудио (поддержка клиентов с использованием скриншотов, фрагментов звонков и документов).
- Генерация и редактирование медиа (фото → видео): прежние возможности семейства Gemini теперь включают Veo / Flow‑стиль фото→видео; предварительная версия указывает на более глубокую мультимедийную генерацию для прототипов и медиапроцессов.