Gemini 3 Pro (Preview) 是 Google/DeepMind 最新的 Gemini 3 系列旗艦級多模態推理模型。其定位為「迄今最智慧的模型」,專為深度推理、代理式工作流程、高階程式設計,以及長上下文的多模態理解(文字、影像、音訊、影片、程式碼與工具整合)而設計。
關鍵功能
- 模態: 文字、影像、影片、音訊、PDF(以及結構化工具輸出)。
- 代理/工具: 內建函式呼叫、將搜尋作為工具、程式碼執行、URL 脈絡,並支援協調多步驟代理。Thought-signature 機制可在多次呼叫之間保留多步推理。
- 程式設計與「vibe coding」: 針對前端生成、互動式 UI 生成與代理式程式設計進行最佳化(據 Google 報告在相關排行榜名列前茅)。被宣稱為迄今最強的「vibe-coding」模型。
- 新的開發者控制項:
thinking_level(low|high) 可在成本/延遲與推理深度間取捨,media_resolution可控制每張圖片或影片影格的多模態保真度。這些控制項有助於平衡效能、延遲與成本。
基準測試表現
- Gemini3Pro 在 LMARE 以 1501 分獲得第一名,超過 Grok-4.1-thinking 的 1484 分,並領先 Claude Sonnet 4.5 與 Opus 4.1。
- 亦在 WebDevArena 程式設計擂台以 1487 分獲得第一名。
- 在 Humanity’s Last Exam 學術推理中,取得 37.5%(無工具);在 GPQA Diamond 科學測試中,達 91.9%;在 MathArena Apex 數學競賽中,23.4%,創下新紀錄。
- 在多模態能力方面,於 MMMU-Pro 達 81%;在 Video-MMMU 影片理解中,達 87.6%。

技術細節與架構
- 「Thinking level」參數: Gemini 3 提供
thinking_level控制,讓開發者在內部推理深度與延遲/成本間取捨。模型將thinking_level視為內部多步推理的相對配額,而非嚴格的權杖保證。對 Pro 而言,預設通常為high。這為開發者提供了明確的新控制項,以調整多步規劃與思考鏈深度。 - 結構化輸出與工具: 模型支援結構化 JSON 輸出,並可結合內建工具(Google Search grounding、URL 脈絡、程式碼執行等)。部分結構化輸出與工具組合的功能僅在
gemini-3-pro-preview提供預覽。 - 多模態與代理式整合: Gemini 3 Pro 明確為代理式工作流程打造(工具 + 多代理,跨程式碼/終端機/瀏覽器)。
限制與已知注意事項
- 事實準確性並非完美——仍可能出現幻覺。儘管 Google 宣稱事實性有所提升,但在高風險場景(法律、醫療、金融)仍需落地驗證與人工審查。
- 長上下文表現依任務而異。雖然支援 1M 輸入視窗是明確能力,但在極端長度上一些基準上實證效果會下降(在部分長上下文測試中於 1M 長度時可觀察到表現下滑)。
- 成本與延遲取捨。更大的脈絡與較高的
thinking_level設定會增加運算、延遲與費用;定價依 token 用量分級。請使用thinking_level與切分策略控管成本。 - 安全與內容過濾。Google 仍套用安全政策與稽核層;某些內容與行為受限制或會觸發拒絕模式。
Gemini 3 Pro Preview 與其他頂尖模型的比較
高層次比較(預覽 → 定性):
相較於 Gemini 2.5 Pro: 在推理、代理式工具使用與多模態整合上有躍升式改進;更大脈絡處理與更佳長篇理解。DeepMind 在學術推理、程式設計與多模態任務上顯示一致性增益。
相較於 GPT-5.1 與 Claude Sonnet 4.5(據報告): 在 Google/DeepMind 的基準測試版圖上,Gemini 3 Pro 被呈現為在多項代理、多模態與長上下文指標上領先(見 Terminal-Bench、MMMU-Pro、AIME)。實際比較結果因任務而異。
典型與高價值使用情境
- 大型文件/書籍摘要與問答:長上下文支援對法律、研究與合規團隊具吸引力。
- 以 repo 規模進行程式碼理解與生成:與開發工具鏈整合與改良推理,有助於大型程式碼庫重構與自動化程式碼審查工作流程。
- 多模態產品助理:影像 + 文字 + 音訊工作流程(客服可匯入螢幕截圖、通話片段與文件)。
- 媒體生成與編輯(照片 → 影片):早期 Gemini 系列功能現已涵蓋 Veo / Flow 風格的照片→影片能力;預覽顯示於原型與媒體工作流程中具備更深入的多媒體生成能力。