Gemini 3 Pro (Preview) là mô hình suy luận đa phương thức đầu bảng mới nhất của Google/DeepMind trong gia đình Gemini 3. Được định vị là “mô hình thông minh nhất của họ đến nay”, mô hình này được thiết kế cho suy luận sâu, quy trình làm việc dựa trên tác tử, lập trình nâng cao và khả năng hiểu đa phương thức với ngữ cảnh dài (văn bản, hình ảnh, âm thanh, video, mã và tích hợp công cụ).
Tính năng chính
- Các phương thức: Văn bản, hình ảnh, video, âm thanh, PDF (và đầu ra công cụ có cấu trúc).
- Tác tử/công cụ: Gọi hàm tích hợp, tìm kiếm-như-một-công-cụ, thực thi mã, ngữ cảnh URL và hỗ trợ điều phối tác tử nhiều bước. Cơ chế “thought-signature” duy trì chuỗi suy luận nhiều bước giữa các lần gọi.
- Lập trình & “vibe coding”: Tối ưu cho tạo front-end, tạo UI tương tác và lập trình theo tác tử (đứng đầu các bảng xếp hạng liên quan do Google báo cáo). Được quảng bá là mẫu mạnh nhất cho “vibe coding” đến nay.
- Điều khiển mới cho lập trình viên:
thinking_level(low|high) để đánh đổi chi phí/độ trễ với độ sâu suy luận, vàmedia_resolutionđể kiểm soát độ trung thực đa phương thức theo từng ảnh hoặc khung hình video. Các tùy chọn này giúp cân bằng hiệu năng, độ trễ và chi phí.
Hiệu năng benchmark
- Gemini3Pro đạt hạng nhất trên LMARE với 1501 điểm, vượt Grok-4.1-thinking (1484 điểm) và dẫn trước Claude Sonnet 4.5 cùng Opus 4.1.
- Cũng đạt hạng nhất tại đấu trường lập trình WebDevArena với 1487 điểm.
- Ở Humanity’s Last Exam (lý luận học thuật), đạt 37,5% (không dùng công cụ); ở GPQA Diamond (khoa học), 91,9%; và MathArena Apex (toán), 23,4%, lập kỷ lục mới.
- Về đa phương thức, MMMU-Pro đạt 81%; và Video-MMMU (hiểu video) đạt 87,6%.

Chi tiết kỹ thuật & kiến trúc
- Tham số “Thinking level”: Gemini 3 cung cấp điều khiển
thinking_levelcho phép lập trình viên đánh đổi độ sâu suy luận nội bộ với độ trễ/chi phí. Mô hình xemthinking_levelnhư một hạn mức tương đối cho suy luận nhiều bước nội bộ hơn là cam kết số lượng token nghiêm ngặt. Mặc định thường làhighcho bản Pro. Đây là điều khiển mới giúp tinh chỉnh lập kế hoạch nhiều bước và độ sâu chain-of-thought. - Đầu ra có cấu trúc & công cụ: Mô hình hỗ trợ đầu ra JSON có cấu trúc và có thể kết hợp với công cụ tích hợp sẵn (Grounding qua Google Search, ngữ cảnh URL, thực thi mã, v.v.). Một số tính năng đầu ra có cấu trúc + công cụ chỉ ở chế độ preview cho
gemini-3-pro-preview. - Tích hợp đa phương thức và tác tử: Gemini 3 Pro được xây dựng rõ ràng cho quy trình tác tử (công cụ + nhiều tác tử trên code/terminal/trình duyệt).
Giới hạn & lưu ý đã biết
- Tính chính xác chưa hoàn hảo — vẫn có thể xuất hiện ảo giác. Dù Google cho biết đã cải thiện mạnh về tính chính xác, vẫn cần kiểm chứng có căn cứ và đánh giá của con người trong các bối cảnh rủi ro cao (pháp lý, y tế, tài chính).
- Hiệu năng ngữ cảnh dài thay đổi theo nhiệm vụ. Hỗ trợ cửa sổ đầu vào 1M là khả năng ở cấp tính năng, nhưng hiệu quả thực nghiệm có thể giảm trên một số benchmark ở độ dài cực lớn (quan sát thấy điểm số giảm ở mức 1M trên vài bài kiểm tra ngữ cảnh dài).
- Đánh đổi chi phí & độ trễ. Ngữ cảnh lớn và
thinking_levelcao làm tăng tính toán, độ trễ và chi phí; các bậc giá áp dụng theo khối lượng token. Dùngthinking_levelvà chiến lược chia nhỏ để quản lý chi phí. - An toàn & bộ lọc nội dung. Google tiếp tục áp dụng chính sách an toàn và lớp kiểm duyệt; một số nội dung và hành động vẫn bị hạn chế hoặc kích hoạt chế độ từ chối.
So sánh Gemini 3 Pro Preview với các mô hình hàng đầu khác
So sánh mức cao (preview → định tính):
So với Gemini 2.5 Pro: Cải tiến mang tính bước nhảy về suy luận, sử dụng công cụ theo tác tử và tích hợp đa phương thức; khả năng xử lý ngữ cảnh lớn hơn và hiểu văn bản dài tốt hơn. DeepMind cho thấy mức tăng ổn định trên suy luận học thuật, lập trình và tác vụ đa phương thức.
So với GPT-5.1 và Claude Sonnet 4.5 (theo báo cáo): Trên bộ benchmark của Google/DeepMind, Gemini 3 Pro được trình bày là dẫn đầu ở nhiều thước đo về tác tử, đa phương thức và ngữ cảnh dài (xem Terminal-Bench, MMMU-Pro, AIME). Kết quả so sánh thay đổi theo từng nhiệm vụ.
Trường hợp sử dụng điển hình và giá trị cao
- Tóm tắt tài liệu/sách lớn & Hỏi & Đáp: Hỗ trợ ngữ cảnh dài khiến mô hình hấp dẫn cho đội ngũ pháp lý, nghiên cứu và tuân thủ.
- Hiểu & sinh mã ở quy mô repo: Tích hợp chuỗi công cụ lập trình và suy luận cải thiện giúp tái cấu trúc codebase lớn và quy trình đánh giá mã tự động.
- Trợ lý sản phẩm đa phương thức: Quy trình hình ảnh + văn bản + âm thanh (hỗ trợ khách hàng tiếp nhận ảnh chụp màn hình, trích đoạn cuộc gọi và tài liệu).
- Tạo & biên tập media (ảnh → video): Các tính năng của gia đình Gemini trước đây nay bao gồm khả năng ảnh→video kiểu Veo / Flow; bản preview gợi ý khả năng tạo đa phương tiện sâu hơn cho nguyên mẫu và quy trình media.