Gemini 3 Pro (Preview) er Google/DeepMinds nyeste flagskibs-multimodale ræsonneringsmodel i Gemini 3-familien. Den positioneres som deres “mest intelligente model til dato”, designet til dyb ræsonnering, agentiske arbejdsgange, avanceret kodning og multimodal forståelse med lang kontekst (tekst, billeder, lyd, video, kode og værktøjsintegrationer).
Nøglefunktioner
- Modaliteter: Tekst, billede, video, lyd, PDF’er (og strukturerede værktøjsoutput).
- Agentisk/værktøjer: Indbygget funktionskald, søgning som værktøj, kodekørsel, URL-kontekst og støtte til orkestrering af flertrins-agenter. Thought-signature-mekanisme bevarer flertrinsræsonnering på tværs af kald.
- Coding & “vibe coding”: Optimeret til front-end-generering, interaktiv UI-generering og agentisk kodning (den topper relevante ranglister rapporteret af Google). Den markedsføres som deres stærkeste “vibe-coding”-model til dato.
- Nye udviklerkontroller:
thinking_level(low|high) for at afveje omkostning/latens mod ræsonneringsdybde, ogmedia_resolutionstyrer multimodal fidelitet pr. billede eller videoramme. Disse hjælper med at balancere ydeevne, latenstid og omkostninger.
Benchmark-resultater
- Gemini3Pro opnåede førsteplads i LMARE med en score på 1501, foran Grok-4.1-thinking’s 1484 point og også foran Claude Sonnet 4.5 og Opus 4.1.
- Den opnåede også førsteplads i programmeringsarenaen WebDevArena med en score på 1487.
- I Humanity’s Last Exam (akademisk ræsonnering) opnåede den 37,5 % (uden værktøjer); i GPQA Diamond (videnskab) 91,9 %; og i MathArena Apex (matematik) 23,4 %, hvilket satte ny rekord.
- I multimodale kapabiliteter opnåede MMMU-Pro 81 %; og i Video-MMMU (videoforståelse) 87,6 %.

Tekniske detaljer og arkitektur
- “Thinking level”-parameter: Gemini 3 eksponerer en
thinking_level-kontrol, der lader udviklere afveje dybden af intern ræsonnering mod latens/omkostning. Modellen behandlerthinking_levelsom en relativ tilladelse til intern flertrinsræsonnering frem for en streng token-garanti. Standard er typiskhighfor Pro. Dette er en eksplicit ny kontrol for at tune flertrinsplanlægning og chain-of-thought-dybde. - Strukturerede output og værktøjer: Modellen understøtter strukturerede JSON-output og kan kombineres med indbyggede værktøjer (Google Search grounding, URL-kontekst, kodekørsel osv.). Nogle structured-output+tools-funktioner er kun i preview for
gemini-3-pro-preview. - Multimodale og agentiske integrationer: Gemini 3 Pro er eksplicit bygget til agentiske arbejdsgange (værktøjer + flere agenter over kode/terminaler/browser).
Begrænsninger og kendte forbehold
- Ikke perfekt faktualitet — hallucinationer er stadig mulige. På trods af stærke faktualitetsforbedringer hævdet af Google er forankret verifikation og menneskelig gennemgang stadig nødvendig i højrisko-sammenhænge (juridisk, medicinsk, finansiel).
- Ydelse på lange kontekster varierer efter opgave. Understøttelsen af et 1M input-vindue er en fast kapabilitet, men den empiriske effektivitet kan falde på nogle benchmarks ved ekstreme længder (observerede punktvise fald ved 1M på nogle langkontekst-tests).
- Afvejninger mellem omkostning og latenstid. Store kontekster og højere
thinking_leveløger beregning, latenstid og omkostninger; prisniveauer gælder baseret på token-mængder. Brugthinking_levelog chunking-strategier til at styre omkostninger. - Sikkerhed og indholdsfiltre. Google anvender fortsat sikkerhedspolitikker og moderationslag; visse indhold og handlinger er fortsat begrænsede eller vil udløse afvisningstilstande.
Sådan står Gemini 3 Pro Preview i forhold til andre topmodeller
Sammenligning på højt niveau (preview → kvalitativ):
Mod Gemini 2.5 Pro: Springvise forbedringer i ræsonnering, agentisk værktøjsbrug og multimodal integration; meget større konteksthåndtering og bedre forståelse af lange tekster. DeepMind viser konsistente gevinster på tværs af akademisk ræsonnering, kodning og multimodale opgaver.
Mod GPT-5.1 og Claude Sonnet 4.5 (ifølge rapporter): På Google/DeepMinds benchmark-sæt præsenteres Gemini 3 Pro som førende på flere agentiske, multimodale og langkontekst-metrics (se Terminal-Bench, MMMU-Pro, AIME). Sammenlignende resultater varierer efter opgave.
Typiske og højværdi-brugsscenarier
- Opsummering af store dokumenter/bøger og Q&A: lang kontekstunderstøttelse gør den attraktiv for juridiske, forsknings- og compliance-teams.
- Forståelse og generering af kode i repo-skala: integration med kodningsværktøjskæder og forbedret ræsonnering hjælper refaktorisering af store kodebaser og automatiserede kodegennemgangsarbejdsgange.
- Multimodale produktassistenter: billede + tekst + lyd-workflows (kundesupport, der indlæser skærmbilleder, klip fra opkald og dokumenter).
- Mediegenerering og -redigering (foto → video): tidligere funktioner i Gemini-familien omfatter nu Veo-/Flow-stil foto→video-muligheder; preview antyder dybere multimediegenerering til prototyper og mediearbejdsgange.