Gemini 3 Pro (Preview) er Google/DeepMind sin nyeste flaggskipsmodell for multimodalt resonnement i Gemini 3‑familien. Den posisjoneres som deres «mest intelligente modell til nå», designet for dypt resonnement, agentbaserte arbeidsflyter, avansert koding og langkontekst multimodal forståelse (tekst, bilder, lyd, video, kode og verktøyintegrasjoner).
Nøkkelfunksjoner
- Modaliteter: Tekst, bilde, video, lyd, PDF-er (og strukturerte verktøyutdata).
- Agenter/verktøy: Innebygd funksjonskall, søk‑som‑verktøy, kodekjøring, URL‑kontekst og støtte for å orkestrere flertrinns agenter. Tankesignatur‑mekanisme bevarer flertrinnsresonnement på tvers av kall.
- Koding og «vibe‑koding»: Optimalisert for front‑end‑generering, interaktiv UI‑generering og agentbasert koding (topper relevante resultatlister rapportert av Google). Markedsføres som deres sterkeste «vibe‑koding»-modell til nå.
- Nye utviklerkontroller:
thinking_level(low|high) for å avveie kostnad/latens mot resonnementdybde, ogmedia_resolutionkontrollerer multimodal fidelitet per bilde eller videoramme. Disse hjelper med å balansere ytelse, latens og kostnad.
Benchmark-ytelse
- Gemini3Pro oppnådde førsteplass i LMARE med en score på 1501, og overgikk Grok-4.1-thinking sine 1484 poeng, samt ledet over Claude Sonnet 4.5 og Opus 4.1.
- Den tok også førsteplass i programmeringsarenaen WebDevArena med en score på 1487.
- I Humanity’s Last Exam akademisk resonnement oppnådde den 37.5% (uten verktøy); i GPQA Diamond science 91.9%; og i MathArena Apex mattkonkurranse 23.4%, og satte ny rekord.
- I multimodale kapabiliteter oppnådde MMMU-Pro 81%; og i Video-MMMU videoforståelse 87.6%.

Tekniske detaljer og arkitektur
- «Thinking level»-parameter: Gemini 3 eksponerer en
thinking_level‑kontroll som lar utviklere avveie dybden av internt resonnement mot latens/kostnad. Modellen behandlerthinking_levelsom en relativ kvote for internt flertrinnsresonnement heller enn en streng token‑garanti. Standard er typiskhighfor Pro. Dette er en eksplisitt ny kontroll for å justere flertrinns planlegging og chain‑of‑thought‑dybde. - Strukturerte utdata og verktøy: Modellen støtter strukturerte JSON‑utdata og kan kombineres med innebygde verktøy (Google Search grounding, URL‑kontekst, kodekjøring osv.). Noen funksjoner for strukturerte utdata + verktøy er kun i forhåndsvisning for
gemini-3-pro-preview. - Multimodale og agentbaserte integrasjoner: Gemini 3 Pro er eksplisitt bygget for agentbaserte arbeidsflyter (verktøy + flere agenter over kode/terminaler/nettleser).
Begrensninger og kjente forbehold
- Ikke perfekt faktualitet — hallusinasjoner er fortsatt mulig. Til tross for sterke faktualitetsforbedringer fra Google, er forankret verifisering og menneskelig gjennomgang fortsatt nødvendig i høyrisikosituasjoner (juridisk, medisinsk, finansielt).
- Ytelse på lange kontekster varierer etter oppgave. Støtte for et 1M inndatavindu er en hard kapabilitet, men empirisk effektivitet kan falle på enkelte benchmarks ved ekstreme lengder (observerte punktvise fall ved 1M på noen langtidskontekst‑tester).
- Kostnads- og latensavveininger. Store kontekster og høyere
thinking_leveløker beregning, latens og kostnad; prisnivåer gjelder basert på tokenvolumer. Brukthinking_levelog oppdelingsstrategier for å håndtere kostnader. - Sikkerhet og innholdsfiltre. Google fortsetter å anvende sikkerhetspolicyer og modereringslag; visst innhold og handlinger forblir begrenset eller vil utløse avslagsmoduser.
Slik sammenlignes Gemini 3 Pro Preview med andre toppmodeller
Sammenligning på høyt nivå (forhåndsvisning → kvalitativ):
Sammenlignet med Gemini 2.5 Pro: Vesentlige forbedringer i resonnement, agentbasert verktøybruk og multimodal integrasjon; langt større konteksthåndtering og bedre forståelse av lengre innhold. DeepMind viser konsistente gevinster på tvers av akademisk resonnement, koding og multimodale oppgaver.
Sammenlignet med GPT-5.1 og Claude Sonnet 4.5 (som rapportert): På Google/DeepMind sin benchmark‑portefølje presenteres Gemini 3 Pro som ledende på flere agentiske, multimodale og langkontekst‑metrikker (se Terminal‑Bench, MMMU‑Pro, AIME). Sammenlignende resultater varierer etter oppgave.
Typiske og høyverdige bruksområder
- Sammendrag av store dokumenter/bøker og Q&A: Støtte for lange kontekster gjør den attraktiv for juridiske miljøer, forskning og etterlevelsesteam.
- Forståelse og generering av kode på reposkala: Integrasjon med kodeverktøykjeder og forbedret resonnement hjelper ved store refaktoriseringer og automatiserte kodegjennomganger/arbeidsflyter.
- Multimodale produktassistenter: bilde + tekst + lyd‑arbeidsflyter (kundestøtte som tar inn skjermbilder, samtaleutdrag og dokumenter).
- Mediagenerering og ‑redigering (foto → video): Tidligere Gemini‑funksjoner inkluderer nå Veo‑/Flow‑stil foto→video‑kapabiliteter; forhåndsvisning antyder dypere multimediagenerering for prototyper og mediaarbeidsflyter.