Unlock exclusive introductory pricing for the newly launched Gemini 3.5 Flash.

GPT-4o Realtids-API

CometAPI
annaJun 11, 2025
GPT-4o Realtids-API

GPT-4o Realtids-API: Et multimodalt streaming-slutpunkt med lav latenstid, der giver udviklere mulighed for at sende og modtage synkroniserede tekst-, lyd- og billeddata via WebRTC eller WebSocket (model=gpt-4o-realtime-preview-<date>, stream=true) til interaktive realtidsapplikationer.


Grundlรฆggende oplysninger og funktioner

OpenAI'er GPT-4o Realtid (model-ID: gpt-4o-realtime-preview-2025-06-03) er den fรธrste offentligt tilgรฆngelige fundamentmodel, der er konstrueret til end-to-end tale-til-tale (S2S) interaktion med latenstid pรฅ under et sekundRealtime-varianten, der stammer fra "omni" GPT-4o-familien, fusionerer talegenkendelse, naturlig sproglig rรฆsonnement og neural tekst-til-tale i et enkelt netvรฆrk, hvilket giver udviklere mulighed for at bygge stemmeagenter, der kommunikerer lige sรฅ flydende som mennesker. Modellen eksponeres gennem den specialbyggede Realtime API og er tรฆt integreret med den nye Realtidsagent abstraktion indeni Agents SDK (TypeScript og Python).


Kernefunktionssรฆt โ€”ย End-to-End S2S โ€ข Afbrydelseshรฅndtering โ€ข Vรฆrktรธjsopkald

โ€ข Indfรธdt tale-til-tale: Lydinput indtages som kontinuerlige strรธmme, internt tokeniseret, bearbejdet og returneret som syntetiseret tale. Der krรฆves ingen eksterne STT/TTS-buffere, hvilket eliminerer pipeline-forsinkelser pรฅ flere sekunder.
โ€ข Millisekunders latenstid: Arkitektonisk beskรฆring, modeldestillation og en GPU-optimeret serveringstack muliggรธr ~300-500 ms latenstid for fรธrste token i typiske cloud-implementeringer, der nรฆrmer sig menneskelige samtale-turtagningsnormer.
โ€ข Robust instruktioner-fรธlgende: Finjusteret pรฅ samtalescripts og funktionskaldsspor, demonstrerer GPT-4o Realtime en >25 % reduktion i fejl i opgaveudfรธrelse sammenlignet med GPT-2024o-grundlinjen fra maj 4.
โ€ข Deterministisk vรฆrktรธjsopkald: Modellen producerer struktureret JSON i overensstemmelse med OpenAI's funktionskaldende skema, hvilket muliggรธr deterministisk kald af backend-API'er (bookingsystemer, databaser, IoT). Fejlbevidste gentagelser og argumentvalidering er indbygget.
โ€ข Yndefulde afbrydelser: En realtidsdetektor for stemmeaktivitet parret med trinvis afkodning gรธr det muligt for agenten at pause tale midt i en sรฆtning, indtage en brugerafbrydelse og genoptage eller omplanlรฆgge svaret problemfrit.
โ€ข Konfigurerbar talehastighed: En ny hastighed Parameteren (0.25โ€“4ร— realtid) giver udviklere mulighed for at skrรฆddersy outputtempo til tilgรฆngelighed eller hurtige applikationer.


Teknisk arkitektur โ€”ย Enhed for multimodal transformer

Samlet encoder-dekoder: GPT-4o Realtime deler omni-arkitekturens enkeltstaktransformator hvor lyd-, tekst- og (fremtids)visionstokens sameksisterer i รฉt latent rum. Lagvis adaptiv beregning genvejer lydbilleder direkte til senere opmรฆrksomhedsblokke og reducerer dermed 20-40 ms pr. gennemlรธb.

Hierarkisk lydtokenisering: Rรฅ 16 kHz PCM er opdelt i log-mel patches โ†’ kvantiseret til grovkornede akustiske tokens โ†’ komprimeret til semantiske tokens, hvilket optimerer token per sekund budget uden at ofre prosodi.

Lav-bit inferenskerner: Udrullede vรฆgte kรธrer ved 4-bit NF4-kvantisering via Triton / TensorRT-LLM-kerner, hvilket fordobler gennemlรธbshastigheden i forhold til fp16, samtidig med at et MOS-kvalitetstab pรฅ <1 dB opretholdes.

Streaming-opmรฆrksomhed: Roterende indlejringer med glidende vinduer og nรธglevรฆrdi-caching gรธr det muligt for modellen at hรฅndtere de sidste 15 sekunder af lyd med O(L)-hukommelse, hvilket er afgรธrende for dialoger, der varer i telefonopkaldslรฆngde.


Tekniske detaljer

  • API Version: 2025-06-03-preview
  • Transportprotokoller:
  • WebRTCUltralav latenstid (< 80 ms) til klientsidede lyd-/videostreams
  • WebSocketServer-til-server-streaming med latenstid pรฅ under 100 ms
  • Datakodning:
  • Opus codec indeni RTP pakker til lyd
  • H.264 / H.265 frame wrappers til video
  • Streaming: Bakker op stream: true at levere inkremental delvise svar, nรฅr tokens genereres
  • Ny stemmepaletIntroducerer otte nye stemmerโ€”legering, aske, ballade, koral, ekko, salvie, glimmerog versโ€”for mere udtryksfulde, menneskelignende interaktioner ..

Udviklingen af โ€‹โ€‹GPT-4o i realtid

  • Maj 2024: GPT-4o Omni debuterer med multimodal understรธttelse af tekst, lyd og billede.
  • oktober 2024: Realtime API gรฅr ind i privat beta (2024-10-01-preview), optimeret til lyd med lav latenstid.
  • December 2024Udvidet global tilgรฆngelighed af gpt-4o-realtime-preview-2024-12-17, Tilfรธjer hurtig cachelagring og flere stemmer.
  • 3. Juni, 2025: Seneste opdatering (2025-06-03-preview) ruller ud raffineret stemmepalet og ydeevneoptimeringer.

Benchmark ydeevne

  • MMLU: 88.7, hvilket overgรฅr GPT-4's 86.5 pรฅ Massiv multitask sprogforstรฅelse .
  • Talegenkendelse: Opnรฅr branchefรธrende ordfejlrater i stรธjende miljรธer, der overgรฅr Hviske basislinjer.
  • Latensitetstest:
  • Ende til ende (tale ind โ†’ tekst ud): 50-80 ms via WebRTC
  • Rundturslyd (tale ind โ†’ tale ud): <100 ms .

Tekniske indikatorer

  • gennemlรธb: Vedligeholder 15 tokens/sek. til tekststrรธmme; 24 kbps Opus for lyd.
  • Priser:
  • tekst5 USD pr. 1 million input-tokens; 20 USD pr. 1 million output-tokens
  • Audio100 USD pr. 1 million input-tokens; 200 USD pr. 1 million output-tokens.
  • tilgรฆngelighedImplementeret globalt i alle regioner, der understรธtter Realtime API'en.

Sรฅdan kalder du GPT-4o Realtime API fra CometAPI

GPT-4o Realtimeย API-priser i CometAPI:

  • Input-tokens: $2 / M-tokens
  • Output-tokens: $8 / M-tokens

Pรฅkrรฆvede trin

  • Log ind pรฅย cometapi.com. Hvis du ikke er vores bruger endnu, bedes du registrere dig fรธrst
  • Fรฅ adgangslegitimations-API-nรธglen til grรฆnsefladen. Klik pรฅ "Tilfรธj token" ved API-tokenet i det personlige center, fรฅ token-nรธglen: sk-xxxxx og send.
  • Hent url'en til dette websted:ย https://api.cometapi.com/

Brugsmetoder

  1. Vรฆlg "gpt-4o-realtime-preview-2025-06-03"slutpunkt" til at sende anmodningen og angive anmodningsteksten. Anmodningsmetoden og anmodningsteksten er hentet fra vores hjemmesides API-dokumentation. Vores hjemmeside tilbyder ogsรฅ Apifox-tests for din bekvemmelighed.
  2. Erstatte med din faktiske CometAPI-nรธgle fra din konto.
  3. Indsรฆt dit spรธrgsmรฅl eller din anmodning i indholdsfeltet โ€“ det er det, modellen vil reagere pรฅ.
  4. . Behandle API-svaret for at fรฅ det genererede svar.

For information om modeladgang i Comet API, se venligstย API-dok.

For modelprisoplysninger i Comet API, se venligstย https://api.cometapi.com/pricing.


Eksempelkode og API-integration

import openai

openai.api_key = "YOUR_API_KEY"

# Establish a Realtime WebRTC connection

connection = openai.Realtime.connect(
    model="gpt-4o-realtime-preview-2025-06-03",
    version="2025-06-03-preview",
    transport="webrtc"
)

# Stream audio frames and receive incremental text

with open("user_audio.raw", "rb") as audio_stream:
    for chunk in iter(lambda: audio_stream.read(2048), b""):
        result = connection.send_audio(chunk)
        print("Assistant:", result)
  • Nรธgleparametre:
  • model: "gpt-4o-realtime-preview-2025-06-03"
  • version: "2025-06-03-forhรฅndsvisning"
  • transport: "webrtc" forum minimal ventetid
  • stream: true forum inkremental opdateringer

Ved at kombinere state-of-the-art multimodal rรฆsonnement, en robust ny stemmepalet, og ultra-lav latenstidsstreaming, GPT-4o Realtid (2025-06-03) giver udviklere mulighed for at bygge รฆgte interaktiv, konversation AI-applikationer.

Se ogsรฅ o3-Pro API

Sikkerhed og overholdelse

OpenAI leverer GPT-4o Realtime med:
โ€ข Gelรฆndere pรฅ systemniveau: Politikken er justeret til at afvise afviste anmodninger (ekstremisme, ulovlig adfรฆrd).
โ€ข Indholdsfiltrering i realtid: Klassifikatorer under 100 ms screener bรฅde brugerinput og modeloutput fรธr emission.
โ€ข Menneskelig godkendelsesstier: Udlรธses ved kald af hรธjrisikovรฆrktรธjer (betalinger, juridisk rรฅdgivning) og udnytter Agents SDK'ens nye godkendelsesprimitiver.

GPT-4o Realtid

Klar til at skรฆre AI-udviklingsomkostninger med 20%?

Kom gratis i gang pรฅ fรฅ minutter. Gratis prรธvekreditter inkluderet. Intet kreditkort pรฅkrรฆvet.

Lรฆs mere