Unlock exclusive introductory pricing for the newly launched Gemini 3.5 Flash.

GPT-4o Lyd-API

CometAPI
annaJun 11, 2025
GPT-4o Lyd-API

GPT-4o lyd-API: En samlet /chat/completions endpoint-udvidelse, der accepterer Opus-kodet lyd (og tekst) input og returnerer syntetiseret tale eller transskriptioner med konfigurerbare parametre (model=gpt-4o-audio-preview-<date>, speed, temperature) til batch- og streaming-stemmeinteraktioner.

Grundlรฆggende information om GPT-4o Audio

GPT-4o lydforhรฅndsvisning (gpt-4o-audio-preview-2025-06-03) er OpenAIs nyeste talecentreret stor sprogmodel gjort tilgรฆngelig via standarden Chat Completions API snarere end realtidskanalen med ultralav latenstid. Bygget pรฅ det samme "omni"-fundament som GPT-4o, er denne variant specialiseret i hรธjkvalitets taleinput og -output til turbaserede samtaler, indholdsoprettelse, tilgรฆngelighedsvรฆrktรธjer og agentiske arbejdsgange, der ikke krรฆver millisekundtiming. Den arver alle tekstrรฆsonnementsstyrker fra GPT-4-klassemodeller, samtidig med at den tilfรธjer end-to-end tale-til-tale (S2S) rรธrledninger, deterministiske funktionskald, og den nye speed parameter til kontrol af stemmehastighed.


Kernefunktionssรฆt i GPT-4o Audio

โ€ข Samlet tale-til-tale-behandling โ€“ Lyd transformeres direkte til semantisk rige tokens, bearbejdes og syntetiseres igen uden eksterne STT/TTS-tjenester, hvilket giver konsistent stemmeklang, prosodi og kontekstbevarelse.
โ€ข Forbedret instruktionsfรธlelse โ€“ Levering af tuning i juni 2025 +19 point bestรฅet ved 1. klasse pรฅ stemmekommandoopgaver i forhold til GPT-2024o-grundlinjen fra maj 4, hvilket reducerer hallucinationer inden for omrรฅder som kundesupport og udarbejdelse af indhold.
โ€ข Stabil vรฆrktรธjsopkald โ€“ Modeloutputtene struktureret JSON der overholder OpenAI-funktionskaldsskemaet, hvilket muliggรธr udlรธsning af backend-API'er (sรธgning, booking, betalinger) med >95 % argumentnรธjagtighed.
โ€ข speed Parameter (0.25โ€“4ร—) โ€“ Udviklere kan modulere taleafspilning til langsomt lรฆringstempo, normal fortรฆlling eller hurtig "hรธrbar skimming"-tilstande, uden resyntetisering af tekst eksternt.
โ€ข Afbrydelsesbevidst turtagning โ€“ Selvom den ikke er lige sรฅ latenstidsdrevet som Realtime-varianten, understรธtter forhรฅndsvisningen delvis streamingTokens udsendes, sรฅ snart de er beregnet, hvilket giver brugerne mulighed for at afbryde tidligt, hvis det er nรธdvendigt.


Teknisk arkitektur af GPT-4o

โ€ข Enkeltstabeltransformer โ€“ Ligesom alle GPT-4o-derivater anvender lydforhรฅndsvisningen en samlet encoder-dekoder hvor tekst og akustiske tokens passerer gennem identiske opmรฆrksomhedsblokke, hvilket fremmer tvรฆrmodal jordforbindelse.
โ€ข Hierarkisk lydtokenisering โ€“ Rรฅ 16 kHz PCM โ†’ log-mel patches โ†’ grove akustiske koder โ†’ semantiske tokensDenne flertrinskompression opnรฅr 40โ€“50ร— bรฅndbreddereduktion samtidig med at nuancer bevares, hvilket muliggรธr klip pรฅ flere minutter pr. kontekstvindue.
โ€ข NF4 kvantiserede vรฆgte โ€“ Konklusionen afgives kl. 4-bit Normal-Float prรฆcision, halvering af GPU-hukommelse sammenlignet med fp16 og opretholdelse 70+ streaming RTF (realtidsfaktor) pรฅ A100-80 GB-noder.
โ€ข Streamingopmรฆrksomhed og KV-caching โ€“ Roterende indlejringer med glidende vinduer opretholder kontekst i over ~30 sekunders tale, samtidig med at de bevarer O(L) hukommelsesforbrug, ideelt til podcast-editorer eller lรฆsehjรฆlpemidler.


Versionsstyring og navngivning โ€”ย Forhรฅndsvisning af spor med datostemplede builds

IdentifierKanalFormรฅlSlip DatoStabilitet
gpt-4o-lyd-forhรฅndsvisning-2025-06-03Chat Completions APITurbaserede lydinteraktioner, agentopgaverJuni 03 2025Eksempelย (feedback er velkommen)

Nรธgleelementer i navnet:

  1. gpt-4oย โ€“ Omni multimodal familie.
  2. lydย โ€“ Optimeret til talebrug.
  3. forhรฅndsvisningย โ€“ API-kontrakten kan udvikle sig; ikke GA endnu.
  4. 2025-06-03ย โ€“ ร˜jebliksbillede af trรฆning og implementering for reproducerbarhed.

Sรฅdan kalder du GPT-4o Audio API API fra CometAPI

GPT-4o Audio APIย API-priser i CometAPI:

  • Input-tokens: $2 / M-tokens
  • Output-tokens: $8 / M-tokens

Pรฅkrรฆvede trin

  • Log ind pรฅย cometapi.com. Hvis du ikke er vores bruger endnu, bedes du registrere dig fรธrst
  • Fรฅ adgangslegitimations-API-nรธglen til grรฆnsefladen. Klik pรฅ "Tilfรธj token" ved API-tokenet i det personlige center, fรฅ token-nรธglen: sk-xxxxx og send.
  • Hent url'en til dette websted:ย https://api.cometapi.com/

Brugsmetoder

  1. Vรฆlg "gpt-4o-audio-preview-2025-06-03"slutpunkt" til at sende anmodningen og angive anmodningsteksten. Anmodningsmetoden og anmodningsteksten er hentet fra vores hjemmesides API-dokumentation. Vores hjemmeside tilbyder ogsรฅ Apifox-tests for din bekvemmelighed.
  2. Erstatte med din faktiske CometAPI-nรธgle fra din konto.
  3. Indsรฆt dit spรธrgsmรฅl eller din anmodning i indholdsfeltet โ€“ det er det, modellen vil reagere pรฅ.
  4. . Behandle API-svaret for at fรฅ det genererede svar.

For information om modeladgang i Comet API, se venligstย API-dok.

For modelprisoplysninger i Comet API, se venligstย https://api.cometapi.com/pricing.

API-arbejdsgang โ€”ย Chat-fuldfรธrelser med lyddele og funktionskroge

  1. Input Formatย -ย audio/*ย MIME ellerย base64ย WAV-stykker indlejret iย messages[].content.
  2. Outputindstillingerย -
    โ€ขย mode: "text"ย โ†’ ren tekst til undertekster.
    โ€ขย mode: "audio"ย โ†’ returnerer enย streamingย Opus- eller ยต-law-nyttelast med tidsstempler.
  3. Funktionskaldย - Tilfรธjeย functions: ย skema; โ€‹โ€‹modellen udsenderย role: "function"ย med JSON-argumenter; udvikleren udfรธrer vรฆrktรธjskaldet og sender eventuelt resultatet tilbage i pipeform.
  4. Rate Kontrolย - Indstilย voice.speed=1.25ย for at accelerere afspilningen; sikre omrรฅder 0.25โ€“4.0.
  5. Token-/lydgrรฆnserย โ€“ 128 k kontekst (~4 min tale) ved opstart;ย 4096 lydtokens / 8192 teksttokensย hvad end der fรธrst kommer.

Eksempelkode og API-integration

pythonimport openai

openai.api_key = "YOUR_API_KEY"

# Single-step audio completion (batch)

with open("prompt.wav", "rb") as audio:
    response = openai.ChatCompletion.create(
        model="gpt-4o-audio-preview-2025-06-03",
        messages=[
            {"role": "system", "content": "You are a helpful voice assistant."},
            {"role": "user", "content": "audio", "audio": audio}
        ],
        temperature=0.3,
        speed=1.2  # 20% faster playback

    )

print(response.choices.message)
  • Highlights:
  • model: "gpt-4o-audio-preview-2025-06-03"
  • lyd nรธgle ind bruger besked til at sende binรฆr strรธm
  • hastighed: Betjeningselementer stemmehastighed mellem langsom (0.5) og hurtig (2.0)
  • temperatur: Vรฆgt kreativitet vs konsistens

Tekniske indikatorer โ€”ย Latens, kvalitet, nรธjagtighed

metricLydforhรฅndsvisningGPT-4o (kun tekst)Delta
Fรธrste token-forsinkelse (1-skud)1.2 sย gns0.35 s+0.85 sekunder
MOS (Taleens naturlighed, 5-point)4.43โ€”โ€”
Instruktionsoverholdelse (stemme)92 %73 %+19 pp
Funktionskald Arg Nรธjagtighed95.8 %87 %+8.8 pp
Ordfejlrate (implicit STT)5.2 %n / aโ€”
GPU-hukommelse / stream (A100-80GB)7.1 DK14 GB (fp16)-49 %

Benchmarks udfรธrt via streaming af Chat Completions, batchstรธrrelse = 1.

Se ogsรฅ GPT-4o Realtids-API

GPT-4o Lyd

Klar til at skรฆre AI-udviklingsomkostninger med 20%?

Kom gratis i gang pรฅ fรฅ minutter. Gratis prรธvekreditter inkluderet. Intet kreditkort pรฅkrรฆvet.

Lรฆs mere