GPT-4o lyd-API: En samlet /chat/completions endpoint-udvidelse, der accepterer Opus-kodet lyd (og tekst) input og returnerer syntetiseret tale eller transskriptioner med konfigurerbare parametre (model=gpt-4o-audio-preview-<date>, speed, temperature) til batch- og streaming-stemmeinteraktioner.
Grundlรฆggende information om GPT-4o Audio
GPT-4o lydforhรฅndsvisning (gpt-4o-audio-preview-2025-06-03) er OpenAIs nyeste talecentreret stor sprogmodel gjort tilgรฆngelig via standarden Chat Completions API snarere end realtidskanalen med ultralav latenstid. Bygget pรฅ det samme "omni"-fundament som GPT-4o, er denne variant specialiseret i hรธjkvalitets taleinput og -output til turbaserede samtaler, indholdsoprettelse, tilgรฆngelighedsvรฆrktรธjer og agentiske arbejdsgange, der ikke krรฆver millisekundtiming. Den arver alle tekstrรฆsonnementsstyrker fra GPT-4-klassemodeller, samtidig med at den tilfรธjer end-to-end tale-til-tale (S2S) rรธrledninger, deterministiske funktionskald, og den nye speed parameter til kontrol af stemmehastighed.
Kernefunktionssรฆt i GPT-4o Audio
โข Samlet tale-til-tale-behandling โ Lyd transformeres direkte til semantisk rige tokens, bearbejdes og syntetiseres igen uden eksterne STT/TTS-tjenester, hvilket giver konsistent stemmeklang, prosodi og kontekstbevarelse.
โข Forbedret instruktionsfรธlelse โ Levering af tuning i juni 2025 +19 point bestรฅet ved 1. klasse pรฅ stemmekommandoopgaver i forhold til GPT-2024o-grundlinjen fra maj 4, hvilket reducerer hallucinationer inden for omrรฅder som kundesupport og udarbejdelse af indhold.
โข Stabil vรฆrktรธjsopkald โ Modeloutputtene struktureret JSON der overholder OpenAI-funktionskaldsskemaet, hvilket muliggรธr udlรธsning af backend-API'er (sรธgning, booking, betalinger) med >95 % argumentnรธjagtighed.
โข speed Parameter (0.25โ4ร) โ Udviklere kan modulere taleafspilning til langsomt lรฆringstempo, normal fortรฆlling eller hurtig "hรธrbar skimming"-tilstande, uden resyntetisering af tekst eksternt.
โข Afbrydelsesbevidst turtagning โ Selvom den ikke er lige sรฅ latenstidsdrevet som Realtime-varianten, understรธtter forhรฅndsvisningen delvis streamingTokens udsendes, sรฅ snart de er beregnet, hvilket giver brugerne mulighed for at afbryde tidligt, hvis det er nรธdvendigt.
Teknisk arkitektur af GPT-4o
โข Enkeltstabeltransformer โ Ligesom alle GPT-4o-derivater anvender lydforhรฅndsvisningen en samlet encoder-dekoder hvor tekst og akustiske tokens passerer gennem identiske opmรฆrksomhedsblokke, hvilket fremmer tvรฆrmodal jordforbindelse.
โข Hierarkisk lydtokenisering โ Rรฅ 16 kHz PCM โ log-mel patches โ grove akustiske koder โ semantiske tokensDenne flertrinskompression opnรฅr 40โ50ร bรฅndbreddereduktion samtidig med at nuancer bevares, hvilket muliggรธr klip pรฅ flere minutter pr. kontekstvindue.
โข NF4 kvantiserede vรฆgte โ Konklusionen afgives kl. 4-bit Normal-Float prรฆcision, halvering af GPU-hukommelse sammenlignet med fp16 og opretholdelse 70+ streaming RTF (realtidsfaktor) pรฅ A100-80 GB-noder.
โข Streamingopmรฆrksomhed og KV-caching โ Roterende indlejringer med glidende vinduer opretholder kontekst i over ~30 sekunders tale, samtidig med at de bevarer O(L) hukommelsesforbrug, ideelt til podcast-editorer eller lรฆsehjรฆlpemidler.
Versionsstyring og navngivning โย Forhรฅndsvisning af spor med datostemplede builds
| Identifier | Kanal | Formรฅl | Slip Dato | Stabilitet |
|---|---|---|---|---|
| gpt-4o-lyd-forhรฅndsvisning-2025-06-03 | Chat Completions API | Turbaserede lydinteraktioner, agentopgaver | Juni 03 2025 | Eksempelย (feedback er velkommen) |
Nรธgleelementer i navnet:
- gpt-4oย โ Omni multimodal familie.
- lydย โ Optimeret til talebrug.
- forhรฅndsvisningย โ API-kontrakten kan udvikle sig; ikke GA endnu.
- 2025-06-03ย โ รjebliksbillede af trรฆning og implementering for reproducerbarhed.
Sรฅdan kalder du GPT-4o Audio API API fra CometAPI
GPT-4o Audio APIย API-priser i CometAPI:
- Input-tokens: $2 / M-tokens
- Output-tokens: $8 / M-tokens
Pรฅkrรฆvede trin
- Log ind pรฅย cometapi.com. Hvis du ikke er vores bruger endnu, bedes du registrere dig fรธrst
- Fรฅ adgangslegitimations-API-nรธglen til grรฆnsefladen. Klik pรฅ "Tilfรธj token" ved API-tokenet i det personlige center, fรฅ token-nรธglen: sk-xxxxx og send.
- Hent url'en til dette websted:ย
https://api.cometapi.com/
Brugsmetoder
- Vรฆlg "
gpt-4o-audio-preview-2025-06-03"slutpunkt" til at sende anmodningen og angive anmodningsteksten. Anmodningsmetoden og anmodningsteksten er hentet fra vores hjemmesides API-dokumentation. Vores hjemmeside tilbyder ogsรฅ Apifox-tests for din bekvemmelighed. - Erstatte med din faktiske CometAPI-nรธgle fra din konto.
- Indsรฆt dit spรธrgsmรฅl eller din anmodning i indholdsfeltet โ det er det, modellen vil reagere pรฅ.
- . Behandle API-svaret for at fรฅ det genererede svar.
For information om modeladgang i Comet API, se venligstย API-dok.
For modelprisoplysninger i Comet API, se venligstย https://api.cometapi.com/pricing.
API-arbejdsgang โย Chat-fuldfรธrelser med lyddele og funktionskroge
- Input Formatย -ย
audio/*ย MIME ellerยbase64ย WAV-stykker indlejret iยmessages[].content. - Outputindstillingerย -
โขยmode: "text"ย โ ren tekst til undertekster.
โขยmode: "audio"ย โ returnerer enย streamingย Opus- eller ยต-law-nyttelast med tidsstempler. - Funktionskaldย - Tilfรธjeย
functions:ย skema; โโmodellen udsenderยrole: "function"ย med JSON-argumenter; udvikleren udfรธrer vรฆrktรธjskaldet og sender eventuelt resultatet tilbage i pipeform. - Rate Kontrolย - Indstilย
voice.speed=1.25ย for at accelerere afspilningen; sikre omrรฅder 0.25โ4.0. - Token-/lydgrรฆnserย โ 128 k kontekst (~4 min tale) ved opstart;ย 4096 lydtokens / 8192 teksttokensย hvad end der fรธrst kommer.
Eksempelkode og API-integration
pythonimport openai
openai.api_key = "YOUR_API_KEY"
# Single-step audio completion (batch)
with open("prompt.wav", "rb") as audio:
response = openai.ChatCompletion.create(
model="gpt-4o-audio-preview-2025-06-03",
messages=[
{"role": "system", "content": "You are a helpful voice assistant."},
{"role": "user", "content": "audio", "audio": audio}
],
temperature=0.3,
speed=1.2 # 20% faster playback
)
print(response.choices.message)
- Highlights:
- model:
"gpt-4o-audio-preview-2025-06-03" - lyd nรธgle ind bruger besked til at sende binรฆr strรธm
- hastighed: Betjeningselementer stemmehastighed mellem langsom (0.5) og hurtig (2.0)
- temperatur: Vรฆgt kreativitet vs konsistens
Tekniske indikatorer โย Latens, kvalitet, nรธjagtighed
| metric | Lydforhรฅndsvisning | GPT-4o (kun tekst) | Delta |
|---|---|---|---|
| Fรธrste token-forsinkelse (1-skud) | 1.2 sย gns | 0.35 s | +0.85 sekunder |
| MOS (Taleens naturlighed, 5-point) | 4.43 | โ | โ |
| Instruktionsoverholdelse (stemme) | 92 % | 73 % | +19 pp |
| Funktionskald Arg Nรธjagtighed | 95.8 % | 87 % | +8.8 pp |
| Ordfejlrate (implicit STT) | 5.2 % | n / a | โ |
| GPU-hukommelse / stream (A100-80GB) | 7.1 DK | 14 GB (fp16) | -49 % |
Benchmarks udfรธrt via streaming af Chat Completions, batchstรธrrelse = 1.
Se ogsรฅ GPT-4o Realtids-API

