Unlock exclusive introductory pricing for the newly launched Gemini 3.5 Flash.

GPT-4o Audio API

CometAPI
annaJun 11, 2025
GPT-4o Audio API

GPT-4o Audio API: Een verenigd /chat/completions eindpuntextensie die Opus-gecodeerde audio- (en tekst-)invoer accepteert en gesynthetiseerde spraak of transcripties retourneert met configureerbare parameters (model=gpt-4o-audio-preview-<date>, speed, temperature) voor batch- en streaming spraakinteracties.

Basisinformatie over GPT-4o Audio

GPT-4o Audiovoorbeeld (gpt-4o-audio-preview-2025-06-03) is de nieuwste van OpenAI spraakgericht groot taalmodel beschikbaar gesteld via de standaard API voor het voltooien van chats in plaats van het Realtime-kanaal met ultralage latentie. Deze variant, gebouwd op dezelfde "omni"-basis als GPT-4o, is gespecialiseerd in spraakinvoer en -uitvoer met hoge getrouwheid voor turn-based conversaties, contentcreatie, toegankelijkheidstools en agent-workflows die geen milliseconde timing vereisen. Het erft alle tekstredeneringssterktes van GPT-4-klasse modellen en voegt er tegelijkertijd aan toe. end-to-end spraak-naar-spraak (S2S) pijpleidingen, deterministisch functie bellenen het nieuwe speed parameter voor het regelen van de spraaksnelheid.


Kernfuncties van GPT-4o Audio

โ€ข Geรผnificeerde spraak-naar-spraakverwerking โ€“ Audio wordt direct omgezet in semantisch rijke tokens, beredeneerd en opnieuw gesynthetiseerd zonder externe STT/TTS-diensten, wat resulteert in consistente stemtimbre, prosodie en contextbehoud.
โ€ข Verbeterde instructie volgen โ€“ Juni-2025 tuning levert +19 pp pass-at-1 bij taken met spraakopdrachten, vergeleken met de GPT-2024o-basislijn van mei 4, waardoor hallucinaties op gebieden als klantenondersteuning en het opstellen van inhoud werden verminderd.
โ€ข Stabiele tool-aanroep โ€“ De modeluitvoer gestructureerde JSON die voldoet aan het OpenAI-functieaanroepschema, waardoor backend-API's (zoeken, boeken, betalingen) kunnen worden geactiveerd met >95% argumentnauwkeurigheid.
โ€ข speed Parameter (0.25โ€“4ร—) โ€“ Ontwikkelaars kunnen de spraakweergave moduleren voor langzaam leren, normale vertelling of snelle โ€œhoorbare skimโ€-modi, zonder het extern opnieuw synthetiseren van tekst.
โ€ข Bewust omgaan met onderbrekingen โ€“ Hoewel niet zo latentiegedreven als de Realtime-variant, ondersteunt de preview gedeeltelijke streaming: tokens worden uitgegeven zodra ze zijn berekend, waardoor gebruikers indien nodig eerder kunnen onderbreken.


Technische architectuur van GPT-4o

โ€ข Single-Stack Transformator โ€“ Zoals alle GPT-4o-derivaten maakt de audiopreview gebruik van een uniforme encoder-decoder waarbij tekst en akoestische tokens door identieke aandachtsblokken gaan, waardoor cross-modale aarding wordt bevorderd.
โ€ข Hiรซrarchische audiotokenisatie โ€“ Ruwe 16 kHz PCM โ†’ log-mel patches โ†’ grove akoestische codes โ†’ semantische tokensDeze meertrapscompressie bereikt 40โ€“50ร— bandbreedtereductie terwijl de nuance behouden blijft en clips van meerdere minuten per contextvenster mogelijk zijn.
โ€ข NF4 gekwantiseerde gewichten โ€“ De gevolgtrekking wordt gedaan op 4-bits normaal-float precisie, waardoor het GPU-geheugen met de helft wordt verminderd in vergelijking met FP16 en 70+ streaming RTF (real-time factor) op A100-80 GB-knooppunten.
โ€ข Streaming Attention & KV-caching โ€“ Draaibare inbeddingen met schuifvensters behouden de context gedurende ongeveer 30 seconden spraak, terwijl O(L) geheugengebruik, ideaal voor podcast-editors of hulpmiddelen voor lezen.


Versiebeheer en naamgeving โ€”ย Preview Track met builds met datumstempel

IdentifierKanaalDoelRelease DateStabiliteit
gpt-4o-audio-preview-2025-06-03API voor het voltooien van chatsOp beurten gebaseerde audio-interacties, agentische takenJuni 03 2025Voorbeschouwingย (feedback wordt aangemoedigd)

Belangrijkste elementen in de naam:

  1. gpt-4oย โ€“ Omni-multimodale familie.
  2. audioย โ€“ Geoptimaliseerd voor spraaktoepassingen.
  3. Previewย โ€“ API-contract kan evolueren; nog niet algemeen beschikbaar.
  4. 2025-06-03ย โ€“ Momentopname van training en implementatie voor reproduceerbaarheid.

Hoe GPT-4o Audio API API aanroepen vanuit CometAPI

GPT-4o Audio APIย API-prijzen in CometAPI:

  • Invoertokens: $2 / M tokens
  • Uitvoertokens: $8 / M tokens

Vereiste stappen

  • Inloggenย cometapi.com. Als u nog geen gebruiker van ons bent, registreer u dan eerst
  • Haal de API-sleutel voor de toegangsgegevens van de interface op. Klik op 'Token toevoegen' bij de API-token in het persoonlijke centrum, haal de tokensleutel op: sk-xxxxx en verstuur.
  • Haal de url van deze site op:ย https://api.cometapi.com/

Gebruiksmethoden

  1. Selecteer de optie "gpt-4o-audio-preview-2025-06-03"eindpunt om de aanvraag te verzenden en de aanvraagbody in te stellen. De aanvraagmethode en de aanvraagbody zijn te vinden in de API-documentatie op onze website. Onze website biedt ook een Apifox-test voor uw gemak.
  2. Vervangen met uw werkelijke CometAPI-sleutel van uw account.
  3. Vul het inhoudsveld in en het model zal hierop reageren.
  4. Verwerk het API-antwoord om het gegenereerde antwoord te verkrijgen.

Voor informatie over Modeltoegang in Comet API, zieย API-document.

Voor informatie over de modelprijs in Comet API, zieย https://api.cometapi.com/pricing.

API-workflow โ€”ย Chat-aanvullingen met audio-onderdelen en functie-hooks

  1. Invoer formaatย -ย audio/*ย MIME ofย base64ย WAV-fragmenten ingebed inย messages[].content.
  2. Uitvoeroptiesย -
    โ€ขย mode: "text"ย โ†’ pure tekst voor ondertiteling.
    โ€ขย mode: "audio"ย โ†’ retourneert eenย streamingย Opus- of ยต-law-payload met tijdstempels.
  3. Functie-aanroepย - Toevoegenย functions: ย schema; het model zendt uitย role: "function"ย met JSON-argumenten; de ontwikkelaar voert de toolaanroep uit en stuurt optioneel het resultaat terug.
  4. rate controlย - Instellenย voice.speed=1.25ย om het afspelen te versnellen; veilige bereiken 0.25โ€“4.0.
  5. Token-/audiolimietenย โ€“ 128 k context (~4 min spraak) bij de lancering;ย 4096 audiotokens / 8192 teksttokensย welke het eerst komt.

Voorbeeldcode en API-integratie

pythonimport openai

openai.api_key = "YOUR_API_KEY"

# Single-step audio completion (batch)

with open("prompt.wav", "rb") as audio:
    response = openai.ChatCompletion.create(
        model="gpt-4o-audio-preview-2025-06-03",
        messages=[
            {"role": "system", "content": "You are a helpful voice assistant."},
            {"role": "user", "content": "audio", "audio": audio}
        ],
        temperature=0.3,
        speed=1.2  # 20% faster playback

    )

print(response.choices.message)
  • Hoogtepunten:
  • model: "gpt-4o-audio-preview-2025-06-03"
  • audio sleutel in gebruiker bericht om binaire stroom te verzenden
  • snelheid: Bedieningselementen stemsnelheid tussen langzaam (0.5) en snel (2.0)
  • temperatuur-: Balansen creativiteit vs consistentie

Technische indicatoren โ€”ย Latentie, kwaliteit, nauwkeurigheid

metrischAudiovoorbeeldGPT-4o (alleen tekst)Delta
Eerste tokenlatentie (1-shot)1.2 sย avg0.35 s+0.85 s
MOS (spraaknatuurlijkheid, 5 pt)4.43--
Instructienaleving (spraak)92%73%+19 pagina's
Nauwkeurigheid van functieaanroep Arg95.8%87%+8.8 pagina's
Woordfoutpercentage (impliciete STT)5.2%n / a-
GPU-geheugen/stream (A100-80GB)7.1 GB14 GB (fp16)โˆ’49%

Benchmarks uitgevoerd via Chat Completions streaming, batchgrootte = 1.

Zie ook GPT-4o Realtime API

GPT-4o Audio

Klaar om de AI-ontwikkelingskosten met 20% te verlagen?

Start gratis in enkele minuten. Gratis proeftegoeden inbegrepen. Geen creditcard vereist.

Lees Meer