GPT-4.1 nano ist ein von OpenAI bereitgestelltes KI-Modell. gpt-4.1-nano: Verfügt über ein größeres Kontextfenster—unterstützt bis zu 1 Million Kontext-Token und kann diesen Kontext dank eines verbesserten Verständnisses langer Kontexte besser nutzen. Verfügt über einen aktualisierten Wissensstand bis Juni 2024. Dieses Modell unterstützt eine maximale Kontextlänge von 1,047,576 Token.

seedance-2-0

OpenAIs leistungsfähigstes Bildgenerierungsmodell mit nahezu perfekter Textdarstellung in mehreren Sprachen, bis zu 4K-Auflösung und Reasoning-gestütztem Thinking Mode. Entwickelt für Produktions-Workflows, die Genauigkeit, Geschwindigkeit und markenkonforme visuelle Ergebnisse verlangen.
.jpeg&w=3840&q=75)
Das intelligenteste und intuitivste Flaggschiffmodell von OpenAI, entwickelt für komplexes Programmieren, agentische Workflows, Computer-Nutzung, Datenanalyse und tiefgehende Forschung. Liefert Intelligenz auf Frontier-Niveau bei gleicher niedriger Latenz wie GPT-5.4, während es Aufgaben mit höherer Token-Effizienz erledigt. Das bevorzugte Modell für anspruchsvolle professionelle und unternehmensweite Workloads.

OpenAIs leistungsfähigstes Modell, entwickelt für die anspruchsvollsten Aufgaben und langandauernde agentische Workflows. GPT-5.5 Pro überzeugt bei komplexem Programmieren, der Computernutzung, tiefgehender Recherche, der Datenanalyse und wissenschaftlichem Schlussfolgern — und liefert Intelligenz auf Spitzenniveau bei GPT-5.4-Latenz mit höherer Token-Effizienz. Ideal für Unternehmens- und professionelle Anwendungsfälle, die höchste Präzision und autonome Aufgabenausführung verlangen.

GPT Image 2 is openai state-of-the-art image generation model for fast, high-quality image generation and editing. It supports flexible image sizes and high-fidelity image inputs.

Sora 2 Pro ist unser fortschrittlichstes und leistungsstärkstes Modell zur Mediengenerierung, das Videos mit synchronisiertem Audio generieren kann. Es kann aus natürlicher Sprache oder Bildern detaillierte, dynamische Videoclips generieren.

gpt-5.2-pro is the highest-capability, production-oriented member of OpenAI’s GPT-5.2 family, exposed through the Responses API for workloads that demand maximal fidelity, multi-step reasoning, extensive tool use and the largest context/throughput budgets OpenAI offers.

GPT-5.4 nano is designed for tasks where speed and cost matter most like classification, data extraction, ranking, and sub-agents.

GPT-5.4 mini brings the strengths of GPT-5.4 to a faster, more efficient model designed for high-volume workloads.

GPT-5.4 is the frontier model for complex professional work. Reasoning.effort supports: none (default), low, medium, high and xhigh.

GPT-5.3 Instant model used in ChatGPT

Äußerst leistungsstarkes Modell zur Videogenerierung, mit Soundeffekten, unterstützt das Chat-Format.

The best voice model for audio in, audio out with Chat Completions.

The best voice model for audio in, audio out.

GPT-5.3-Codex is optimized for agentic coding tasks in Codex or similar environments. GPT-5.3-Codex supports low, medium, high, and xhigh reasoning effort settings.

GPT-5.2-Codex is an upgraded version of GPT-5.2 optimized for agentic coding tasks in Codex or similar environments. GPT-5.2-Codex supports low, medium, high, and xhigh reasoning effort settings.

GPT-Image-1.5 is OpenAI’s image model in the GPT Image family . It is a natively multimodal GPT model designed to generate images from text prompts and to perform high-fidelity edits of input images while following user instructions closely.

gpt-5.2-chat-latest is the Chat-optimized snapshot of OpenAI’s GPT-5.2 family (branded in ChatGPT as GPT-5.2 Instant). It is the model for interactive/chat use cases that need a blend of speed, long-context handling, multimodal inputs and reliable conversational behaviour.
GPT-5.1-Codex-Max is OpenAI’s purpose-built agentic coding model in the GPT-5.1 family, optimized to execute long-running software engineering workflows (refactors, multi-hour agent loops, terminal automation, test runs and code review) with higher reliability and token efficiency than its predecessors.
GPT-5.1-Codex is a high-performance large language model focused on code generation and understanding, with enhanced capabilities for complex programming tasks, code reasoning, and production-level applications.
GPT-5.1 Chat ist ein an Anweisungen feinabgestimmtes konversationelles Sprachmodell für allgemeine Chat-, Reasoning- und Schreibaufgaben. Es unterstützt mehrstufige Dialoge, Zusammenfassungen, das Erstellen von Entwürfen, Fragebeantwortung auf Grundlage von Wissensbasen sowie leichtgewichtige Code-Unterstützung für In-App-Assistenten, Support-Automatisierung und Workflow-Copilots. Zu den technischen Highlights gehören chat-optimiertes Alignment, steuerbare und strukturierte Ausgaben sowie Integrationspfade für Toolaufrufe und Retrieval-Workflows, sofern verfügbar.
GPT-5.1 ist ein universell einsetzbares, instruktionsoptimiertes Sprachmodell mit Fokus auf Textgenerierung und logischem Schlussfolgern über Produkt-Workflows hinweg. Es unterstützt Dialoge über mehrere Runden, strukturierte Ausgabeformate sowie codeorientierte Aufgaben wie die Erstellung von Entwürfen, Refactoring und Erklärungen. Typische Anwendungsfälle umfassen Chat-Assistenten, retrieval-gestützte Fragebeantwortung, Datentransformation und agentenartige Automatisierung mit Tools oder APIs, sofern unterstützt. Zu den technischen Highlights zählen eine textzentrierte Modalität, das Befolgen von Anweisungen, Ausgaben im JSON-Stil und Kompatibilität mit Funktionsaufrufen in gängigen Orchestrierungs-Frameworks.
Kostenoptimierte Version von GPT Image 1. Es handelt sich um ein natives multimodales Sprachmodell, das sowohl Text- als auch Bildeingaben akzeptiert und Bildausgaben erzeugt.
GPT-5-Codex is a high-performance large language model focused on code generation and understanding, with enhanced capabilities for complex programming tasks, code reasoning, and production-level applications.
GPT-5 ist OpenAIs bisher leistungsstärkstes Code-Modell. Es zeigt erhebliche Verbesserungen bei der Generierung komplexer Frontends und beim Debuggen großer Codebasen. Es kann Ideen mit intuitiven und ästhetisch ansprechenden Ergebnissen in die Realität umsetzen und damit schöne, responsive Websites, Anwendungen und Spiele erstellen – mit nur einem Prompt. Frühe Tester haben zudem seine Designentscheidungen hervorgehoben, mit einem tieferen Verständnis für Elemente wie Abstände, Typografie und Weißraum.
GPT-5 Nano ist ein von OpenAI bereitgestelltes KI-Modell.
GPT-5 mini ist das kosten- und latenzoptimierte Mitglied der GPT-5-Familie von OpenAI, das darauf ausgelegt ist, einen Großteil der multimodalen Stärken von GPT-5 sowie seiner Stärken bei der Befolgung von Anweisungen zu deutlich geringeren Kosten für den großskaligen Produktionseinsatz bereitzustellen. Es richtet sich an Umgebungen, in denen Durchsatz, vorhersehbare Kosten pro Token und schnelle Antworten die primären Rahmenbedingungen sind, während es gleichzeitig starke allgemeine Fähigkeiten bietet.
GPT-5 Chat (latest) ist ein von OpenAI bereitgestelltes KI-Modell.
coming soon
gpt-4o-image generate images as output, optionally using images as input

GPT-5.2 is a multi-flavored model suite (Instant, Thinking, Pro) engineered for better long-context understanding, stronger coding and tool use, and materially higher performance on professional “knowledge-work” benchmarks.
OpenAI o3‑pro ist eine “pro”-Variante des o3‑Reasoning‑Modells, die darauf ausgelegt ist, länger nachzudenken und die zuverlässigsten Antworten zu liefern, indem sie privates Chain‑of‑Thought‑Reinforcement‑Learning einsetzt und neue State‑of‑the‑Art‑Benchmarks in Bereichen wie Wissenschaft, Programmierung und Wirtschaft setzt—während sie autonom Tools wie Websuche, Dateianalyse, Python‑Ausführung und visuelles Schlussfolgern über die API integriert.
Eine kostengünstige Version des Echtzeit-GPT—die in Echtzeit über WebRTC-, WebSocket- oder SIP-Verbindungen auf Audio- und Texteingaben reagieren kann.

OpenAI Text-zu-Sprache

Sprach-zu-Text, Erstellung von Übersetzungen
GPT-4o mini TTS ist ein neuronales Text-to-Speech-Modell, das für natürliche Sprachgenerierung mit geringer Latenz in benutzerorientierten Anwendungen entwickelt wurde. Es wandelt Text in natürlich klingende Sprache um, mit auswählbaren Stimmen, Ausgabe in mehreren Formaten und Streaming-Synthese für reaktionsschnelle Nutzererlebnisse. Typische Einsatzszenarien sind Sprachassistenten, IVR- und Contact-Flows, Vorlesen von Produktinhalten und Medienvertonung. Zu den technischen Highlights zählen API-basiertes Streaming und der Export in gängige Audioformate wie MP3 und WAV.
GPT-4o Transcribe ist ein Audio-zu-Text-Modell für mehrsprachige, latenzarme Spracherkennung. Es unterstützt Echtzeit-Streaming und Stapeltranskription aus gängigen Audioformaten, mit Zeichensetzung und Satzsegmentierung. Typische Anwendungsfälle sind Live-Untertitel, Eingaben für Sprachassistenten, Besprechungsnotizen sowie die Transkription von Medien- oder Anrufaufzeichnungen. Zu den technischen Highlights zählen die Unterstützung der Audio-Modalität, die Verarbeitung langer Aufnahmen und APIs, die für interaktive und serverseitige Workflows geeignet sind.
GPT-4o mini Audio Preview ist ein kompaktes, multimodales Modell zur Entwicklung dialogfähiger Audioanwendungen. Es unterstützt neben Text auch Sprachein- und -ausgabe und ermöglicht damit Spracherkennung, Sprachsynthese sowie gemischte Text-Audio-Dialoge mit Tool-/Funktionsaufrufen für strukturierte Aktionen. Typische Anwendungsfälle umfassen Sprachassistenten, Streaming-Transkription mit Zusammenfassung, IVR- und Callbot-Workflows sowie Audio-fähige In-App-Helfer. Zu den technischen Highlights zählen Audio-I/O, Streaming-Antworten, das Befolgen von Anweisungen sowie die Integration über Chat- und Tools-APIs.
GPT-4o mini Realtime Preview ist ein multimodales Echtzeitmodell für interaktive Sprach- und visuelle Erlebnisse. Es verarbeitet Sprache, Text und Bilder mit Streaming-Ein- und -Ausgabe sowie Tool-/Funktionsaufrufen für kontextgebundene Aktionen. Zu den typischen Einsatzbereichen gehören Sprachassistenten, die Live-Bearbeitung von Anrufen, Echtzeit-Untertitelung und visuelle Fragebeantwortung anhand von Kamera- oder Bildschirminhalten. Zu den technischen Highlights zählen bidirektionales Audio, das Verstehen visueller Inhalte, Streaming-Antworten und strukturierte Ausgaben über Funktionen.

GPT-4o mini Audio ist ein multimodales Modell für Sprach- und Textinteraktionen. Es führt Spracherkennung, Übersetzung und Text-zu-Sprache durch, befolgt Anweisungen und kann Tools für strukturierte Aktionen aufrufen, wobei Antworten gestreamt werden. Typische Anwendungsfälle umfassen Echtzeit-Sprachassistenten, Live-Untertitelung und -Übersetzung, Anrufzusammenfassungen und sprachgesteuerte Anwendungen. Zu den technischen Highlights gehören Audioeingabe und -ausgabe, Streaming-Antworten, Funktionsaufrufe und strukturierte JSON-Ausgabe.
Die Realtime API ermöglicht Entwicklern, latenzarme, multimodale Anwendungen zu entwickeln, einschließlich Sprach-zu-Sprach-Funktionalität. Text und Audio, die von der Realtime API verarbeitet werden, werden separat abgerechnet. Dieses Modell unterstützt eine maximale Kontextlänge von 128,000 Token.
Dieses Modell unterstützt eine maximale Kontextlänge von 128,000 Token.
An Ada-based text embedding model optimized for various NLP tasks.
A small text embedding model for efficient processing.
A large text embedding model for a wide range of natural language processing tasks.
An advanced AI model for generating images from text descriptions.
New version of DALL-E for image generation.
O4-mini ist ein von OpenAI bereitgestelltes KI-Modell.
O3-mini ist ein von OpenAI bereitgestelltes KI-Modell.
O3 ist ein von OpenAI bereitgestelltes KI-Modell.
O1-pro is an artificial intelligence model provided by OpenAI.
O1-mini is an artificial intelligence model provided by OpenAI.
O1 is an artificial intelligence model provided by OpenAI.
gpt-oss-20b is an artificial intelligence model provided by cloudflare-workers-ai.
gpt-oss-120b is an artificial intelligence model provided by cloudflare-workers-ai.
GPT-4o mini ist ein von OpenAI bereitgestelltes KI-Modell.
<div>GPT-4o ist OpenAIs fortschrittlichstes multimodales Modell, schneller und günstiger als GPT-4 Turbo, mit stärkeren visuellen Fähigkeiten. Dieses Modell verfügt über einen 128K-Kontext und einen Wissensstand bis Oktober 2023. Modelle der 1106-Serie und höher unterstützen tool_calls und function_call.</div> Dieses Modell unterstützt eine maximale Kontextlänge von 128,000 Token.
GPT-4.1 mini ist ein von OpenAI bereitgestelltes KI-Modell. gpt-4.1-mini: Ein bedeutender Sprung in der Leistung kleiner Modelle, der in vielen Benchmarks sogar GPT-4o übertrifft. Es erreicht oder übertrifft GPT-4o bei der Intelligenzbewertung, während es die Latenz nahezu halbiert und die Kosten um 83 % senkt. Dieses Modell unterstützt eine maximale Kontextlänge von 1,047,576 Token.
GPT-4.1 ist ein von OpenAI bereitgestelltes KI-Modell. gpt-4.1-nano: Verfügt über ein größeres Kontextfenster—unterstützt bis zu 1 Million Kontext-Token und kann diesen Kontext dank eines verbesserten Verständnisses langer Kontexte besser nutzen. Hat einen aktualisierten Wissensstand bis Juni 2024. Dieses Modell unterstützt eine maximale Kontextlänge von 1,047,576 Token.
GPT-3.5 Turbo 0125 is an artificial intelligence model provided by OpenAI. A pure official high-speed GPT-3.5 series, supporting tools_call. This model supports a maximum context length of 4096 tokens.
coming soon