pro Model HubDocs
Grundlagen

Wartezeiten und Retries

Warum die erste Antwort manchmal etwas länger dauert und wie du Fehler abfängst.

Modellwechsel

Einige Modelle teilen sich Rechenkapazität. Wird ein Modell gerade nicht genutzt, wird es bei der ersten Anfrage aktiviert. Das dauert meist nur wenige Sekunden. Laufen auf dem geteilten Platz noch Anfragen an ein anderes Modell, werden diese zuerst fertig bearbeitet. Spätestens nach 10 Sekunden nimmt das andere Modell keine neuen Anfragen mehr an. Eine lange laufende Generierung wird aber nicht abgebrochen, in dem Fall kann die Wartezeit länger sein.

Ein aktives Modell bleibt aktiv, bis ein anderes Modell auf demselben Platz angefragt wird. Im Alltag merkst du davon meist nur eine etwas längere Zeit bis zum ersten Token.

Wann du einen Retry brauchst

Kann ein Modell vorübergehend nicht antworten (z. B. während eines Wechsels unter hoher Last oder bei Wartung), antwortet die API mit 503. Solche Fehler sind vorübergehend: Wiederhole den Request nach einer kurzen Pause mit wachsendem Abstand (exponentielles Backoff).

StatusWiederholen?
429 mit rate_limit_exceededja, nach der Zeit im Header retry-after bzw. wenn laufende Requests fertig sind
429 mit insufficient_quotanein – das Paket ist verbraucht (Fehler)
500, 502, 503, 504ja, mit Backoff (z. B. 1, 2, 4, 8 Sekunden)
400, 401, 403, 404, 413, 422nein – der Request muss geändert werden

Die offiziellen OpenAI-SDKs wiederholen 429 und 5xx bereits automatisch (standardmäßig zweimal). Ausgenommen ist 429 mit insufficient_quota: Die API schickt dabei den Header x-should-retry: false, die SDKs werfen dann sofort RateLimitError. Frag den Fehlercode ab, statt selbst zu wiederholen (Fehler). Eigene Retry-Logik ohne SDK sollte insufficient_quota genauso auslassen. Für Hintergrundjobs lohnt es sich, die Zahl der Retries zu erhöhen:

client = OpenAI(
    base_url="https://api.promodelhub.de/v1",
    api_key=os.environ["PRO_MODEL_HUB_API_KEY"],
    max_retries=5,
    timeout=600,
)

Mehr zu Fehlercodes und dem Fehlerformat unter Fehler.

Auf dieser Seite