pro Model HubDocs
Grundlagen

Limits

Paketlimits, Rate-Limits, Kontextfenster, Größen und Timeouts.

LimitWertBei Überschreitung
Credits pro Abrechnungszeitraumje Paket, siehe unten429 mit Code insufficient_quota
Requests pro Minute (Account)je Paket429 mit Code rate_limit_exceeded, Header retry-after
Parallele Requests (Account)je Paket429 mit Code rate_limit_exceeded
Requests pro IP-Adresseetwa 10 pro Sekunde503
Kontextfensterje Modell, siehe Modelle400
Größe eines Requests20 MB413
Bilder pro Request4400
Eingabe pro Embedding8.192 Token400
Dauer eines Requests600 SekundenAbbruch
Limits pro Key und Nutzerselbst festgelegt, in Credits pro Abrechnungszeitraum401, siehe Konto und API-Keys
Kein aktives Paket–403 mit Code no_package

Die Fehler und was du jeweils tun kannst, stehen unter Fehler.

Paketlimits

PaketCredits/MonatRequests pro Minuteparallele Requests
Starter5 Mio.305
Pro80 Mio.6010
Business320 Mio.15020
Business Plus650 Mio.15020

Alle Paketlimits gelten pro Account, also für alle API-Keys und Nutzer zusammen. Mehrere Keys erhöhen die Limits nicht. Wie Credits verbraucht werden, steht unter Abrechnung.

Credits

Sind die Credits des laufenden Abrechnungszeitraums verbraucht, antwortet die API mit 429 und dem Code insufficient_quota. Ein Retry hilft hier nicht: Die Sperre gilt bis zum nächsten Zeitraum oder bis du ein größeres Paket buchst. Der Verbrauch wird etwa einmal pro Minute ausgewertet, deshalb können bis zur Sperre noch einzelne Requests über 100 % hinaus durchgehen.

Requests pro Minute

Gezählt werden die Requests deines Accounts in den letzten 60 Sekunden. Ist das Limit erreicht, antwortet die API mit 429, Code rate_limit_exceeded und dem Header retry-after (Sekunden bis zum nächsten freien Platz).

Parallele Requests

So viele Requests darf dein Account gleichzeitig offen haben. Ein Request belegt seinen Platz, bis die Antwort vollständig ist, beim Streaming also bis zum letzten Chunk. Ist das Limit erreicht, antwortet die API mit 429 und dem Code rate_limit_exceeded, die Meldung nennt die parallelen Requests. Warte, bis laufende Requests fertig sind, oder begrenze die Parallelität in deiner Anwendung (z. B. mit einem Semaphore oder einer Worker-Queue).

Brauchst du dauerhaft mehr, buche ein größeres Paket.

Kontextfenster

Das Kontextfenster umfasst Eingabe und Ausgabe zusammen: Die Input-Token plus max_tokens dürfen es nicht überschreiten. Sonst lehnt die API den Request mit 400 ab, die Fehlermeldung nennt die Token-Zahlen:

This model's maximum context length is 32768 tokens. However, you requested 10 output tokens
and your prompt contains 80003 input tokens, for a total of 80013 tokens. ...

Ohne max_tokens darf die Antwort den gesamten restlichen Platz im Kontextfenster nutzen.

Lange Antworten

Ein Request darf höchstens 600 Sekunden dauern. Für lange Antworten empfehlen wir Streaming: Die ersten Token kommen nach wenigen Sekunden, und Verbindungen über Proxys oder Load Balancer brechen seltener ab.

Auf dieser Seite