Limits
Paketlimits, Rate-Limits, Kontextfenster, Größen und Timeouts.
| Limit | Wert | Bei Überschreitung |
|---|---|---|
| Credits pro Abrechnungszeitraum | je Paket, siehe unten | 429 mit Code insufficient_quota |
| Requests pro Minute (Account) | je Paket | 429 mit Code rate_limit_exceeded, Header retry-after |
| Parallele Requests (Account) | je Paket | 429 mit Code rate_limit_exceeded |
| Requests pro IP-Adresse | etwa 10 pro Sekunde | 503 |
| Kontextfenster | je Modell, siehe Modelle | 400 |
| Größe eines Requests | 20 MB | 413 |
| Bilder pro Request | 4 | 400 |
| Eingabe pro Embedding | 8.192 Token | 400 |
| Dauer eines Requests | 600 Sekunden | Abbruch |
| Limits pro Key und Nutzer | selbst festgelegt, in Credits pro Abrechnungszeitraum | 401, siehe Konto und API-Keys |
| Kein aktives Paket | – | 403 mit Code no_package |
Die Fehler und was du jeweils tun kannst, stehen unter Fehler.
Paketlimits
| Paket | Credits/Monat | Requests pro Minute | parallele Requests |
|---|---|---|---|
| Starter | 5 Mio. | 30 | 5 |
| Pro | 80 Mio. | 60 | 10 |
| Business | 320 Mio. | 150 | 20 |
| Business Plus | 650 Mio. | 150 | 20 |
Alle Paketlimits gelten pro Account, also für alle API-Keys und Nutzer zusammen. Mehrere Keys erhöhen die Limits nicht. Wie Credits verbraucht werden, steht unter Abrechnung.
Credits
Sind die Credits des laufenden Abrechnungszeitraums verbraucht, antwortet die API mit 429 und dem Code insufficient_quota. Ein Retry hilft hier nicht: Die Sperre gilt bis zum nächsten Zeitraum oder bis du ein größeres Paket buchst. Der Verbrauch wird etwa einmal pro Minute ausgewertet, deshalb können bis zur Sperre noch einzelne Requests über 100 % hinaus durchgehen.
Requests pro Minute
Gezählt werden die Requests deines Accounts in den letzten 60 Sekunden. Ist das Limit erreicht, antwortet die API mit 429, Code rate_limit_exceeded und dem Header retry-after (Sekunden bis zum nächsten freien Platz).
Parallele Requests
So viele Requests darf dein Account gleichzeitig offen haben. Ein Request belegt seinen Platz, bis die Antwort vollständig ist, beim Streaming also bis zum letzten Chunk. Ist das Limit erreicht, antwortet die API mit 429 und dem Code rate_limit_exceeded, die Meldung nennt die parallelen Requests. Warte, bis laufende Requests fertig sind, oder begrenze die Parallelität in deiner Anwendung (z. B. mit einem Semaphore oder einer Worker-Queue).
Brauchst du dauerhaft mehr, buche ein größeres Paket.
Kontextfenster
Das Kontextfenster umfasst Eingabe und Ausgabe zusammen: Die Input-Token plus max_tokens dürfen es nicht überschreiten. Sonst lehnt die API den Request mit 400 ab, die Fehlermeldung nennt die Token-Zahlen:
This model's maximum context length is 32768 tokens. However, you requested 10 output tokens
and your prompt contains 80003 input tokens, for a total of 80013 tokens. ...Ohne max_tokens darf die Antwort den gesamten restlichen Platz im Kontextfenster nutzen.
Lange Antworten
Ein Request darf höchstens 600 Sekunden dauern. Für lange Antworten empfehlen wir Streaming: Die ersten Token kommen nach wenigen Sekunden, und Verbindungen über Proxys oder Load Balancer brechen seltener ab.