pro Model HubDocs
Grundlagen

Abrechnung

Credit-Pakete, Credit-Faktoren, Abrechnungszeitraum und wie Token gezählt werden.

Du buchst ein Monatspaket mit einem festen Kontingent an Credits. Jedes Modell verbraucht Credits mit einem eigenen Credit-Faktor: Kleine, effiziente Modelle verbrauchen weniger, größere mehr. Eine Abrechnung nach Verbrauch gibt es nicht. Alle Preise sind Nettopreise zzgl. USt.

So funktionieren Credits

  • 1 Credit = 1 Token bei Credit-Faktor 1×. Der Faktor gibt an, wie viele Credits ein Token kostet (Credits pro Token).
  • Verbrauch pro Request: (Input-Token + Output-Token) × Credit-Faktor
  • Token sind das, was das Modell zählt. Die Zahlen stehen in jeder Antwort im Feld usage.

Beispiel: Ein Request mit 2.000 Input- und 500 Output-Token an Qwen3.8 27B (Faktor 1,5×) verbraucht 2.500 × 1,5 = 3.750 Credits.

Den aktuellen Credit-Faktor jedes Modells findest du in der Modellübersicht und auf der Seite des Modells. Ändert sich ein Faktor, gilt für jeden Request der Faktor zum Zeitpunkt des Requests.

Pakete

StarterProBusinessBusiness Plus
Preis/Monat7 €35 €129 €249 €
Credits/Monat5 Mio.80 Mio.320 Mio.650 Mio.
entspricht bei Faktor 1×5 Mio. Token80 Mio. Token320 Mio. Token650 Mio. Token
Requests pro Minute3060150150
parallele Requests5102020
Support per E-Mail–✓✓✓

Alle Pakete enthalten alle Modelle, Hosting in Deutschland und einen AVV. Ein Paket mit eigener GPU (Dedicated) gibt es auf Anfrage, sobald der zweite GPU-Server in Betrieb ist. Requests pro Minute und parallele Requests gelten für deinen ganzen Account, siehe Limits.

Das Angebot richtet sich an Geschäftskunden.

Was ein Paket hergibt

Token, wenn alle Credits auf ein Modell gehen:

PaketQwen3-Coder-Next (1×)Qwen3.8 27B / Gemma 4 31B (1,5×)Mistral Small 24B (2×)Qwen3-VL-Embedding 2B (0,25×)
Starter5 Mio.3,3 Mio.2,5 Mio.20 Mio.
Pro80 Mio.53 Mio.40 Mio.320 Mio.
Business320 Mio.213 Mio.160 Mio.1,28 Mrd.
Business Plus650 Mio.433 Mio.325 Mio.2,6 Mrd.

Die Faktoren für Gemma 4 31B und Mistral Small 24B sind vorläufig.

Was als Input und Output zählt

TokenEnthält
Input (prompt_tokens)alle Nachrichten des Requests inklusive System-Prompt und bisherigem Gesprächsverlauf, Tool-Definitionen, Bilder
Output (completion_tokens)die Antwort des Modells inklusive Tool-Aufrufen und – falls eingeschaltet – des Gedankengangs beim Reasoning

Input- und Output-Token werden mit demselben Credit-Faktor verrechnet. Die genauen Zahlen stehen in jeder Antwort im Feld usage:

"usage": {
  "prompt_tokens": 57,
  "completion_tokens": 253,
  "total_tokens": 310,
  "completion_tokens_details": { "reasoning_tokens": 245 }
}

Bei einem Modell mit Faktor 1,5× verbraucht dieser Request 310 × 1,5 = 465 Credits.

Hinweise:

  • Gesprächsverlauf: Die API ist zustandslos. Bei einem Chat schickst du den bisherigen Verlauf bei jedem Request erneut mit, er zählt also jedes Mal als Input. Lange Verläufe lohnen sich zu kürzen oder zusammenzufassen.
  • Reasoning: Die Denk-Token (reasoning_tokens) sind Teil der completion_tokens und zählen als Output.
  • Bilder: Ein Bild zählt je nach Modell als einige hundert Input-Token (bei Gemma 4 etwa 280).
  • Embeddings: Es fallen nur Input-Token an.
  • Streaming: verbraucht dasselbe wie ein normaler Request. Die Token-Zahlen bekommst du mit stream_options.include_usage (Streaming).

Abrechnungszeitraum

Die Laufzeit ist monatlich und beginnt mit deiner Bestellung. Jeder Account hat damit seinen eigenen Monatsrhythmus, z. B. vom 12. eines Monats bis zum 12. des Folgemonats. Die Grenze ist jeweils Mitternacht deutscher Zeit. Gibt es den Tag in einem Monat nicht (z. B. den 31.), endet der Zeitraum am letzten Tag des Monats.

Zu Beginn jedes Zeitraums wird dein Kontingent wieder voll aufgefüllt. Nicht verbrauchte Credits verfallen am Ende des Zeitraums.

Testphase

Das Starter-Paket kannst du 30 Tage kostenlos testen, einmal pro Account. Du aktivierst es im Portal unter Paket. Die Aktivierung ist bereits die Bestellung: Kündigst du nicht vor Testende, läuft Starter danach für 7 €/Monat (netto) weiter.

  • Bestellst du gleich ein größeres Paket, ist die Testphase damit verbraucht.
  • Ein Upgrade während der Testphase beendet den Test. Das neue Paket wird sofort zum vollen Preis berechnet, mit vollem Kontingent.

Paket wechseln und kündigen

Das Paket bestellt und ändert nur der Owner des Accounts, im Portal unter Paket.

ÄnderungWirkung
Upgradesofort. Die Preisdifferenz wird anteilig für die restlichen Tage des Zeitraums berechnet, der Tag des Upgrades zählt mit. Dein Kontingent steigt auf das des neuen Pakets, bereits verbrauchte Credits bleiben verbraucht. War die API wegen eines verbrauchten Pakets gesperrt, ist sie sofort wieder frei.
Downgradezum Ende des laufenden Zeitraums. Bis dahin gilt das bisherige Paket.
Kündigungzum Ende des laufenden Zeitraums, in der Testphase zum Testende.

Downgrade und Kündigung kannst du bis zum Ende des Zeitraums zurücknehmen. Ein Upgrade hebt einen vorgemerkten Downgrade oder eine Kündigung auf.

Wenn das Kontingent aufgebraucht ist

  • Bei 75 % und 90 % Verbrauch siehst du einen Hinweis im Portal.
  • Bei 100 % nimmt die API keine neuen Requests mehr an. Sie antwortet mit 429 und dem Fehlercode insufficient_quota (Fehler). Das gilt, bis der nächste Zeitraum beginnt oder du ein größeres Paket buchst.
  • Ein Request, der schon angenommen wurde, läuft immer bis zum Ende, auch beim Streaming. Erst der nächste Request wird abgelehnt.
  • Der Verbrauch wird etwa einmal pro Minute ausgewertet. Bis der Stopp greift, können deshalb noch einzelne Requests über 100 % hinaus durchgehen. Sie zählen zum Verbrauch, kosten aber nichts extra.

Es entstehen keine unerwarteten Zusatzkosten.

Verbrauch einsehen

Im Portal unter Kosten & Verbrauch siehst du Token und Credits pro Modell für den laufenden und die vergangenen Zeiträume samt Abrechnungen, unter API-Keys den Verbrauch jedes Keys im laufenden Zeitraum. Neue Requests erscheinen dort nach etwa ein bis zwei Minuten.

Verbrauch steuern

Mit Limits pro Key und pro Nutzer (in Credits pro Abrechnungszeitraum) teilst du das Kontingent im Team auf (Konto und API-Keys). Weitere Stellschrauben:

  • max_tokens begrenzt die Länge der Antwort.
  • Ein Modell mit kleinerem Credit-Faktor für einfache Aufgaben wie Klassifikation oder Extraktion (siehe Welches Modell passt?).
  • Reasoning nur einschalten, wo es die Qualität wirklich verbessert.

Auf dieser Seite