pro Model HubDocs

Gemma 4 31B

Leistungsstarkes Allround-Modell von Google mit 31 Mrd. Parametern, das neben Text auch Bilder versteht: Es liest Screenshots, Fotos und gescannte Dokumente und antwortet in Text.

BetaBildeingabeTool-CallingReasoning

Steckbrief

API-ID (model)gemma-4-31b
AnbieterGoogle
KategorieSprachmodelle
Kontextfenster32.768 Token (Eingabe und Ausgabe zusammen)
Credit-Faktor1,5× (Credits pro Token)
Bildeingabeja (Anleitung)
Tool-Callingja (Anleitung)
ReasoningOptional (standardmäßig aus) (Anleitung)

Verbrauch pro Request: (Input-Token + Output-Token) × Credit-Faktor, siehe Abrechnung.

Stärken

  • Bildverständnis (Image-to-Text): bis zu 4 Bilder pro Anfrage
  • Sehr gute Ergebnisse bei Wissens- und Reasoning-Benchmarks für seine Größe
  • Optionaler Reasoning-Modus (Thinking) für mehrstufige Aufgaben
  • Zuverlässiges Tool Calling
  • Großes Kontextfenster (32.768 Token)

Schwächen

  • Erzeugt keine Bilder, antwortet nur in Text
  • Bilder nur als Base64 im Request, Bild-URLs werden nicht abgerufen
  • Jedes Bild zählt als Input-Token (ca. 280 Token pro Bild)
  • Das Nachdenken im Reasoning-Modus erzeugt zusätzliche Output-Token

Empfohlene Einsatzbereiche

  • Dokumente, Belege und Formulare auslesen
  • Screenshots und Diagramme erklären
  • Bildbeschreibungen und Alt-Texte
  • Anspruchsvolle Texterstellung und Analyse
  • Agenten mit Tool-Nutzung

API-Hinweise

  • Reasoning: Jeder Wert von reasoning_effort außer none (low, medium, high) schaltet den Denkmodus ein. Die Stufe ändert die Länge des Gedankengangs nicht.
  • tool_choice: "required" und das Erzwingen einer bestimmten Funktion setzt das Modell nicht um, es entscheidet wie bei auto selbst. Bei required kommt trotzdem finish_reason: "tool_calls" zurück, auch wenn kein Aufruf enthalten ist – prüfe tool_calls statt finish_reason.
  • Bilder nur als Base64-Data-URI, höchstens 4 pro Request, jedes etwa 280 Input-Token.

Beispiel

Den API-Key legst du im Portal unter API-Keys an, siehe Schnellstart.

curl https://api.promodelhub.de/v1/chat/completions \
  -H "Authorization: Bearer $PRO_MODEL_HUB_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemma-4-31b",
    "messages": [{"role": "user", "content": "Erkläre in zwei Sätzen, was ein Sprachmodell ist."}]
  }'
import os
from openai import OpenAI

client = OpenAI(
    base_url="https://api.promodelhub.de/v1",
    api_key=os.environ["PRO_MODEL_HUB_API_KEY"],
)

response = client.chat.completions.create(
    model="gemma-4-31b",
    messages=[{"role": "user", "content": "Erkläre in zwei Sätzen, was ein Sprachmodell ist."}],
)
print(response.choices[0].message.content)

Reasoning

Der Denkmodus ist standardmäßig aus. Einschalten: "reasoning_effort": "low" oder "chat_template_kwargs": {"enable_thinking": true}. Den Gedankengang liefert die API getrennt von der Antwort in reasoning_content.

# Denkmodus einschalten (standardmäßig aus)
response = client.chat.completions.create(
    model="gemma-4-31b",
    messages=[{"role": "user", "content": "Wie viele Montage hat der März 2027?"}],
    reasoning_effort="low",
)
message = response.choices[0].message
print(getattr(message, "reasoning_content", None))  # Gedankengang, falls eingeschaltet
print(message.content)                              # eigentliche Antwort