Gemma 4 31B
Leistungsstarkes Allround-Modell von Google mit 31 Mrd. Parametern, das neben Text auch Bilder versteht: Es liest Screenshots, Fotos und gescannte Dokumente und antwortet in Text.
BetaBildeingabeTool-CallingReasoning
Steckbrief
API-ID (model) | gemma-4-31b |
|---|---|
| Anbieter | |
| Kategorie | Sprachmodelle |
| Kontextfenster | 32.768 Token (Eingabe und Ausgabe zusammen) |
| Credit-Faktor | 1,5× (Credits pro Token) |
| Bildeingabe | ja (Anleitung) |
| Tool-Calling | ja (Anleitung) |
| Reasoning | Optional (standardmäßig aus) (Anleitung) |
Verbrauch pro Request: (Input-Token + Output-Token) × Credit-Faktor, siehe Abrechnung.
Stärken
- Bildverständnis (Image-to-Text): bis zu 4 Bilder pro Anfrage
- Sehr gute Ergebnisse bei Wissens- und Reasoning-Benchmarks für seine Größe
- Optionaler Reasoning-Modus (Thinking) für mehrstufige Aufgaben
- Zuverlässiges Tool Calling
- Großes Kontextfenster (32.768 Token)
Schwächen
- Erzeugt keine Bilder, antwortet nur in Text
- Bilder nur als Base64 im Request, Bild-URLs werden nicht abgerufen
- Jedes Bild zählt als Input-Token (ca. 280 Token pro Bild)
- Das Nachdenken im Reasoning-Modus erzeugt zusätzliche Output-Token
Empfohlene Einsatzbereiche
- Dokumente, Belege und Formulare auslesen
- Screenshots und Diagramme erklären
- Bildbeschreibungen und Alt-Texte
- Anspruchsvolle Texterstellung und Analyse
- Agenten mit Tool-Nutzung
API-Hinweise
- Reasoning: Jeder Wert von
reasoning_effortaußernone(low,medium,high) schaltet den Denkmodus ein. Die Stufe ändert die Länge des Gedankengangs nicht. tool_choice: "required"und das Erzwingen einer bestimmten Funktion setzt das Modell nicht um, es entscheidet wie beiautoselbst. Beirequiredkommt trotzdemfinish_reason: "tool_calls"zurück, auch wenn kein Aufruf enthalten ist – prüfetool_callsstattfinish_reason.- Bilder nur als Base64-Data-URI, höchstens 4 pro Request, jedes etwa 280 Input-Token.
Beispiel
Den API-Key legst du im Portal unter API-Keys an, siehe Schnellstart.
curl https://api.promodelhub.de/v1/chat/completions \
-H "Authorization: Bearer $PRO_MODEL_HUB_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemma-4-31b",
"messages": [{"role": "user", "content": "Erkläre in zwei Sätzen, was ein Sprachmodell ist."}]
}'import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.promodelhub.de/v1",
api_key=os.environ["PRO_MODEL_HUB_API_KEY"],
)
response = client.chat.completions.create(
model="gemma-4-31b",
messages=[{"role": "user", "content": "Erkläre in zwei Sätzen, was ein Sprachmodell ist."}],
)
print(response.choices[0].message.content)Reasoning
Der Denkmodus ist standardmäßig aus. Einschalten: "reasoning_effort": "low" oder "chat_template_kwargs": {"enable_thinking": true}. Den Gedankengang liefert die API getrennt von der Antwort in reasoning_content.
# Denkmodus einschalten (standardmäßig aus)
response = client.chat.completions.create(
model="gemma-4-31b",
messages=[{"role": "user", "content": "Wie viele Montage hat der März 2027?"}],
reasoning_effort="low",
)
message = response.choices[0].message
print(getattr(message, "reasoning_content", None)) # Gedankengang, falls eingeschaltet
print(message.content) # eigentliche Antwort