Funktionen
Bildeingabe
Bilder und Screenshots vom Modell beschreiben, auslesen und auswerten lassen (Image-to-Text).
Modelle mit Bildeingabe verstehen Bilder im Chat: Fotos beschreiben, Text aus Screenshots und Dokumenten auslesen, Diagramme erklären oder Produktbilder einordnen. Die Antwort ist immer Text – Bilder erzeugen können die Modelle nicht.
Bildeingabe unterstützen:
- Gemma 4 31B (
gemma-4-31b)
Bild senden
Bilder schickst du als Teil einer user-Nachricht, als Base64-Data-URI:
import base64
with open("rechnung.jpg", "rb") as f:
image = base64.b64encode(f.read()).decode()
response = client.chat.completions.create(
model="gemma-4-31b",
messages=[{
"role": "user",
"content": [
{"type": "text", "text": "Lies Rechnungsnummer, Datum und Gesamtbetrag aus."},
{"type": "image_url", "image_url": {"url": f"data:image/jpeg;base64,{image}"}},
],
}],
)
print(response.choices[0].message.content)Keine Bild-URLs
Links auf Bilder (https://…) lehnt die API mit 400 ab. Lade das Bild in deiner Anwendung und schicke es als Data-URI (data:image/png;base64,…).
Limits
| Bilder pro Request | höchstens 4 |
| Formate | PNG, JPEG, WebP, GIF |
| Größe des Requests | höchstens 20 MB inklusive Base64-Aufschlag von etwa 33 % |
| Verbrauch | ein Bild entspricht je nach Modell einigen hundert Input-Token (Gemma 4: etwa 280) |
Tipps
- Verkleinern spart Übertragungszeit: Eine lange Kante von 1.000 bis 1.600 Pixeln reicht meist. Für kleine Schrift in Screenshots nicht zu stark verkleinern und PNG statt stark komprimiertem JPEG nutzen.
- Konkret fragen: „Lies den Gesamtbetrag aus“ funktioniert besser als „Was siehst du?“. Kombiniere Bildeingabe mit strukturierten Ausgaben, um Felder direkt als JSON zu bekommen.
- Mehrere Seiten: Schicke bis zu vier Bilder in einer Nachricht, z. B. Vorder- und Rückseite eines Dokuments.
- Ausprobieren: Im Test-Chat des Portals kannst du Bilder hochladen oder Screenshots einfügen.