pro Model HubDocs
Funktionen

Bildeingabe

Bilder und Screenshots vom Modell beschreiben, auslesen und auswerten lassen (Image-to-Text).

Modelle mit Bildeingabe verstehen Bilder im Chat: Fotos beschreiben, Text aus Screenshots und Dokumenten auslesen, Diagramme erklären oder Produktbilder einordnen. Die Antwort ist immer Text – Bilder erzeugen können die Modelle nicht.

Bildeingabe unterstützen:

Bild senden

Bilder schickst du als Teil einer user-Nachricht, als Base64-Data-URI:

import base64

with open("rechnung.jpg", "rb") as f:
    image = base64.b64encode(f.read()).decode()

response = client.chat.completions.create(
    model="gemma-4-31b",
    messages=[{
        "role": "user",
        "content": [
            {"type": "text", "text": "Lies Rechnungsnummer, Datum und Gesamtbetrag aus."},
            {"type": "image_url", "image_url": {"url": f"data:image/jpeg;base64,{image}"}},
        ],
    }],
)
print(response.choices[0].message.content)

Keine Bild-URLs

Links auf Bilder (https://…) lehnt die API mit 400 ab. Lade das Bild in deiner Anwendung und schicke es als Data-URI (data:image/png;base64,…).

Limits

Bilder pro Requesthöchstens 4
FormatePNG, JPEG, WebP, GIF
Größe des Requestshöchstens 20 MB inklusive Base64-Aufschlag von etwa 33 %
Verbrauchein Bild entspricht je nach Modell einigen hundert Input-Token (Gemma 4: etwa 280)

Tipps

  • Verkleinern spart Übertragungszeit: Eine lange Kante von 1.000 bis 1.600 Pixeln reicht meist. Für kleine Schrift in Screenshots nicht zu stark verkleinern und PNG statt stark komprimiertem JPEG nutzen.
  • Konkret fragen: „Lies den Gesamtbetrag aus“ funktioniert besser als „Was siehst du?“. Kombiniere Bildeingabe mit strukturierten Ausgaben, um Felder direkt als JSON zu bekommen.
  • Mehrere Seiten: Schicke bis zu vier Bilder in einer Nachricht, z. B. Vorder- und Rückseite eines Dokuments.
  • Ausprobieren: Im Test-Chat des Portals kannst du Bilder hochladen oder Screenshots einfügen.

Auf dieser Seite