
Simon Willison testet GPT Image 2.0 — Eindrücke und Grenzen
OpenAI veröffentlichte am 21. April 2026 GPT Image 2.0 und Sam Altman bezeichnete den Sprung von gpt-image-1 zu gpt-image-2 als vergleichbar mit dem Schritt von GPT-3 zu GPT-5. Simon Willison testete das neue Modell mit einem bewusst kniffligen Prompt: ein „Wo ist Walter?"-Wimmelbild, in dem ein Waschbär mit Amateurfunkgerät versteckt sein soll. Als Vergleichsbasis diente gpt-image-1, in dessen Ergebnis weder Willison noch Claude Opus 4.7 einen Waschbär mit Sicherheit identifizieren konnten. Googles „Nano Banana 2" (über Gemini) schnitt beim selben Prompt deutlich besser ab: Der Waschbär war klar sichtbar an einem „Amateur Radio Club"-Stand mit dem Callsign-Wortspiel „W6HAM" zu finden. Mit gpt-image-2 auf maximaler Auflösung (3840×2160, outputQuality: high) gelang schließlich ein überzeugenderes Bild — ein 17-MB-PNG, konvertiert zu 5 MB WebP — bei dem der Waschbär links unten gut auffindbar war. Der Rendervorgang kostete 13.342 Output-Tokens zu einem Preis von rund 40 US-Cent. Als Nebenbefund zeigte sich, dass Modelle ihre eigenen generierten Wimmelbilder nicht zuverlässig lösen können: Ein Nutzer auf Hacker News ließ ChatGPT einen roten Kreis um den Waschbär zeichnen — das Ergebnis war nachweislich falsch.
- Sam Altman verglich auf dem Livestream den Sprung gpt-image-1 → gpt-image-2 mit dem Schritt von GPT-3 auf GPT-5.
- Willison nutzte ein eigenes openai_image.py-Skript als dünnen Wrapper um die OpenAI Python Client Library; das Modell-ID-Feld wird von der Library nicht validiert, weshalb gpt-image-2 trotz fehlendem offiziellem Support nutzbar war.
- Maximale verfügbare Bildgröße bei gpt-image-2: 3840×2160 Pixel; das erzeugte PNG wog 17 MB (nach WebP-Konvertierung 5 MB).
- Kosten für das Hochqualitätsbild: 13.342 Output-Tokens à $30/Million, ergibt ca. 40 US-Cent pro Bild.
- Nano Banana Pro in AI Studio lieferte laut Willison das schlechteste Ergebnis aller getesteten Modelle — Ursache unklar.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge

Simon Willison testet GPT Image 2.0 — Eindrücke und Grenzen
OpenAI veröffentlichte am 21. April 2026 GPT Image 2.0 und Sam Altman bezeichnete den Sprung von gpt-image-1 zu gpt-image-2 als vergleichbar mit dem Schritt von GPT-3 zu GPT-5. Simon Willison testete das neue Modell mit einem bewusst kniffligen Prompt: ein „Wo ist Walter?"-Wimmelbild, in dem ein Waschbär mit Amateurfunkgerät versteckt sein soll. Als Vergleichsbasis diente gpt-image-1, in dessen Ergebnis weder Willison noch Claude Opus 4.7 einen Waschbär mit Sicherheit identifizieren konnten. Googles „Nano Banana 2" (über Gemini) schnitt beim selben Prompt deutlich besser ab: Der Waschbär war klar sichtbar an einem „Amateur Radio Club"-Stand mit dem Callsign-Wortspiel „W6HAM" zu finden. Mit gpt-image-2 auf maximaler Auflösung (3840×2160, outputQuality: high) gelang schließlich ein überzeugenderes Bild — ein 17-MB-PNG, konvertiert zu 5 MB WebP — bei dem der Waschbär links unten gut auffindbar war. Der Rendervorgang kostete 13.342 Output-Tokens zu einem Preis von rund 40 US-Cent. Als Nebenbefund zeigte sich, dass Modelle ihre eigenen generierten Wimmelbilder nicht zuverlässig lösen können: Ein Nutzer auf Hacker News ließ ChatGPT einen roten Kreis um den Waschbär zeichnen — das Ergebnis war nachweislich falsch.
- Sam Altman verglich auf dem Livestream den Sprung gpt-image-1 → gpt-image-2 mit dem Schritt von GPT-3 auf GPT-5.
- Willison nutzte ein eigenes openai_image.py-Skript als dünnen Wrapper um die OpenAI Python Client Library; das Modell-ID-Feld wird von der Library nicht validiert, weshalb gpt-image-2 trotz fehlendem offiziellem Support nutzbar war.
- Maximale verfügbare Bildgröße bei gpt-image-2: 3840×2160 Pixel; das erzeugte PNG wog 17 MB (nach WebP-Konvertierung 5 MB).
- Kosten für das Hochqualitätsbild: 13.342 Output-Tokens à $30/Million, ergibt ca. 40 US-Cent pro Bild.
- Nano Banana Pro in AI Studio lieferte laut Willison das schlechteste Ergebnis aller getesteten Modelle — Ursache unklar.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.