Google DeepMind hat gerade Nano Banana Pro vorgestellt, sein neues Modell zur Generierung und Bearbeitung von Bildern. Dieses Modell basiert auf Gemini 3 Pro und bringt zahlreiche Verbesserungen mit sich, darunter eine bessere Textverarbeitung, Weltwissen und erweiterte Steuerungsmöglichkeiten. Es ist in der Gemini-App, in AI Studio, Vertex und weiteren Diensten verfügbar. In der Gemini-App können Sie es beispielsweise ausprobieren, indem Sie die Option „Bilder erstellen“ mit dem Modell „Thinking“ auswählen. Für kostenlose Nutzer steht eine begrenzte Anzahl von Versuchen zur Verfügung, danach wird auf die ältere Version von Nano Banana umgestellt. Abonnenten von Google AI Plus, Pro und Ultra erhalten höhere Limits.
Das Modell Nano Banana Pro hilft dabei, Ideen zu visualisieren, Infografiken zu erstellen oder handschriftliche Notizen in Diagramme umzuwandeln. Dank der fortschrittlichen Schlussfolgerungsfähigkeiten von Gemini 3 Pro kann es auf Grundlage realer Informationen präzise und detailreiche Visualisierungen erstellen. Sie können beispielsweise eine Infografik über die Pflanze String of Turtles erstellen, die Details zu Herkunft, Pflege und Wachstum enthält. Ein weiteres Beispiel ist eine Infografik über die Zubereitung von Elaichi Chai, einem Tee mit Kardamom, mit detaillierten Schritt-für-Schritt-Anleitungen.

Einer der größten Vorteile ist die bessere Verarbeitung von Text direkt in Bildern. Nano Banana Pro kann gut lesbaren Text in verschiedenen Sprachen erstellen, was ideal für Plakate, Mockups oder internationale Inhalte ist. Sie können beispielsweise ein Storyboard für eine Szene mit einem Astronauten generieren, das aus vier Panels besteht: einer Einführungsaufnahme, einer Halbnahaufnahme, einer Nahaufnahme und einer Aufnahme aus der Ich-Perspektive. Ein weiteres Beispiel ist das Bild einer Straße in Berlin, bei dem die Hausfassaden das Wort „BERLIN“ in Blau, Rot, Weiß und Schwarz bilden, wobei die Häuser weiterhin wie Häuser aussehen und die Ähnlichkeit mit Buchstaben dezent bleibt.
Das Modell unterstützt Übersetzungen und Lokalisierungen. Sie können den Text auf Dosen aus dem Englischen ins Koreanische übersetzen, während der Rest des Bildes unverändert bleibt. Ein weiteres Beispiel ist der Satz „Wie viel Holz würde ein Murmeltier werfen, wenn ein Murmeltier Holz werfen könnte“, der aus Holz dargestellt wird, das von einem Murmeltier gehackt wird. Nano Banana Pro beherrscht auch einen Comicstil für Wetterdarstellungen und greift dabei auf reale Daten aus der Google-Suche zurück, etwa Wetterinformationen oder Sportergebnisse.
Erweiterte Steuerung und kreative Möglichkeiten
Nano Banana Pro bietet Bearbeitungen in Studioqualität. Sie können Beleuchtung, Kamerawinkel, Fokus oder Farbabstimmung verändern. Verwandeln Sie beispielsweise eine Tagesszene mit einem Fuchs in eine Nachtszene oder fokussieren Sie die Blumen statt des Mädchens auf dem Feld. Das Modell unterstützt verschiedene Seitenverhältnisse, etwa 9:16 für ein vertikales Plakat oder 21:9 für eine Breitbildaufnahme, sowie Auflösungen von bis zu 4K.

Eine weitere Stärke ist das Zusammenführen von Bildern. Sie können bis zu 14 Bilder kombinieren (die Anzahl variiert je nach Plattform) und dabei die Konsistenz von bis zu fünf Figuren bewahren. Kombinieren Sie beispielsweise 14 pelzige Figuren, die auf einem Sofa vor dem Fernseher in einem gemütlichen Wohnzimmer sitzen, mit warmem Licht aus dem Fenster und dem Schein des Fernsehers. Ein weiteres Beispiel ist das Zusammenführen von Bildern mit Kleidern, Pflanzen und einem Stuhl zu einer einzigen filmischen Szene im Seitenverhältnis 16:9, in der Sie das Kleid auf der Schaufensterpuppe austauschen.
Für Marken ist die Beibehaltung eines einheitlichen Stils besonders nützlich. Sie können ein von einer Skizze inspiriertes Logo erstellen, etwa das Wort „WAVE“ in Wellenform im Retro-Stil der 60er- und 70er-Jahre, mit weichen, fließenden Buchstaben, einem hellblauen Hintergrund und einem dunkelblauen Logo. Anschließend können Sie es auf 10 Mockups anwenden, etwa auf Produkte, Werbeanzeigen, Plakatwände oder Bushaltestellen, jeweils im Seitenverhältnis 16:9.
Tipps für eine effektive Nutzung
Damit Sie Nano Banana Pro optimal nutzen können, schreiben Sie detaillierte Prompts. Geben Sie das Motiv an, etwa einen stoischen Roboter-Barista mit blauer Optik, die Komposition wie eine extreme Nahaufnahme, die Handlung wie das Zubereiten von Kaffee, den Ort wie ein futuristisches Café auf dem Mars und den Stil wie eine 3D-Animation. Formulieren Sie Bearbeitungswünsche direkt, zum Beispiel: „Ändere die Krawatte des Mannes in Grün und entferne das Auto im Hintergrund.“
Fügen Sie Details zu Kamera und Beleuchtung hinzu, etwa „niedriger Kamerawinkel mit geringer Schärfentiefe (f/1.8)“ oder „goldene Stunde mit langen Schatten“. Geben Sie für Text genaue Vorgaben an, etwa „Überschrift ‚STADTFORSCHER‘ in fetter, weißer, serifenloser Schrift oben“. Wenn Sie hochgeladene Bilder verwenden, definieren Sie deren Rolle, zum Beispiel: „Verwende Bild A für die Pose der Figur, Bild B für den Kunststil und Bild C für den Hintergrund.“
Betonen Sie bei Diagrammen die Genauigkeit, zum Beispiel „wissenschaftlich genaue Querschnittsdarstellung“ oder „stelle die historische Genauigkeit für die viktorianische Epoche sicher“.
Aktuelle Grenzen des Modells
Nano Banana Pro weist noch Bereiche mit Verbesserungspotenzial auf. Kleine Schrift, feine Details oder korrekte Rechtschreibung sind möglicherweise nicht perfekt. Überprüfen Sie stets die Fakten in Diagrammen oder Infografiken. Bei Übersetzungen können grammatikalische Fehler auftreten oder kulturelle Nuancen fehlen. Komplexe Bearbeitungen wie das Zusammenführen von Bildern oder Änderungen an der Beleuchtung erzeugen manchmal unnatürliche Artefakte. Die Konsistenz von Figuren ist in der Regel zuverlässig, kann jedoch variieren.
Das Modell ist für Verbraucher in der Gemini-App, für professionelle Nutzer in Google Ads und Workspace-Anwendungen wie Google Slides und Vids, für Entwickler über die Gemini API und Google AI Studio sowie für Unternehmen in Vertex AI verfügbar. Alle Bilder enthalten das unsichtbare Wasserzeichen SynthID, das sie als KI-generiert kennzeichnet. In der Gemini-App können Sie ein Bild hochladen und fragen, ob es von Google AI erstellt wurde.
Naina Raisinghani, Produktmanagerin bei Google DeepMind, beschrieb das Modell als Brücke zwischen Vorstellungskraft und professioneller Umsetzung. Bea Alessio, Group Product Manager bei Google DeepMind, gab Tipps zur Formulierung von Prompts. Das YouTube-Video zeigt mit Musik und Beispielen, wie das Modell funktioniert. Dabei erscheinen der Text „Nano Banana Pro von Google“ sowie Szenen zur Steuerung von Farben, Fokus und Beleuchtung.



