ChatGPT kann jetzt bessere Bilder erstellen: OpenAI bringt eine neue Generation von KI-Bildern direkt in ChatGPT
OpenAI hat neue Möglichkeiten zur Bildgenerierung mithilfe künstlicher Intelligenz direkt in ChatGPT und Sora über sein Modell GPT-4o vorgestellt. Diese Innovation ermöglicht es den Nutzern, Bilder direkt in der Chat-Oberfläche zu erstellen und zu bearbeiten, wodurch der Bedarf an externen Tools wie DALL-E entfällt.
Was bringt die neue Funktion „Images in ChatGPT“?
Die neue, vom Modell GPT-4o unterstützte Funktion „Images in ChatGPT“ bringt mehrere wesentliche Verbesserungen:
Erstellung und Bearbeitung von Bildern direkt im Chat – Nutzer können neue Bilder generieren oder bestehende mithilfe natürlicher Sprache oder hochgeladener Dateien direkt in ChatGPT bearbeiten
Für alle verfügbar – Die Funktion steht allen Nutzern (Free, Plus, Team und Pro) ohne strenge Limits für Nutzer der kostenlosen Version zur Verfügung (die Einschränkungen können je nach Nachfrage angepasst werden)
Verbesserte Textdarstellung – Deutliche Verbesserung der Genauigkeit bei der Darstellung von Text in Bildern
Präzisere Farben und Texturen – Generierung fotorealistischer Bilder mit präzisen Lichteffekten und Texturen
Warum ist das wichtig?
OpenAI ist seit Langem der Überzeugung, dass die Bildgenerierung eine grundlegende Fähigkeit ihrer Sprachmodelle sein sollte. Menschen nutzen seit jeher visuelle Kommunikation – von Höhlenmalereien bis hin zu modernen Infografiken – zur Vermittlung von Informationen, zur Überzeugung und zur Analyse, nicht nur zur Dekoration.
Während frühere generative Modelle beeindruckende surrealistische Szenen erstellen konnten, scheiterten sie oft an der Erstellung praktischer Bilder, die Menschen zum Teilen und Erstellen von Informationen verwenden. GPT-4o behebt diese Mängel:
Deutlich bessere Konsistenz – ChatGPT kann jetzt 15 bis 20 Elemente in einem Bild präzise platzieren, im Vergleich zu nur 5 bis 8 Elementen bei früheren Modellen
Hervorragende Erstellung strukturierter visueller Inhalte – Das Modell ist besonders gut darin, Speisekarten, Diagramme und Infografiken mit lesbarem Text zu generieren
Verbesserte Bildbearbeitung – Ermöglicht die Bearbeitung bestehender Bilder (einschließlich solcher mit Menschen) unter Beibehaltung komplexer Szenen
Wie hat OpenAI das erreicht?
OpenAI setzte eine Gruppe menschlicher Trainer ein, die Trainingsdaten für das Modell kennzeichneten. Dadurch wurde Folgendes ermöglicht:
Generierung präziser dargestellter und nützlicherer Bilder
Besseres Befolgen menschlicher Anweisungen
Nutzung des umfangreichen Wissens des Modells zum besseren Verständnis des Kontexts
Dank der multimodalen Fähigkeiten von GPT-4o können jetzt genau die Bilder erstellt werden, die Sie sich vorstellen, und Sie können effektiver mithilfe visueller Inhalte kommunizieren.
Diese Verbesserung ersetzt das frühere Modell OpenAI DALL-E und bringt lang erwartete Fortschritte bei der Textdarstellung, den Designfähigkeiten und der Bearbeitung mithilfe natürlicher Sprache. Sie markiert den Beginn einer neuen Ära von durch künstliche Intelligenz erstellten visuellen Inhalten, die jetzt für jeden zugänglicher und intuitiver sind.
Hier können Sie sich das Demonstrationsvideo ansehen.



