
Qwen Image 3.0 ist das Bild-Grundlagenmodell der dritten Generation des Qwen-Teams. Es wurde am 21. Juli 2026 angekündigt und soll die KI-Bildgenerierung über attraktive Einzelbilder hinaus weiterentwickeln – hin zu visuellen Inhalten, die nützliche Informationen transportieren können: Zeitungen, Bildungsdiagramme, Storyboards, Interface-Konzepte, annotierte Bilder und andere inhaltsreiche Designs.
Zu den wichtigsten Neuerungen gehören ein 4,5K-Token-Anweisungslimit, Textdarstellung in Größen von bis zu 10 Pixeln, native Darstellung in 12 Sprachen, Unterstützung für mehr als 20 Schriftarten und mehr als 100 visuelle Stile sowie eine stärkere Nutzung von visuellem und Weltwissen. Das Modell akzeptiert Text- und Bildeingaben und kann sowohl Bilder generieren als auch bearbeiten.
Einige Upstream-Details bleiben unbekannt, darunter Parameterzahl, Architektur, native Maximalauflösung, Lizenz und offene Gewichte. PoYo bietet jedoch jetzt eine produktive API mit zwei Modell-IDs, 1K/2K-Ausgabe und veröffentlichten Preisen.
Qwen Image 3.0 auf einen Blick
| Merkmal | Bestätigte Informationen |
|---|---|
| Offizieller Name | Qwen-Image-3.0 |
| Angekündigt | 21. Juli 2026 |
| Modelltyp | Grundlagenmodell für Bildgenerierung und -bearbeitung |
| Eingabe | Text und Bilder |
| Ausgabe | Bilder |
| Maximale Anweisungslänge | 4,5K Tokens |
| Darstellung kleiner Texte | Text bis etwa 10px |
| Sprachen | Native Darstellung in 12 Sprachen |
| Schriftarten | Mehr als 20 |
| Visuelle Stile | Mehr als 100 |
| Upstream-Modell-ID bei QwenCloud | qwen-image-3.0-pro |
| PoYo-Modell-IDs | qwen-image-3, qwen-image-3-pro |
| PoYo-API-Status | Jetzt verfügbar |
| PoYo-Ausgabeoptionen | 1K, 2K |
| Parameteranzahl | Nicht veröffentlicht |
| Maximale Auflösung | Nicht veröffentlicht |
| Open Weights und Lizenz | Nicht veröffentlicht |
Die offizielle Veröffentlichung beschreibt das Modell anhand von drei Ideen: Rich Content, Authentic Details und Deep Knowledge. Qwen fasst sie mit einem übergeordneten Begriff zusammen: „Real“ – nicht nur im Sinne von Fotorealismus, sondern als Inhalt, der umfangreich und nützlich genug für praktische Anwendungen ist.
Was ist neu in Qwen Image 3.0?
Frühere Qwen Image-Versionen begründeten den Ruf der Modellfamilie für Typografie und präzise Bildbearbeitung. Qwen Image 2.0 kombinierte anschließend Generierung und Bearbeitung in einem Modell, unterstützte native 2K-Ausgabe und akzeptierte Anweisungen mit bis zu 1K Tokens.
Qwen Image 3.0 erweitert die Menge und Komplexität der Informationen, die in einer Anfrage verarbeitet werden können. Das Anweisungslimit steigt von 1K auf 4,5K Tokens, während die offiziellen Beispiele deutlich stärker auf dichte Layouts, verschachtelte Interfaces, kleinen Text, Formeln, mehrsprachige Inhalte und wissensreiche Grafiken setzen.
| Bereich | Qwen Image 2.0 | Qwen Image 3.0 |
|---|---|---|
| Länge der Anweisung | Bis zu 1K Tokens | Bis zu 4,5K Tokens |
| Generierung und Bearbeitung | In einem Modell vereint | Beides unterstützt |
| Native Auflösung | 2K veröffentlicht | Noch nicht veröffentlicht |
| Hauptfokus | Typografie, semantische Übereinstimmung, Fotorealismus | Umfangreiche Inhalte, feine Details, tiefes Wissen |
| Dichter kleiner Text | Verbesserte Textdarstellung | Offiziell bei etwa 10px demonstriert |
| Komplexe Layouts | Poster, Folien, Comics, Infografiken | Zeitungen, Prüfungsblätter, Storyboards, verschachtelte Interfaces, mehrteilige Grafiken |
Dieser Vergleich sollte nicht als Beweis verstanden werden, dass jede Ausgabe von Qwen Image 3.0 automatisch genauer ist. Er beschreibt die von Qwen angekündigten Fähigkeiten und die Positionierung des Modells. Unabhängige, wiederholbare Tests sind weiterhin erforderlich, um die Konsistenz bei verschiedenen Prompts zu messen.
Rich Content: Längere Prompts und dichtere Layouts
Das Eingabelimit von 4,5K Tokens ist eine der deutlichsten Änderungen von Qwen Image 3.0. Es ermöglicht einem Prompt, viele Bereiche, Beschriftungen, Beziehungen und visuelle Regeln zu beschreiben, ohne die gesamte Vorgabe auf wenige Sätze komprimieren zu müssen.
Dies bedeutet nicht, dass das Bild 4.500 Tokens perfekt dargestellten Text enthalten wird. Es bedeutet, dass das Modell eine Anweisung dieser Länge akzeptieren kann, einschließlich Beschreibungen von Inhalt, Layout, Stil, Typografie und räumlichen Beziehungen.
Mehrteilige Visualisierungen in einer einzigen Generierung
In einem offiziellen Beispiel erzeugt Qwen Image 3.0 in einem Durchgang ein vollständiges 3×3-Bildungsraster. Der ungefähr 3,7K Token umfassende Prompt beschreibt neun verschiedene Themenbereiche, darunter Geometrie, Physik, Biologie, Medizin, Literatur, Bankwesen und abstrakte Algebra. Einzelne Bereiche enthalten Illustrationen, Formeln, Diagramme, chinesischen und englischen Text sowie eine eigene visuelle Hierarchie.
Dieses Beispiel testet mehr als nur die Prompt-Länge. Das Modell muss parallele Konzepte getrennt halten, sie in den gewünschten Bereichen platzieren und verhindern, dass Inhalte eines Bereichs in einen anderen übergehen.
Diese Fähigkeit könnte nützlich sein für:
- Bildungsplakate und Unterrichtsmaterialien
- Redaktionelle Doppelseiten und Zeitungsdesigns
- Produktvergleichsraster
- Storyboards für Kurzdramen und Werbung
- Prüfungsblätter und Arbeitsblätter
- Menüs, Kataloge und visuelle Berichte
Verschachtelte Bilder und Interfaces
Qwen zeigt auch vertikale oder verschachtelte Komplexität. Ein Prompt fordert das Modell auf, eine VS Code-Oberfläche um ein Qwen Chat-Interface zu platzieren, das wiederum ein WeChat-Interface enthält, in dem sich ein Kaffeeposter befindet.
Diese Art von Bild-in-Bild-Aufgabe testet semantische Verschachtelung, relative Größenverhältnisse, Interface-Wissen und die Fähigkeit des Modells, mehrere Inhaltsebenen zu bewahren. Dies ist besonders relevant für UI-Konzepte, Softwareillustrationen, bildschirmbasierte Werbung und redaktionelle Grafiken.
Authentic Details: Kleiner Text und realistische Texturen
Qwen verwendet „Authentic Details“, um sowohl Typografie als auch physische Details zu beschreiben. Das Modell soll dichte Textinhalte darstellen und gleichzeitig kleine visuelle Merkmale verbessern, die Menschen, Objekte und Materialien glaubwürdig erscheinen lassen.
Text bis zu einer Größe von 10 Pixeln
Qwen gibt an, dass Qwen Image 3.0 lesbaren Text bei etwa 10px darstellen kann. Die offiziellen Beispiele umfassen:
- Eine textreiche Walhai-Infografik
- Eine Zeitungsseite mit mehreren Spalten
- Eine wissenschaftliche Arbeit mit algebraischer Geometrie
- Hochgestellte Zeichen, tiefgestellte Zeichen, griechische Buchstaben, Klammern, Brüche und mehrzeilige Formeln
- Handschriftliche Anmerkungen auf einer fotografierten Buchseite
Dies kann potenziell für Poster, Interfaces, Folien, Dokumente und technische Diagramme wertvoll sein. Lesbarkeit und Genauigkeit sind jedoch nicht dasselbe. Eine Zeile kann typografisch überzeugend wirken und trotzdem ein falsch geschriebenes Wort, eine falsche Zahl oder eine fehlerhafte Formel enthalten. Generierter Text und Fakten sollten vor der Veröffentlichung immer geprüft werden.
Feine fotografische Details
Die offiziellen Beispiele konzentrieren sich außerdem auf Hautporen, einzelne Haarsträhnen, Mikroexpressionen, Papier, Stoff, Pinselstriche und andere subtile Texturen. Ziel ist es, das glatte oder künstliche Erscheinungsbild zu reduzieren, das häufig ein KI-generiertes Porträt oder Produktbild verrät.
Feine Details sind nicht nur für fotorealistische Porträts wichtig. Sie können verbessern:
- Produktmaterialien wie Glas, Metall, Leder und Stoff
- Food- und Getränkeaufnahmen
- Redaktionelle und Lifestyle-Bilder
- Historische Kunstwerke und Dokumentenrestaurierung
- Nahaufnahmen aus Natur und wissenschaftliche Illustrationen
Detailorientierte Bearbeitung
Qwen Image 3.0 ist nicht auf Text-zu-Bild-Generierung beschränkt. In Qwens Bearbeitungsdemonstrationen fügt das Modell realistische handschriftliche Lernnotizen zu einer Buchseite hinzu und restauriert beschädigte traditionelle Gemälde, wobei versucht wird, ursprüngliche Tuscheverläufe, Federtexturen, Komposition und Pinselarbeit zu bewahren.
Diese Beispiele deuten darauf hin, dass das Modell eine übergeordnete Anweisung mit dem Erscheinungsbild eines bestehenden Bildes kombinieren kann. Wie bei jedem generativen Editor sollte im Produktionseinsatz weiterhin geprüft werden, ob Bereiche außerhalb der gewünschten Bearbeitung verändert wurden.
Deep Knowledge: Sprachen, Stile, Interfaces und Fakten
Die dritte Säule von Qwen Image 3.0 ist „Deep Knowledge“. Sie beschreibt die Fähigkeit des Modells, nicht nur erkennbare Objekte zu erzeugen, sondern visuelle Inhalte, die von Sprache, Interface-Konventionen, künstlerischen Stilen und Fachwissen abhängen.
Native Darstellung in 12 Sprachen
Qwen gibt an, dass das Modell 12 Sprachen nativ darstellen kann. Die Startmaterialien zeigen sichtbar Chinesisch, Englisch, Japanisch, Koreanisch und Spanisch, liefern jedoch keine vollständige offizielle Liste aller 12 Sprachen.
Diese Unterscheidung ist wichtig. Es wäre verfrüht, eine erfundene Sprachliste zu veröffentlichen oder von gleicher Genauigkeit in jeder unterstützten Sprache auszugehen. Mehrsprachige Kampagnen sollten von Muttersprachlern auf Rechtschreibung, Zeichensetzung, Zeilenumbrüche und kulturell passende Typografie geprüft werden.
Mehr als 20 Schriftarten und 100 visuelle Stile
QwenCloud listet die Unterstützung von über 20 Schriftarten auf, während der Veröffentlichungsbeitrag mehr als 100 künstlerische Stile beschreibt. Diese Fähigkeiten können dabei helfen, ein spezifischeres visuelles System zu definieren, anstatt nur einen generischen „Poster“- oder „Illustrations“-Stil anzufordern.
Für bessere Kontrolle sollte ein Prompt Typografie nach ihrer Funktion beschreiben:
- Den exakten Text, der erscheinen muss
- Sprache und Schriftsystem
- Überschrift, Unterüberschrift, Fließtext, Label oder Bildunterschrift
- Serifenschrift, serifenlose Schrift, Handschrift, Display- oder technischer Stil
- Stärke, Ausrichtung, Farbe, Abstand und Hierarchie
Das Vorhandensein vieler Stile garantiert nicht die exakte Reproduktion einer bestimmten kommerziellen Schriftart oder des Stils eines lebenden Künstlers. Marken- und Lizenzprüfungen bleiben Aufgabe des Nutzers.
Realistische Interface-Generierung
Qwen Image 3.0 kann vertraute visuelle Strukturen simulieren, darunter:
- Webseiten
- Softwareanwendungen
- Spiele
- Livestream-Räume
- Chat-Interfaces
- Mobile Bildschirme
Dies macht das Modell nützlich für visuelle Konzepte und Storyboards. Es macht die Ausgabe jedoch nicht automatisch zu produktionsreifem UI-Code und garantiert nicht, dass das Interface Barrierefreiheits- und Interaktionsstandards erfüllt.
Weltwissen und Webabruf
Die offiziellen Beispiele nutzen Fachwissen, um wissenschaftliche Infografiken und kommentierte Forschungsabbildungen zu erstellen. In einem Fall bewahrt das Modell ein Insektenfoto und fügt Taxonomie, morphologische Beschriftungen, vergrößerte Details und eine Maßstabsleiste hinzu.
Qwen zeigt außerdem eine aktuelle Wettergrafik, die mit Online-Abruf erstellt wurde. Dies sollte als Modell-plus-Tool-Workflow verstanden werden: Der Webzugriff liefert aktuelle Informationen, und das Bildmodell wandelt sie in eine Visualisierung um. Es ist kein Beleg dafür, dass das Basismodell immer aktuelle Fakten enthält.
Jede wissensintensive Ausgabe sollte anhand einer zuverlässigen Quelle überprüft werden. Bildgenerierung kann falsche Informationen mit sehr überzeugender visueller Qualität darstellen.
Was können Sie mit Qwen Image 3.0 erstellen?
Die stärksten potenziellen Anwendungen des Modells liegen bei Aufgaben, bei denen visuelle Qualität und Informationsstruktur gleichzeitig erforderlich sind.
Infografiken und Bildungsinhalte
Lange Prompts können mehrere Bereiche, Diagramme, Formeln, Hervorhebungen und erklärenden Text definieren. Dadurch könnte Qwen Image 3.0 eine interessante Option für Unterrichtsposter, Zeitachsen, wissenschaftliche Erklärgrafiken und Präsentationsmaterialien sein.
Zeitungen und redaktionelle Layouts
Kleiner Text, Spalten, Bildunterschriften und Papiertexturen können gemeinsam erzeugt werden. Das Ergebnis kann gut als Konzept, Illustration oder Entwurf funktionieren, aber exakte Texte sollten bei kritischen Anwendungen manuell gesetzt werden.
Storyboards und Comics
Die erweiterte Anweisungslänge kann mehrere Szenen, Orte, Aktionen, Kamerawinkel und Beschriftungen in einem Prompt beschreiben. Die Konsistenz von Figuren über mehrere Panels hinweg muss weiterhin getestet und darf nicht vorausgesetzt werden.
UI- und Spielekonzepte
Das Wissen über gängige Interface-Muster kann die frühe Ideenphase für Anwendungen, Dashboards, Spielbildschirme und Livestream-Grafiken beschleunigen. Designer sollten das Ergebnis als visuelle Referenz und nicht als fertige Interface-Spezifikation betrachten.
E-Commerce- und Marketing-Kreativinhalte
Die Kombination aus detaillierten Oberflächen, strukturierten Layouts, Produktinformationen und mehrsprachigem Text könnte Kampagnen-Mockups, Katalogseiten, Menüs und Produkterklärungen unterstützen.
Dokumentenannotation und Restaurierung
Die Bildbearbeitung kann Notizen, Beschriftungen, Diagramme und andere kontextbezogene Elemente zu bestehenden Bildern hinzufügen. Die gezeigten Beispiele zur Kunstrestaurierung weisen ebenfalls auf kreative Restaurierungs- und Rekonstruktionsprozesse hin. Historisch bedeutendes Material sollte jedoch nicht ohne Expertenprüfung und klare Kennzeichnung verändert werden.
So greifen Sie auf Qwen Image 3.0 zu
Die QwenCloud-Seite nennt folgende Upstream-Modell-ID:
qwen-image-3.0-pro
Diese ID gehört zu QwenCloud. Auf PoYo verwenden Produktionsanfragen:
qwen-image-3
qwen-image-3-pro
Beide PoYo-Modelle unterstützen Text-zu-Bild und Bild-zu-Bild, 1K/2K, acht Seitenverhältnisse, PNG/JPEG, Prompt-Erweiterung, Negativ-Prompts und Seed-Steuerung. Prompt-Erweiterung wird so aktiviert:
{
"parameters": {
"prompt_extend": true
}
}
Der Preview-Status von QwenCloud beschreibt nicht die PoYo-Verfügbarkeit. Verwenden Sie für Produktion die PoYo-Dokumentation.
Das Standardmodell kostet 4,8 Credits ($0.024) pro 1K- oder 2K-Bild. Pro kostet 6,4 Credits ($0.032) bei 1K und 12 Credits ($0.06) bei 2K. Jedes Eingabebild kostet zusätzlich 0,5 Credits ($0.0025).
So schreiben Sie bessere Qwen Image 3.0 Prompts
Das längere Anweisungsfenster ist am nützlichsten, wenn der Prompt strukturiert ist. Einfach mehr Adjektive hinzuzufügen, verbessert die Ausgabe wahrscheinlich nicht.
Eine praktische Struktur ist:
- Definieren Sie Zweck und Leinwand, beispielsweise ein vertikales Bildungsposter oder eine dreispaltige Zeitung.
- Beschreiben Sie die gesamte visuelle Hierarchie und das Raster.
- Spezifizieren Sie jeden Bereich in räumlicher Reihenfolge.
- Setzen Sie exakten Anzeigetext in Anführungszeichen.
- Definieren Sie Typografie, Sprache und relative Textgröße.
- Beschreiben Sie Bilder, Materialien, Beleuchtung und Stil.
- Geben Sie Beziehungen und Einschränkungen an, einschließlich dessen, was sich nicht überlappen darf.
- Fordern Sie nur dann faktische Beschriftungen an, wenn Sie diese anschließend überprüfen können.
Bei komplexen Layouts sind Abschnittsbezeichnungen wie „Header“, „Linke Spalte“, „Mittleres Panel“ und „Footer“ nützlicher als ein unstrukturierter Absatz. Bei der Bearbeitung eines Bildes sollte angegeben werden, was geändert werden soll und was unverändert bleiben muss.
Aktuelle Einschränkungen und unbekannte Details
Qwen Image 3.0 ist neu, und die Veröffentlichungsmaterialien konzentrieren sich auf ausgewählte Beispiele statt auf einen vollständigen technischen Bericht oder unabhängige Bewertungen. Beachten Sie folgende Einschränkungen:
- QwenCloud-Zugriff und PoYo sind getrennt; die zwei dokumentierten PoYo-Modell-IDs sind jetzt verfügbar.
- Qwen hat die Parameteranzahl oder die detaillierte Modellarchitektur nicht veröffentlicht.
- Qwen nennt keine native Maximalauflösung; PoYo bietet unterstützte 1K- und 2K-Ausgaben.
- PoYo-Preise sind veröffentlicht; Latenz und Ratenlimits sind in der aktuellen Dokumentation zu prüfen.
- Verfügbarkeit von Open Weights, Lizenzierung und Anforderungen für lokale Bereitstellung sind unbekannt.
- Die Angabe einer Textdarstellung von etwa 10px garantiert keine perfekte Rechtschreibung oder faktische Genauigkeit.
- Die vollständige Liste der 12 unterstützten Sprachen wurde nicht veröffentlicht.
- Komplexe Formeln, wissenschaftliche Beschriftungen und abgerufene Fakten erfordern weiterhin menschliche Überprüfung.
- UI-ähnliche Bilder können überzeugend aussehen, ohne logisch oder technisch gültige Interfaces zu sein.
- Offizielle Beispielbilder messen nicht, wie konsistent das Modell bei wiederholten Generierungen arbeitet.
Übertragen Sie keine Spezifikationen von Qwen Image 2.0 auf Qwen Image 3.0. Insbesondere hat Qwen nicht bestätigt, dass das neue Modell dieselbe Parameteranzahl, Architektur, Auflösungsgrenzen oder dasselbe Bereitstellungsprofil besitzt.
Ist Qwen Image 3.0 eine Beobachtung wert?
Ja – insbesondere für Workflows, die bisher einen separaten Bildgenerator, ein Layout-Tool und einen manuellen Typografie-Schritt erforderten.
Die wichtigste Verbesserung von Qwen Image 3.0 ist nicht ein einzelner Wert für Bildqualität. Es ist der Versuch, ein einzelnes generiertes Bild gleichzeitig mit stärker strukturierter Information, kleinerem lesbarem Text, reicheren visuellen Details und breiterem Fachwissen auszustatten.
PoYo bietet heute einen praktischen gehosteten API-Zugang. Lokale Inferenz bleibt ohne veröffentlichte Gewichte, Lizenz und Hardwareanforderungen unklar.
Kosten und unterstützte PoYo-Ausgaben sind dokumentiert; Konsistenz, Geschwindigkeit, native Maximalauflösung und lokale Bereitstellung müssen weiter bewertet werden.
Häufig gestellte Fragen
Was ist Qwen Image 3.0?
Qwen Image 3.0 ist Qwens Grundlagenmodell der dritten Generation für Bildgenerierung und Bildbearbeitung. Es konzentriert sich auf informationsreiche Layouts, feine visuelle Details, mehrsprachigen Text, Interface-Simulation und wissensbasierte visuelle Inhalte.
Wann wurde Qwen Image 3.0 veröffentlicht?
Das Qwen-Team kündigte Qwen Image 3.0 am 21. Juli 2026 an.
Wie lang kann ein Qwen Image 3.0 Prompt sein?
Qwen gibt an, dass das Modell Anweisungen mit bis zu 4,5K Tokens akzeptiert. Dies ist die Prompt-Grenze und keine Garantie dafür, dass 4.500 Tokens Text in einem Bild korrekt dargestellt werden können.
Kann Qwen Image 3.0 kleinen Text erzeugen?
Qwen gibt an, dass das Modell lesbaren Text in Größen von etwa 10 Pixeln darstellen kann. Exakte Schreibweise, Formeln, Zahlen und Fakten sollten weiterhin manuell geprüft werden.
Welche Sprachen unterstützt Qwen Image 3.0?
Qwen gibt an, dass das Modell native Darstellung in 12 Sprachen unterstützt. Die Startmaterialien zeigen mehrere Sprachen, darunter Chinesisch, Englisch, Japanisch, Koreanisch und Spanisch, veröffentlichen jedoch nicht die vollständige Liste der 12 Sprachen.
Kann Qwen Image 3.0 Bilder bearbeiten?
Ja. Offizielle Beispiele zeigen, wie das Modell handschriftliche Anmerkungen hinzufügt, Fotos mit technischen Informationen erweitert und fehlende oder beschädigte Teile traditioneller Kunstwerke wiederherstellt.
Ist Qwen Image 3.0 Open Source?
Qwen hat keine offenen Gewichte oder Lizenz veröffentlicht. Der gehostete PoYo-Zugang bedeutet nicht, dass lokale Gewichte verfügbar sind.
Wie lautet der API-Modellname von Qwen Image 3.0?
PoYo verwendet qwen-image-3 und qwen-image-3-pro; QwenCloud verwendet qwen-image-3.0-pro. Die IDs dürfen nicht vertauscht werden.
Welche Auflösung unterstützt Qwen Image 3.0?
PoYo unterstützt 1K und 2K. Diese Ausgabeoptionen sind keine Aussage über die native Trainings- oder Maximalauflösung.
Erzeugen Sie Bilder auf der Qwen Image 3.0 Modellseite oder lesen Sie die PoYo API-Dokumentation.