Funktionen¶
Bildgenerierung bietet eine einheitliche Oberfläche für Text-to-Image und Image-to-Image. Der Funktionsumfang umfasst die Bilderzeugung selbst, ein zweistufiges Voreinstellungssystem, eine erweiterte manuelle Parametersteuerung sowie Mechanismen zur Reproduzierbarkeit und zur Reduktion von unerwünschten Bildbestandteilen.
Anwendungsszenarien¶
- Workshop- und Veranstaltungsposter: Aus einer kurzen Beschreibung des Anlasses entsteht ein druckfertiges Posterlayout mit Titel und passender Bildsprache. Über das Image-to-Image-Verfahren können bestehende Entwürfe als Referenz übernommen und variiert werden.
- Projekt- und Forschungslogos: Auf Grundlage einer thematischen Beschreibung lassen sich minimalistische Logo-Entwürfe in mehreren Varianten gleichzeitig erzeugen, aus denen anschließend ausgewählt wird.
- Illustrative Stadt- und Themenbilder: Für Webseiten, Folien und interne Materialien können szenische Darstellungen (z.B. isometrische Stadtansichten, abstrakte Themenbilder) in passender Auflösung und Bildform erstellt werden.
- Visualisierung von Konzepten und Mockups: Produkt- und Verpackungsmockups, Action-Figuren-Darstellungen oder andere Konzeptvisualisierungen werden aus textlichen Beschreibungen erzeugt und bei Bedarf mit Referenzbildern weiter angepasst.
- Iterative Bildvarianten: Ein vorhandenes Bild dient als Ausgangspunkt für gezielte Veränderungen (Stil, Komposition, Bildelemente). Die Übernahme des Ergebnisses als neues Referenzbild erlaubt schrittweise Annäherung an die gewünschte Darstellung.
- Schnelle Vorschau-Generierung: Im Vorschau-Modus werden mit reduzierter Auflösung und wenigen Inference Steps mehrere Varianten in kurzer Zeit erzeugt, um vor einer hochauflösenden Erzeugung Bildideen vorzusortieren.
Auf einen Blick¶
- Text-to-Image und Image-to-Image in einer Oberfläche
- Anbindung an einen Inferenz-Dienst in der lokalen Infrastruktur über die OpenAI-API
- Unterstützung für zwei austauschbare Bildmodelle (Qwen-Image-2512, black-forest-labs/FLUX.2-dev)
- Zwölf vordefinierte Auflösungen von 512×512 bis 1664×1664 inklusive Quer- und Hochformaten
- Bis zu vier Bilder pro Durchlauf
- Negative Prompts, frei wählbarer Seed, Inference Steps und Guidance Scale
- PNG-Ausgabe mit Zeitstempel-basierten Dateinamen, direkt aus der Galerie herunterladbar
Bilderzeugung¶
Die Bilderzeugung erfolgt in zwei sich automatisch anpassenden Betriebsarten. Ohne Referenzbilder wird der Bilderzeugungs-Endpunkt der OpenAI-API verwendet (Text-to-Image). Sobald mindestens ein Referenzbild bereitgestellt wird, schaltet die Anwendung auf den Chat-Completion-Endpunkt um (Image-to-Image), bei dem Referenzbilder als eingebettete Bilddaten in der Anfrage übergeben werden. Beide Pfade nutzen denselben Server und dasselbe konfigurierte Modell.
- Text-to-Image: Erzeugung aus einem reinen Text-Prompt, optional mit negativem Prompt.
- Image-to-Image: Erzeugung unter Berücksichtigung eines oder mehrerer Referenzbilder. Mehrfache Bildreferenzen werden zusammen mit dem Prompt an das Modell übergeben.
- Mehrfacherzeugung: Pro Durchlauf können bis zu vier Bilder gleichzeitig angefordert werden. Im Image-to-Image-Modus wird der Seed pro Variante systematisch erhöht, um unterschiedliche Ergebnisse zu erzielen.
Anbindung und Modelle¶
Die Anwendung kommuniziert über HTTPS mit einem OpenAI-kompatiblen Inferenz-Dienst, der zentral konfiguriert wird.
- Inferenz-Dienst in der lokalen Infrastruktur: Der angesprochene Server wird in der lokalen Infrastruktur betrieben und über Basis-URL, API-Schlüssel und Modellbezeichnung konfiguriert. Eingaben und erzeugte Bilder verlassen die lokale Infrastruktur nicht.
- Bildmodell Qwen-Image-2512: Wird der Modellname
Qwen/Qwen-Image-2512konfiguriert, leitet der Inferenz-Dienst Anfragen an dieses Modell weiter. - Bildmodell black-forest-labs/FLUX.2-dev: Alternativ kann der Modellname
black-forest-labs/FLUX.2-devkonfiguriert werden. Die Oberfläche und der Aufrufpfad bleiben identisch.
Preset-System¶
Zwei aufeinander abgestimmte Voreinstellungen reduzieren die Anzahl der Bedienschritte für typische Aufgaben.
- Modus-Preset: Setzt Auflösung und Anzahl der Bilder gemeinsam (z.B. „Vorschau – 4 Bilder, 512×512", „Standard – 1 Bild, 1024×1024", „Hoch – 1 Bild, 1280×1280", „Sehr hoch – 1 Bild, 1664×1664").
- Qualitäts-Preset: Setzt Inference Steps und Guidance Scale gemeinsam (von „Entwurf – schnell, kreativ" bis „Fein – detailliert, prompt-treu").
Erweiterte Parameter¶
Sämtliche Parameter sind im Akkordeon „Weitere Optionen" einzeln zugänglich und überschreiben die Preset-Auswahl. Ein erneutes Anklicken eines Presets setzt die Werte zurück.
- Auflösung: Auswahl aus zwölf vordefinierten Werten zwischen 512×512 und 1664×1664, einschließlich quadratischer, querformatiger und hochformatiger Maße.
- Anzahl Bilder: Eins bis vier Bilder pro Durchlauf.
- Inference Steps: Zwischen fünf und einhundert Schritten. Höhere Werte erhöhen den Detailgrad und die Erzeugungsdauer.
- Guidance Scale: Zwischen 1,0 und 20,0. Höhere Werte führen zu strengerer Prompt-Treue, niedrigere Werte zu freierer Interpretation.
- Seed: Ganzzahliger Wert; -1 erzeugt einen zufälligen Seed.
- Negativer Prompt: Freitext zur Beschreibung unerwünschter Bildelemente.
- Referenzbilder: Mehrfach-Upload mit Dateityp-Filter auf Bildformate.
Funktionen zur Qualitätssicherung¶
Mehrere Mechanismen unterstützen reproduzierbare und gezielte Ergebnisse:
- Negative Prompts: Gezielter Ausschluss unerwünschter Bildelemente reduziert den Anteil an unbrauchbaren Generierungen.
- Reproduzierbarkeit über Seed: Bei festem Seed liefern identische Eingaben identische Bilder, sodass Variationen einzelner Parameter systematisch nachvollzogen werden können.
- Iterative Verfeinerung: Erzeugte Bilder lassen sich mit einer Schaltfläche als Referenz für den nächsten Durchlauf übernehmen, wodurch ein Ergebnis schrittweise verfeinert werden kann.
- Bildvorverarbeitung: Referenzbilder werden vor der Übertragung auf eine maximale Kantenlänge skaliert und je nach Modus als JPEG (RGB) oder PNG (mit Transparenz) kodiert. Dies reduziert Anfragen-Größe und Übertragungszeit ohne sichtbare Qualitätseinbußen.
- Fehlerbehandlung: Verbindungsabbrüche, Zeitüberschreitungen und Fehlerantworten der API werden mit verständlichen Hinweisen abgefangen, einschließlich Hinweisen zur möglichen Ursache (z.B. Servererreichbarkeit, zu hohe Steps oder Auflösung).
Bildverarbeitung und -ausgabe¶
- Galerie-Ansicht: Alle Ergebnisse eines Durchlaufs werden gemeinsam in einer scrollbaren Galerie angezeigt.
- Benannte Dateien: Erzeugte Bilder werden mit einem Zeitstempel und ggf. einer laufenden Nummer als PNG abgelegt und können einzeln heruntergeladen werden.
- Übernahme als Referenz: Mit einem Klick werden alle Ergebnisse eines Durchlaufs als Eingabe für den nächsten Durchlauf gesetzt.
- Beispiel-Prompts: Die Oberfläche enthält Beispiele, deren Werte sich beim Anklicken direkt in die Eingabefelder übertragen.