Zum Inhalt

Funktionen

Bildgenerierung bietet eine einheitliche Oberfläche für Text-to-Image und Image-to-Image. Der Funktionsumfang umfasst die Bilderzeugung selbst, ein zweistufiges Voreinstellungssystem, eine erweiterte manuelle Parametersteuerung sowie Mechanismen zur Reproduzierbarkeit und zur Reduktion von unerwünschten Bildbestandteilen.

Anwendungsszenarien

  • Workshop- und Veranstaltungsposter: Aus einer kurzen Beschreibung des Anlasses entsteht ein druckfertiges Posterlayout mit Titel und passender Bildsprache. Über das Image-to-Image-Verfahren können bestehende Entwürfe als Referenz übernommen und variiert werden.
  • Projekt- und Forschungslogos: Auf Grundlage einer thematischen Beschreibung lassen sich minimalistische Logo-Entwürfe in mehreren Varianten gleichzeitig erzeugen, aus denen anschließend ausgewählt wird.
  • Illustrative Stadt- und Themenbilder: Für Webseiten, Folien und interne Materialien können szenische Darstellungen (z.B. isometrische Stadtansichten, abstrakte Themenbilder) in passender Auflösung und Bildform erstellt werden.
  • Visualisierung von Konzepten und Mockups: Produkt- und Verpackungsmockups, Action-Figuren-Darstellungen oder andere Konzeptvisualisierungen werden aus textlichen Beschreibungen erzeugt und bei Bedarf mit Referenzbildern weiter angepasst.
  • Iterative Bildvarianten: Ein vorhandenes Bild dient als Ausgangspunkt für gezielte Veränderungen (Stil, Komposition, Bildelemente). Die Übernahme des Ergebnisses als neues Referenzbild erlaubt schrittweise Annäherung an die gewünschte Darstellung.
  • Schnelle Vorschau-Generierung: Im Vorschau-Modus werden mit reduzierter Auflösung und wenigen Inference Steps mehrere Varianten in kurzer Zeit erzeugt, um vor einer hochauflösenden Erzeugung Bildideen vorzusortieren.

Auf einen Blick

  • Text-to-Image und Image-to-Image in einer Oberfläche
  • Anbindung an einen Inferenz-Dienst in der lokalen Infrastruktur über die OpenAI-API
  • Unterstützung für zwei austauschbare Bildmodelle (Qwen-Image-2512, black-forest-labs/FLUX.2-dev)
  • Zwölf vordefinierte Auflösungen von 512×512 bis 1664×1664 inklusive Quer- und Hochformaten
  • Bis zu vier Bilder pro Durchlauf
  • Negative Prompts, frei wählbarer Seed, Inference Steps und Guidance Scale
  • PNG-Ausgabe mit Zeitstempel-basierten Dateinamen, direkt aus der Galerie herunterladbar

Bilderzeugung

Die Bilderzeugung erfolgt in zwei sich automatisch anpassenden Betriebsarten. Ohne Referenzbilder wird der Bilderzeugungs-Endpunkt der OpenAI-API verwendet (Text-to-Image). Sobald mindestens ein Referenzbild bereitgestellt wird, schaltet die Anwendung auf den Chat-Completion-Endpunkt um (Image-to-Image), bei dem Referenzbilder als eingebettete Bilddaten in der Anfrage übergeben werden. Beide Pfade nutzen denselben Server und dasselbe konfigurierte Modell.

  • Text-to-Image: Erzeugung aus einem reinen Text-Prompt, optional mit negativem Prompt.
  • Image-to-Image: Erzeugung unter Berücksichtigung eines oder mehrerer Referenzbilder. Mehrfache Bildreferenzen werden zusammen mit dem Prompt an das Modell übergeben.
  • Mehrfacherzeugung: Pro Durchlauf können bis zu vier Bilder gleichzeitig angefordert werden. Im Image-to-Image-Modus wird der Seed pro Variante systematisch erhöht, um unterschiedliche Ergebnisse zu erzielen.

Anbindung und Modelle

Die Anwendung kommuniziert über HTTPS mit einem OpenAI-kompatiblen Inferenz-Dienst, der zentral konfiguriert wird.

  • Inferenz-Dienst in der lokalen Infrastruktur: Der angesprochene Server wird in der lokalen Infrastruktur betrieben und über Basis-URL, API-Schlüssel und Modellbezeichnung konfiguriert. Eingaben und erzeugte Bilder verlassen die lokale Infrastruktur nicht.
  • Bildmodell Qwen-Image-2512: Wird der Modellname Qwen/Qwen-Image-2512 konfiguriert, leitet der Inferenz-Dienst Anfragen an dieses Modell weiter.
  • Bildmodell black-forest-labs/FLUX.2-dev: Alternativ kann der Modellname black-forest-labs/FLUX.2-dev konfiguriert werden. Die Oberfläche und der Aufrufpfad bleiben identisch.

Preset-System

Zwei aufeinander abgestimmte Voreinstellungen reduzieren die Anzahl der Bedienschritte für typische Aufgaben.

  • Modus-Preset: Setzt Auflösung und Anzahl der Bilder gemeinsam (z.B. „Vorschau – 4 Bilder, 512×512", „Standard – 1 Bild, 1024×1024", „Hoch – 1 Bild, 1280×1280", „Sehr hoch – 1 Bild, 1664×1664").
  • Qualitäts-Preset: Setzt Inference Steps und Guidance Scale gemeinsam (von „Entwurf – schnell, kreativ" bis „Fein – detailliert, prompt-treu").

Erweiterte Parameter

Sämtliche Parameter sind im Akkordeon „Weitere Optionen" einzeln zugänglich und überschreiben die Preset-Auswahl. Ein erneutes Anklicken eines Presets setzt die Werte zurück.

  • Auflösung: Auswahl aus zwölf vordefinierten Werten zwischen 512×512 und 1664×1664, einschließlich quadratischer, querformatiger und hochformatiger Maße.
  • Anzahl Bilder: Eins bis vier Bilder pro Durchlauf.
  • Inference Steps: Zwischen fünf und einhundert Schritten. Höhere Werte erhöhen den Detailgrad und die Erzeugungsdauer.
  • Guidance Scale: Zwischen 1,0 und 20,0. Höhere Werte führen zu strengerer Prompt-Treue, niedrigere Werte zu freierer Interpretation.
  • Seed: Ganzzahliger Wert; -1 erzeugt einen zufälligen Seed.
  • Negativer Prompt: Freitext zur Beschreibung unerwünschter Bildelemente.
  • Referenzbilder: Mehrfach-Upload mit Dateityp-Filter auf Bildformate.

Funktionen zur Qualitätssicherung

Mehrere Mechanismen unterstützen reproduzierbare und gezielte Ergebnisse:

  • Negative Prompts: Gezielter Ausschluss unerwünschter Bildelemente reduziert den Anteil an unbrauchbaren Generierungen.
  • Reproduzierbarkeit über Seed: Bei festem Seed liefern identische Eingaben identische Bilder, sodass Variationen einzelner Parameter systematisch nachvollzogen werden können.
  • Iterative Verfeinerung: Erzeugte Bilder lassen sich mit einer Schaltfläche als Referenz für den nächsten Durchlauf übernehmen, wodurch ein Ergebnis schrittweise verfeinert werden kann.
  • Bildvorverarbeitung: Referenzbilder werden vor der Übertragung auf eine maximale Kantenlänge skaliert und je nach Modus als JPEG (RGB) oder PNG (mit Transparenz) kodiert. Dies reduziert Anfragen-Größe und Übertragungszeit ohne sichtbare Qualitätseinbußen.
  • Fehlerbehandlung: Verbindungsabbrüche, Zeitüberschreitungen und Fehlerantworten der API werden mit verständlichen Hinweisen abgefangen, einschließlich Hinweisen zur möglichen Ursache (z.B. Servererreichbarkeit, zu hohe Steps oder Auflösung).

Bildverarbeitung und -ausgabe

  • Galerie-Ansicht: Alle Ergebnisse eines Durchlaufs werden gemeinsam in einer scrollbaren Galerie angezeigt.
  • Benannte Dateien: Erzeugte Bilder werden mit einem Zeitstempel und ggf. einer laufenden Nummer als PNG abgelegt und können einzeln heruntergeladen werden.
  • Übernahme als Referenz: Mit einem Klick werden alle Ergebnisse eines Durchlaufs als Eingabe für den nächsten Durchlauf gesetzt.
  • Beispiel-Prompts: Die Oberfläche enthält Beispiele, deren Werte sich beim Anklicken direkt in die Eingabefelder übertragen.