Zum Inhalt

Bildgenerierung

Bildgenerierung ist eine Webanwendung zur Erzeugung und Bearbeitung von Bildern auf Basis natürlichsprachlicher Beschreibungen. Die Oberfläche bündelt Text-to-Image und Image-to-Image in einer einheitlichen Eingabemaske und greift dafür auf einen über die OpenAI-API angebundenen Inferenz-Dienst zu, der in der lokalen Infrastruktur betrieben wird. Unterstützt werden derzeit zwei austauschbare Bildmodelle.

Auf einen Blick

  • Bilder aus Textbeschreibungen erzeugen — von kurzen Stichpunkten bis zu detaillierten Szenen, einschließlich Schrift im Bild
  • Vorhandene Bilder weiterbearbeiten — Referenzbilder mitgeben und gezielt verändern lassen
  • Mehrere Varianten parallel erzeugen — bis zu vier Bilder in einem Durchlauf vergleichen
  • Iterativ arbeiten — ein Ergebnis direkt als Referenzbild für den nächsten Durchlauf übernehmen
  • Mit Voreinstellungen schnell ans Ziel kommen — Auflösung, Bildanzahl, Detailgrad und Prompt-Treue über zwei Auswahllisten setzen
  • Reproduzierbare Ergebnisse erzielen — über einen festen Seed lassen sich identische Bilder erneut erzeugen
  • Generierte Bilder herunterladen — direkt aus der Galerie als PNG-Dateien mit sprechenden Dateinamen

Highlights

Die Anwendung kapselt den Aufruf eines Bildmodells, der mit einem direkten API-Request technisch aufwendig wäre, hinter einer auf typische Aufgaben zugeschnittenen Oberfläche. Folgende Eigenschaften gehen über einen einfachen Aufruf hinaus und beeinflussen die Ergebnisqualität sowie die Wechselbarkeit von Modellen:

  • Anbindung über die OpenAI-API — Die Kommunikation mit dem Inferenz-Dienst nutzt die standardisierten OpenAI-Endpunkte für Bilderzeugung und Chat-Completion. Dadurch lassen sich Modelle und Server austauschen, ohne dass die Anwendung oder der Workflow angepasst werden müssen.
  • Zwei Erzeugungsmodi in einer Oberfläche — Je nachdem, ob Referenzbilder vorliegen, wird intern automatisch der passende API-Pfad gewählt (Text-to-Image oder Image-to-Image). Der Wechsel zwischen den Modi erfolgt für Nutzende transparent über dieselbe Eingabemaske.
  • Anbindung an die lokale Infrastruktur — Die Inferenz erfolgt auf einem in der lokalen Infrastruktur betriebenen Server. Eingaben, Referenzbilder und erzeugte Bilder verlassen diese nicht.
  • Auswahl zwischen mehreren Bildmodellen — Unterstützt werden derzeit Qwen-Image-2512 und black-forest-labs/FLUX.2-dev über dieselbe Oberfläche. Das jeweils aktive Modell wird zentral konfiguriert.
  • Preset-System für die häufigen Fälle — Voreinstellungen für Modus (Auflösung und Anzahl) und Qualität (Inference Steps und Guidance Scale) erlauben einen schnellen Einstieg, ohne dass die Bedeutung der Detailparameter bekannt sein muss.
  • Manuelle Parameter überschreibbar — Auflösung, Bildanzahl, Inference Steps, Guidance Scale und Seed lassen sich über ein Akkordeon einzeln setzen und ergänzen die Presets, ohne diese zu verdecken.
  • Iterative Bildbearbeitung — Ein erzeugtes Bild kann mit einem Klick als Referenz für den nächsten Durchlauf übernommen werden. Dadurch lässt sich schrittweise an ein gewünschtes Ergebnis annähern.
  • Negative Prompts — Unerwünschte Bildelemente lassen sich gezielt ausschließen, was den Anteil an Ausschuss reduziert.
  • Reproduzierbarkeit über Seed — Bei festem Seed führen identische Eingaben zu identischen Ausgaben. Das ermöglicht systematisches Variieren einzelner Parameter und das Wiederherstellen früherer Ergebnisse.