Bildgenerierung¶
Bildgenerierung ist eine Webanwendung zur Erzeugung und Bearbeitung von Bildern auf Basis natürlichsprachlicher Beschreibungen. Die Oberfläche bündelt Text-to-Image und Image-to-Image in einer einheitlichen Eingabemaske und greift dafür auf einen über die OpenAI-API angebundenen Inferenz-Dienst zu, der in der lokalen Infrastruktur betrieben wird. Unterstützt werden derzeit zwei austauschbare Bildmodelle.
Auf einen Blick¶
- Bilder aus Textbeschreibungen erzeugen — von kurzen Stichpunkten bis zu detaillierten Szenen, einschließlich Schrift im Bild
- Vorhandene Bilder weiterbearbeiten — Referenzbilder mitgeben und gezielt verändern lassen
- Mehrere Varianten parallel erzeugen — bis zu vier Bilder in einem Durchlauf vergleichen
- Iterativ arbeiten — ein Ergebnis direkt als Referenzbild für den nächsten Durchlauf übernehmen
- Mit Voreinstellungen schnell ans Ziel kommen — Auflösung, Bildanzahl, Detailgrad und Prompt-Treue über zwei Auswahllisten setzen
- Reproduzierbare Ergebnisse erzielen — über einen festen Seed lassen sich identische Bilder erneut erzeugen
- Generierte Bilder herunterladen — direkt aus der Galerie als PNG-Dateien mit sprechenden Dateinamen
Highlights¶
Die Anwendung kapselt den Aufruf eines Bildmodells, der mit einem direkten API-Request technisch aufwendig wäre, hinter einer auf typische Aufgaben zugeschnittenen Oberfläche. Folgende Eigenschaften gehen über einen einfachen Aufruf hinaus und beeinflussen die Ergebnisqualität sowie die Wechselbarkeit von Modellen:
- Anbindung über die OpenAI-API — Die Kommunikation mit dem Inferenz-Dienst nutzt die standardisierten OpenAI-Endpunkte für Bilderzeugung und Chat-Completion. Dadurch lassen sich Modelle und Server austauschen, ohne dass die Anwendung oder der Workflow angepasst werden müssen.
- Zwei Erzeugungsmodi in einer Oberfläche — Je nachdem, ob Referenzbilder vorliegen, wird intern automatisch der passende API-Pfad gewählt (Text-to-Image oder Image-to-Image). Der Wechsel zwischen den Modi erfolgt für Nutzende transparent über dieselbe Eingabemaske.
- Anbindung an die lokale Infrastruktur — Die Inferenz erfolgt auf einem in der lokalen Infrastruktur betriebenen Server. Eingaben, Referenzbilder und erzeugte Bilder verlassen diese nicht.
- Auswahl zwischen mehreren Bildmodellen — Unterstützt werden derzeit Qwen-Image-2512 und black-forest-labs/FLUX.2-dev über dieselbe Oberfläche. Das jeweils aktive Modell wird zentral konfiguriert.
- Preset-System für die häufigen Fälle — Voreinstellungen für Modus (Auflösung und Anzahl) und Qualität (Inference Steps und Guidance Scale) erlauben einen schnellen Einstieg, ohne dass die Bedeutung der Detailparameter bekannt sein muss.
- Manuelle Parameter überschreibbar — Auflösung, Bildanzahl, Inference Steps, Guidance Scale und Seed lassen sich über ein Akkordeon einzeln setzen und ergänzen die Presets, ohne diese zu verdecken.
- Iterative Bildbearbeitung — Ein erzeugtes Bild kann mit einem Klick als Referenz für den nächsten Durchlauf übernommen werden. Dadurch lässt sich schrittweise an ein gewünschtes Ergebnis annähern.
- Negative Prompts — Unerwünschte Bildelemente lassen sich gezielt ausschließen, was den Anteil an Ausschuss reduziert.
- Reproduzierbarkeit über Seed — Bei festem Seed führen identische Eingaben zu identischen Ausgaben. Das ermöglicht systematisches Variieren einzelner Parameter und das Wiederherstellen früherer Ergebnisse.