Zum Inhalt

Vision Model Interface

Das Vision Model Interface ist eine webbasierte Anwendung zur Analyse von Bildern und PDF-Dokumenten mit Vision Language Models. Die Anwendung nimmt Bilder oder mehrseitige PDFs entgegen, übergibt sie an ein über eine OpenAI-kompatible Schnittstelle angebundenes Vision-Modell und liefert die Ergebnisse strukturiert zurück. Bei PDFs werden die Seiten einzeln analysiert und zu einer Gesamtzusammenfassung verdichtet; das Ergebnis lässt sich in mehreren Formaten exportieren.

Auf einen Blick

  • Bilder und PDF-Dokumente per Browser hochladen und durch ein Vision-Modell beschreiben oder auswerten lassen
  • Aus PDFs gezielt einzelne Seiten oder Seitenbereiche zur Analyse auswählen
  • Zwischen vordefinierten Analyse-Modi wählen (z.B. Alt-Text-Generierung für Barrierefreiheit, Texterkennung, Kurz- oder Detailanalyse) oder einen eigenen Prompt formulieren
  • Aus Postern, Plakaten und anderen visuellen Vorlagen barrierearme Textbeschreibungen erzeugen
  • Bei mehrseitigen PDFs eine kohärente Gesamtzusammenfassung über alle ausgewählten Seiten erhalten
  • Ergebnisse als Markdown-, Word- oder HTML-Datei exportieren und weiterverwenden

Highlights

Im Unterschied zu einem direkten Prompt an ein Sprachmodell übernimmt die Anwendung die vollständige Aufbereitung visueller Vorlagen, die Steuerung mehrstufiger Analysen und die formatkonforme Ausgabe. Daraus ergeben sich Ergebnisse, die ohne Zwischenschritte weiterverarbeitet werden können.

  • Zweistufige PDF-Verarbeitung — Jede ausgewählte Seite wird einzeln durch das Vision-Modell analysiert; ein nachgelagerter Textaufruf erstellt aus den Einzelergebnissen eine konsolidierte Gesamtzusammenfassung. Pro Seite und für die Zusammenfassung lassen sich Token-Budgets und Detailtiefe getrennt steuern.
  • Klickbasierte Seitenauswahl — In einer Vorschau-Galerie werden die PDF-Seiten als Thumbnails dargestellt. Per Klick werden Seiten in die Auswahl aufgenommen oder entfernt; eine Rahmen- und Häkchen-Markierung zeigt den Status visuell. Alternativ stehen ein Modus „alle Seiten" und eine manuelle Bereichseingabe (z.B. 1-3, 5, 7-10) zur Verfügung.
  • Vordefinierte Prompt-Vorlagen — Für wiederkehrende Aufgaben wie detaillierte Seitenanalyse, Alt-Text-Generierung, Kurzzusammenfassung und Texterkennung (OCR) sind getestete Prompt-Vorlagen hinterlegt. Eigene Prompts lassen sich ergänzen.
  • Mehrere Bildeingaben — Bilder können per Datei-Upload, URL, Zwischenablage oder Webcam zugeführt werden. Lokale Dateien und über HTTP geladene Bilder werden gleichermaßen unterstützt.
  • Automatische Bildaufbereitung — Vor der Analyse korrigiert die Anwendung die EXIF-Orientierung, skaliert große Bilder verlustarm auf eine modellverträgliche Kantenlänge, konvertiert in RGB und kodiert als JPEG. Damit sind Eingaben unabhängig von Quelle und Format konsistent verarbeitet.
  • Dreifacher Export — Analyseergebnisse stehen als Markdown-, Word- oder HTML-Datei zur Verfügung. Word- und HTML-Export betten die zugehörigen Seitenbilder ein, sodass Ergebnis und Vorlage gemeinsam dokumentiert werden.
  • Barrierefreiheit als Anwendungsfall — Über die Alt-Text-Vorlage werden zu Bildern, Diagrammen und Grafiken auf einer Seite strukturierte Beschreibungen erzeugt, die für Screenreader geeignet sind. Damit lassen sich vorhandene Plakate und Druckerzeugnisse nachträglich barrierearm beschreiben.
  • Konfigurierbare Modellanbindung — Die Schnittstelle erwartet einen OpenAI-kompatiblen Chat-Completions-Endpunkt mit Vision-Unterstützung. Endpunkt, Modellname und Zugangsschlüssel sind über Umgebungsvariablen gesetzt; das Modell ist damit austauschbar.
  • DSGVO-konforme Voreinstellungen — Die Auslieferung erfolgt ohne Google Fonts und ohne Telemetrie. Temporäre Dateien aus Upload und Export werden über das eingebaute Session-Management automatisch bereinigt.