Funktionen¶
Das Vision Model Interface bietet zwei Hauptarbeitsbereiche: Einzelbild-Analyse und mehrseitige PDF-Analyse. Beide nutzen denselben Modellzugang, unterscheiden sich aber in Eingabe, Steuerung und Ausgabe. Ein Schwerpunkt liegt auf wiederholbaren, qualitätsgesicherten Abläufen — etwa der Generierung von Alt-Texten oder der seitenweisen Auswertung umfangreicher Dokumente.
Anwendungsszenarien¶
- Barrierearme Versionen von Postern — Aus eingescannten Plakaten oder Posterdateien werden über die Alt-Text-Vorlage strukturierte Bildbeschreibungen erzeugt, die für Screenreader geeignet sind und nachträgliche Barrierefreiheitsanforderungen unterstützen.
- Detaillierte Analyse einzelner Bilder — Diagramme, Schaubilder oder Fotografien werden mit einem frei formulierten Prompt ausgewertet, etwa zur Beschreibung des Inhalts, zur Datenextraktion aus Diagrammen oder zur strukturierten Auswertung visueller Inhalte.
- Aufbereitung mehrseitiger PDF-Dokumente — Gescannte oder erzeugte PDFs werden seitenweise analysiert und zu einer Gesamtzusammenfassung verdichtet, sodass sich Inhalte langer Dokumente überblicksartig erschließen lassen.
- Texterkennung aus visuellen Vorlagen — Über die OCR-Vorlage wird Text aus Seiten extrahiert und mit erhaltener Struktur (Überschriften, Absätze, Listen) ausgegeben, etwa für die Weiterverarbeitung gescannter Vorlagen.
- Kurzzusammenfassungen pro Seite — Lange Dokumente werden seitenweise auf zwei bis drei Sätze reduziert, etwa zur Vorab-Sichtung oder zur Erstellung kompakter Inhaltsübersichten.
Auf einen Blick¶
- Zwei Arbeitsbereiche: Bildanalyse und PDF-Analyse mit Seitenvorschau
- Vier Eingabequellen für Bilder: Upload, URL, Zwischenablage, Webcam
- Fünf Prompt-Vorlagen (Detailanalyse, Alt-Text, Kurzzusammenfassung, OCR, Benutzerdefiniert)
- Drei Modi der PDF-Seitenauswahl: alle Seiten, Auswahl per Klick, manuelle Bereichseingabe
- Drei Exportformate: Markdown, Word, HTML — Word und HTML mit eingebetteten Seitenbildern
- Konfigurierbare Token-Budgets pro Seite und für die Zusammenfassung
- Wählbare Detailtiefe der Bildverarbeitung (auto / low / high)
Eingabequellen¶
Die Anwendung verarbeitet Bilder und PDFs aus unterschiedlichen Quellen, ohne weitere externe Datenanbindungen. Die für die Analyse benötigten Vorlagen werden direkt von Nutzerinnen und Nutzern bereitgestellt.
- Datei-Upload (Bild) — Übergabe lokaler Bilddateien über die Browser-Oberfläche. Übliche Bildformate werden unterstützt; das Bild wird vor der Analyse automatisch aufbereitet.
- URL-Eingabe (Bild) — Bilder werden über HTTP/HTTPS direkt von einer angegebenen Adresse geladen. Vor der Verarbeitung erfolgt eine Inhalts- und Größenprüfung.
- Zwischenablage (Bild) — Eingefügte Bilder werden direkt aus der Zwischenablage übernommen, ohne Zwischenspeichern auf dem Endgerät.
- Webcam (Bild) — Aufnahmen können unmittelbar in der Browser-Oberfläche erstellt werden, etwa zur Analyse aktuell vorliegender Vorlagen.
- Datei-Upload (PDF) — PDF-Dokumente werden hochgeladen, validiert und als Thumbnail-Galerie zur Vorschau aufbereitet. Passwortgeschützte und ungültige Dateien werden mit verständlicher Fehlermeldung abgewiesen.
Modellanbindung¶
Die Anwendung kommuniziert mit einem OpenAI-kompatiblen Chat-Completions-Endpunkt, der Vision-Eingaben unterstützt. Endpunkt-URL, Modellname und Zugangsschlüssel werden über Umgebungsvariablen konfiguriert; die konkrete Modellinstanz ist damit austauschbar. Der Bildanteil einer Anfrage wird als Base64-kodierte Daten-URL übergeben, die Detailtiefe des Bildaufrufs (auto, low, high) ist je Anfrage wählbar.
Analyse-Modi¶
Für PDF-Analysen stehen vorbereitete Prompt-Vorlagen zur Verfügung, die jeweils ein bestimmtes Ergebnisformat anstreben:
- Detaillierte Analyse — Strukturierte Beschreibung von Hauptinhalt, Abbildungen, relevanten Daten und Layout einer Seite.
- Alt-Text für Bilder — Barrierefreie Beschreibungen aller visuellen Elemente in einem für Screenreader geeigneten Format mit Element-Typ, Inhalt und Funktion.
- Kurze Zusammenfassung — Verdichtung der Seite auf zwei bis drei Sätze.
- Texterkennung (OCR) — Vollständige Transkription des sichtbaren Texts unter Beibehaltung der Struktur (Überschriften, Absätze, Listen).
- Benutzerdefiniert — Freier Prompt für Spezialfälle.
Im Bildanalyse-Bereich wird der Prompt frei formuliert; die Vorlagen wirken hier nicht.
Seitenauswahl bei PDFs¶
Drei Modi bestimmen, welche Seiten eines PDFs in die Analyse eingehen:
- Alle Seiten — Sequenzielle Analyse des gesamten Dokuments.
- Auswahl aus Vorschau — Per Klick auf Thumbnails werden einzelne Seiten in die Auswahl aufgenommen oder entfernt; ausgewählte Seiten erhalten eine Rahmen- und Häkchen-Anzeige.
- Manuelle Eingabe — Eingabe gemischter Listen und Bereiche (z.B.
1-3, 5, 7-10); zusätzlich werden Schlüsselwörter wielastund das Bis-Ende-Muster (5-last) verstanden.
Export-Formate¶
Die Ergebnisse einer PDF-Analyse lassen sich in drei Formate ausleiten. Bild-Eingaben werden bisher nicht exportiert; das Ergebnis lässt sich aus dem Browser kopieren.
- Markdown (
.md) — Reine Textausgabe mit Metadaten, Zusammenfassung und Einzelanalysen. Eignet sich für Versionierung und Weiterverarbeitung in Dokumentationssystemen. - Word (
.docx) — Vollständig formatiertes Dokument mit Überschriftshierarchie, Listen, Tabellen und eingebetteten Seitenbildern. Eingehender Markdown-Text aus dem Modell wird in Word-Formatierung übersetzt. - HTML (
.html) — In sich geschlossene HTML-Datei mit Base64-eingebetteten Seitenbildern und schlichtem CSS. Lässt sich ohne weitere Abhängigkeiten weitergeben oder archivieren.
Qualitätssichernde Funktionen¶
Mehrere Mechanismen sorgen für reproduzierbare und nachvollziehbare Ergebnisse:
- Eingabevalidierung — PDFs werden auf Existenz, Größe, Gültigkeit und Passwortschutz geprüft. Bilder werden vor dem Modellaufruf auf Verfügbarkeit, Größe und Format geprüft.
- Bildvorverarbeitung — EXIF-Orientierung wird korrigiert, große Bilder werden auf eine modellverträgliche Kantenlänge reskaliert, RGBA/Palette-Bilder werden auf weißem Hintergrund nach RGB konvertiert. Damit ist die an das Modell übergebene Vorlage unabhängig von der Quelle einheitlich.
- Markdown-Normalisierung — Vom Modell zurückgegebene Unicode-Varianten von Markdown-Zeichen (Vollbreitenstern, gerichtete Anführungszeichen u.a.) werden vor der Weiterverarbeitung auf ASCII zurückgeführt, sodass Word-, HTML- und Markdown-Export einheitlich rendern.
- Fehlertoleranz pro Seite — Schlägt die Analyse einer einzelnen PDF-Seite fehl (Render- oder Modellfehler), wird der Lauf nicht abgebrochen. Erfolgreiche Seiten gehen in die Gesamtzusammenfassung ein, fehlgeschlagene Seiten werden mit Fehlermeldung dokumentiert.
- Strukturierte Fehlerklassen — Fehler werden nach Typ (Netzwerk, API, Bild, Validierung, Konfiguration) klassifiziert und mit verständlichen Meldungen an die Oberfläche gegeben.
- Fortschritts- und Kostenanzeige — Während der Analyse wird der Bearbeitungsstand seitenweise angezeigt. Nach Abschluss werden analysierte Seiten, Laufzeit und der vom Endpunkt zurückgegebene Token-Verbrauch ausgewiesen.
- Reproduzierbare Konfiguration — Modellzugang, Modellname, Render-Auflösungen und Verarbeitungsparameter sind über Umgebungsvariablen oder eine
.env-Datei festgelegt. Damit ist eine Analyse mit identischen Einstellungen wiederholbar.