Zum Inhalt

Funktionen

Das Vision Model Interface bietet zwei Hauptarbeitsbereiche: Einzelbild-Analyse und mehrseitige PDF-Analyse. Beide nutzen denselben Modellzugang, unterscheiden sich aber in Eingabe, Steuerung und Ausgabe. Ein Schwerpunkt liegt auf wiederholbaren, qualitätsgesicherten Abläufen — etwa der Generierung von Alt-Texten oder der seitenweisen Auswertung umfangreicher Dokumente.

Anwendungsszenarien

  • Barrierearme Versionen von Postern — Aus eingescannten Plakaten oder Posterdateien werden über die Alt-Text-Vorlage strukturierte Bildbeschreibungen erzeugt, die für Screenreader geeignet sind und nachträgliche Barrierefreiheitsanforderungen unterstützen.
  • Detaillierte Analyse einzelner Bilder — Diagramme, Schaubilder oder Fotografien werden mit einem frei formulierten Prompt ausgewertet, etwa zur Beschreibung des Inhalts, zur Datenextraktion aus Diagrammen oder zur strukturierten Auswertung visueller Inhalte.
  • Aufbereitung mehrseitiger PDF-Dokumente — Gescannte oder erzeugte PDFs werden seitenweise analysiert und zu einer Gesamtzusammenfassung verdichtet, sodass sich Inhalte langer Dokumente überblicksartig erschließen lassen.
  • Texterkennung aus visuellen Vorlagen — Über die OCR-Vorlage wird Text aus Seiten extrahiert und mit erhaltener Struktur (Überschriften, Absätze, Listen) ausgegeben, etwa für die Weiterverarbeitung gescannter Vorlagen.
  • Kurzzusammenfassungen pro Seite — Lange Dokumente werden seitenweise auf zwei bis drei Sätze reduziert, etwa zur Vorab-Sichtung oder zur Erstellung kompakter Inhaltsübersichten.

Auf einen Blick

  • Zwei Arbeitsbereiche: Bildanalyse und PDF-Analyse mit Seitenvorschau
  • Vier Eingabequellen für Bilder: Upload, URL, Zwischenablage, Webcam
  • Fünf Prompt-Vorlagen (Detailanalyse, Alt-Text, Kurzzusammenfassung, OCR, Benutzerdefiniert)
  • Drei Modi der PDF-Seitenauswahl: alle Seiten, Auswahl per Klick, manuelle Bereichseingabe
  • Drei Exportformate: Markdown, Word, HTML — Word und HTML mit eingebetteten Seitenbildern
  • Konfigurierbare Token-Budgets pro Seite und für die Zusammenfassung
  • Wählbare Detailtiefe der Bildverarbeitung (auto / low / high)

Eingabequellen

Die Anwendung verarbeitet Bilder und PDFs aus unterschiedlichen Quellen, ohne weitere externe Datenanbindungen. Die für die Analyse benötigten Vorlagen werden direkt von Nutzerinnen und Nutzern bereitgestellt.

  • Datei-Upload (Bild) — Übergabe lokaler Bilddateien über die Browser-Oberfläche. Übliche Bildformate werden unterstützt; das Bild wird vor der Analyse automatisch aufbereitet.
  • URL-Eingabe (Bild) — Bilder werden über HTTP/HTTPS direkt von einer angegebenen Adresse geladen. Vor der Verarbeitung erfolgt eine Inhalts- und Größenprüfung.
  • Zwischenablage (Bild) — Eingefügte Bilder werden direkt aus der Zwischenablage übernommen, ohne Zwischenspeichern auf dem Endgerät.
  • Webcam (Bild) — Aufnahmen können unmittelbar in der Browser-Oberfläche erstellt werden, etwa zur Analyse aktuell vorliegender Vorlagen.
  • Datei-Upload (PDF) — PDF-Dokumente werden hochgeladen, validiert und als Thumbnail-Galerie zur Vorschau aufbereitet. Passwortgeschützte und ungültige Dateien werden mit verständlicher Fehlermeldung abgewiesen.

Modellanbindung

Die Anwendung kommuniziert mit einem OpenAI-kompatiblen Chat-Completions-Endpunkt, der Vision-Eingaben unterstützt. Endpunkt-URL, Modellname und Zugangsschlüssel werden über Umgebungsvariablen konfiguriert; die konkrete Modellinstanz ist damit austauschbar. Der Bildanteil einer Anfrage wird als Base64-kodierte Daten-URL übergeben, die Detailtiefe des Bildaufrufs (auto, low, high) ist je Anfrage wählbar.

Analyse-Modi

Für PDF-Analysen stehen vorbereitete Prompt-Vorlagen zur Verfügung, die jeweils ein bestimmtes Ergebnisformat anstreben:

  • Detaillierte Analyse — Strukturierte Beschreibung von Hauptinhalt, Abbildungen, relevanten Daten und Layout einer Seite.
  • Alt-Text für Bilder — Barrierefreie Beschreibungen aller visuellen Elemente in einem für Screenreader geeigneten Format mit Element-Typ, Inhalt und Funktion.
  • Kurze Zusammenfassung — Verdichtung der Seite auf zwei bis drei Sätze.
  • Texterkennung (OCR) — Vollständige Transkription des sichtbaren Texts unter Beibehaltung der Struktur (Überschriften, Absätze, Listen).
  • Benutzerdefiniert — Freier Prompt für Spezialfälle.

Im Bildanalyse-Bereich wird der Prompt frei formuliert; die Vorlagen wirken hier nicht.

Seitenauswahl bei PDFs

Drei Modi bestimmen, welche Seiten eines PDFs in die Analyse eingehen:

  • Alle Seiten — Sequenzielle Analyse des gesamten Dokuments.
  • Auswahl aus Vorschau — Per Klick auf Thumbnails werden einzelne Seiten in die Auswahl aufgenommen oder entfernt; ausgewählte Seiten erhalten eine Rahmen- und Häkchen-Anzeige.
  • Manuelle Eingabe — Eingabe gemischter Listen und Bereiche (z.B. 1-3, 5, 7-10); zusätzlich werden Schlüsselwörter wie last und das Bis-Ende-Muster (5-last) verstanden.

Export-Formate

Die Ergebnisse einer PDF-Analyse lassen sich in drei Formate ausleiten. Bild-Eingaben werden bisher nicht exportiert; das Ergebnis lässt sich aus dem Browser kopieren.

  • Markdown (.md) — Reine Textausgabe mit Metadaten, Zusammenfassung und Einzelanalysen. Eignet sich für Versionierung und Weiterverarbeitung in Dokumentationssystemen.
  • Word (.docx) — Vollständig formatiertes Dokument mit Überschriftshierarchie, Listen, Tabellen und eingebetteten Seitenbildern. Eingehender Markdown-Text aus dem Modell wird in Word-Formatierung übersetzt.
  • HTML (.html) — In sich geschlossene HTML-Datei mit Base64-eingebetteten Seitenbildern und schlichtem CSS. Lässt sich ohne weitere Abhängigkeiten weitergeben oder archivieren.

Qualitätssichernde Funktionen

Mehrere Mechanismen sorgen für reproduzierbare und nachvollziehbare Ergebnisse:

  • Eingabevalidierung — PDFs werden auf Existenz, Größe, Gültigkeit und Passwortschutz geprüft. Bilder werden vor dem Modellaufruf auf Verfügbarkeit, Größe und Format geprüft.
  • Bildvorverarbeitung — EXIF-Orientierung wird korrigiert, große Bilder werden auf eine modellverträgliche Kantenlänge reskaliert, RGBA/Palette-Bilder werden auf weißem Hintergrund nach RGB konvertiert. Damit ist die an das Modell übergebene Vorlage unabhängig von der Quelle einheitlich.
  • Markdown-Normalisierung — Vom Modell zurückgegebene Unicode-Varianten von Markdown-Zeichen (Vollbreitenstern, gerichtete Anführungszeichen u.a.) werden vor der Weiterverarbeitung auf ASCII zurückgeführt, sodass Word-, HTML- und Markdown-Export einheitlich rendern.
  • Fehlertoleranz pro Seite — Schlägt die Analyse einer einzelnen PDF-Seite fehl (Render- oder Modellfehler), wird der Lauf nicht abgebrochen. Erfolgreiche Seiten gehen in die Gesamtzusammenfassung ein, fehlgeschlagene Seiten werden mit Fehlermeldung dokumentiert.
  • Strukturierte Fehlerklassen — Fehler werden nach Typ (Netzwerk, API, Bild, Validierung, Konfiguration) klassifiziert und mit verständlichen Meldungen an die Oberfläche gegeben.
  • Fortschritts- und Kostenanzeige — Während der Analyse wird der Bearbeitungsstand seitenweise angezeigt. Nach Abschluss werden analysierte Seiten, Laufzeit und der vom Endpunkt zurückgegebene Token-Verbrauch ausgewiesen.
  • Reproduzierbare Konfiguration — Modellzugang, Modellname, Render-Auflösungen und Verarbeitungsparameter sind über Umgebungsvariablen oder eine .env-Datei festgelegt. Damit ist eine Analyse mit identischen Einstellungen wiederholbar.