Zum Inhalt

KI-Umfrage

KI-Umfrage ist ein Experimentierwerkzeug, das untersucht, wie sich offene Umfragen durch den Einsatz eines Large Language Model (LLM) qualitativ verbessern lassen. Die Anwendung führt freie Antworten durch eine mehrstufige LLM-Pipeline, in der Antworten zunächst auf Klarheit bewertet, bei Bedarf durch automatisch generierte Nachfragen präzisiert und anschließend für eine spätere Auswertung strukturiert werden. Im Vordergrund steht die Frage, ob ein Sprachmodell vage oder unspezifische Eingaben zuverlässig erkennen und durch gezielte Rückfragen so weit konkretisieren kann, dass die resultierenden Antworten clusterfähig werden.

Auf einen Blick

  • Offene Umfrage-Fragen formulieren und durch einen LLM-gestützten Dialog beantworten lassen — vage Antworten werden automatisch erkannt und nachgefragt.
  • Antworten werden nach einer einstellbaren Klarheits-Schwelle bewertet; nur unzureichend spezifische Antworten lösen Nachfragen aus.
  • Vollständige Konversationen werden zu einer einzigen, strukturierten Endantwort verdichtet, die für statistische Auswertung und Clustering vorbereitet ist.
  • Prompt-Templates lassen sich in einer eigenen Oberfläche editieren, vergleichen und gegen Test-Antworten prüfen — ohne Code-Eingriff.
  • Größere Antwortdatensätze können im CSV-Format eingespielt und im Batch-Modus gegen die Pipeline getestet werden, inklusive Erwartungswert-Vergleich.
  • Eine geführte Demo-Session zeigt den vollständigen Ablauf von der ersten Frage bis zur finalen strukturierten Antwort.
  • Laufzeiten und Verarbeitungs-Phasen werden pro Operation erfasst und im Performance-Tab eingesehen.

Highlights

Die Anwendung unterscheidet sich von einem direkten Prompt an ein LLM oder einem einfachen Skript dadurch, dass sie Antworten nicht in einem Schritt verarbeitet, sondern dialogorientiert nachschärft und am Ende in eine strukturierte, auswertbare Form überführt.

  • Mehrstufige LLM-Pipeline. Antworten durchlaufen drei voneinander getrennte LLM-Aufrufe: eine Bewertung der Klarheit, optional eine Nachfragen-Generierung und abschließend eine Strukturierung der Gesamtkonversation. Jede Stufe arbeitet mit einem eigenen, fachlich zugeschnittenen Prompt-Template.
  • Automatische Erkennung vager Antworten. Das Modell vergibt einen Klarheits-Score zwischen 0 und 1 und benennt zugleich die Problemtypen (etwa „vage Terminologie", „fehlende Spezifität", „zu kurz"). Der Schwellwert für eine Nachfrage ist konfigurierbar.
  • Gezielte Nachfragen statt fester Skripte. Nachfragen werden zur Laufzeit aus dem ursprünglichen Frageinhalt, der konkreten Antwort und den erkannten Problemtypen erzeugt; sie sind dadurch spezifischer als vorgegebene Standardfragen.
  • Strukturierung für Clustering. Aus der vollständigen Konversation wird eine einzelne, dichte Endantwort erzeugt, ergänzt um eine Hauptkategorie, eine Liste spezifischer Begriffe und einen Konfidenzwert — Grundlage für eine spätere Auswertung über mehrere Sessions.
  • Live-Prompt-Engineering. Alle Prompt-Templates können in der Oberfläche geladen, geändert, mit Test-Antworten verglichen und gegen die Roh-Antwort des LLM gegengeprüft werden.
  • Batch-Test-Modus. Vorbereitete Antwortdatensätze (CSV) lassen sich gegen die Pipeline laufen lassen, um Bewertungsverhalten und Nachfrage-Quote systematisch zu beobachten.
  • Konfigurierbare Bewertungsstrenge. Klarheits-Schwelle, maximale Anzahl Nachfragen pro Frage und Followup-Aggressivität sind im Interface ohne Neustart anpassbar.
  • OpenAI-kompatibel über frei wählbaren Endpoint. Die Anwendung spricht jede OpenAI-kompatible Chat-Completion-Schnittstelle an; ein Mock-Modus erlaubt Entwicklung und Tests ohne erreichbares Modell.
  • Reproduzierbare Ergebnisse. Sessions, Konversationen und finale Antworten werden serialisiert abgelegt und enthalten neben dem strukturierten Ergebnis auch Roh-Antwort, Konversationsverlauf und Bewertungsmetadaten.
  • Anbindung an 1 externe Quelle: OpenAI-kompatibler LLM-Endpoint. Konfigurations- und Umfragedefinitionen werden lokal über YAML-Dateien eingelesen.