Zum Inhalt

Funktionen

KI-Umfrage stellt einen vollständigen Arbeitsbereich für das experimentelle Aufsetzen, Durchführen und Auswerten LLM-gestützter Umfrage-Dialoge bereit. Der Funktionsumfang umfasst die interaktive Beantwortung einzelner Fragen, das Nachschärfen vager Eingaben, die Strukturierung der Ergebnisse, das Editieren der zugrunde liegenden Prompts sowie die Auswertung im Batch.

Anwendungsszenarien

  • Konzept-Erprobung an Beispiel-Umfragen. Mit den mitgelieferten Demo-Fragen (Cloud-Nutzung, IT-Sicherheitslage) lässt sich nachvollziehen, wie das System eine vage Antwort wie „Cloud" oder „gut" erkennt, eine spezifische Nachfrage formuliert und die kombinierte Antwort am Ende strukturiert.
  • Vergleich von Prompt-Varianten. Zwei Formulierungen desselben Bewertungs- oder Nachfrage-Prompts lassen sich gegen identische Test-Antworten laufen lassen, um die Auswirkungen einzelner Änderungen auf Klarheits-Score und Nachfrage-Verhalten direkt sichtbar zu machen.
  • Systematische Validierung gegen einen Antwortdatensatz. Eine vorbereitete CSV-Datei mit Frage-Antwort-Paaren und erwartetem Nachfrage-Verhalten kann im Batch-Modus durchlaufen werden, um zu prüfen, in wie vielen Fällen die Pipeline der Erwartung entspricht.
  • Feinkalibrierung der Bewertungsstrenge. Über Klarheits-Schwelle, maximale Nachfragen-Anzahl und LLM-Temperature lässt sich beobachten, wie sich diese Stellschrauben auf das Verhalten gegenüber typischen Antwortmustern auswirken.
  • Stakeholder-Demos. Ein dedizierter Demo-Modus führt eine zweistufige Mini-Umfrage chronologisch durch und visualisiert nach jeder Frage Klarheits-Bewertung, ggf. erfolgte Nachfragen und die finale strukturierte Antwort.
  • Performance-Beobachtung. Verarbeitungszeiten der einzelnen Pipeline-Stufen werden mitgeschnitten und können während des Tests eingesehen werden, um Engpässe (etwa langsame LLM-Antworten) zu erkennen.

Auf einen Blick

  • Sechs thematisch getrennte Tabs: Playground, Prompt-Engineering, Batch-Testing, Fragen-Editor, Session-Demo, Performance.
  • Bewertungsentscheidung in jeder Antwort-Runde durch konfigurierbaren Klarheits-Schwellwert.
  • Konfigurierbare maximale Anzahl Nachfragen pro Hauptfrage; jede Nachfrage trägt eine eigene Begründung und einen Konfidenzwert.
  • Live editierbare Prompt-Templates für Bewertung, Nachfrage, Strukturierung und Behandlung irrelevanter Antworten.
  • Import per YAML (Konfiguration, Umfragedefinition) und CSV (Batch-Tests); Export der Sessions als JSON.
  • Mock-Modus für Entwicklung und Tests ohne erreichbares LLM.
  • Sessions inklusive vollständigem Konversationsverlauf werden persistent abgelegt.

Konnektoren und Datenquellen

Externer Konnektor:

  • OpenAI-kompatible Chat-Completion-API. Über einen konfigurierbaren Endpoint (api_base, api_key, model) wird ein beliebiges Modell angesprochen, das die OpenAI-Chat-API umsetzt. Die Anwendung fordert strukturierte JSON-Antworten an und greift bei Timeout oder Fehlern auf regelbasierte Ersatz-Antworten zurück, um den Ablauf stabil zu halten.

Interne Komponenten:

  • YAML-basierte Umfrage- und System-Konfiguration. Bewertungsschwellen, maximale Nachfragen-Anzahl, LLM-Verbindungsdaten sowie die Definition der Umfrage selbst (Fragen, erwartete Antwortmuster, Hilfetexte) werden aus YAML-Dateien geladen; Umgebungsvariablen können einzelne Werte überschreiben.
  • Lokale Ergebnis-Ablage. Abgeschlossene Sessions werden mit Konversationsverlauf, Bewertungsmetadaten und finalen strukturierten Antworten in einem konfigurierbaren Ergebnisverzeichnis gespeichert.

Import- und Exportformate

  • YAML (Import). Trennung in eine zentrale System-Konfiguration und eine Umfrage-Definition. Letztere enthält die Fragen, ihre Kontextinformationen sowie typische Beispielantworten in den Kategorien „vage" und „klar", aus denen sich die Bewertungsstrenge beim Prompting ableitet.
  • CSV (Import, Batch-Test). Spalten für Frage, Antwort und das jeweils erwartete Nachfrage-Verhalten. Der Batch-Lauf gleicht die tatsächliche Pipeline-Reaktion mit dem Erwartungswert ab.
  • JSON (Export). Vollständige Session-Ergebnisse mit Frage-, Antwort- und Bewertungsdaten, Konversationsverlauf, Cluster-Vorschlag, Konfidenzwert und Metadaten zur Verarbeitung.

Qualitätssichernde Funktionen

  • Mehrstufige Verarbeitung. Antworten werden nicht in einem einzigen LLM-Aufruf verarbeitet, sondern in getrennten Schritten bewertet, ggf. nachgefragt und am Ende strukturiert. Dadurch sind Zwischenergebnisse einzeln einsehbar und korrigierbar.
  • Klarheits-Score mit Schwellwert-Logik. Jede Antwort erhält einen Wert zwischen 0 und 1; nur Werte unterhalb der konfigurierten Schwelle (Default 0.7) lösen eine Nachfrage aus.
  • Validierung der Bewertungs-Antwort. Die strukturierten Bewertungs-Felder (Klarheits-Score, Nachfrage-Notwendigkeit, Problemtypen, Verbesserungsvorschläge) werden gegen erlaubte Wertebereiche geprüft; ungültige Einträge werden auf Defaults zurückgeführt.
  • Konfidenzwert für die Endantwort. Die strukturierte Endantwort trägt einen eigenen Konfidenzwert; liegt dieser unter einer Schwelle, wird die Antwort automatisch zur manuellen Nachprüfung markiert.
  • Begrenzung der Nachfrage-Tiefe. Pro Hauptfrage ist die maximale Anzahl Nachfragen konfigurierbar, um Endlosschleifen bei wiederholt vagen Antworten zu vermeiden.
  • Robuste Fallback-Pfade. Bei Timeout, Verbindungsfehler oder ungültigem JSON greift jede Pipeline-Stufe auf eine regelbasierte Ersatz-Logik zurück (heuristische Klarheits-Bewertung, vorgefertigte Nachfrage-Muster, lokale Strukturierung), so dass auch im Störfall ein nachvollziehbares Ergebnis entsteht.
  • Nachvollziehbarkeit. Jede Session wird inklusive der einzelnen Interaktionen, Begründungstexte des Modells und Verarbeitungszeiten aufgezeichnet und steht für eine spätere Auswertung zur Verfügung.

Weitere Funktionen

  • Live-Prompt-Engineering. Alle Prompt-Templates lassen sich aus der Oberfläche heraus laden, bearbeiten und gegen Test-Antworten ausführen; die rohe LLM-Antwort kann zur Diagnose direkt eingesehen werden.
  • Fragen-Editor. Frage-Texte und zugehörige Hilfehinweise lassen sich anpassen, ohne YAML-Dateien direkt zu bearbeiten.
  • Performance-Monitoring. Pro Operation (Bewertung, Nachfrage-Generierung, Strukturierung, Gesamt-Durchlauf) werden Laufzeiten erfasst und in einer Übersicht zusammengeführt; Sollwerte sind hinterlegt.
  • Konfigurierbare Bedienelemente. Klarheits-Schwellwert, maximale Nachfragen, Followup-Aggressivität und LLM-Temperature lassen sich pro Sitzung verändern.
  • Mock-Modus. Schaltbar über Umgebungsvariable; liefert vorgefertigte Antworten in der Pipeline-Struktur, sodass die Oberfläche auch ohne LLM bedienbar bleibt.