Funktionen¶
KI-Umfrage stellt einen vollständigen Arbeitsbereich für das experimentelle Aufsetzen, Durchführen und Auswerten LLM-gestützter Umfrage-Dialoge bereit. Der Funktionsumfang umfasst die interaktive Beantwortung einzelner Fragen, das Nachschärfen vager Eingaben, die Strukturierung der Ergebnisse, das Editieren der zugrunde liegenden Prompts sowie die Auswertung im Batch.
Anwendungsszenarien¶
- Konzept-Erprobung an Beispiel-Umfragen. Mit den mitgelieferten Demo-Fragen (Cloud-Nutzung, IT-Sicherheitslage) lässt sich nachvollziehen, wie das System eine vage Antwort wie „Cloud" oder „gut" erkennt, eine spezifische Nachfrage formuliert und die kombinierte Antwort am Ende strukturiert.
- Vergleich von Prompt-Varianten. Zwei Formulierungen desselben Bewertungs- oder Nachfrage-Prompts lassen sich gegen identische Test-Antworten laufen lassen, um die Auswirkungen einzelner Änderungen auf Klarheits-Score und Nachfrage-Verhalten direkt sichtbar zu machen.
- Systematische Validierung gegen einen Antwortdatensatz. Eine vorbereitete CSV-Datei mit Frage-Antwort-Paaren und erwartetem Nachfrage-Verhalten kann im Batch-Modus durchlaufen werden, um zu prüfen, in wie vielen Fällen die Pipeline der Erwartung entspricht.
- Feinkalibrierung der Bewertungsstrenge. Über Klarheits-Schwelle, maximale Nachfragen-Anzahl und LLM-Temperature lässt sich beobachten, wie sich diese Stellschrauben auf das Verhalten gegenüber typischen Antwortmustern auswirken.
- Stakeholder-Demos. Ein dedizierter Demo-Modus führt eine zweistufige Mini-Umfrage chronologisch durch und visualisiert nach jeder Frage Klarheits-Bewertung, ggf. erfolgte Nachfragen und die finale strukturierte Antwort.
- Performance-Beobachtung. Verarbeitungszeiten der einzelnen Pipeline-Stufen werden mitgeschnitten und können während des Tests eingesehen werden, um Engpässe (etwa langsame LLM-Antworten) zu erkennen.
Auf einen Blick¶
- Sechs thematisch getrennte Tabs: Playground, Prompt-Engineering, Batch-Testing, Fragen-Editor, Session-Demo, Performance.
- Bewertungsentscheidung in jeder Antwort-Runde durch konfigurierbaren Klarheits-Schwellwert.
- Konfigurierbare maximale Anzahl Nachfragen pro Hauptfrage; jede Nachfrage trägt eine eigene Begründung und einen Konfidenzwert.
- Live editierbare Prompt-Templates für Bewertung, Nachfrage, Strukturierung und Behandlung irrelevanter Antworten.
- Import per YAML (Konfiguration, Umfragedefinition) und CSV (Batch-Tests); Export der Sessions als JSON.
- Mock-Modus für Entwicklung und Tests ohne erreichbares LLM.
- Sessions inklusive vollständigem Konversationsverlauf werden persistent abgelegt.
Konnektoren und Datenquellen¶
Externer Konnektor:
- OpenAI-kompatible Chat-Completion-API. Über einen konfigurierbaren Endpoint (
api_base,api_key,model) wird ein beliebiges Modell angesprochen, das die OpenAI-Chat-API umsetzt. Die Anwendung fordert strukturierte JSON-Antworten an und greift bei Timeout oder Fehlern auf regelbasierte Ersatz-Antworten zurück, um den Ablauf stabil zu halten.
Interne Komponenten:
- YAML-basierte Umfrage- und System-Konfiguration. Bewertungsschwellen, maximale Nachfragen-Anzahl, LLM-Verbindungsdaten sowie die Definition der Umfrage selbst (Fragen, erwartete Antwortmuster, Hilfetexte) werden aus YAML-Dateien geladen; Umgebungsvariablen können einzelne Werte überschreiben.
- Lokale Ergebnis-Ablage. Abgeschlossene Sessions werden mit Konversationsverlauf, Bewertungsmetadaten und finalen strukturierten Antworten in einem konfigurierbaren Ergebnisverzeichnis gespeichert.
Import- und Exportformate¶
- YAML (Import). Trennung in eine zentrale System-Konfiguration und eine Umfrage-Definition. Letztere enthält die Fragen, ihre Kontextinformationen sowie typische Beispielantworten in den Kategorien „vage" und „klar", aus denen sich die Bewertungsstrenge beim Prompting ableitet.
- CSV (Import, Batch-Test). Spalten für Frage, Antwort und das jeweils erwartete Nachfrage-Verhalten. Der Batch-Lauf gleicht die tatsächliche Pipeline-Reaktion mit dem Erwartungswert ab.
- JSON (Export). Vollständige Session-Ergebnisse mit Frage-, Antwort- und Bewertungsdaten, Konversationsverlauf, Cluster-Vorschlag, Konfidenzwert und Metadaten zur Verarbeitung.
Qualitätssichernde Funktionen¶
- Mehrstufige Verarbeitung. Antworten werden nicht in einem einzigen LLM-Aufruf verarbeitet, sondern in getrennten Schritten bewertet, ggf. nachgefragt und am Ende strukturiert. Dadurch sind Zwischenergebnisse einzeln einsehbar und korrigierbar.
- Klarheits-Score mit Schwellwert-Logik. Jede Antwort erhält einen Wert zwischen 0 und 1; nur Werte unterhalb der konfigurierten Schwelle (Default 0.7) lösen eine Nachfrage aus.
- Validierung der Bewertungs-Antwort. Die strukturierten Bewertungs-Felder (Klarheits-Score, Nachfrage-Notwendigkeit, Problemtypen, Verbesserungsvorschläge) werden gegen erlaubte Wertebereiche geprüft; ungültige Einträge werden auf Defaults zurückgeführt.
- Konfidenzwert für die Endantwort. Die strukturierte Endantwort trägt einen eigenen Konfidenzwert; liegt dieser unter einer Schwelle, wird die Antwort automatisch zur manuellen Nachprüfung markiert.
- Begrenzung der Nachfrage-Tiefe. Pro Hauptfrage ist die maximale Anzahl Nachfragen konfigurierbar, um Endlosschleifen bei wiederholt vagen Antworten zu vermeiden.
- Robuste Fallback-Pfade. Bei Timeout, Verbindungsfehler oder ungültigem JSON greift jede Pipeline-Stufe auf eine regelbasierte Ersatz-Logik zurück (heuristische Klarheits-Bewertung, vorgefertigte Nachfrage-Muster, lokale Strukturierung), so dass auch im Störfall ein nachvollziehbares Ergebnis entsteht.
- Nachvollziehbarkeit. Jede Session wird inklusive der einzelnen Interaktionen, Begründungstexte des Modells und Verarbeitungszeiten aufgezeichnet und steht für eine spätere Auswertung zur Verfügung.
Weitere Funktionen¶
- Live-Prompt-Engineering. Alle Prompt-Templates lassen sich aus der Oberfläche heraus laden, bearbeiten und gegen Test-Antworten ausführen; die rohe LLM-Antwort kann zur Diagnose direkt eingesehen werden.
- Fragen-Editor. Frage-Texte und zugehörige Hilfehinweise lassen sich anpassen, ohne YAML-Dateien direkt zu bearbeiten.
- Performance-Monitoring. Pro Operation (Bewertung, Nachfrage-Generierung, Strukturierung, Gesamt-Durchlauf) werden Laufzeiten erfasst und in einer Übersicht zusammengeführt; Sollwerte sind hinterlegt.
- Konfigurierbare Bedienelemente. Klarheits-Schwellwert, maximale Nachfragen, Followup-Aggressivität und LLM-Temperature lassen sich pro Sitzung verändern.
- Mock-Modus. Schaltbar über Umgebungsvariable; liefert vorgefertigte Antworten in der Pipeline-Struktur, sodass die Oberfläche auch ohne LLM bedienbar bleibt.