Funktionen¶
Das Umfrage-Analyse-System deckt den vollständigen Auswertungsablauf ab: vom Import der Rohdaten über die Codierung und Clusterung von Freitextantworten bis zur Erstellung mehrsprachiger Berichte und Dashboard-Datensätze. Der Schwerpunkt liegt auf nachvollziehbarer Verarbeitung mit manueller Eingriffsmöglichkeit an allen kritischen Stellen.
Anwendungsszenarien¶
- Vollständige Auswertung einer Hochschulumfrage. Eine als CSV oder Excel exportierte Umfrage mit gemischten Fragetypen wird importiert; die Anwendung erkennt Fragetypen, übersetzt fremdsprachige Antworten, clustert Freitexte, berechnet Signifikanztests und erzeugt einen strukturierten Word-Bericht.
- Nachbearbeitung automatisch erzeugter Cluster. Nach einem ersten LLM-gestützten Clustering werden Cluster-Namen unscharf oder die Granularität unpassend befunden. Über die Workbench werden Cluster umbenannt, zusammengeführt oder neu definiert, und ein erneuter Clustering-Lauf richtet die Items an den korrigierten Kategorien aus.
- Themenübergreifende Auswertung über Fragen hinweg. Themen werden über Schlagwörter und explizite Fragen-Zuordnungen definiert; die Anwendung erzeugt eine Themen-zu-Frage-Zuordnung als Grundlage für die Navigation in einer separaten Dashboard-Anwendung.
- Segmentvergleich nach Land, Hochschultyp und Größe. Für jede Frage — auch Freitextfragen mit Cluster-Strukturen — werden Anteile pro Segment, gruppierte Diagramme, Small Multiples sowie Chi-Quadrat-Tests berechnet und in einem Anhang dokumentiert.
- Mehrsprachige Publikation. Ein erzeugter Bericht wird in Deutsch, Französisch und Englisch ausgegeben; ergänzende Markdown-Quellen (Cover, Hintergrund, Einführung) werden absatzweise übersetzt und mit dem Auswertungsteil zu einem publikationsreifen Dokument zusammengeführt.
- Bereitstellung der Daten für eine Begleit-Website. Sämtliche Analyseergebnisse, Korrelationen und Themen-Zuordnungen werden als JSON exportiert und sind die Datenbasis einer separat betriebenen Dashboard-Anwendung.
Auf einen Blick¶
- Sieben Fragetyp-Handler (Einfach-/Mehrfachauswahl, Ja/Nein-Matrix, Likert, Ranking, Freitext, Kooperationsmatrix)
- Drei Konnektoren: Tabellen-Import (CSV/Excel), LimeSurvey-Strukturdatei (.lss), LLM-API
- Vier Exportformate: Word, JSON, CSV, PNG
- Drei Sprachen für Verarbeitung und Ausgabe (DE/FR/EN)
- Segmentierung nach Land, Hochschultyp, Größe — auch für Freitext-Cluster
- Workbench für Cluster, Items und Normalisierung
- Wiederaufnahmefähige Batch-Operationen mit Datenbank-Cache
Datenimport¶
Tabellarische Umfragedaten werden über einen Import-Dialog eingelesen. Die Anwendung erkennt Spaltenstrukturen automatisch und schlägt geeignete Handler-Typen vor; bestehende Konfigurationen lassen sich aus YAML-Dateien laden oder im UI bearbeiten.
- CSV / Excel: Tabellarische Umfragedaten mit semikolon- oder kommabasiertem Format werden mit automatischer Encoding-Erkennung (UTF-8, UTF-8-BOM, Latin-1, CP1252) eingelesen. Excel-Dateien (.xlsx, .xls) werden direkt unterstützt.
- LimeSurvey-Strukturdatei (.lss): Die XML-basierte Strukturdatei aus LimeSurvey wird parsiert, um mehrsprachige Fragetexte, Hilfetexte und Antwortoptionen automatisch in die interne Konfiguration zu übernehmen. Damit entfällt das manuelle Pflegen von Frageübersetzungen.
- LLM-API (extern): Eine OpenAI-kompatible Schnittstelle (z.B. vLLM) wird für Übersetzung, Item-Extraktion, Clustering, Themen-Extraktion und Zusammenfassungstexte angesprochen. URL, Modellname und Zeitlimits sind über Umgebungsvariablen konfigurierbar.
Verarbeitung von Freitext-Antworten¶
Freitexte werden zweistufig aufbereitet. Zuerst werden zusammengesetzte Antworten in einzelne Items zerlegt; anschließend werden die Items thematisch gruppiert. Beide Schritte sind nachvollziehbar dokumentiert und manuell korrigierbar.
- Item-Extraktion (Hybrid). Eine regelbasierte Erkennung erfasst strukturierte Antworten (Listen, Aufzählungen, Trennzeichen). Bei niedriger Konfidenz oder Fließtext übernimmt eine LLM-gestützte Extraktion mit zwei Prompt-Modi: konservativ (möglichst kein Trennen) oder thematisch (Trennen nach eigenständigen Aussagen unter Erhalt des Kontexts).
- Clustering. Items werden über das LLM zu thematischen Clustern zusammengefasst. Mindest- und Höchstanzahl der Cluster sowie der maximale Anteil eines Einzelclusters skalieren mit der Antwortmenge, um sowohl Über- als auch Untergliederung zu vermeiden.
- Auswahl repräsentativer Beispiele. Zu jedem Cluster wählt das LLM aus den zugeordneten Items eine kleine Menge an Belegantworten, die im Bericht als Beispiele erscheinen.
Workbench für Qualitätssicherung¶
Die Workbench bündelt alle Korrekturmöglichkeiten an automatisch erzeugten Ergebnissen. Sie ist auf Auswertende zugeschnitten, die LLM-Vorschläge prüfen und an die fachliche Sicht anpassen.
- Cluster-Editor: Bearbeiten von Cluster-Namen (DE/FR/EN), Beschreibungen sowie Hinzufügen oder Löschen von Clustern.
- Item-Editor: Umbenennen, Löschen, Zusammenführen und Aufteilen extrahierter Items; Neuzuordnung zwischen Clustern; Suche und Filter nach Cluster und Schlagwort.
- Normalisierung: Erkennen und Vereinheitlichen ähnlicher Schreibweisen (etwa „M365" und „Office 365") über regel- oder LLM-gestützte Vorschläge.
- Re-Clustering mit fixierten Kategorien: Erneute Zuordnung der Items zu einem manuell definierten Kategoriensatz; optional unter Zulassung neuer Kategorien.
Analyse und Segmentierung¶
Für jeden Fragetyp existiert ein eigener Handler mit fragetyp-passender Aggregation. Die Auswertung kann gesamthaft oder segmentiert erfolgen.
- Segmentierung: nach Land, Hochschultyp und Größe; konfigurierbar in der zentralen Konfigurationsdatei.
- Freitext-Segmentierung: Cluster-Vergleich pro Segment, einschließlich Vergleichstabellen und gruppierter Diagramme.
- Statistische Tests: Chi-Quadrat-Test mit Cramér's V als Effektstärke; Stichprobenwarnungen bei niedrigen erwarteten Häufigkeiten.
- Korrelationsanalyse: Berechnung paarweiser Zusammenhänge zwischen Fragen mit Klassifikation der Effektstärke.
- Diagrammtypen: horizontale Balken, gestapelte 100%-Balken, Tortendiagramm, Treemap, divergierende Balken, Ranking-Diagramm, gruppierte Balken und Small Multiples.
Auswertungstexte und Themen¶
Neben der numerischen Auswertung erzeugt die Anwendung Texte zur Einordnung der Ergebnisse und ordnet Fragen Themenbereichen zu.
- Frage-Zusammenfassungen: Pro Frage werden drei Textblöcke erzeugt — Beschreibung der Verteilung, Interpretation auffälliger Befunde und Hinweis auf signifikante Segmentunterschiede. Die Texte werden in den drei Sprachen erstellt und in der Datenbank gecacht.
- Themenanalyse: Themen werden mit Schlagwörtern definiert; die Zuordnung erfolgt über String-Matching oder eine tiefere LLM-gestützte Prüfung der einzelnen Cluster. Ergebnis ist eine Themen-zu-Frage-Zuordnung als Basis für die Dashboard-Navigation.
Export und Berichtserstellung¶
Die Anwendung erzeugt sowohl einzelne Berichte als auch eine Pipeline-Ausgabe mit allen Bestandteilen einer publikationsreifen Auswertung.
- Strukturierter Word-Bericht: Titelseite, Inhaltsverzeichnis, Hauptteil nach Fragengruppen mit Diagrammen pro Frage (Gesamt, gruppierter Segmentvergleich, Small Multiples), Anhang A mit Detailtabellen und Signifikanzwerten, Anhang B mit Freitext-Clustern und Beispielen.
- Document Builder: Markdown-Quelldateien (Cover, Einführung, Hintergrund, Themen-Zusammenfassungen) werden absatzweise mit Glossar-Unterstützung übersetzt und gemeinsam mit dem Bericht zu einem mehrsprachigen Publikationsdokument verbunden.
- Dashboard-JSON: Vollständiger Datensatz mit globalen und segmentierten Ergebnissen, Korrelationen und Themen-Zuordnungen für eine separate Dashboard-Webanwendung.
- CSV und PNG: Auswertungstabellen als CSV und einzelne Diagramme als PNG.
- Wiederaufnahmemodus: Pipeline-Läufe greifen auf bereits berechnete Ergebnisse zurück, sodass nur fehlende Schritte neu ausgeführt werden.