LLM-Chat¶
LLM-Chat ist eine webbasierte Anwendung für den dialogbasierten Einsatz großer Sprachmodelle. Sie führt Freitext-Chat, Dokumentenanalyse und Bildverarbeitung in einer einzigen Oberfläche zusammen und ist über einen OpenAI-kompatiblen Endpunkt an einen Sprachmodell-Server angebunden. Eine zentrale technische Besonderheit ist die Modell-Profil-Verwaltung, über die das Sampling-Verhalten und die Reasoning-Steuerung an die jeweils eingesetzte Modellfamilie angepasst werden.
Auf einen Blick¶
- Allgemeine Fragen im Dialog klären, Texte erzeugen, übersetzen oder überarbeiten.
- Eigene Dokumente in den Gesprächskontext laden und über mehrere Sitzungen hinweg verfügbar halten.
- Bilder, Diagramme oder Screenshots zur visuellen Analyse direkt an eine Nachricht anhängen.
- Mehrere parallele Chat-Sitzungen mit separatem Verlauf führen und thematisch sortiert wechseln.
- Den Chat-Verlauf als formatiertes Word-Dokument exportieren.
- Den System-Prompt aus vorgefertigten Rollenprofilen wählen oder frei anpassen.
- Vorgefertigte Prompt-Vorlagen für wiederkehrende Aufgaben (Zusammenfassung, Analyse, Übersetzung, Vergleich) per Klick übernehmen.
Highlights¶
Gegenüber einem direkten Aufruf eines Sprachmodells oder einer minimalen Chat-Oberfläche ergänzt LLM-Chat Mechanismen für die Verarbeitung größerer Dokumentmengen, die einheitliche Behandlung gemischter Eingaben und die Anpassung an unterschiedliche Modellfamilien — mit dem Ziel, reproduzierbare und kontextgerechte Antworten zu erzeugen.
- Modell-Profil-System: Sampling-Parameter, Reasoning-Steuerung und vLLM-spezifische Zusatzparameter werden je Modellfamilie als Profil hinterlegt. Die Profilauswahl erfolgt explizit per Konfigurationsvariable oder automatisch anhand des Modellnamens; der Wechsel zwischen Modellen erfordert keine Codeänderung.
- Vorkonfigurierte Modellprofile: Profile bestehen für die Modellfamilien Qwen3, Qwen3.5, Kimi und GLM; weitere Modelle werden über ein Default-Profil unterstützt. Pro Profil wird zwischen Reasoning- und Instruct-Modus mit jeweils eigenen Parametersätzen unterschieden.
- Anbindung an einen LLM-Endpunkt: Die Verbindung erfolgt über die OpenAI-Chat-Completions-API zu einem Sprachmodell-Server, der über Konfiguration adressiert wird. Externe Dienste, Tracking-Anbieter oder Schriftartenserver werden nicht angesprochen.
- Einheitlicher Upload-Mechanismus: Bilder und Dokumente werden über denselben Eingabekanal angenommen und automatisch nach Dateityp behandelt — Bilder als visueller Inhalt der jeweiligen Nachricht, Dokumente als dauerhafter Bestandteil des Sitzungskontexts.
- Mehrstufige Dokumentenextraktion: Pro Format wird zunächst ein schlanker, formatspezifischer Extraktor verwendet; nur bei Fehlschlag fällt die Verarbeitung auf einen universellen Layout-Parser zurück. Damit verkürzt sich die Verarbeitungszeit insbesondere bei großen Dokumentmengen deutlich.
- Globaler Dokumentkontext: Geladene Dokumente bleiben über alle Chat-Sitzungen hinweg verfügbar und werden weder bei einem Sitzungswechsel noch beim Anlegen einer neuen Sitzung entfernt.
- Token-Budget-Verwaltung: Für Dokumente steht ein konfigurierbares Token-Kontingent zur Verfügung; die Auslastung wird laufend angezeigt, bei Überschreitung wird der Upload kontrolliert abgewiesen, ohne den Chat-Zustand zu beschädigen.
- Reasoning-Filterung im Streaming: Werden in der Modellausgabe
<think>-Markierungen erkannt, werden diese Abschnitte transparent gefiltert und durch eine kompakte Statusanzeige ersetzt; die finale Antwort bleibt frei von internen Zwischenschritten. - Word-Export mit Markdown-Rendering: Der Chat-Verlauf lässt sich als Word-Dokument exportieren, das Überschriften, Listen, Tabellen, Code-Blöcke, Blockzitate und Inline-Formatierungen aus den Modellantworten übernimmt.
- Lokale Verarbeitung: Sämtliche Daten werden auf dem Server der Anwendung verarbeitet; die Oberfläche bindet keine externen Ressourcen wie CDNs oder Schriftartenserver ein.