Treffer auswerten & testen
Mit dem Auswertungswerkzeug prüfen, wie Eingaben auf Trainingsdaten gematcht werden.
Bevor Sie veröffentlichen, lohnt es sich zu prüfen, ob Ihre Trainingsdaten die Antworten der Menschen tatsächlich erfassen. Mit dem Werkzeug Trainingsdaten evaluieren geben Sie eine Beispielantwort ein und sehen genau, wie die Matching-Engine reagiert — so schließen Sie Lücken, bevor echte Teilnehmende darauf stoßen.
Eine Evaluation durchführen
Werkzeug öffnen
Wählen Sie im Modul Trainieren Evaluieren und dann den Frageblock, den Sie testen möchten.
Beispielantwort eingeben
Tippen Sie im Feld Frage eine Antwort ein, die eine teilnehmende Person geben könnte, und klicken Sie auf Evaluation starten.
Ergebnisse lesen
Der Matching-Bericht zeigt, welche Datensätze eingestuft wurden, mit einem deutlichen Bester Treffer an der Spitze. Treffer mit zu niedriger Bewertung erscheinen unter Höchster Match aber unter Cutoff — sie würden in einem echten Dialog nicht ausgelöst.
Den Matching-Bericht lesen
Was Sie sehen | Was es bedeutet |
|---|---|
Bester Treffer | Der Datensatz, den der Bot für diese Antwort verwenden würde. Seine Reaktion wird ausgespielt. |
Höchster Match aber unter Cutoff | Der nächstgelegene Datensatz, aber nicht nah genug, um verwendet zu werden — ein Hinweis, dass Sie mehr Varianten der Eingabe brauchen. |
Globale Trainingsdaten | Zeigt an, dass der Treffer aus Ihren globalen Datensätzen stammt und nicht aus dem Frageblock. |
Landet eine sinnvolle Antwort unter dem Cutoff, fügen Sie sie als Variante der Eingabe des richtigen Datensatzes hinzu und evaluieren Sie erneut.
LLM- und Chat-Verhalten testen
Zwei weitere Schaltflächen gehen über das reine Matching hinaus:
LLM Response testen — erzeugt eine KI-Antwort auf Basis Ihrer vorhandenen Trainingsdaten, nützlich für offene Fragen und Quizze.
Chat-Verhalten simulieren — spielt durch, wie sich der Bot im Chat tatsächlich verhalten würde, einschließlich jeder Aktion wie Weiter zur nächsten Frage oder Bleibe bei aktueller Frage.
Die LLM-Generierung benötigt Beispiel-Trainingsdaten als Grundlage. Wenn Sie nur Datensätze für richtige Antworten haben, aber eine falsche testen, kann keine LLM-Antwort erzeugt werden — decken Sie also beide Fälle ab.
Wenn die Treffer stimmen, geht es weiter mit dem Testen des gesamten Dialogs.