So verhindern Sie, dass Ihre Support-KI Antworten erfindet
Halluzinationen sind der häufigste Einwand gegen KI im Support – und meist ein Problem von Retrieval und Berechtigungen, nicht des Modells. Diese Maßnahmen reduzieren erfundene Antworten tatsächlich.
Auch verfügbar auf: English · Nederlands · Français · Español
Fragen Sie eine beliebige Support-Leitung, was sie davon abhält, KI an vorderster Front einzusetzen, und Sie hören eine Variante von: Was, wenn sie eine Richtlinie erfindet, die wir gar nicht haben? Die Sorge ist berechtigt. Gerade im Support ist sie aber auch eine der besser lösbaren – denn der Fehler entsteht fast nie in der Fantasie des Modells. Er entsteht in dem, was dem Modell vorgelegt wurde, und in dem, was es tun durfte, als das Material nicht mehr ausreichte.
Drei verschiedene Fehler, die unter einem Namen laufen
Gerade weil sie in einen Topf geworfen werden, wirkt das Problem unlösbar. Getrennt betrachtet hat jeder Fehler eine eigene und ziemlich unspektakuläre Lösung.
| Fehler | Wie er sich zeigt | Die eigentliche Lösung |
|---|---|---|
| Retrieval-Lücke | Der Kunde fragt nach einer Richtlinie, die existiert, aber der Suchschritt lieferte nichts Relevantes – also füllte das Modell die Lücke mit Allgemeinwissen. | Ein Inhalts-, kein Modellproblem. Finden Sie die Fragen, die nichts zurückliefern, und schreiben Sie den fehlenden Artikel. |
| Veraltete Quelle | Die Antwort kommt selbstbewusst und war im letzten Quartal richtig. Der Artikel wurde nie aktualisiert. | Überprüfungsdaten und eine maßgebliche Seite pro Fakt. Das Modell wiederholt getreu, was Sie ihm gesagt haben. |
| Uneingeschränkte Generierung | Das Material war dünn, der Prompt verbot das Extrapolieren nicht, und das Modell lieferte eine plausibel klingende Richtlinie. | Ausdrückliche Grounding-Anweisungen plus ein belohnter Ausweg. Nur dieser der drei Fehler ist wirklich eine Frage des Modellverhaltens. |
Geben Sie ihr einen Ausweg – und machen Sie ihn zum einfachen Weg
Ein Modell ohne akzeptablen Weg zu scheitern, scheitert auf inakzeptable Weise. Wenn jede Runde eine Antwort liefern muss und das Referenzmaterial keine enthält, muss etwas nachgeben – und das ist die Genauigkeit. Die Lösung ist unspektakulär: Weisen Sie das System an, nur aus bereitgestelltem Material zu antworten, niemals Richtlinien, Preise oder Bestelldetails zu erfinden und, wenn es etwas nicht weiß, das klar zu sagen und an einen Menschen zu übergeben. Diese Anweisung ist nur etwas wert, wenn die Übergabe tatsächlich existiert und funktioniert; ein Ausweg, der in einer Sackgasse endet, trainiert dasselbe Verhalten wie gar keiner.
Trennen Sie, was sie lesen darf, von dem, was sie behaupten darf
Die schädlichsten erfundenen Antworten im Support sind nicht falsche Richtlinien, sondern falsche Einzelheiten: ein Lieferdatum, ein Erstattungsstatus, eine Kontostufe. Diese dürfen nie aus der Schlussfolgerung eines Modells stammen. Sie kommen aus einer Systemabfrage, nachdem die Identität des Kunden verifiziert wurde – oder sie werden gar nicht genannt. Der Unterschied ist so wichtig, dass wir die Identitätsprüfung und die neutrale Antwort bei fehlender Übereinstimmung in den Retrieval-Pfad eingebaut haben statt in den Prompt – eine Prompt-Anweisung ist eine Bitte, keine Kontrolle. Mehr dazu, wo das sitzt, finden Sie in der Funktionsübersicht.
Die Maßnahmen, geordnet nach ihrem Nutzen
- Abdeckung vor Raffinesse. Die größte Einzelreduktion erfundener Antworten bringt es, die zwanzig Fragen zu dokumentieren, die derzeit nichts zurückliefern. Ziehen Sie die Gesprächsverläufe heran, in denen die KI eskaliert hat oder der Kunde zweimal umformulieren musste, und schreiben Sie diese Artikel zuerst.
- Grounding-Anweisungen, die die verbotenen Kategorien ausdrücklich benennen – Richtlinien, Preise, Bestelldetails – statt einer allgemeinen Bitte um Genauigkeit.
- Ein funktionierender Eskalationspfad, damit das Ablehnen einer Antwort irgendwohin führt.
- Identitätsprüfung vor jeder kontobezogenen Aussage, mit einer neutralen Antwort bei nicht übereinstimmenden Angaben, damit eine fehlgeschlagene Abfrage nicht zum Ausforschungswerkzeug wird.
- Menschliche Freigabe für unumkehrbare Aktionen – so wird aus einer falschen Antwort ein abgelehnter Vorschlag statt einer erstatteten Bestellung.
- Erfassung von Wiedereröffnungen, denn eine selbstbewusst falsche Antwort schneidet bei Lösungsquote und Antwortzeit genauso ab wie eine richtige. Das ist das Argument für eine Wartefrist, bevor etwas als gelöst gezählt wird – die Begründung steht in Deflection-Rate oder Lösungsquote.
Was Sie einen Anbieter fragen sollten
Die meisten Demos laufen auf kuratierten Inhalten, bei denen das Retrieval nie versagt – das interessante Verhalten tritt also nie auf. Fragen Sie stattdessen: Was tut das System, wenn das Retrieval nichts liefert – lehnt es ab oder improvisiert es? Kann ich die Quellpassagen hinter einer bestimmten Antwort sehen? Sind diese Quellen für meine Agents sichtbar, und – davon getrennt – können sie Kunden angezeigt werden? Kann ich eine Konfidenzschwelle festlegen, unterhalb derer eskaliert statt geantwortet wird? Und was speichert das Protokoll, damit sich eine Beschwerde rekonstruieren lässt? Unsere eigenen Antworten darauf stehen in der Dokumentation, die Messseite unter So messen wir.
Ein Vorbehalt, den man klar aussprechen sollte, weil Anbieter es selten tun: Nichts davon senkt die Fehlerquote auf null, und wer etwas anderes andeutet, will verkaufen. Das realistische Ziel ist, dass Fehler selten, sichtbar, auf umkehrbare Aktionen begrenzt und auf eine Quelle zurückführbar sind, die Sie korrigieren können. Das ist erreichbar. Perfektion nicht – deshalb ist die Freigabe-Warteschlange aus KI-Agent oder Chatbot wichtiger als jeder Prompt.
Warum gibt KI im Kundenservice falsche Antworten?
Im Support liegt die Ursache meist darin, dass der Retrieval-Schritt nichts Relevantes oder einen veralteten Artikel geliefert hat und das System nicht darauf beschränkt war, abzulehnen, wenn sein Referenzmaterial nicht ausreichte. Weit seltener schlussfolgert das Modell schlecht. Das ist wichtig, weil sich die ersten beiden Ursachen durch das Schreiben und Pflegen von Inhalten beheben lassen – gewöhnliche operative Arbeit statt eines Machine-Learning-Problems.
Wie verhindert man, dass ein KI-Chatbot halluziniert?
Beschränken Sie den KI-Chatbot darauf, nur aus bereitgestelltem Referenzmaterial zu antworten, benennen Sie die verbotenen Kategorien wie Richtlinien, Preise und Bestelldetails ausdrücklich, und weisen Sie ihn ausdrücklich an, zu sagen, dass er etwas nicht weiß, und an einen Menschen zu eskalieren, wenn das Material die Frage nicht abdeckt. Dieser Ausweg funktioniert nur, wenn die Übergabe tatsächlich einen Menschen erreicht – sonst lernt das System, dass Ablehnen keine echte Option ist.
Lässt sich verhindern, dass KI-Support-Agents Bestelldetails erfinden?
Ja, und das ist die leichter lösbare Hälfte des Problems. Bestell- und Kontodetails sollten aus einer verifizierten Systemabfrage stammen statt aus dem Modell: Die Identität des Kunden wird zuerst bestätigt, und bei fehlender Übereinstimmung kommt eine neutrale Antwort statt einer Vermutung. Erst wenn das im Retrieval-Pfad statt in der Prompt-Formulierung durchgesetzt wird, ist es eine Kontrolle statt einer Bitte.
Wie teste ich, ob meine Support-KI Antworten erfindet?
Fragen Sie die Support-KI nach einer Richtlinie, von der Sie wissen, dass Sie sie nirgends dokumentiert haben. Ein korrekt konfiguriertes System sagt, dass es unsicher ist, und bietet einen Menschen an; ein schlecht konfiguriertes liefert eine selbstbewusste, plausible Antwort. Wiederholen Sie den Test mit Fragen, deren Antworten sich kürzlich geändert haben, denn Fehler aus veralteten Quellen sind für das Modell unsichtbar und werden mit derselben Sicherheit vorgetragen wie korrekte Antworten.
Welche Kennzahl zeigt, dass eine KI selbstbewusst falsche Antworten gibt?
Die Wiedereröffnungsrate innerhalb eines festgelegten Zeitfensters, denn eine selbstbewusst vorgetragene falsche Antwort schneidet bei Lösungsquote, Zeit bis zur ersten Antwort und oft auch bei unmittelbaren Zufriedenheitsbewertungen genauso ab wie eine richtige. Der Kunde bemerkt den Fehler später und meldet sich erneut – jede Zählung gelöster Anfragen ohne Wartefrist überschätzt die Qualität also genau dort, wo sie am schlechtesten ist.
Lösen Sie mehr Tickets automatisch.
Verbinden Sie Ihr Help-Center, testen Sie Antworten auf Ihre eigenen Fragen und prüfen Sie Übergaben, bevor Sie live gehen.