← Neueste Arbeiten
💬 NLP

ShopEase: A Generative AI-Based Multi-Agent Framework for Intelligent Enterprise Customer Support Using Hybrid Retrieval-Augmented Generation

Dieses Paper stellt ShopEase vor, ein Multi-Agenten-Framework für generative KI im Enterprise-Kundensupport, das lokales LLaMA 3.2 und hybride Retrieval-Verfahren nutzt und durch eine Evaluierung an 2.632 Abfragen nachweist, dass die dichte FAISS-Retrieval-Methode sparsamen sowie durch Reranking optimierten hybriden Ansätzen in der Genauigkeit überlegen ist, während sie gleichzeitig die mit Cross-Encoder-Reranking verbundenen Latenzstrafen vermeidet.

Ursprüngliche Autoren: Aakash Kumar Tiwari, Somesh Kumar

Veröffentlicht 2026-09-15✓ Author reviewed
📖 6 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Aakash Kumar Tiwari, Somesh Kumar

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

In der modernen Geschäftswelt bedeutet die Zufriedenheit eines Kunden oft, seine Fragen schnell und präzise zu beantworten. Wenn eine Person etwas online kauft und dann Informationen über eine Rückerstattung, eine Lieferverzögerung oder einen beschädigten Artikel benötigt, erwartet sie eine sofortige Antwort. Seit Jahrzehnten versuchen Unternehmen, dies mit Chatbots zu automatisieren – Computerprogrammen, die darauf ausgelegt sind, wie Menschen zu chatten. Diese Programme funktionieren gut bei einfachen, sich wiederholenden Fragen, aber sie geraten oft ins Straucheln, wenn eine Situation kompliziert wird. Wenn ein Kunde nach einer spezifischen Richtlinie fragt und gleichzeitig eine vergangene Bestellung oder ein einzigartiges Problem erwähnt, könnte ein einfaches Programm den Faden verlieren, weil es sich nicht an das Gespräch erinnern oder das richtige Regelwerk finden kann. Um dies zu lösen, entwickeln Forscher nun Systeme, die eher wie ein Team von Spezialisten als wie ein einzelner Roboter agieren. Diese neuen Systeme nutzen eine Methode namens Retrieval-Augmented Generation, was eine schicke Art zu sagen ist, dass der Computer Fakten in einer Datenbank nachschlägt, bevor er spricht, um sicherzustellen, dass seine Antwort auf echten Unternehmensregeln basiert und nicht nur auf Vermutungen beruht. Sie verwenden auch mehrere „Agenten“ oder kleine Programme, die verschiedene Aufgaben übernehmen, wie etwa eines, das sich daran erinnert, wer der Kunde ist, ein anderes, das die passende Richtlinie findet, und ein drittes, das entscheidet, ob ein Mensch eingreifen muss.

Ein Forschungsteam am Indian Institute of Technology Kharagpur hat ein neues System namens ShopEase entwickelt, um zu testen, wie gut dieser Team-Ansatz für den Enterprise-Kundensupport funktioniert. Ihr Ziel war es, ein Framework zu schaffen, das den gesamten Weg einer Kundenanfrage bewältigen kann – vom Moment, in dem eine Frage gestellt wird, bis zur finalen Antwort –, während es gleichzeitig weiß, wann es den Staffelstab an einen menschlichen Mitarbeiter übergeben muss. Das System besteht aus sechs verschiedenen Teilen, die zusammenarbeiten. Zuerast prüft ein Wächter (Guard) die eingehende Frage, um sicherzustellen, dass sie sicher und klar ist. Dann identifiziert ein Agent, was der Kunde tatsächlich möchte. Andere Agenten rufen die persönliche Historie des Kunden aus einer Datenbank ab und erinnern sich an Details aus früheren Gesprächen. Ein zentrales Retrieval-Team durchsucht dann Tausende von Richtliniendokumenten, um die spezifischen Regeln zu finden, die auf die Situation zutreffen. Wenn das System das Gefühl hat, dass das Problem zu komplex oder riskant ist, übergibt ein Eskalations-Agent den Fall an einen Menschen. Schließlich koordiniert ein Supervisor all diese Schritte und stellt sicher, dass die endgültige Antwort überprüft wird, bevor sie an den Kunden zurückgesendet wird.

Um zu sehen, ob dieses Design tatsächlich funktioniert, testeten die Forscher es an einem großen Datensatz von 2.632 echten Kundenfragen, die speziell für dieses Experiment zurückgestellt worden waren. Diese Fragen deckten sechs gängige Kategorien ab: Rückerstattungen, Rücksendungen, Versandprobleme, Stornierungen, beschädigte Produkte und eine Gruppe von Fragen, die in keine klare Kategorie passten. Das Team wollte sehen, welche Methode zur Auffindung des richtigen Richtliniendokuments am besten funktionierte. Sie testeten sechs verschiedene Suchstrategien. Einige stützten sich nur auf das Abgleichen exakter Wörter, während andere eine Methode verwendeten, die die Bedeutung hinter den Worten verstand, selbst wenn die spezifische Vokabel anders war. Sie testeten auch Kombinationen dieser Methoden und fügten einen Schritt hinzu, bei dem eine zweite, sorgfältigere Prüfung der Top-Ergebnisse durchgeführt wurde, um zu sehen, ob dies die endgültige Antwort verbessert.

Die Ergebnisse zeigten, dass das Verständnis der Bedeutung der Frage weitaus wichtiger war als das Abgleichen exakter Wörter. Das System, das sich ausschließlich auf das Finden von Dokumenten mit ähnlichen Bedeutungen verließ, erreichte die höchste Erfolgsquote und identifizierte die richtige Richtlinienkategorie für 85,37 Prozent der Fragen korrekt. Dies war signifikant besser als das System, das nur nach passenden Wörtern suchte, welches die Antwort nur in 55,74 Prozent der Fälle richtig stellte. Interessanterweise half der zusätzliche Schritt der sorgfältigeren Prüfung nicht. Tatsächlich machte er das System langsamer, ohne die Genauigkeit zu erhöhen. Die Forscher fanden heraus, dass die Zeit bis zum Erhalt einer Antwort spürbar anstieg, wenn sie diese zusätzliche Ebene der Verarbeitung hinzufügten, ohne dass die Anzahl der korrekten Antworten zunahm. Dies deutet darauf darauf hin, dass für diese Art von Aufgabe eine schnelle, bedeutungsorientierte Suche effektiver ist als ein langsamerer, mehrstufiger Prozess.

Als die Forscher genauer untersuchten, wo das System erfolgreich war und wo es scheiterte, zeichnete sich ein klares Muster ab. Das System war sehr gut darin, Fragen zu Versand, Stornierungen und Rücksendungen zu bearbeiten, wobei es oft in mehr als 90 Prozent der Fälle die richtige Antwort gab. Es hatte jedoch erhebliche Schwierigkeiten mit Fragen, die nicht sauber in eine bekannte Kategorie passten. Wenn ein Kunde eine vage Frage stellte, die keiner spezifischen Richtlinie entsprach, rät das System oft und ordnet sie dennoch einer bekannten Kategorie zu, anstatt zuzugeben, dass es es nicht weiß. Dies war die Hauptquelle für Fehler. Das System hatte auch Schwierigkeiten, zwischen Rückerstattungen und Rücksendungen zu unterscheiden, da diese beiden Konzepte oft eine ähnliche Sprache verwenden, was zu Verwirrung führte. Trotz dieser kleinen Stolpersteine bewies die Studie, dass ein Multi-Agenten-System erfolgreich Kundengeschichte, Gesprächsgedächtnis und Richtlinienabruf in einem einzigen, koordinierten Workflow kombinieren kann.

Die Forscher testeten auch, was geschah, wenn sie bestimmte Teile des Systems entfernten, um zu sehen, wie wichtig jedes einzelne Stück war. Sie fanden heraus, dass das Entfernen des Teils, der sich an die persönlichen Details des Kunden erinnerte, den größten Rückgang in der Personalisierung der Antworten verursachte. Dies bestätigte, dass zu wissen, wer der Kunde ist, genauso wichtig ist wie das Wissen um die Regeln. Das Entfernen des Teils, der die Gesprächshistorie verwaltet, beeinträchtigte die Qualität der Antworten ebenfalls, jedoch nicht so stark wie der Verlust der Kundendaten. Der Teil, der für die Übergabe von Fällen an Menschen zuständig ist, hatte weniger Auswirkungen auf die Qualität der automatisierten Antworten, was sinnvoll ist, da seine Hauptaufgabe darin besteht, einzuspringen, wenn die Maschine das Problem nicht lösen kann, anstatt die eigene Leistung der Maschine zu verbessern.

Am Ende zeigte das ShopEase-System, dass ein teambasierter Ansatz für den Enterprise-Support gut funktioniert, sofern die richtigen Werkzeuge eingesetzt werden. Die Studie ergab, dass „Dense Retrieval“, also das Verständnis der Bedeutung von Wörtern, einer einfachen Schlüsselwortsuche für diese Art von Arbeit überlegen ist. Sie zeigte auch, dass das Hinzufügen komplexer Überprüfungsschritte die Dinge verlangsamen kann, ohne einen Mehrwert zu bieten. Obwohl das System nicht perfekt ist, insbesondere im Umgang mit vagen oder außerhalb des Rahmens liegenden Fragen, bietet es eine solide Grundlage für die Zukunft des Kundenservice. Die Forscher schlagen vor, dass zukünftige Verbesserungen sich auf bessere Wege konzentrieren sollten, um zu erkennen, wann eine Frage außerhalb des Wissens des Systems liegt, sowie auf die Erweiterung der Richtlinienbibliothek, um mehr diverse Szenarien abzudecken. Für den Moment bietet diese Arbeit eine klare Roadmap für den Bau intelligenter Support-Systeme, die schnell, präzise und bereit sind, die Aufgabe an einen Menschen zu übergeben, wenn die Situation es erfordert.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →