Measuring Successful Cooperation in Human-AI Teamwork: Development and Validation of the Perceived Cooperativity and Teaming Perception Scales
Dieser Beitrag stellt zwei neue Skalen vor und validiert sie, die Perceived Cooperativity Scale (PCS) und die Teaming Perception Scale (TPS), die in drei empirischen Studien die subjektive Qualität der Mensch-KI-Zusammenarbeit in unterschiedlichen Kontexten wirksam messen.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich vor, Sie versuchen, einen Kuchen mit einem neuen, hochtechnologischen Roboter-Assistenten zu backen. Manchmal ist der Roboter erstaunlich: Er weiß genau, wann er mischen muss, sagt Ihnen, wenn der Ofen zu heiß ist, und Sie haben das Gefühl, ein perfektes Back-Team zu sein. Zu anderen Zeiten ist der Roboter verwirrend: Er verbrennt den Teig, ignoriert Ihre Anweisungen oder tut so, als hätte er keine Ahnung, was er tut.
Diese Arbeit handelt davon, zwei spezielle „Zeugnisse" (genannt Skalen) zu erstellen, um genau zu messen, wie sich diese Back-Partnerschaft aus Ihrer Perspektive anfühlt. Die Forscher, die mit Honda und der Universität Lübeck zusammenarbeiteten, wollten über die bloße Frage „Mögen Sie diesen Roboter?" hinausgehen und stattdessen fragen: „Wie gut haben wir tatsächlich zusammengearbeitet?"
Hier ist eine Aufschlüsselung ihrer Arbeit unter Verwendung einfacher Analogien:
Die zwei Zeugnisse
Die Forscher erkannten, dass die Zusammenarbeit mit KI auf zwei verschiedene Arten stattfindet, und entwickelten daher zwei verschiedene Messinstrumente:
1. Das „Einzelner Moment"-Zeugnis (Wahrgenommene Kooperations-Skala – PCS)
- Was es misst: Wie gut die KI während einer spezifischen Aufgabe gehandelt hat.
- Die Analogie: Stellen Sie sich dies wie das Bewerten einer einzelnen Tanzbewegung vor. Hat Ihr Partner klar geführt? Hat er Ihrer Führung gefolgt? Sind sie nur für dieses eine Lied im Takt geblieben?
- Die Theorie: Es basiert auf der „Theorie der gemeinsamen Aktivität". Es prüft, ob die KI transparent war (Sie wussten, was sie dachte), zuverlässig war (sie tat, was sie sagte) und reaktionsfähig war (sie hörte Ihnen zu).
- Das Ergebnis: Sie testeten dies an 409 Personen in drei verschiedenen Szenarien: beim Spielen eines kooperativen Kartenspiels, beim Chatten mit einem Text-Bot und bei der Nutzung eines Reiseplaners für ein Auto. Die Karte funktionierte hervorragend! Sie konnte klar zwischen einem menschlichen Partner (der hohe Punktzahlen erhielt), einem intelligenten, aber vorhersehbaren regelbasierten Roboter (mittlere Punktzahlen) und einem Roboter, der durch Versuch und Irrtum lernte und verwirrt wurde (niedrige Punktzahlen), unterscheiden.
2. Das „Langfristiges Team"-Zeugnis (Teaming-Wahrnehmungs-Skala – TPS)
- Was es misst: Das Gefühl, dass Sie und die KI im Laufe der Zeit zu einem echten Team geworden sind.
- Die Analogie: Dies geht nicht nur um eine einzelne Tanzbewegung; es geht darum, ob Sie das Gefühl haben, Teil einer Tanztruppe zu sein. Fühlen Sie sich, als würden Sie beide Anstrengungen investieren? Fühlen Sie sich, als hätten Sie ein gemeinsames Ziel? Fühlen Sie sich, als wäre der Roboter ein „Teamkollege" und nicht nur ein Werkzeug?
- Die Theorie: Es basiert auf der „Theorie der evolutionären Kooperation". Es untersucht, ob beide Seiten einen „Kostenbeitrag" (Anstrengung) leisten, um dem anderen zum Erfolg zu verhelfen.
- Das Ergebnis: Diese Skala besteht aus drei Teilen:
- Das Team: „Wir sind eine Einheit."
- Der Partner: „Sie helfen mir."
- Das Selbst: „Ich helfe Ihnen."
- Die Wendung: Der Teil „Selbst" war schwierig. Menschen neigten dazu, sich unabhängig davon, wie schlecht der Roboter war, hohe Punktzahlen zu geben. Es ist wie ein Schüler, der denkt: „Ich habe hart gelernt!", auch wenn er eigentlich nicht gelernt hat. Die Forscher stellten fest, dass dieser Teil der Skala situationsabhängig ist; er funktioniert besser, wenn Menschen mehr Freiheit haben, zu wählen, wie hart sie arbeiten.
Wie sie es testeten (Die drei Studien)
Um sicherzustellen, dass ihre Zeugnisse genau waren, nutzten sie drei verschiedene „Trainingsgelände":
Das Kartenspiel (Hanabi): Stellen Sie sich ein Spiel vor, bei dem Sie Ihre eigenen Karten nicht sehen können und sich auf Hinweise Ihres Partners verlassen müssen.
- Der Test: Menschen spielten mit einem Menschen, einem Roboter, der strengen Regeln folgte, und einem Roboter, der selbstständig lernte.
- Die Erkenntnis: Die Zeugnisse stuften sie erfolgreich ein: Mensch > Regelbasierter Roboter > Lernender Roboter. Der lernende Roboter war oft verwirrend, daher fühlten sich die Menschen nicht so, als würden sie gut zusammenarbeiten.
Der Chatbot (LLM): Menschen nutzten einen Text-Bot, um Artikel auf Fakten zu überprüfen.
- Der Test: Sie nutzten Bots, die hilfreich waren, Bots, die hilfreich waren, aber unerwünschte Änderungen hinzufügten, und Bots, die versagten.
- Die Erkenntnis: Die Skalen erfassten die Unterschiede darin, wie „kooperativ" sich die Bots anfühlten.
Der Autoreiseplaner: Menschen nutzten einen Tesla-Reiseplaner, um Ladestationen zu finden.
- Der Test: Dies war ein „Grenzfall". Das Auto ist eigentlich kein „Teamkollege"; es ist nur ein Werkzeug.
- Die Erkenntnis: Das „Einzelner Moment"-Zeugnis (PCS) funktionierte hier immer noch gut. Das „Langfristiges Team"-Zeugnis (TPS) wurde jedoch nicht verwendet, da ein Autoreiseplaner nicht wirklich einen „Geist" oder „Ziele" hat, mit denen man ein Team bilden könnte. Man kann sich mit einem GPS nicht wirklich wie ein Team fühlen.
Was sie lernten (Die Erkenntnisse)
- Das „Einzelner Moment"-Zeugnis ist unerschütterlich. Es ist eine sehr zuverlässige Methode, um zu messen, wie gut eine KI während einer spezifischen Aufgabe handelt. Es funktioniert für alles, von Chatbots bis hin zu Spiel-Bots.
- Das „Team"-Zeugnis ist kraftvoll, erfordert aber Sorgfalt. Es misst das tiefe Gefühl der Partnerschaft. Der Teil, in dem Menschen ihren eigenen Beitrag bewerten, ist jedoch etwas verzerrt. Menschen neigen dazu, zu denken, sie seien großartige Teamkollegen, selbst wenn die KI schrecklich ist. Dies deutet darauf hin, dass in starren Situationen (wie einem Kartenspiel, bei dem Sie müssen kooperieren) sich die Selbsteinschätzungen der Menschen nicht viel ändern.
- Der Kontext ist wichtig. Wenn Sie nur ein Werkzeug verwenden (wie einen Taschenrechner oder ein GPS), gilt das „Team"-Gefühl nicht wirklich. Aber wenn Sie an einem komplexen Projekt arbeiten, bei dem Sie und die KI aufeinander angewiesen sind, sagen Ihnen diese Skalen, ob diese Partnerschaft funktioniert.
Warum das wichtig ist
Vorher hatten wir hauptsächlich Werkzeuge, um zu fragen: „Vertrauen Sie der KI?" oder „Ist diese KI intelligent?" Diese Arbeit gibt uns die Möglichkeit zu fragen: „Wie gut arbeiten wir gerade zusammen?" und „Fühlen wir uns wie ein Team?"
Dies hilft Designern, bessere KI zu entwickeln. Wenn ein Roboter bei „Vorhersehbarkeit" niedrige Punktzahlen erhält, wissen die Designer, dass sie die Aktionen des Roboters klarer gestalten müssen. Wenn die „Team"-Punktzahl niedrig ist, wissen sie, dass der Roboter mehr Unterstützung und gemeinsame Ziele zeigen muss.
Kurz gesagt: Die Forscher bauten zwei Lineale. Das eine misst, wie gut ein Roboter in einem einzigen Lied tanzt. Das andere misst, ob Sie das Gefühl haben, dass Sie und der Roboter zusammen in einer Tanztruppe sind. Sie testeten diese Lineale an 409 Personen und stellten fest, dass sie gut funktionieren, obwohl das „Tanztruppe"-Lineal je nachdem, wie viel Freiheit der Mensch hat, sich zu bewegen, sorgfältig eingesetzt werden muss.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.