Die freundlichste Stimme im Raum
Was eine warme KI-Oberfläche verspricht – und was ein Unternehmen tatsächlich verantworten kann

Eine digitale Assistenz kann mit einem freundlichen Gruß beginnen, in der Ich-Form antworten und sich für einen Fehler entschuldigen. Das sind sichtbare Merkmale einer Oberfläche. Sie zeigen noch nicht, dass das System versteht, sich kümmert, entscheiden darf oder eine Zusage einhalten kann. Genau an dieser Lücke setzt die Gestaltungsfrage an: Welche Rolle legt das Interface nahe, welche Funktion hat das System tatsächlich, und wie können Menschen eine Antwort prüfen, an einen zuständigen Menschen übergeben oder die Interaktion beenden?
Ein verantwortliches Team muss Freundlichkeit nicht verbannen und Nutzende auch nicht mit Warnhinweisen überhäufen. Es muss aber die Gestaltungssignale von belegbaren Produkteigenschaften trennen. Der passende Maßstab ist weder möglichst wenig Vertrauen noch möglichst viel Vertrauen, sondern eine informierte, angemessen begrenzte Nutzung: Menschen sollen erkennen können, womit sie sprechen, was dieses System leisten kann, wer für folgenreiche Entscheidungen zuständig bleibt und welche Wege offenstehen, wenn etwas nicht passt.
1. Eine Oberfläche sendet Signale; die Organisation trägt Versprechen
Stellen wir uns einen vollständig fiktiven kleinen Fahrradverleih vor. Auf seiner Website soll ein textbasierter Assistent Öffnungszeiten, Abhol- und Rückgabeorte erklären und eine Buchung vorbereiten. Er kann jedoch keine bestehende Buchung ändern, keine Zahlung auslösen und keine verbindliche Zusage machen. Das Team erwägt einen persönlichen Avatar, eine Begrüßung wie „Hallo, ich helfe dir gern“ und einen warmen, zugewandten Ton.
Eine Besucherin fragt, ob sie das Rad später zurückgeben kann. Der Assistent antwortet: „Kein Problem, ich kümmere mich darum.“ Im nächsten Satz zeigt sich, dass er die Rückgabezeit nicht ändern kann. Vielleicht hat die Besucherin die Antwort als höfliche Gesprächsform verstanden. Vielleicht als Hinweis, dass die Änderung bereits veranlasst wurde. Vielleicht hat sie nur die Öffnungszeiten gesucht. Ohne eine passende Untersuchung wissen wir nicht, welche Deutung in diesem Fall tatsächlich entsteht.
Wir können die Prüfung dennoch beginnen, wenn wir drei Ebenen auseinanderhalten:
| Ebene | Beispiel | Was daraus folgt |
|---|---|---|
| Beobachtbares Signal | Avatar, Ich-Form, freundlicher Ton, „Ich kümmere mich darum“, Kennzeichnung, Kontaktknopf | Das Interface lässt sich beschreiben, ohne eine innere Eigenschaft zuzuschreiben. |
| Mögliche Rollenvermutung | „Hier spricht eine Person“, „das System kann die Änderung vornehmen“, „jemand hat meinen Fall übernommen“ | Das sind Hypothesen über mögliche Deutungen. Sie müssen als solche behandelt und bei Bedarf geprüft werden. |
| Tatsächliche Produktzusage | „Der Assistent zeigt dokumentierte Rückgabeorte; Änderungen bestätigt ausschließlich der Betrieb.“ | Eine Organisation kann diese Aussage an Funktion, Zuständigkeit und Nachweis binden. |
Die Trennung ist praktisch wichtig. Ein Satz kann fürsorglich klingen, ohne einen Fall tatsächlich zu übernehmen. Ein Avatar kann menschliche Nähe andeuten, ohne dass ein Mensch den Dialog liest. Eine Entschuldigung kann höflich sein, ohne ein Problem zu beheben. Das sind keine Diagnosen über ein System und keine Behauptungen über die Absicht seiner Entwickler. Es sind Unterschiede zwischen sichtbarer Gestaltung, möglicher Interpretation und institutioneller Verantwortung.
Auch die Frage „Vertraut jemand der KI?“ ist zu grob, wenn sie nicht sagt, worauf sich das Vertrauen richtet. Geht es um die Richtigkeit einer Öffnungszeit? Um eine tatsächliche Buchungsänderung? Um eine verbindliche Zusage? Oder darum, ob bei einem Problem ein Mensch erreichbar ist? Für den Betrieb sind diese Fragen nicht austauschbar. Ein Interface kann angenehm wirken und trotzdem eine falsche Erwartung an die eigene Zuständigkeit nahelegen. Umgekehrt kann eine sachliche Oberfläche schwer verständlich oder unnötig abweisend sein.
Die folgenden Begriffe sind eine Arbeitsunterscheidung für diesen Artikel, keine vollständige oder einheitliche psychologische Definition. Ein Produktteam sollte mindestens vier Begriffe auseinanderhalten:
Sympathie beschreibt eine Bewertung der Begegnung oder Darstellung.
Vertrauen bezeichnet eine Bereitschaft, sich unter Unsicherheit auf eine andere Instanz zu verlassen; welche Handlung und welches Risiko gemeint sind, muss benannt werden.
Reliance oder Nutzung ist beobachtbares Verhalten, etwa ob jemand eine Antwort übernimmt oder einem nächsten Schritt folgt.
Vertrauenswürdigkeit betrifft die begründete Frage, ob Leistung, Grenzen und Zuständigkeit die Reliance rechtfertigen.
Eine positive Bewertung ist kein Beleg für korrekte Leistung. Eine Nutzung ist kein Beweis dafür, dass die Oberfläche verständlich war. Eine menschlich wirkende Darstellung ist keine Zusicherung, dass die Rolle des Systems angemessen gestaltet wurde.

2. Was Forschung zeigt – und was sie nicht zeigt
Es gibt keinen wissenschaftlichen Freibrief, aus einem freundlichen Satz eine allgemeine Wirkung abzuleiten. Die hier relevanten Originalstudien untersuchen unterschiedliche Signale, Aufgaben und Messgrößen. Zusammen liefern sie gute Prüfimpulse, aber keine universelle Designformel für einen Fahrradverleih, einen Chatbot oder sämtliche Nutzenden.
In einer experimentellen Studie mit einem textbasierten Messenger-Agenten für eine fiktive Blumenbestellung wurden informelle Sprache, ein menschlicher Name und dialogische Begrüßungs- und Abschiedsformen als Bündel mit einer stärker anthropomorphen Wahrnehmung in Verbindung gebracht. Die finale Analyse umfasste 175 Teilnehmende. Die Studie untersuchte kein Profilbild. Außerdem fand sie keinen allgemeinen signifikanten Haupteffekt auf soziale Präsenz und keinen signifikanten direkten oder Gesamteffekt auf Unternehmenszufriedenheit oder Einstellung zum Unternehmen. Ein Ergebnis über ein bestimmtes Signalbündel in einer leichten, fiktiven Aufgabe belegt daher weder die Wirkung eines Avatars noch eine generelle Vertrauenswirkung im Kundenservice. [1]
Drei Experimente aus der Automationsforschung berichten eine andere, ebenso wichtige Spannung. Teilnehmende erhielten Rat von einem Computer, einem Avatar oder einer menschlich präsentierten Instanz, deren Zuverlässigkeit schrittweise abnahm. Unter diesen Bedingungen war anthropomorphe Präsentation mit einer größeren Widerstandsfähigkeit des gemessenen Vertrauens verbunden. Das Ergebnis bedeutet nicht, dass Menschen stets stärker vertrauen, dass das System zuverlässiger war oder dass eine menschliche Darstellung verantwortungsvoll wäre. Es zeigt vielmehr, weshalb die wahrgenommene Verlässlichkeit und die tatsächlich geprüfte Leistung getrennt betrachtet werden müssen. Die Aufgabe und das System der Studie waren keine heutige Buchungsassistenz eines kleinen Betriebs. [2]
Auch die Offenlegung, dass ein Gegenüber kein Mensch, sondern ein Chatbot ist, ergibt kein einfaches Wirkungsbild. Zwei szenariobasierte Experimente im Kundenservice eines Energieanbieters variierten unter anderem, ob ein Anliegen kritisch oder routinemäßig war und ob ein Serviceverlauf erfolgreich endete oder scheiterte. Die gemessenen Vertrauenseffekte unterschieden sich je nach Situation. Bei einem kritischen Anliegen zeigte sich in einer Studie ein niedrigerer Vertrauenswert in der offengelegten Bedingung; bei routinemäßigen Anliegen ergab sich kein entsprechender Effekt. In der zweiten Studie war die Richtung im fehlgeschlagenen Verlauf anders als im erfolgreichen. Das sind kontextgebundene Befunde aus Szenarien, kein Grund, eine Identität zu verbergen. Sie belegen auch nicht, dass eine einzelne Kennzeichnung die tatsächliche Rolle für alle verständlich macht. [3]
Eine Arbeit zur Mensch-Maschine-Übergabe in Dialogsystemen macht einen weiteren Beitrag: Handoff lässt sich als konkrete Funktion mit definierten Auslösern und Testfällen modellieren. In den untersuchten Daten gehörten ein ausdrücklicher Wunsch nach einer Person, eine unbefriedigende Antwort, negative Stimmung oder wiederholte Äußerungen zu Kategorien, die eine Übergabe nahelegen konnten. Die Arbeit untersucht Aufgaben und Modellleistung für bestimmte Datensätze. Sie belegt nicht, dass ein bestimmter Knopf leicht auffindbar ist oder dass jede Übergabe die Erfahrung verbessert. Sie hilft aber, die vage Aussage „Es gibt menschliche Unterstützung“ in eine überprüfbare Produktfrage zu übersetzen: Wann wird übergeben, an wen, mit welchen Informationen und was geschieht, wenn niemand verfügbar ist? [4]
Das NIST-Profil für generative KI ordnet unangemessene Anthropomorphisierung, Automation Bias, übermäßige Reliance und emotionale Verstrickung als Risiken der menschlichen KI-Konfiguration ein. Es empfiehlt, den Nutzungskontext, Erwartungen, Einschränkungen, Risiken und menschliche Aufsicht zu dokumentieren. Das ist eine freiwillige Risiko-Management-Leitlinie, keine empirische Effektgröße, keine EU-Rechtsnorm und keine Aussage, dass ein bestimmtes Avatar-Design schädlich wäre. Für den Fahrradverleih ist sie ein Anlass, die Interaktion als soziotechnische Entscheidung zu dokumentieren, nicht eine bereits festgestellte Risikobewertung. [6]
Aus diesen Befunden ergibt sich eine sorgfältige Zwischenbilanz:
1. Gestaltungssignale können in bestimmten Studien die Wahrnehmung eines Systems verändern; ihre Wirkung hängt von Signalbündel, Aufgabe und Messung ab. 2. Vertrauen und Reliance sind weder gleichbedeutend noch ein Maß für die tatsächliche Richtigkeit oder die institutionelle Zuständigkeit. 3. Eine Offenlegung kann unterschiedliche Reaktionen begleiten. Eine solche Reaktion ersetzt keine ethische, organisatorische oder rechtliche Prüfung der Offenlegung. 4. Übergabe und Ausstieg lassen sich als konkrete Produktfunktionen entwerfen und prüfen. Welche konkrete Ausgestaltung angemessen ist, bleibt eine Gestaltungsentscheidung, bis sie in einem passenden Kontext untersucht wurde.
Die Forschung gibt somit keine Antwort auf „Wie freundlich soll die Oberfläche sein?“. Sie zwingt zu einer präziseren Frage: Welche Erwartung könnte ein konkretes Signal in einer konkreten Situation nahelegen, welche davon wäre für die Funktion nötig, und wie kann die Organisation Fehlannahmen erkennbar machen und korrigieren?
3. Die ethische Spannung: Klarheit ohne Kälte, Nähe ohne falsches Versprechen
Es wäre zu einfach, jede menschlich wirkende Sprache als Täuschung zu behandeln. Ein höflicher Gruß kann eine Interaktion zugänglich und weniger einschüchternd machen. Eine knappe, verständliche Erklärung kann hilfreicher sein als eine technisch korrekte, aber unlesbare Beschreibung. Menschen mit unterschiedlichen sprachlichen oder digitalen Vorerfahrungen können unterschiedliche Zugänge benötigen. Der Artikel kann daraus keine allgemeine Wirkung behaupten; er kann jedoch als normative Gestaltungsfrage festhalten, dass Verständlichkeit selbst zählt.
Die Gegenposition ist ernst zu nehmen: Wenn eine Organisation jeden Satz mit Warntext versieht, macht sie die Bedienung mühsam, verteilt die Aufmerksamkeit auf Nebensachen und kann gerade die relevanten Hinweise verdecken. Für einen Betrieb mit begrenzten Personalressourcen ist eine jederzeit verfügbare menschliche Übergabe vielleicht nicht realistisch. Ein neutral formulierter Assistent ist nicht automatisch verständlicher als ein warmer. Eine überdeutliche Oberfläche ist nicht automatisch eine faire Oberfläche.
Das Gegenargument setzt aber nicht die Grenze für sich selbst. Aus knappen Ressourcen folgt nicht, dass eine Oberfläche mehr versprechen sollte, als der Betrieb einlösen kann. Aus einem warmen Ton folgt nicht automatisch eine falsche Rollenvermutung. Aus einer gekennzeichneten Rolle folgt nicht automatisch, dass alle Menschen sie bemerken. Die tragfähige Norm ist deshalb keine Maximierung von Nähe oder Warnungen, sondern eine Übereinstimmung von Gestaltung, Fähigkeit und Verantwortung.
Man kann diese Norm philosophisch als Frage nach Wahrhaftigkeit und Autonomie beschreiben. Wahrhaftigkeit erschöpft sich im Produkt nicht darin, dass jede einzelne Textzeile wörtlich wahr ist. Auch Reihenfolge, Platzierung und Weglassen können Erwartungen formen. Autonomie verlangt zugleich nicht, dass jede Unsicherheit in einem langen Haftungstext ausgelagert wird. Sie verlangt, dass die für eine Handlung entscheidenden Informationen auffindbar sind: Wer oder was antwortet? Wozu ist das System da? Was kann es nicht tun? Wer kann eine Entscheidung ändern? Wie beendet oder eskaliert jemand den Vorgang?
Der Fahrradverleih könnte ein sinnvolles Leistungsversprechen formulieren: „Dieser digitale Assistent erklärt Abhol- und Rückgabeinformationen und hilft bei der Vorbereitung einer Buchung. Er ändert keine bestehende Buchung und kann keine verbindlichen Zusagen machen. Für Änderungen nutzen Sie den Kontakt zum Betrieb.“ Ob die Aussage an jeder Stelle wiederholt, beim Start gezeigt oder bei bestimmten Fragen erneut eingeblendet wird, muss am Ablauf und am geltenden Recht geprüft werden. Wichtig ist, dass die behauptete Funktion der tatsächlichen System- und Betriebsleistung entspricht.
Diese Frage berührt Verantwortung. Ein einzelner Dialogsatz ist das Ergebnis von Produktentscheidungen: Welche Aufgaben wurden freigeschaltet? Welche Grenzen wurden getestet? Wer entscheidet, ob eine Übergabe verfügbar ist? Wer prüft eine Änderung? Wer kann Inhalte aktualisieren und Beschwerden bearbeiten? Die Interaktion wird vom System ausgeführt, aber die Organisation verantwortet, welche Rolle sie ihm gibt, welche Aussagen sie zulässt und wie sie auf Fehlsteuerungen reagiert.
Ein hilfreiches Designziel ist deshalb kalibrierte Reliance: Nutzende sollen eine Funktion dort verwenden können, wo sie passt, und anhalten oder übergeben können, wenn die Frage außerhalb ihrer Grenzen liegt. Das ist eine normative Produktanforderung, keine Behauptung, ein bestimmtes Layout könne sie bereits garantieren. Dazu müssen Team und Nutzer:innen nicht dieselbe Meinung über Freundlichkeit haben. Sie müssen aber über Funktion, Grenzen, Zuständigkeit und Korrekturmöglichkeiten nicht im Dunkeln bleiben.
4. Das Fragenmodell ändert die Ausgangsfrage
Das Fragenmodell F ist in der Kategorie kein Prompt-Zauber und keine Wahrheitsmaschine. Es ist ein Verfahren, um die Ausgangsfrage zu prüfen, mehrere Erklärungen offen zu halten, Unklarheit nicht zu kaschieren und erst dann eine überarbeitete Leitfrage festzuhalten. Seine Reihenfolge ist A → B → D → C. [7] Für diesen Fall verändert die Methode tatsächlich das Arbeitsziel.
Die voreilige Ausgangsfrage lautet: „Wie machen wir den Assistenten möglichst sympathisch, damit Besuchende ihm vertrauen?“ Darin liegen mindestens drei ungeprüfte Annahmen: dass Sympathie das relevante Ziel ist, dass mehr Vertrauen grundsätzlich besser wäre und dass Tonfall oder Avatar die sachlich passende Vertrauenswürdigkeit herstellen können.
A – Begriffe, Ziel und Ursache klären
Die sokratische Klärung fragt zunächst, was „sympathisch“, „vertrauen“ und „helfen“ in diesem konkreten Produkt bedeuten. Eine Besucherin kann dem Assistenten zutrauen, Öffnungszeiten korrekt zu nennen, aber nicht, Buchungsänderungen vorzunehmen. Der Betrieb wiederum braucht vielleicht keine sympathischere Oberfläche, sondern verlässlichere Informationen und weniger Verwechslungen bei Abholorten.
Hier dient 5-Why der Ursachensuche und nicht dem Beweis einer einzigen wahren Ursache. Warum soll der Assistent vertrauenswürdig wirken? Vielleicht, weil wiederholte Fragen Personal binden. Warum wiederholen sich Fragen? Vielleicht sind Rückgabeorte an verschiedenen Seiten uneinheitlich beschrieben. Dann könnte die erste Verbesserung eine klare Informationsseite sein, nicht ein persönlicher Avatar. SCAMPER öffnet anschließend Varianten: bestehende Informationen verständlicher ordnen, die Aufgabe begrenzen, eine menschliche Auskunft ergänzen oder den Assistenten vorerst weglassen. Die Frage-Techniken helfen dabei, Alternativen zu bilden; sie belegen nicht deren Wirkung.
B – Mehrere Hypothesen statt einer Wunschgeschichte
Die Kontextanalyse erzeugt mehrere konkurrierende Erklärungen:
H1: Ein klarer, freundlicher Ton kann die Bedienung einladender machen, sofern die Funktion verständlich bleibt.
H2: Ein persönlicher Avatar und Sätze wie „Ich kümmere mich darum“ könnten in diesem Ablauf eine weitergehende Zuständigkeit nahelegen, als das System tatsächlich hat.
H3: Die Bedeutung solcher Signale kann davon abhängen, ob jemand nur einen Abholort sucht oder eine bereits bezahlte Buchung ändern möchte.
H4: Das Problem wird womöglich durch die Struktur der Website verursacht; eine KI-Oberfläche behebt die Ursache nicht.
Die Meta-Frage lautet: Wessen Aufwand soll sinken, und wer trägt den Aufwand oder das Risiko, wenn eine Antwort als verbindlicher verstanden wird als beabsichtigt? Sie verschiebt den Blick von der Überzeugungskraft eines Gesprächs auf die Verteilung seiner Folgen.
D – Unklarheit markieren und die Frage revidieren
Für den fiktiven Betrieb liegen keine Nutzertests vor. Es ist offen, ob der Avatar bei den relevanten Aufgaben eine Rollenvermutung verändert, ob eine Startkennzeichnung wahrgenommen wird, ob der Kontaktweg auf kleinen Bildschirmen auffindbar ist und wie eine Übergabe funktioniert, wenn gerade niemand antworten kann. Diese Lücken dürfen weder mit Bauchgefühl noch mit einer erfundenen Prozentzahl geschlossen werden.
Das Modell verlangt hier nicht, irgendeine Hypothese als Gewinnerin zu küren. Es verlangt eine dokumentierte Rückfrage oder einen Fallback. Der Betrieb kann zunächst prüfen, ob die statischen Seiten verständlicher werden, und einen begrenzten Prototyp mit fiktiven Testaufgaben verwenden. Falls eine Annahme unklar bleibt, bleibt sie offen. Die Dokumentation notiert, welche Beobachtung sie später ändern könnte.
C – Eine bessere Frage und einen Handlungsplan festhalten
Aus der Revision wird eine engere Arbeitsfrage:
Welche Signale und Funktionen braucht ein begrenzter digitaler Fahrradverleih-Assistent, damit seine tatsächliche Rolle und seine Grenzen erkennbar sind, eine menschliche Übergabe bei nicht unterstützten oder folgenreichen Anliegen möglich ist und die Interaktion ohne Schleife beendet werden kann?
Ein GROW-Handlungsplan kann den nächsten Schritt ordnen: Goal – ein überprüfbarer Prototyp, in dem Funktion, Grenzen, Kontakt und Ende sichtbar sind; Reality – welche Wege und Zuständigkeiten bestehen bereits; Options – klarere Website ohne KI, neutraler Assistent, warmer Ton mit expliziter Rollenklärung oder ein begrenzter Pilot; Will – eine verantwortliche Rolle erstellt drei Prototypvarianten, dokumentiert Annahmen und entscheidet nach einem festgelegten Test, ob eine davon weiterverfolgt wird. Der Plan beantwortet die ethische Frage nicht automatisch. Er macht nur die nächste Entscheidung prüfbar.
Die sichtbare Veränderung ist entscheidend: Statt „Wie gewinnen wir Vertrauen?“ fragt das Team nun, welche Information, Zuständigkeit und Exit-Funktion die tatsächliche Rolle nachvollziehbar machen. Aus der Optimierung einer Wirkung wird eine Prüfung von Bedingungen, Rechten und Grenzen.
5. Das Konsultationsmodell macht aus Perspektiven eine Governance-Entscheidung
Das Konsultationsmodell K ist breiter als eine Abstimmung über zwei Entwürfe. Es verbindet Lernziel, unterschiedliche Perspektiven, Reflexion, Entscheidung, Umsetzung und Auswertung. Sein methodischer Grundzyklus hat vier Schritte: Exploration → Reflexion/Analyse → Entscheidungsfindung/Empfehlung → Feedback/Evaluation. [8] In den ausführlichen Fallszenarien wird die Umsetzung als eigener Pilot-Schritt sichtbar; dadurch entsteht eine fünfschrittige Fallausarbeitung: Exploration, Reflexion, Entscheidung, Implementierung/Pilot und Abschlussbewertung/Optimierung. Diese fünf Schritte sind die erweiterte Szenarioform des K-Modells, nicht sein vierstufiger Grundzyklus. Sie sind außerdem nicht die fünf Phasen des gesonderten Beratungsmodells R.
Im Fahrradverleih beginnt Exploration damit, die wirklichen Aufgaben und Rollen zu erfassen: Wer sucht Öffnungszeiten? Wer beantwortet Buchungsänderungen? Wer ist im Betrieb zuständig? Welche Personen benötigen eine Alternative zum Chat? Nicht jede Perspektive braucht personenbezogene Profile. Die Übung kann mit fiktiven Aufgaben und freiwilliger, datensparsamer Rückmeldung arbeiten.
In Reflexion und Analyse treten die Werte in Spannung. Eine schnelle Selbstbedienung kann bequem sein; eine klare Grenze kann verhindern, dass der Assistent eine Änderung suggeriert, die nicht vorgenommen wurde. Eine wiederholte Kennzeichnung kann Transparenz unterstützen, aber die Seite überfrachten. Ein jederzeit erreichbarer Mensch wäre nützlich, kann aber Personalressourcen voraussetzen. Das Modell fordert, diese Spannungen nicht in eine fiktive Punktzahl oder einen vermeintlich neutralen Konsens aufzulösen.
Die Entscheidung muss eine konkrete, zuordenbare Regel ändern. Für den Entwurf des fiktiven Betriebs könnte sie lauten: „Die Begrüßung benennt den Assistenten als digitales Hilfsmittel und seine unterstützten Aufgaben. Bei einer Änderungsanfrage zeigt er sofort, dass er die Buchung nicht ändern kann, und bietet den tatsächlich verfügbaren Kontaktweg. Eine Beenden-Funktion bleibt sichtbar.“ Das ist eine redaktionelle Produktentscheidung für den Übungsfall, keine empirisch ermittelte optimale Lösung.
Im Pilot werden nicht „Vertrauen“ oder „ethische Qualität“ mit einem einzelnen Gefallenswert gemessen. Der Betrieb legt vielmehr vorab beobachtbare Prüffragen fest:
Können Testpersonen die unterstützten Aufgaben korrekt benennen? Erkennen sie, dass die Oberfläche digital ist und keine verbindlichen Buchungsänderungen durchführt? Finden sie den tatsächlichen Kontakt- und Beenden-Weg ohne Umwege? Gibt es einen Fehlerfall, in dem der Assistent eine Weitergabe suggeriert, die nicht stattgefunden hat? Welche Nutzergruppe oder Zugangssituation fehlt in der Testanlage?
Das Feedback/Evaluation prüft anschließend, ob eine Designregel geändert werden muss. Dazu gehören qualitative Rückmeldungen und einfache Aufgabenbeobachtungen, nicht die pauschale Überwachung realer Gespräche. Jede reale Erhebung bräuchte einen klaren Zweck, eine angemessene Rechts- und Datenschutzprüfung sowie verständliche Informationen. Eine neue Fehlinterpretation öffnet die Governance-Entscheidung wieder: Die Rolle ist nicht einmalig beschriftet und dann für immer erledigt.
Das Konsultationsmodell wirkt hier also nicht, indem es „die Stakeholder“ erwähnt, sondern indem es den bevorzugten Entwurf verändern kann. Wenn Testpersonen eine Formulierung wiederholt als Buchungsbestätigung verstehen, wird die Formulierung verworfen. Wenn eine permanente Kontaktmöglichkeit mangels Ressourcen nicht angeboten wird, darf das Team nicht so tun, als sei sie vorhanden; es muss eine tatsächlich erreichbare Alternative definieren oder den Funktionsumfang verkleinern. Unterschiedliche Perspektiven sind Teil der Entscheidung, nicht Dekoration um eine bereits festgelegte Lösung.
Das Modell schlägt für Unterricht eine 70/30-Aufteilung von Praxis und Theorie als Gestaltungsoption vor. Die Zahl ist keine validierte Dosis und wird in diesem Artikel nicht als Lernwirksamkeit ausgegeben. Die vorgeschlagene 45-Minuten-Übung weiter unten lässt sich unabhängig davon an Kursziel und Gruppe anpassen.
6. Das Beratungsmodell R übergibt konkrete Rechtsfragen an Fachleute
R ist ein eigenständiger, fünfphasiger Fachprüfpfad für vertragliche, rechtliche und regulatorische Fragen. Er beginnt nicht mit einer spontanen KI-Antwort auf „Ist unser Chatbot rechtssicher?“. Die fünf Phasen lauten Vorbereitung/Anamnese → Analyse/Problemdefinition → Beratung/Lösung → Umsetzung/Dokumentation → Evaluation/Nachbereitung. [9] Das Modell schafft einen strukturierten Auftrag und eine Nachweisspur. Es macht weder einen Kursartikel noch ein ausgefülltes Formular zur Rechtsberatung.
Für den fiktiven Assistenten könnte eine juristische oder Compliance-Fachprüfung folgende Informationen benötigen:
1. Vorbereitung/Anamnese: Technik, konkrete Funktion, beteiligte Organisationen und Rollen, Verträge, Unterlagen, Datenflüsse, Kommunikationskanal, Rechtsraum und Stichtag zusammentragen.
2. Analyse/Problemdefinition: Lücken, Risiken, Chancen und Prioritäten im benannten Fall bestimmen; etwa klären, ob es um direkte Interaktion mit einem KI-System, Verbraucherkommunikation, Vertragswirkung einer Aussage, Datenschutz oder Zugänglichkeit geht.
3. Beratung/Lösung: Eine qualifizierte Fachperson entwickelt in fachlicher Zusammenarbeit mögliche Lösungen, prüft die aktuelle Primärnorm und benennt Bedingungen und offene Punkte. Der Artikel entscheidet das nicht vorweg.
4. Umsetzung/Dokumentation: Zuständige Personen setzen die geprüfte Lösung um, dokumentieren Version, Verantwortlichkeit und Nachweis und kommunizieren die Änderung an die betroffenen Rollen. Auch eine verständlich formulierte Oberfläche braucht einen tatsächlichen Prozess dahinter.
5. Evaluation/Nachbereitung: Ergebnis und offene Punkte nachverfolgen; bei Änderungen an Funktion, Organisation, Anbieter, Rechtsraum oder maßgeblicher Norm Anpassungen vornehmen und erneut prüfen. Eine frühere Prüfung ist keine zeitlose Freigabe.
Am 25. September 2026 nennen die EU-Kommissionsleitlinien Artikel 50 des AI Act als ab dem 2. August 2026 anwendbar. Artikel 50 Absatz 1 betrifft Anbieter von KI-Systemen, die für die direkte Interaktion mit natürlichen Personen bestimmt sind: Sie müssen das System so gestalten, dass die Personen über die KI-Interaktion informiert werden, soweit dies angesichts der Umstände und des Kontexts nicht offensichtlich ist. Ob und wie eine konkrete Organisation, Funktion und Oberfläche darunter fallen, ist eine Fachfrage. Der Fahrradverleih-Fall wird hier nicht rechtlich klassifiziert; die Signal-/Rollenkarte ersetzt weder Rechtsprüfung noch Nachweis der Einhaltung. [5]
Die Übergabe R→K ist genauso wichtig wie die Abgabe an Fachleute. Gibt die Prüfung eine konkrete Bedingung oder offene Frage zurück, muss die Governance-Entscheidung angepasst werden. Vielleicht braucht die Oberfläche eine klarere Startinformation; vielleicht muss ein Funktionsversprechen gestrichen werden; vielleicht ist der Einsatzfall anders zu begrenzen. R arbeitet also nicht als fünfte Stufe der K-Fallausarbeitung. Beide Modelle haben verschiedene Aufgaben und unterschiedliche Eingaben.
7. Die Signal-, Offenlegungs- und Ausstiegskarte
Das Arbeitsartefakt für den Artikel ist eine Karte, die an einer konkreten Interaktion ausgefüllt wird. Ihre Felder verhindern, dass ein beobachtbarer Satz stillschweigend in eine Tatsachenbehauptung über Nutzende, das System oder das Unternehmen umgedeutet wird.
| Feld | Eintrag im fiktiven Fall | Prüfstatus |
|---|---|---|
| Beobachtbares Signal | Avatar, Ich-Form, „Ich kümmere mich darum“, Begrüßung, Hinweis bei Beginn, Kontaktknopf | Beschreibung, kein Wirkungsnachweis |
| Mögliche Rollenvermutung | „Eine Buchungsänderung wurde veranlasst“ | Hypothese, noch nicht untersucht |
| Tatsächliche Funktion | Öffnungszeiten und Orte erklären; Buchung vorbereiten | Vom Betreiber zu belegen |
| Grenze | Keine Buchungsänderung, keine Zahlung, keine verbindliche Zusage | Muss mit Technik und Betriebsablauf übereinstimmen |
| Offenlegung | Information, dass es sich um einen digitalen KI-Assistenten handelt, im jeweiligen Interaktionskontext | Gestaltung plus gesonderte Anwendbarkeitsprüfung |
| Übergabe | Tatsächlich betreibbarer Kontaktweg bei Änderungswunsch, wiederholtem Fehlweg oder ausdrücklichem Personenwunsch | Durch Testfälle prüfen; keine Übergabe vortäuschen |
| Ausstieg | Sichtbar „Chat schließen“ oder zurück zur Informationsseite | Produktentscheidung und Testhypothese, kein belegter Wirkungsclaim |
| Verantwortliche Rolle | Betriebsverantwortliche prüft Funktionsangaben; Serviceverantwortung betreibt den Kontaktweg | Menschen/Organisation bleiben zuständig |
| Revisionsauslöser | Testperson hält eine Antwort für die Bestätigung einer Änderung; Kontaktweg funktioniert nicht | Designregel neu öffnen und dokumentieren |
Die Karte kann mit drei Versionen derselben Produktfunktion angewendet werden:
Variante A – ohne KI: Eine strukturierte Informationsseite mit klaren Öffnungszeiten, Orten, FAQ und Kontaktmöglichkeit. Sie kann die Ursache einer wiederkehrenden Frage adressieren, bevor eine dialogische Oberfläche hinzukommt.
Variante B – sachlicher Assistent: Eine kurze Rollenbeschreibung, begrenzte Aufgabenliste, klare Antworten und dauerhaft auffindbarer Kontakt- und Beenden-Weg.
Variante C – warmer Assistent: Ein zugewandter Ton bleibt möglich, aber die Rollenbeschreibung und Grenzen werden nicht durch eine vermenschlichende Stimme ersetzt. Bei einer Buchungsänderung wird kein Vollzug suggeriert.
Keine Variante gilt allein aufgrund dieser Beschreibung als die beste. Das Team dokumentiert für jede: welche Annahme sie voraussetzt, welche Belastung sie für Beschäftigte erzeugt, welche Zugänge sie eröffnet oder erschwert und welche konkrete Beobachtung zu einer Änderung führen würde. Wenn die einfachere Informationsseite die Aufgabe zuverlässig erfüllt, muss eine dialogische KI nicht aus Prestige- oder Modernisierungsgründen eingesetzt werden.
8. Eine 45-Minuten-Übung für Kurs und KMU
Ziel: Teilnehmende unterscheiden sichtbares Signal, mögliche Deutung und tatsächliche Produktzusage. Sie üben eine begründete Revision und leiten daraus eine überprüfbare Regel für Offenlegung, Übergabe und Ausstieg ab. Bewertet wird die Qualität der Begründung, nicht die Zustimmung zu einer vorgegebenen Lösung.
Material: zwei fiktive Karten mit derselben Funktion und unterschiedlichen Oberflächen. Karte 1 nutzt Avatar, Ich-Form und warmen Ton, Karte 2 eine sachliche Darstellung. Beide haben identische Fähigkeiten und Grenzen. Als dritte Option liegt eine Informationsseite ohne KI bereit. Keine Karte enthält echte Nutzungsdaten oder rekonstruierte Gesprächsverläufe.
Ablauf:
1. Minuten 0–5 – Ausgangsfrage: „Welche Karte wirkt vertrauenswürdiger?“ Die Gruppe hält spontane Antworten fest, markiert aber, dass Sympathie, Reliance und Vertrauenswürdigkeit verschiedene Dinge sind.
2. Minuten 5–15 – F-A: Begriffe und Annahmen klären. Jede Gruppe notiert sichtbare Elemente wortgetreu und trennt sie von einer vermuteten Rolle. 5-Why prüft, welches Geschäfts- oder Informationsproblem die Oberfläche lösen soll. SCAMPER oder eine einfache Optionsrunde erzeugt eine Nicht-KI-Alternative.
3. Minuten 15–22 – F-B: Mindestens drei konkurrierende Hypothesen über mögliche Deutungen oder Hürden formulieren. Eine Meta-Frage muss benennen, wer Nutzen erhält und wer Folgen eines Missverständnisses tragen würde.
4. Minuten 22–27 – F-D: Die Gruppe markiert, welche Hypothese mangels Evidenz offenbleibt. Sie darf keine Prozentwerte erfinden. Sie formuliert, welche kurze, datensparsame Beobachtung die Annahme prüfen könnte.
5. Minuten 27–37 – K: Exploration und Reflexion erfassen betroffene Rollen und den stärksten Einwand. Die Gruppe entscheidet sich für eine konkrete Produktregel, etwa eine Änderung des Leistungsversprechens oder einen sichtbaren Ausgang. Sie benennt eine Testbedingung und einen Revisionsauslöser.
6. Minuten 37–42 – R-Übergabe: Falls eine Rechtsfrage offen ist, schreibt die Gruppe einen Fachprüfauftrag mit Funktion, Organisation, Kanal, Rechtsraum, Stichtag und benötigten Unterlagen. Die Gruppe entscheidet die Rechtsfrage nicht selbst.
7. Minuten 42–45 – F-C: Eine neue, eng gefasste Frage und ein nächster Schritt werden festgehalten. Der GROW-Plan nennt Ziel, Ist-Zustand, Optionen und eine verantwortliche Handlung.
Abgabekriterium: ein ausgefüllter Kartensatz mit (a) beobachtetem Signal, (b) klar als Hypothese bezeichneter Deutung, (c) tatsächlicher Funktionsgrenze, (d) gewählter Governance-Regel, (e) realem Übergabe-/Ausstiegspfad, (f) offener Fachfrage und (g) Revisionsbedingung. Zwei begründet unterschiedliche Entscheidungen können gleich gut sein, wenn sie Evidenz, Werte, Betroffene und Grenzen offenlegen.
In einem KMU-Workshop kann die Aufgabe auf 45 Minuten gekürzt oder in eine längere Prototypsitzung eingebettet werden. Die Gruppe sollte nicht dazu gedrängt werden, persönliche Erlebnisse oder private Kundengespräche zu schildern. Testaufgaben können vollständig fiktiv sein. Werden reale Rückmeldungen erhoben, braucht es dafür einen eigenen Zweck, eine passende Information, eine Datensparsamkeit und eine geeignete Rechtsprüfung.
9. Eine kurze Regel für Produktteams
Vor der Freigabe eines dialogischen Assistenten kann ein kleines Team fünf Fragen schriftlich beantworten:
1. Was ist zu sehen? Die konkreten Signale präzise beschreiben, ohne Begriffe wie empathisch, verständig oder zuverlässig als Systemeigenschaften auszugeben.
2. Was ist tatsächlich möglich? Aufgaben, Grenzen und die für Nutzende relevante Reichweite der Funktion belegen.
3. Was kann eine Person über die Rolle verstehen? Mögliche Deutungen als Hypothesen markieren und mit Gegenbeispielen prüfen.
4. Was geschieht bei einer Grenze? Übergabe, Rückkehr zu statischer Information und Ausstieg müssen als tatsächliche Abläufe existieren, nicht nur als freundliche Formulierungen.
5. Wer ändert die Regel? Zuständigkeit, Nachweis, Revisionsauslöser und erforderliche Fachprüfung benennen.
Diese Fragen sind ein Lern- und Governance-Instrument, kein Zertifikat. Sie können für ein kleines Produktteam auf eine Seite passen; sie ersetzen keine vertiefte Prüfung, wenn der Einsatz erhebliche Folgen, besondere Daten oder rechtliche Pflichten berührt. Ihre Nützlichkeit hängt davon ab, ob Antworten überprüft und nötigenfalls geändert werden.
Schluss: Freundlichkeit braucht eine überprüfbare Rolle
Eine freundliche KI-Oberfläche ist weder automatisch fürsorglich noch automatisch irreführend. Sie ist eine gestaltete Begegnung, deren Rolle Menschen unterschiedlich deuten können. Wissenschaftliche Befunde aus eng umrissenen Aufgaben zeigen, dass anthropomorphe Signale, Reliance und Disclosure nicht mit einer einfachen Regel zusammenfallen. Ihre Grenzen sind Teil des Ergebnisses, nicht Fußnoten, die man nach einer Designentscheidung anhängt.
Das Fragenmodell F nimmt die voreilige Wirkungssuche auseinander und entwickelt eine engere, revisionsoffene Frage. Das Konsultationsmodell K zwingt die Organisation, Perspektiven und Gegenpositionen in eine konkrete Governance-Regel zu überführen und diese im Pilot überprüfen zu können. Das Beratungsmodell R übergibt nur die präzise abgegrenzten Rechts- und Vertragsfragen an eine zuständige Fachprüfung und führt deren Bedingungen zurück in die Produktentscheidung. Keines dieser Modelle liefert von selbst die „richtige“ Oberfläche.
Für den fiktiven Betrieb heißt das: Ein warmer Ton kann bestehen bleiben, wenn er nicht die Grenze zwischen Information und Buchungsänderung verwischt. Ein Avatar muss weder grundsätzlich entfernt noch als harmlos angenommen werden. Eine Offenlegung muss im konkreten Produkt- und Rechtskontext geprüft werden. Ein Mensch soll nicht nur in einem Werbesatz erreichbar sein, sondern über einen funktionierenden Weg. Und ein Ausstieg ist erst dann eine Option, wenn er auffindbar und nutzbar ist.
Die zentrale Frage ist darum nicht, ob eine KI nett klingt. Sie lautet: Kann die Organisation die Rolle belegen, die ihre Oberfläche nahelegt – und kann sie handeln, wenn Menschen eine andere Rolle verstehen?
Quellen
1. Araujo, T. (2018). “Living up to the chatbot hype: The influence of anthropomorphic design cues and communicative agency framing on conversational agent and company perceptions.” Computers in Human Behavior, 85, 183–189. https://doi.org/10.1016/j.chb.2018.03.051.
2. de Visser, E. J., Monfort, S. S., McKendrick, R., Smith, M. A. B., McKnight, P. E., Krueger, F., & Parasuraman, R. (2016). “Almost human: Anthropomorphism increases trust resilience in cognitive agents.” Journal of Experimental Psychology: Applied, 22(3), 331–349. https://doi.org/10.1037/xap0000092.
3. Mozafari, N., Weiger, W. H., & Hammerschmidt, M. (2020). “The Chatbot Disclosure Dilemma: Desirable and Undesirable Effects of Disclosing the Non-Human Identity of Chatbots.” Proceedings of ICIS 2020, Paper 1415. https://aisel.aisnet.org/icis2020/hci_artintel/hci_artintel/6/.
4. Liu, J., Gao, Z., Kang, Y., Jiang, Z., He, G., Sun, C., Liu, X., & Lu, W. (2021). “Time to Transfer: Predicting and Evaluating Machine-Human Chatting Handoff.” Proceedings of the AAAI Conference on Artificial Intelligence, 35(7), 5841–5849. https://doi.org/10.1609/aaai.v35i7.16731.
5. European Parliament and Council. Regulation (EU) 2024/1689, Article 50(1), consolidated text dated 27 July 2026. EUR-Lex: https://eur-lex.europa.eu/eli/reg/2024/1689/2026-07-27/eng. European Commission, “Guidelines on transparency obligations for providers and deployers of certain AI systems,” last updated 6 August 2026: https://digital-strategy.ec.europa.eu/en/policies/guidelines-ai-transparency-obligations. Accessed 25 September 2026.
6. National Institute of Standards and Technology (2024). Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile. NIST AI 600-1. https://doi.org/10.6028/NIST.AI.600-1.
7. SAKIZLI.AI. Fragenmodell v5 (deutsche Methodenfassung), S. 1–3. Modellreihenfolge A → B → D → C; methodische Beschreibung, kein Wirksamkeitsnachweis.
8. SAKIZLI.AI. Konsultationsmodell (deutsche Methodenfassung), Grundzyklus S. 7–8; ausführliche Fallszenarien S. 20–33. Die vierteilige Grundmethode und die separate fünfteilige Fallausarbeitung werden unterschieden.
9. SAKIZLI.AI. 5-Phasen-Beratungsmodell (deutsche Methodenfassung), Überblick S. 1–3; Vertiefung S. 4–16. Methodischer Fachprüfpfad, keine Rechtsberatung.
Hinweis zum Fall: Fahrradverleih, Website, Dialoge, Aufgaben und Produktregeln sind vollständig fiktiv. Sie behaupten keine beobachtete Nutzerwirkung, keine reale Produkteigenschaft und keine rechtliche Konformität. Die Modellbeschreibungen erklären methodische Arbeitsweisen; sie belegen nicht deren wissenschaftliche Wirksamkeit.
0 Kommentare
● Kommentare werden geladen…