← SAKIZLI AI
Article25. September 2026 · 26 Min. Lesezeit2 / 4Frei · Öffentlich

Wer trägt Verantwortung, wenn KI vorbereitet?

Dieser Artikel fragt nach Verantwortung im Moment zwischen einem plausiblen KI-Entwurf und einer wirksamen Entscheidung. Entscheidend ist nicht, wer zuletzt klickt, sondern wer wissen, ändern, anhalten und später erklären kann.

KI-EthikVerantwortungMenschliche AufsichtAutomation Bias
FFurkan SakızlıKI-Forscher & Tutor · unabhängig
Eine Hand stellt durchscheinende Karten in eine Reihe vor einen offenen, durchsichtigen Rahmen; daneben liegt eine dunkelblaue Scheibe
Zwischen Entwurf und Entscheidung
Bild mit KI erzeugt

Ein Entwurf kann eine Entscheidung so aussehen lassen, als sei sie schon gefallen. Er enthält eine freundliche Formulierung, eine klare Empfehlung und vielleicht sogar einen Verweis auf eine interne Regel. Dann steht vor einer Servicekraft nur noch eine scheinbar kleine Handlung: prüfen, bestätigen, senden. Genau an dieser Stelle wird Verantwortung oft zu schnell beschrieben. „Ein Mensch hat freigegeben“ klingt nach Kontrolle. Es beantwortet aber weder, was dieser Mensch wusste, noch welche Handlung er tatsächlich verhindern konnte, noch wer mit einem späteren Einwand umgehen müsste.

Der folgende Fall ist vollständig erfunden. Ein kleiner Ersatzteilbetrieb liefert Maschinen- und Fahrzeugteile an Werkstätten. Für eine Übung mit ausschließlich erfundenen Tickets erprobt er ein Sprachmodell, das bei Transportschaden-Reklamationen einen Antwortentwurf vorbereitet: Ersatzlieferung vorschlagen, Belege nachfordern oder eine Ablehnung formulieren. Die Servicekraft prüft den Entwurf nur im simulierten Fall; weder dieser Entwurf noch eine andere Nachricht wird versendet. Es werden keine Aussagen über einen realen Betrieb, reale Kundinnen oder die typische Zuverlässigkeit eines solchen Systems gemacht.

Im Fall R-184 meldet eine Werkstatt, ein Bauteil sei mit beschädigter Verpackung angekommen. Das Fallmaterial enthält das ausdrücklich fiktive Stoppsignal „möglicher Sicherheitsbezug“. Der Modelltext schlägt vor: „Bitte reichen Sie Fotos nach; wir entscheiden innerhalb von fünf Werktagen.“ Die Nachricht enthält aber noch etwas: Für den Einbau besteht ein bereits vereinbarter Termin. Im Ticket fehlt die Angabe, ob der Karton geöffnet wurde. Wäre das Teil verwendbar, wäre eine Ersatzlieferung nötig, ist die Ware zu sperren, oder braucht die Werkstatt zunächst eine andere Information? Der Textentwurf weiß das nicht. Er macht die Unsicherheit nur leicht übersehbar.

Die Leitfrage lautet deshalb: Unter welchen Informationen, Rechten und Nachweisen darf eine Servicekraft eine KI-Empfehlung zu einer Transportschaden-Reklamation bestätigen?

Diese Frage verschiebt den Schwerpunkt. Der Artikel behandelt Verantwortung als organisatorische Rechenschaft. In dieser didaktischen Matrix ist das Modell kein rechenschaftsfähiger Akteur; Rechenschafts-, Prüf- und Korrekturaufgaben werden menschlichen oder organisatorischen Rollen zugewiesen. Zu arbeits-, haftungs- oder vertragsrechtlichen Pflichten einer konkreten Konstellation trifft der Artikel keine Aussage. Er fragt auch nicht bloß, ob Menschen beteiligt sind. Menschen können in einem Ablauf anwesend sein und trotzdem ohne wirksame Rolle bleiben. Verantwortung wird hier als organisatorische Verbindung von vier Bedingungen behandelt: ausreichendes fallbezogenes Wissen, ein praktisches Eingriffsrecht, eine zurechenbare Entscheidung und ein zugänglicher Weg zur Korrektur.

Ein Klick ist keine Verantwortungsarchitektur

Eine Person kann einen vorgeschlagenen Text bestätigen und dennoch kaum verantwortlich entscheiden. Vielleicht sieht sie nur eine Zusammenfassung, aber nicht das Originalticket. Vielleicht darf sie den Text ändern, wird jedoch an einer Bearbeitungszahl gemessen, die jede Rückfrage als Verzögerung erscheinen lässt. Vielleicht kann sie einen Fehler melden, doch die Person, die Regeln oder Zugriffsrechte ändern könnte, erfährt davon nie. Vielleicht ist später nur gespeichert, dass „reviewed“ wurde; der Grund, die fehlende Information und die Eskalation fehlen. In allen vier Fällen trägt die Organisation Verantwortung anders, als der letzte Klick vermuten lässt.

Das ist keine Entlastung für die Person am Bildschirm. Eine Servicekraft kann auch bei einem KI-Entwurf fachlich fehlerhaft handeln, wenn sie verfügbare Informationen ignoriert oder eine eindeutige Stop-Regel missachtet. Eine Organisation darf sie jedoch nicht zur alleinigen Fehlerträgerin machen, wenn sie ihr die notwendige Akte, Zeit, Vertretung und Befugnis vorenthält. Die philosophische Arbeit von Santoni de Sio und van den Hoven beschreibt sinnvolle menschliche Kontrolle über „Tracking“ und „Tracing“: Nach ihrem Maßstab muss ein System auf relevante menschliche moralische Gründe und Umweltfakten reagieren können (Tracking); jede Systemhandlung muss auf das technische und moralische Verständnis mindestens einer Person in der Design- oder Einsatzkette zurückführbar sein (Tracing). Die Autor:innen entwickeln diese Begriffe aus der Debatte über autonome Systeme; sie sind keine empirische Wirksamkeitsstudie und keine Rechtsregel für diesen erfundenen Betrieb. Für R-184 schärfen sie dennoch die Frage: Kann eine zuständige Rolle verstehen, was das System in diesem Fall leistet und bewirkt, und ist die Entscheidung zu ihr zurückverfolgbar?

Eine brauchbare Antwort braucht mehrere Ebenen.

Autorisierungsverantwortung liegt bei der Stelle, die Zweck, Grenze, Rollen und Ressourcen des Einsatzes festlegt.

Fallverantwortung liegt bei der Stelle, die für diesen Sachverhalt eine fachliche Entscheidung trifft oder die zulässige Entscheidung bewusst zurückstellt.

Sachverhaltsverantwortung liegt bei der Stelle, die eine konkrete Tatsache prüft, etwa Verpackungszustand, Lieferstatus oder Produktkennzeichnung.

System- und Regelverantwortung liegt bei der Stelle, die Prompt, Regelbestand, Zugriffe und Stopp des Systems verändern darf.

Revisionsverantwortung liegt bei der Stelle, die einen Einwand entgegennimmt, die Entscheidung erneut prüfen lässt und eine Korrektur verständlich zurückmeldet.

Dies sind keine fünf schuldrechtlichen Kategorien. Sie sind eine didaktische Trennung von Aufgaben, damit in einem Fall nicht alles unter „menschliche Aufsicht“ verschwindet. Mehrere Aufgaben können in einem kleinen Betrieb bei derselben Person liegen. Dann muss gerade dokumentiert werden, welche Rolle sie in welchem Moment ausübt und wer sie vertritt. Eine Tabelle mit fünf Namen ist nicht ausreichend, wenn alle zugleich überlastet sind oder niemand den Ablauf stoppen darf.

Das NIST AI Risk Management Framework 1.0 behandelt klare Rollen, Verantwortlichkeiten und Kommunikationswege als Governance-Aufgabe (GOVERN 2.1–2.3, gedruckte S. 23). Es beschreibt außerdem, Rückmeldungen externer Beteiligter zu möglichen Auswirkungen zu sammeln, zu berücksichtigen, zu priorisieren und einzubeziehen (GOVERN 5.1, S. 24). Das Framework ist freiwillige, sektorneutrale Orientierung. Es bestimmt nicht, wie viele Prüfschritte der Fall R-184 benötigt, und es spricht keiner konkreten Person im Beispiel eine rechtliche Verantwortlichkeit zu. Für den Artikel folgt daraus nur eine praktische Forderung: Eine Rolle muss sich an einer Handlung und an einem Nachweis messen lassen.

Die UNESCO-Empfehlung zur Ethik der KI fordert Mitgliedstaaten auf sicherzustellen, dass ethische und rechtliche Verantwortung im Lebenszyklus und bei Abhilfe natürlichen Personen oder bestehenden juristischen Personen zugeordnet werden kann (Abs. 35). Auch dies ist keine einzelne Betriebsanweisung. Er stützt jedoch die Unterscheidung zwischen einem Werkzeug, das Vorschläge erzeugt, und den Menschen sowie Organisationen, die über Einsatz und Wirkung entscheiden.

Der Fall beginnt mit einer Lücke, nicht mit einer Antwort

R-184 enthält drei unterschiedliche Fragen, die der glatte Textentwurf zusammenzieht. Erstens: Was ist tatsächlich passiert? Beschädigte Verpackung beweist noch nicht, ob das Teil selbst betroffen ist. Zweitens: Welche fachliche Handlung ist bis zur Klärung angemessen? Dazu gehören Sperrung, Prüfung, Ersatz oder eine begründete Rückfrage. Drittens: Was darf der Betrieb der Werkstatt zusagen? Diese Kommunikation kann von einer Vertrags- oder Garantiefrage, einer Kulanzregel oder einer Lieferbedingung abhängen. Ein gut formulierter Entwurf ersetzt keine dieser Prüfungen.

Das bereitgestellte F-Modell verändert den Fall schon in seinem Schritt B. B bedeutet hier nicht: noch mehr Argumente für den ersten Entwurf sammeln. Es verlangt konkurrierende Erklärungen dafür, warum Verantwortung verloren gehen könnte. Die drei folgenden Hypothesen sehen ähnlich aus, verlangen aber verschiedene Reparaturen:

Hypothese aus F-BBeobachtbares ProblemWas würde die Hypothese widerlegen oder einschränken?Konsequenz für R-184
B1: Wissenslücke. Die Servicekraft sieht nur den Entwurf, aber nicht Ticket, Lieferstatus, Foto oder fehlende Angaben.Im Nachweis fehlt mindestens eine entscheidungsrelevante Quelle; die Person kann den Vorschlag nicht gegen den Sachverhalt halten.Die vollständige, zugelassene Fallakte ist vor der Entscheidung einsehbar und die Person kann zeigen, welche Quelle sie genutzt hat.Kein Versand; fehlende Kartonöffnung und Schadenbild werden als offene Fakten markiert.
B2: Eingriffslücke. Die Servicekraft kann formal ändern, hat aber keine Zeit, Vertretung oder Rückfragebefugnis.Änderungen oder Eskalationen werden faktisch als Leistungsfehler behandelt; eine Stop-Regel bleibt folgenlos.Es gibt ein geschütztes Verwerfungsrecht, ein eindeutiges Eskalationsziel und eine Vertretung innerhalb eines festgelegten Zeitfensters.Entwurf verwerfen oder anhalten; die Leitung muss die Frist und Vertretung absichern.
B3: Rechenschaftslücke. Der Ablauf speichert den Klick, aber nicht Grundlage, Ausnahme und Entscheidung.Nachträglich ist nicht nachvollziehbar, warum der Entwurf übernommen oder geändert wurde und wer eine Regel korrigieren müsste.Eine Entscheidungsspur verbindet Fallmaterial, menschliche Änderung, Regelversion, Eskalation und Rückmeldung.Kein Abschluss mit bloßem Status „reviewed“; ein Grund und die nächste zuständige Rolle werden festgehalten.

F-B verändert damit die Ausgangsfrage. Ohne diesen Schritt könnte die Lösung lauten: „Die Servicekraft muss sorgfältiger lesen.“ Mit ihm entstehen drei überprüfbare Organisationsfragen: Welche Unterlagen müssen vorliegen? Wie wird ein Stopp praktisch möglich? Was wird so aufgezeichnet, dass ein späterer Einwand bearbeitet werden kann? Eine vierte Option gehört ebenfalls auf den Tisch: kein Modelltext, sondern eine fachliche Checkliste mit Textbausteinen. Diese Nicht-KI-Option ist kein Rückschritt und kein Strafpunkt für das Projekt. Sie ist der Vergleich, der verhindert, dass der Entwurf allein deshalb als Hilfe gilt, weil er neu ist.

Der nachfolgende F-Schritt D hält die offenen Tatsachen aus, statt die plausibelste Annahme in eine Entscheidung zu verwandeln. Für R-184 stehen weder Kartonöffnung noch Teilzustand fest. Daraus folgt nicht automatisch eine Ersatzlieferung, eine Ablehnung oder ein Fotoauftrag als endgültige Lösung. Daraus folgt ein Halt: Der Entwurf darf nicht als normale Reklamationsantwort versendet werden, solange die Informationen fehlen und der fiktive Sicherheitsmarker nicht fachlich geklärt ist. F-C formuliert schließlich eine engere Regel: Eine Servicekraft darf nur dann bestätigen, wenn die erforderlichen Fallinformationen vorliegen, keine Stop-Regel auslöst und der Entwurf innerhalb einer freigegebenen Regel bleibt. Sonst leitet sie weiter.

Diese Formulierung ist keine „smarte“ Automationsregel. Sie benennt, wann die Automatisierung gerade nicht weiterhilft. Das kann in einem kleinen Betrieb wertvoller sein als die Fähigkeit, sehr viele Standardfälle schnell zu texten. Das hier verwendete F-Modell belegt allein weder die Wirksamkeit der Regel noch eine angemessene Prüfdauer. Es ordnet die Fragen; die Antworten brauchen Akte, Rollen und Beobachtung.

Was ein sichtbarer Mensch aus der Forschung noch nicht macht

Die Behauptung „ein Mensch prüft am Ende“ ist keine empirische Schutzgarantie. In einer Laborsimulation einer Flug-Monitoringaufgabe verglichen Skitka, Mosier und Burdick 80 Studierende mit und ohne Automationshilfe. Die Teilnehmenden wussten, dass die Hilfe unvollkommen sein könne. Bei nicht gemeldeten Ereignissen lag die Genauigkeit in dieser Studie bei 59 Prozent mit Hilfe gegenüber 97 Prozent ohne Hilfe; bei widersprüchlichen Empfehlungen zählten die Autor:innen durchschnittlich 3,92 Befolgungsfehler in sechs Gelegenheiten. Zugleich verbesserte die Hilfe die Leistung bei korrekten Direktiven. Der Befund zeigt somit keine allgemeine Überlegenheit oder Unterlegenheit von KI-Hinweisen. Er zeigt für genau diese Simulation, dass bekannte Unzuverlässigkeit allein eine menschliche Endprüfung nicht zuverlässig macht. Die Originalstudie betrifft eine ältere, simulierte Aufgabe mit Studierendensample; aus ihr folgt keine Fehlerquote für heutige generative KI oder diesen fiktiven Kundenservice.

Eine zweite Studie macht die Abwägung schwieriger statt einfacher. Buçinca, Malaya und Gajos untersuchten online 199 ausgewertete US-MTurk-Teilnehmende bei einer simulierten Ernährungsaufgabe mit absichtlich nur zu 75 Prozent korrekter KI. Kognitive Forcing-Designs reduzierten die Übernahme falscher Vorschläge gegenüber einfachen Erklärdesigns, beseitigten die Fehler aber nicht. Die Teilnehmenden erlebten diese Designs zugleich als komplexer; für die Gesamtleistung ergab sich zwischen den untersuchten Designkategorien kein signifikanter Unterschied. Die Studie untersucht keine professionelle Aufsicht, keine Vertragsentscheidung und keine Hochrisikoumgebung. Sie stützt jedoch das Gegenargument gegen einfache Rezepte: Eine zusätzliche Denk- oder Prüfanforderung kann falsche Übernahmen senken und zugleich Bedienbarkeit kosten.

Für diesen Artikel folgt keine Forderung nach einer universellen Doppelprüfung. Die Studie bestimmt weder die Prüfdauer für R-184 noch die passende Oberfläche. Sie macht nur deutlich, warum die Matrix nach Informationen, Eingriffsrechten und Nachweisen fragen muss, statt den menschlichen Klick als Beweis für wirksame Kontrolle zu behandeln.

K-Governance: Eine Rolle bekommt erst durch Rechte Gewicht

Das bereitgestellte K-Modell wird im Fall nicht als Gesprächsrunde neben dem Prozess eingesetzt. Es ändert die Verantwortungsmatrix. In der Exploration werden Originalticket, Lieferbeleg, Foto, Produktkennzeichnung, Modellvorschlag und fehlende Angaben getrennt sichtbar gemacht. In der Reflexion und Analyse kommen die widersprüchlichen Belange an den Tisch: Die Werkstatt braucht eine verlässliche nächste Handlung; die Lagerfachkraft darf ein möglicherweise betroffenes Teil nicht sprachlich wegmoderieren; die Servicekraft darf nicht durch einen Zeitwert zur bloßen Abzeichnerin werden; die Betriebsleitung muss Kapazität, Regel und Pilotgrenze verantworten. In der Entscheidung werden nicht alle Fälle gleich behandelt, sondern Rechte, Stopp und Nachweis zugeteilt. Feedback und Evaluation betrachten später gerade die Fälle, in denen ein Entwurf angehalten, verändert oder eskaliert wurde.

Damit ändert K die Matrix gegenüber einer Minimalfassung erheblich. Eine Minimalfassung hätte bloß gesagt: „Service prüft, Leitung genehmigt, Technik betreibt.“ Die folgende ausgefüllte Fassung verteilt für R-184 Wissen, Handlung, Gegenprüfung, Eskalation, Nachweis und Rückmeldung. Sie beschreibt ein didaktisches Soll für einen später getrennt zu prüfenden Einsatz; R-184 selbst bleibt eine Übung ohne Außenwirkung. Sie ist kein zertifiziertes Governance-Modell.

Auslöser / FalllageFachlich entscheidende RolleTechnische oder operative HandlungGegenprüfung durch andere FallrolleStop / EskalationDokumentierter NachweisRückmeldung / Beschwerde
Eingehende Transportschaden-Reklamation ohne Sicherheitsbezug, Akte vollständig.Servicekraft innerhalb der vorab freigegebenen Routine. Sie prüft Originalticket, Lieferstatus, benötigte Belege und Entwurf.Entwurf ändern, übernehmen oder verwerfen; keine automatische Versendung. Zugelassene Eingaben und Regelversion werden angezeigt.Stichprobenprüfung durch Serviceleitung, die nicht denselben Fallentscheid trifft.Bei unklarer Regel, fehlendem Kernbeleg oder nicht erklärbarem Entwurf: nicht abschließen, Rückfrage oder Leitung.Fall-ID, Quellenliste, Modell-/Prompt-/Regelversion, Übernahme/Änderung/Verwerfung und kurzer Grund.Verständlicher Kontaktweg zur menschlichen erneuten Prüfung; Eingang und Ergebnis werden protokolliert.
Fallmarker „möglicher Sicherheitsbezug“, Beschädigung oder Verpackung/Öffnung unklar – der konkrete Zustand von R-184.Serviceleitung entscheidet erst nach dem Befund der Lagerfachkraft über die Kundenkommunikation; die Servicekraft entscheidet nur über Halt und Übergabe.Servicekraft setzt den Entwurf auf „nicht versenden“ und fordert die festgelegten Angaben an; Lagerfachkraft kennzeichnet den Sachverhalt als geprüft, unklar oder sperrrelevant.Lagerfachkraft prüft Schadenbild, Versand- und Produktdaten; Serviceleitung prüft die Kommunikation gegen vollständige Fallakte.Sofortiger Halt. Eskalation an Serviceleitung und Lager. Bei Vertrags-/Garantiefrage, Kostenübernahme, grenzüberschreitendem Sachverhalt oder neuer Datenweitergabe: eng begrenzter Fachprüfauftrag.Originalticket; fehlende Angaben; Befund samt Quelle/Fotos; Sperrkennzeichen, falls gesetzt; Entscheider, Regel oder Ausnahme, Zeitpunkt und Kundenmitteilung.Werkstatt erhält keine Scheinsicherheit. Sie bekommt eine verständliche Information über Prüfung, Rückfrage und Kontakt für erneute menschliche Bewertung.
Entwurf empfiehlt Ablehnung oder verbindliche Zusage trotz fehlendem Beleg.Serviceleitung; keine Routinefreigabe durch Servicekraft.Entwurf verwerfen und als Abweichung markieren. Die technischen Verantwortlichen erhalten keinen Inhalt als „Fehlerkorrektur“, sondern eine dokumentierte Regelabweichung.Zweite Serviceleitung oder benannte Vertretung prüft Ausnahmeentscheidung anhand derselben Akte.Halt bis zur Prüfung. Wiederholt sich die Abweichung, pausiert Betriebsleitung die betreffende Einsatzklasse.Abweichungstyp, Regelversion, Fallmaterial, Entscheidung und Begründung; bei Pause: Zeitpunkt, Umfang, Anlass.Betroffene erhalten eine erneute Prüfung mit Ergebnis; der Beschwerdekanal darf den Fall nicht mit einem automatischen Hinweis schließen.
Servicekraft kann Vorschlag nicht erklären oder die notwendige Information nicht sehen.Servicekraft entscheidet nicht fachlich über den Fall, sondern über den Stopp. Betriebsleitung verantwortet die Behebung der Zugriffs- oder Zeitlücke.„Unvollständige Entscheidungsgrundlage“ auswählen; Entwurf sperren; an Leitung weitergeben.Serviceleitung bestätigt, dass die Akte vervollständigt oder der Einsatz für diese Fallklasse ausgesetzt wurde.Halt; bei fehlender Vertretung oder wiederkehrender Lücke Stopp der Klasse durch Betriebsleitung.Fehlende Quelle oder Befugnis, Zeitpunkt, Übergabeziel, Rückkehrentscheidung und eventuell Regeländerung.Rückmeldung nennt eine erreichbare Stelle und die nächste Frist; sie behauptet keine Prüfung, die nicht stattgefunden hat.
Beschwerde: Werkstatt bestreitet Zusage, Behandlung oder Verständlichkeit der Antwort.Beschwerdestelle beziehungsweise benannte Serviceleitung veranlasst eine neue menschliche Fallprüfung. Sie darf nicht dieselbe fehlerhafte Entscheidung nur bestätigen.Entscheidungsspur abrufen, erneute Prüfung anlegen, nötige Korrektur oder Erklärung versenden.Eine Person außerhalb der ursprünglichen Fallentscheidung prüft, ob Regel, Beleglage und Antwort nachvollziehbar waren.Wenn die Spur fehlt oder die Ausgangsentscheidung nicht erklärbar ist: Fall neu öffnen und Einsatzklasse überprüfen.Beschwerdeeingang, Frist, prüfende Rolle, Ergebnis, Korrektur oder begründete offene Frage.Zugänglicher Weg zur Rückfrage; Antwort beschreibt die tatsächlich erfolgte Prüfung und verweist auf weitere zuständige Stelle, falls nötig.
Wiederkehrende Stopps, erhebliche Mehrarbeit oder ungeklärte Fehlerklasse.Betriebsleitung entscheidet über Pilotgrenze, Ressourcen und Pause; sie entscheidet nicht ohne Akte über einzelne Reklamationen.Einsatzklasse einschränken, pausieren oder auf Checkliste/Textbausteine ohne Modell zurückstellen; Schulung, Zeit und Vertretung anpassen.Regelreview durch Service, Lager und mindestens eine Perspektive des Beschwerdewegs; bei Fachfrage Rückgabe aus R.Stop oder Anpassung vor weiterem Einsatz. Ein Dashboard allein ist kein Gegenprüfungssubjekt.Regelversion, Muster aus Fällen, Ressourcenentscheidung, Reviewtermin, begründete Fortsetzung oder Beendigung.Aggregierte, verständliche Information über geänderte Abläufe, soweit erforderlich; individuelle Beschwerdefälle bleiben bearbeitbar.

Die Matrix macht zwei wichtige Punkte sichtbar. Erstens ist die Servicekraft in R-184 nicht „verantwortungslos“, weil sie nicht selbst über Ersatzlieferung oder Garantie entscheidet. Ihre Verantwortung ist konkret: Sie darf den Entwurf nicht zur Entscheidung machen, wenn die Stop-Regel greift, und sie muss die Fallakte an die richtigen Rollen übergeben. Zweitens verschwindet Verantwortung nicht bei der Eskalation. Die Betriebsleitung muss Zeit, Vertretung und die Möglichkeit zur Pause schaffen. Die Lagerfachkraft muss einen Befund als Befund und nicht als Kundenzusage dokumentieren. Die Serviceleitung muss die Kommunikationsentscheidung begründen. Eine Beschwerdestelle muss echte Wiederaufnahme ermöglichen.

Das K-Modell verändert so die Entscheidung selbst. Die erste Reaktion auf R-184 lautet nicht länger: „Der Text klingt vernünftig, also prüft ihn jemand.“ Sie lautet: „Die Fallklasse wechselt von Routine in Halt; die Servicekraft darf nicht senden; die Lagerprüfung und Leitung erhalten klare Aufgaben; ein fehlender Nachweis hält die Entscheidung offen.“ Die Matrix erzeugt zusätzliche Arbeit. Gerade deshalb ist sie kein dekoratives Governance-Dokument, sondern eine Aussage darüber, welche Arbeit im sicheren Umgang mit der Empfehlung tatsächlich anfällt.

Die Matrix unterscheidet eine Gegenprüfung durch eine andere Fallrolle von einer zweiten Unterschrift. Die prüfende Rolle bewertet nicht den eigenen Erstentscheid, sondern erfüllt eine andere Fallaufgabe. Eine Vertretung ersetzt die ursprüngliche Rolle, ist aber keine Gegenprüfung. Für die Routine kann das eine Stichprobe durch die Leitung sein. Für R-184 ist es die fachliche Befundprüfung durch Lager und die Kommunikationsprüfung durch die Serviceleitung. Eine Organisation muss dabei den Zugriff auf Informationen nach dem jeweiligen Zweck begrenzen. „Alle sehen alles“ wäre keine Lösung für Verantwortung, sondern eine neue Frage nach Datenzugriff und Vertraulichkeit.

Rechenschaft heißt: Der Weg zurück ist beschreibbar

Eine Entscheidungsspur ist mehr als ein Protokoll für eine spätere Schuldfrage. Sie soll es der Werkstatt und dem Betrieb ermöglichen, einen Fehler zu erkennen und zu korrigieren. Für einen späteren, gesondert freizugebenden Pilot würde die minimale Spur enthalten: Fall-ID; zulässigen Zweck und Grenze des KI-Einsatzes; zugelassene Eingaben; Modell-, Prompt- und Regelversion mit Zeit; Originalunterlagen; Entwurf; menschliche Änderung, Übernahme oder Verwerfung samt Grund; Eskalation und Ergebnis; vorgesehene oder später tatsächlich gesendete Nachricht; Feedback oder Korrektur. In der Übung bleibt die Nachricht unversendet.

Diese Liste beweist nicht, dass eine Entscheidung richtig war. Eine gut geführte Akte kann einen Fehler enthalten. Sie erschwert aber drei Ausweichbewegungen: dass ein Modelltext als Quelle ausgegeben wird, obwohl entscheidende Tatsachen fehlen; dass eine Organisation eine persönliche Freigabe behauptet, ohne den Eingriffsweg zu zeigen; und dass ein Beschwerdefall in einem System endet, in dem niemand mehr weiß, welche Regel zu ändern wäre. Raji und Kolleg:innen schlagen für interne KI-Audits eine Verbindung von Dokumenten, Beteiligten und entscheidungsfähigen Rollen über den Lebenszyklus vor (S. 1–3). Das ist ein konzeptioneller Vorschlag, kein Nachweis, dass die hier entworfene Spur einen Fehler tatsächlich behebt.

Nach Abs. 38 der UNESCO-Empfehlung sollen Betroffene Gründe für eine KI-gestützte Entscheidung erhalten und eine Überprüfung sowie Korrektur durch eine zuständige Stelle verlangen können. Die OECD-Empfehlung zu KI nennt Transparenzinformationen, die nachteilig Betroffene in die Lage versetzen sollen, einen Output anzufechten, sowie kontextgerechte Mechanismen zur sicheren Übersteuerung, Reparatur oder Stilllegung (§ 1.3(iv), § 1.4(b), S. 8). Diese Texte begründen in diesem Artikel weder einen pauschal einklagbaren Beschwerdeanspruch noch eine Pflicht, jede Antwort durch mehrere Menschen zu prüfen. Sie unterstützen eine Gestaltungsregel: Wenn eine Entscheidung nach außen wirken kann, muss eine Person den Weg zur menschlichen Überprüfung tatsächlich finden und nutzen können.

Für R-184 verlangt die Übung den Entwurf einer Rückfrage oder Zwischenmitteilung, die keine endgültige Prüfung vorspiegelt und erklärt, was noch offen ist. Sie wird nicht versendet. Welche Informationen im Einzelfall zugänglich sein müssen, hängt vom Kontext und gegebenenfalls vom anwendbaren Recht ab. Für die Übung genügt: Die Rückmeldung darf keinen Abschluss vortäuschen und muss einen verständlichen Weg zur erneuten menschlichen Prüfung benennen.

Vier verbundene Karten: drei Punkte münden in einen Ring, ein aufgeklapptes Blatt, ein Balken neben einer erhobenen Hand, ein Kreis mit drei Knoten; ein Kabel führt vom letzten zurück zum ersten
Wissen, Akte, Stopp, Überprüfung — und ein Weg zurück
Bild mit KI erzeugt

Ein ernstes Gegenargument: Verlangsamt diese Matrix genau die Hilfe, die nötig wäre?

Das stärkste Gegenargument ist nicht, dass Verantwortung unwichtig sei. Es lautet: In einem kleinen Betrieb sind Menschen, Lagerzugriffe und Führungskapazität begrenzt. Jede Stoppregel, zweite Prüfung und Dokumentation nimmt Zeit. Gerade die Werkstatt mit einem dringenden Termin könnte durch ein aufwändiges Verfahren länger auf eine brauchbare Antwort warten. Ein späterer Einsatz könnte einfache Rückfragen vorbereiten; ob er tatsächlich Zeit freispielt, wäre gesondert zu beobachten. Wenn jede Abweichung einen halben Ausschuss auslöst, wird die Governance selbst zu einer Ursache von Verzögerung, Frust und schlechter Erreichbarkeit.

Dieses Argument trägt. Eine verantwortliche Organisation darf nicht so tun, als seien Prüfungen kostenlos oder als seien Wartezeiten ethisch neutral. Auch Arbeitslast ist eine Auswirkung des Einsatzes. Der richtige Schluss ist jedoch Verhältnismäßigkeit, nicht die Rückkehr zum symbolischen Klick. Für eine vollständige Routineakte kann die Servicekraft innerhalb einer klaren Regel entscheiden; eine Stichprobe genügt als Gegenprüfung. Für R-184 greift die aufwändigere Spur, weil der fiktive Sicherheitsmarker, die unklare Tatsachenlage und die mögliche Zusage gerade nicht Routine sind. Der Fall erzeugt nicht zusätzliche Komplexität durch Ethik. Er bringt die Komplexität ans Licht, die schon in der Reklamation liegt.

Eine knappe Organisation kann mit drei Schwellen arbeiten:

1. Routine: Vollständige Akte, keine Stop-Regel, klare Regel. Die Servicekraft prüft und entscheidet innerhalb der festgelegten Grenze.

2. Halt: Fehlende entscheidende Information, Sicherheitshinweis, nicht erklärbarer Entwurf oder strittige Zusage. Keine Außenkommunikation als fertige Entscheidung; Übergabe an die benannte Rolle.

3. Regelreview: Wiederkehrender Halt, fehlende Vertretung, Regelabweichung oder Beschwerdemuster. Betriebsleitung passt den Umfang an, pausiert ihn oder nutzt wieder eine Nicht-KI-Alternative.

Diese Schwellen sind eine fiktive Rollenregel, keine Messung von Geschwindigkeit, Belastung oder Fehlern. Der Artikel „KI-Ethik beginnt vor dem ersten Prompt“ klärt den Vergleich mit der Nicht-KI-Alternative; ein späterer Artikel dieser Reihe untersucht Arbeitslast; ein weiterer prüft später die tatsächliche Qualität eines Overrides. Hier bleibt die Gegenfrage auf die Zuständigkeit begrenzt: Ist auch für die Checkliste erkennbar, wer ihren Vorschlag fachlich prüft, stoppen darf und auf einen Einwand reagiert?

R als enger Fachprüfauftrag, nicht als Rechtsstempel

Die Matrix enthält einen Anlass für Fachprüfung, aber keine Rechtsberatung. R wird nicht für jedes Ticket vollständig durchlaufen. Im Fall R-184 beginnt R1, die Vorbereitung beziehungsweise Anamnese, weil das Fallmaterial einen möglichen Sicherheitsbezug, mögliche Ersatzkosten und eine Kundenkommunikation mit offenem Tatsachenkern verbindet. Der Prüfauftrag erhält nur die Frage, die tatsächlich beantwortet werden soll, und die Unterlagen, die dafür erforderlich sind.

R-PhaseKonkrete Übergabe im Fall R-184Rückgabe in die Governance
R1 Vorbereitung / AnamneseTicket, Produkt, Liefer- und Verpackungsdaten, Vertrag oder Garantieunterlagen, beteiligte Systeme, Datenfluss, Rechtsraum, gewünschte Entscheidungsfrist.Fehlende Unterlagen, richtige Fachstelle oder präzisere Sachverhaltsfrage.
R2 AnalyseEnge Frage: „Welche Unterlagen, offenen Tatsachen und zuständige Fachstelle muss die Serviceleitung klären, bevor sie eine Kosten-, Garantie- oder sonstige verbindliche Zusage kommuniziert?“Prüfpriorität und offene Tatsachen, keine abstrakte Konformitätsbehauptung.
R3 LösungsentwurfFachlich begrenzte Handlungsoption oder Feststellung, dass eine Entscheidung noch nicht möglich ist.Regel ändern, Ausnahme begründen oder Fall zurück an Service und Lager.
R4 Umsetzung / DokumentationFreigegebene Fallhandlung, zuständige Rolle und Kommunikation an die Werkstatt.Nachweis in der Fallakte; kein universelles Freigabesiegel für künftige Fälle.
R5 EvaluationWiederkehrende Streitpunkte, fehlende Dokumente oder unpassende Regel aus mehreren Fällen.F erneut öffnen und Pilotgrenze oder Regel überprüfen.

Der R-Auftrag schützt vor zwei Fehlern. Er verhindert, dass ein Textentwurf eine Vertrags-, Garantie- oder Haftungsfrage heimlich beantwortet. Und er verhindert, dass eine Fachstelle ein allgemeines „konform“ für einen Prozess erteilen soll, dessen Zweck, Datenfluss und Einzelfall noch unklar sind. Eine konkrete Fachprüfung kann Unterlagen nachfordern und als Ergebnis auch zurückgeben, dass gegenwärtig keine belastbare Zusage möglich ist. Das ist ein brauchbares Ergebnis, keine Panne.

90 Minuten: „Der Klick hat keinen Namen“

Die Unterrichtseinheit macht die Matrix zu einer Prüfaufgabe. Die ausgefüllte Matrix, die Stop- und Eskalationskarte sowie eine Blankovorlage stehen im Arbeitsblatt. Lernende müssen nicht dieselbe Kundenentscheidung treffen. Sie sollen zeigen, ob eine Rolle genug weiß, wirksam eingreifen kann und eine später überprüfbare Spur hinterlässt. Das Lernmaterial enthält ausschließlich den erfundenen Fall R-184: Ticket, Modelltext, Lieferstatus, einen unvollständigen Fotohinweis und den Fallmarker „möglicher Sicherheitsbezug; Einbautermin steht an“. Ein Element bleibt absichtlich offen: Ob der Karton geöffnet wurde.

Lernprodukt: Jede Gruppe gibt eine ausgefüllte Verantwortungsmatrix, zwei Stoppauslöser, einen eng formulierten R-Prüfauftrag und eine minimale Entscheidungsspur ab. Die Bewertung prüft Verbindung von Wissen, Eingriff und Nachweis. Zustimmung zu derselben Ersatz- oder Ablehnungsentscheidung ist kein Kriterium.

ZeitAufgabeSichtbares Ergebnis
0–10 MinutenEinzelarbeit: Ticket und Entwurf lesen. Jede Person markiert getrennt: gesicherte Tatsache, fehlende Tatsache, Aussage des Modelltexts und mögliche Wirkung der Antwort.Vier farblich getrennte Markierungen. Schon hier wird sichtbar, ob der Entwurf als Beleg verwechselt wird.
10–25 MinutenGruppenarbeit mit F-A und F-B. Begriffe „Vorbereitung“, „Entscheidung“, „Freigabe“ und „Rechenschaft“ klären. Danach mindestens drei Hypothesen zum Verantwortungsverlust sowie eine Nicht-KI-Option formulieren.B1, B2 und B3 oder gleichwertige überprüfbare Hypothesen; fachliche Checkliste/Textbausteine als echte Option.
25–40 MinutenKartenereignis: „Kartonöffnung unklar“, „Sicherheitsbezug“ und „Termin heute“. Gruppen arbeiten F-D und F-C: Was muss offen bleiben? Welche Regel gilt jetzt?Stoppentscheidung, dokumentierte Rückfrage und präzise Endfrage. Keine Gruppe darf den Ausgang durch eine erfundene Tatsache schließen.
40–60 MinutenK-Exploration und Reflexion: Rollen Service, Lager, Werkstatt, Leitung und Beschwerdeweg. Jede Rolle nennt ein legitimes Interesse, eine notwendige Information und eine Handlung, die ihr zusteht.Rollenkarte mit Konflikt: schnelle Information, sichere Ware, gerechte Arbeitslast, erklärbare Korrektur.
60–73 MinutenK-Entscheidung: Gruppen füllen die Verantwortungsmatrix aus. Sie benennen Vertretung, unabhängige Gegenprüfung und zwei konkreten Stoppauslöser.Ausgefüllte Matrix, die für R-184 die Servicekraft vom Versand trennt und Lager/Leitung zur Akte führt.
73–83 MinutenR-Fachprüfauftrag schreiben. Die Gruppe darf keine Rechtsmeinung erfinden. Sie formuliert eine enge Frage, Unterlagen und einen Rückgabeweg.Prüfauftrag mit Rechtsraum, Vertrags-/Garantieunterlagen als gegebenenfalls fehlend und klarer Zuständigkeit.
83–90 MinutenPeer-Review: Eine andere Gruppe versucht, den Ablauf mit zwei Fragen zu brechen: „Kann die Servicekraft wirklich stoppen?“ und „Kann eine Werkstatt später verständlich widersprechen?“Eine dokumentierte Revision. Eine gefundene Lücke führt zurück zu F-D oder K, nicht zu einer nachträglichen Schönformulierung.

Die Lehrkraft muss nicht den richtigen Ersatzteilentscheid kennen. Sie moderiert, ob die Gruppen Fakten, Modellvorschlag und Regel sauber trennen. Eine Gruppe kann begründet sagen, dass sie ohne zusätzliche Information keine Kundenzusage empfiehlt. Eine andere kann eine Zwischenmitteilung mit schneller Rückfrage formulieren. Beide können gut arbeiten, sofern keine Gruppe fehlende Tatsachen erfindet und die Matrix den Stopp nicht an eine folgenlose Rollenbezeichnung delegiert.

Der Negativtest ist absichtlich konkret: Eine Gruppe trägt „Servicekraft stoppt“ ein; die prüfende Gruppe fragt, ob die Matrix dafür eine Informationsquelle, Zeit und Vertretung benennt. Fehlt eine dieser Angaben, ist die fiktive Rollenbeschreibung unvollständig. Die Gruppe ergänzt Aktenzugriff, Vertretung oder eine kleinere Einsatzklasse. Ob ein Stopp unter tatsächlichem Arbeitsdruck gelingt, prüft diese Papierübung nicht; das bleibt ein späterer Gegenstand dieser Reihe.

Was dieser Artikel entscheidet – und was später geprüft werden muss

Dieser Artikel entwickelt keine allgemeine Antwort auf die Frage, ob KI im Kundenservice eingesetzt werden soll. Der Artikel „KI-Ethik beginnt vor dem ersten Prompt“ behandelt die vorgelagerte Entscheidung über Problem, Zweck und begrenzten Test. Dieser Artikel setzt danach an und ordnet die Verantwortung für einen vorbereiteten Einzelfall. Ein späterer Artikel dieser Reihe wird Arbeitslast und Zeitdruck als Prüfgegenstand vertiefen: Diese Fassung benennt Zeit und Vertretung als Bedingung eines realen Eingriffsrechts, sie misst aber keine Belastung. Ein weiterer wird die Eingriffsprobe am fehlerhaften Output durchführen: Diese Fassung schafft dafür Fallakte, Stopp, Rollen und Nachweis, sie testet den Override noch nicht.

Der Artikel enthält deshalb keine Behauptung, dass die Matrix Fehler verringert, Beschwerden löst oder ein Modell sicher macht. Er zeigt eine engere institutionelle These: Eine Person übernimmt einen KI-Entwurf erst dann verantwortlich, wenn sie den relevanten Sachverhalt prüfen, den Vorschlag folgenwirksam ändern oder anhalten und ihre Entscheidung so dokumentieren kann, dass eine andere zuständige Stelle sie überprüfen und korrigieren kann. Wo eine dieser Bedingungen fehlt, muss die Organisation die Lücke benennen und entweder die Rolle ausstatten, den Fall eskalieren oder die Einsatzgrenze verkleinern. Auch die Gegenprobe in diesem Artikel prüft nur die Vollständigkeit einer fiktiven Matrix, nicht die Leistung eines produktiven Overrides.

Das Ergebnis im Fall R-184 ist daher keine dramatische Heldentat und keine Aussage, dass KI verboten sei. Der Vorschlag wird angehalten. Die Lagerfachkraft prüft den Sachverhalt, die Serviceleitung entscheidet erst auf vollständigerer Grundlage über die Kommunikation, und eine gegebenenfalls notwendige Fachfrage bleibt eng begrenzt. Der entscheidende Fortschritt ist, dass niemand so tun kann, als habe ein flüssiger Text die fehlende Tatsache und die zuständige Entscheidung ersetzt.

Quellen und Geltungsgrenzen

NIST (2023), Artificial Intelligence Risk Management Framework (AI RMF 1.0), besonders GOVERN 2.1–2.3 und 5.1 (gedruckte S. 23–24). Freiwilliges Rahmenwerk; keine konkrete Rollenmatrix, Rechtsnorm oder Wirksamkeitsstudie.

UNESCO (2021), Recommendation on the Ethics of Artificial Intelligence, besonders Abs. 35–38, 47 und 50–53. Internationale normative Empfehlung; keine individuelle Rechtsberatung und kein vorgegebenes Beschwerdeformular für den erfundenen Betrieb.

OECD (2019, geändert 2024), Recommendation of the Council on Artificial Intelligence (OECD/LEGAL/0449), § 1.3(iv) und § 1.4(b), S. 8. Orientierung zu Anfechtbarkeit und sicheren Übersteuerungsmechanismen; keine pauschale Pflicht zu mehreren menschlichen Prüfungen.

Skitka, Mosier & Burdick (1999), „Does automation bias decision-making?“, International Journal of Human-Computer Studies 51, S. 991–1006, besonders PDF S. 5–9 und 12–13. Laborsimulation mit 80 Studierenden; keine Schätzung für generative KI oder Kundenservice.

Buçinca, Malaya & Gajos (2021), „To Trust or to Think“, DOI: 10.1145/3449287, besonders PDF S. 1–2 und 16. Online-Experiment mit 199 ausgewerteten US-MTurk-Teilnehmenden und simulierter KI; keine Studie zu professioneller Aufsicht oder Organisationshaftung.

Santoni de Sio & van den Hoven (2018), „Meaningful Human Control over Autonomous Systems: A Philosophical Account“, DOI: 10.3389/frobt.2018.00015, besonders PDF S. 8–12. Philosophische Begriffsarbeit; keine empirische Wirksamkeitsstudie und keine Rechtsregel.

Raji et al. (2020), „Closing the AI Accountability Gap“, DOI: 10.1145/3351095.3372873, besonders PDF S. 1–3. Konzeptioneller Vorschlag für interne Algorithmus-Audits; keine Garantie für die Wirksamkeit oder Unabhängigkeit interner Prüfungen.

Bereitgestellte interne Methodenmaterialien: F (A → B → D → C), K (Exploration; Reflexion/Analyse; Entscheidung/Empfehlung; Feedback/Evaluierung) und R (Vorbereitung; Analyse; Lösungsentwurf; Umsetzung/Dokumentation; Evaluation). Sie strukturieren die didaktische Fallarbeit; sie belegen weder Wirksamkeit, angemessene Prüfdauer noch Rechtskonformität.

Die Matrix und die Verhältnismäßigkeitsregel sind ausdrücklich als didaktische, fiktive Synthesen ausgewiesen. Eine spätere produktive Anwendung bräuchte eine fallbezogene Fachprüfung zu Rechtsraum, Rolle, Datenfluss und Systemtyp.

HTMLThemenübersicht: Wer trägt Verantwortung, wenn KI vorbereitet?1 Seite↓DOCXArbeitsblatt: Verantwortung vor dem Klick35–45 Min.↓

0 Kommentare

● Kommentare werden geladen…

Zum Kommentieren anmelden · Mitglied werden →