← SAKIZLI AI
Article25. September 2026 · 22 Min. Lesezeit1 / 1Frei · Öffentlich

KI-Ethik beginnt vor dem ersten Prompt

Dieser Artikel entwickelt die redaktionelle These: Ethische Entscheidungen über KI können fallen, bevor jemand das Modell öffnet. Welches Problem gilt als lösenswert, und wer darf die Folgen einer vorgeschlagenen Lösung tragen?

KI-EthikVerantwortungGovernanceMensch & KI
FFurkan SakızlıKI-Forscher & Tutor · unabhängig
Eine Hand setzt durchscheinende Karten in eine Reihe: ein Globus, drei blaue Punkte, eine hohe Scheibe mit dunklem Kreis, dahinter leere Kreise und ein Blatt mit blauem Punkt
Was auf die Linie kommt, wird vor dem ersten Prompt entschieden
Bild mit KI erzeugt

Ein kleiner, hier vollständig erfundener Ersatzteilbetrieb möchte Anfragen zu Lieferungen und Reklamationen schneller bearbeiten. Die Geschäftsleitung schlägt vor, ein Sprachmodell solle eingehende Nachrichten lesen und gleich Antworten verschicken. Eine vorbildlich formulierte Anweisung könnte Tonfall, Länge und Format der Antworten regeln. Sie würde aber noch nicht klären, ob eine verspätete Lieferung, eine Reklamation und eine Adressänderung überhaupt dieselbe Art von Arbeit sind.

Bei einer Adressänderung kann eine falsche Zuordnung zur falschen Lieferung führen. Bei einer Reklamation kann eine allzu selbstsichere Antwort einen Streit verschärfen. Eine Frage nach dem Lieferstatus braucht vielleicht gar kein Sprachmodell, sondern einen verlässlicheren Status aus dem Warenwirtschaftssystem. Die ethische Frage lautet deshalb zunächst nicht: „Wie prompten wir die KI?“, sondern: „Welche Entscheidung soll hier von wem mit welchen Informationen vorbereitet oder getroffen werden?“

Dieser Blick ist keine Einladung zum Stillstand. Er schafft die Grundlage für einen kleinen, begrenzten Versuch. Das NIST AI Risk Management Framework, Version 1.0 sieht für die Kontextbestimmung unter anderem dokumentierte Zwecke, Nutzungsbedingungen, mögliche Auswirkungen und Annahmen vor; bei der Governance beschreibt es klare Rollen. NIST bezeichnet das Framework ausdrücklich als freiwillige Orientierung, nicht als Freigabestempel für einen einzelnen Betrieb (S. 2, 22 und 25 des Berichts). Die hier vorgeschlagene Entscheidungskarte ist unsere didaktische Umsetzung dieser Gedanken, keine offizielle NIST-Vorlage.

Vier Fragen, die leicht ineinander rutschen

Eine Mitarbeiterin hält es für falsch, dass ein Kunde eine überzeugende, aber ungeprüfte Absage erhält. Das ist ein moralisches Urteil: Aus ihrer Perspektive steht etwas auf dem Spiel. Ethik beginnt hier als begründete Prüfung: Welche Interessen kollidieren, welches Argument spricht für den schnellen Dienst, welches für eine langsamere Prüfung, und was würde eine Gegenposition ändern? Recht stellt eine andere Frage: Welche konkreten Pflichten und Rechte gelten für den vorgesehenen Vorgang im zuständigen Rechtsraum? Governance ist die organisatorische Antwort darauf, wer entscheiden, prüfen, stoppen und nachbessern darf.

Diese Unterscheidung ist ein Arbeitsvorschlag, keine vollständige philosophische Taxonomie. Eine rechtlich zulässige Handlung kann aus guten Gründen unklug oder unfair sein. Eine wohlmeinende Handlung kann zugleich an einer konkreten rechtlichen Grenze scheitern. Und eine Betriebsanweisung, die „Mensch prüft alles“ schreibt, schafft noch keine wirksame Aufsicht, wenn dieser Mensch weder Zeit noch Informationen noch Eingriffsrecht hat.

Die Wahl des Problems verteilt Vor- und Nachteile

Man könnte einwenden, eine Problemdefinition sei bloß eine Beschreibung des Bestehenden. Im Betrieb ist sie zugleich eine Auswahl. Wer „zu lange Antwortzeiten“ zum einzigen Problem macht, misst wahrscheinlich Minuten. Wer „falsche Auskünfte“ hinzunimmt, muss sich für eine andere Art von Prüfung interessieren. Wer „unzugängliche Beschwerdewege“ aufnimmt, fragt nach den Menschen, die im Standardprozess gerade nicht vorkommen. Keine dieser Beschreibungen ist wertfrei. Jede legt nahe, welche Fälle als Erfolg zählen und welche als unerwünschte Abweichung.

Das ist keine Behauptung, dass es keine objektiven Beobachtungen gebe. Eine Wartezeit lässt sich beobachten. Strittig ist, welche Beobachtung für die Entscheidung maßgeblich sein soll. Ein Mittelwert könnte sich verbessern, obwohl seltene, folgenreiche Fehlleitungen zunehmen. Die Mittelung wäre rechnerisch korrekt und als alleinige Entscheidungshilfe trotzdem unzureichend. Ein Team braucht daher neben einem gewünschten Nutzen eine ausdrücklich benannte Schadensgrenze. Erst so wird eine Zielbeschreibung überprüfbar, ohne moralische Fragen in einer Kennzahl zu verstecken.

Zwei ethische Prüfungen geraten hier in Spannung. Eine folgenorientierte Perspektive fragt, ob die Lösung insgesamt Wartezeit und Fehlwege verringert und mit knappen Ressourcen mehr Menschen erreicht. Eine rechte- und pflichtenorientierte Perspektive fragt, welche Antworten selbst bei gutem Gesamtergebnis nicht ungeprüft nach außen gehen dürfen und wer einen Fehler anfechten kann. Hinzu kommt eine Perspektive gerechter Verteilung: Tragen gerade jene Menschen den neuen Aufwand, die bereits bei Ausnahmen schlecht bedient werden? Diese Linsen geben nicht automatisch dieselbe Antwort. Der Artikel nutzt sie als Fragen an die Entscheidung, nicht als mathematische Abstimmung zwischen philosophischen Schulen.

Für das Unternehmen heißt das: Es reicht nicht, eine Erklärung „wir handeln verantwortungsvoll“ an den Anfang eines Projektdokuments zu stellen. Das Team muss den Zweck so formulieren, dass jemand die Zielwahl bestreiten darf. Warum soll ausgerechnet die schnellste erste Antwort das Erfolgskriterium sein? Würde ein langsamerer, aber richtiger Bearbeitungsweg dem erklärten Anliegen eher entsprechen? Welche Folgen zählen nicht zu den Kennzahlen, müssen aber im Review erscheinen? Bereits diese Einwände können den Auftrag ändern, noch bevor eine Zeile des Prompts geschrieben wird.

Diese Rahmensetzung hat eine wissenschaftliche Parallele: Selbst und Mitautorinnen und Mitautoren (2019) kritisieren in ihrer theoretischen Arbeit zu Fairness in soziotechnischen Systemen den Fehler, einen sozialen Maßstab nur am Modell und seinen Ein-/Ausgaben zu prüfen und die menschlichen und institutionellen Teile auszublenden. Die Übertragung auf unseren Ersatzteilbetrieb ist eine Analogie: Die richtige Klassifikation einer erfundenen Nachricht wäre noch kein Beweis für einen fairen oder hilfreichen Kundenprozess. Der Aufsatz liefert weder eine gemessene Effektgröße noch eine fertige Methode für dieses KMU.

Der Fall enthält empirische Fragen über den Ablauf, normative Fragen über die Verteilung der Fehlerfolgen und institutionelle Fragen über Verantwortung. Das NIST-Framework bezeichnet KI-Systeme als soziotechnisch: Risiken und Nutzen ergeben sich aus Technik und Einsatzkontext, Bedienung und gesellschaftlichen Bedingungen (NIST, S. 1). Die UNESCO-Empfehlung zur Ethik der KI verlangt, die Verantwortung für auf KI gestützte Entscheidungen menschlichen oder organisatorischen Akteuren zuzuordnen (Abs. 35 und 42). Die Empfehlung ist ein internationaler normativer Text. Aus ihr allein folgen weder die im Einzelfall geltenden Pflichten noch ein Beweis, dass unsere Methode wirkt.

„Schneller“ ist noch kein hinreichendes Ziel

Im erfundenen Betrieb lautet die Startfrage: „Wie lassen wir KI alle Kundenanfragen sofort beantworten?“ Sie enthält schon eine Vorentscheidung: Die Antwort soll automatisiert nach außen gehen. Auch „sofort“ klingt eindeutig, verbirgt aber verschiedene Größen. Geht es um die erste Eingangsbestätigung, die Zeit bis zur richtigen Abteilung, die sachliche Lösung oder das Gefühl, ernst genommen zu werden?

Wir benutzen hier eine kleine, ausdrücklich begrenzte Anwendung des vorliegenden Fragenmodells [Fragenerweiterung v5, Original-PDF S. 1–3]. Dessen Reihenfolge lautet A → B → D → C: erst klären, dann konkurrierende Deutungen bilden, Unsicherheit und Fehler bearbeiten, zuletzt eine revidierte Frage formulieren. Der vollständige Modellgang folgt in einem späteren Artikel dieser Reihe. Hier genügt eine einzige nachvollziehbare Änderung.

A – Klären. Das Team trennt drei Ziele: schnellere Zuordnung, weniger falsche Auskünfte und gute Erreichbarkeit für Kunden mit nicht standardisierten Anliegen. Es fragt, welche Arbeit derzeit wirklich Zeit kostet. Mehrfaches „Warum?“ legt als prüfbare Hypothese nahe, dass fehlende Bestellnummern und unklare Zuständigkeiten den Ablauf bremsen. Die Fragetechnik beweist die Ursache nicht; dazu müsste der Betrieb seine Vorgänge beobachten und auswerten.

B – Alternativen. Drei Erklärungen bleiben offen: Vielleicht fehlt hauptsächlich ein guter Statuszugriff. Vielleicht sind die Formulare schlecht. Vielleicht hilft eine Vorordnung unkritischer Nachrichten tatsächlich. Als vierte Option steht eine bessere Eingabemaske ohne KI im Raum. Diese Vergleichsregel ist unsere Ergänzung für den Fall, kein ausdrücklich benannter F-Schritt. Die Entscheidung hängt jetzt nicht mehr an einem beeindruckenden Textbeispiel, sondern an konkurrierenden, testbaren Erklärungen.

D – Fehler und Rückfrage. Es gibt noch keine belastbare Beobachtung, wie oft Nachrichten falsch zugeordnet werden. Ungeklärt sind auch Datenflüsse und die Frage, ob eine Reklamation gesondert behandelt werden muss. Das Team kann die Lücke benennen, statt einen vermeintlichen „Konfidenzwert“ für die beste Lösung auszugeben. Ein solcher Wert aus einem Prompt wäre ohne Kalibrierung und Datenbasis keine Wahrscheinlichkeit.

C – Revidierte Frage. „Kann ein begrenzter Versuch mit erfundenen Nachrichten zeigen, ob eine KI ausschließlich unkritische Anfragen zur internen Prüfung besser vorsortiert als eine verbesserte Maske, ohne Nachrichten selbst zu verschicken?“ Diese Frage ist enger. Sie legt eine Alternative, eine Zuständigkeit, ein beobachtbares Ergebnis und eine Grenze fest. Zum Abschluss verbindet das Modell sie mit einem kompakten GROW-Handlungsplan: Ziel = verlässlichere interne Zuordnung; Realität = Fehlwege und Datenlage noch unbekannt; Optionen = Maske oder begrenzter KI-Test; nächster Schritt = Fachteam legt Vergleichsfälle fest, Leitung benennt Stopprecht und dokumentiert die Auswertung. Sie entscheidet noch nicht, dass der Versuch mit echten Kundendaten zulässig oder sinnvoll ist.

Das NIST-Framework formuliert ausdrücklich, dass verantwortliche Akteure prüfen sollen, ob KI für einen Zweck überhaupt geeignet oder nötig ist (NIST, S. 13). Unser Nicht-KI-Vergleich ist eine redaktionelle Folgerung daraus, kein Nachweis, dass eine Maske in diesem Betrieb schon besser ist.

Was durch die neue Frage tatsächlich anders wird

Die Anfangsfrage verlangt ein System für alle Nachrichten und eine Aktion nach außen. Die revidierte Frage lässt zunächst nur interne Vorsortierung an künstlich erzeugten Fällen zu. Dieser Unterschied ist operativ: Aus einem Versandvorhaben wird ein Lernvorhaben; aus „alle Anfragen“ werden vorab definierte, unkritische Fallklassen; aus „schnell“ wird eine Kombination aus richtiger Zuordnung, Zeit bis zur Bearbeitung und dokumentierten Ausnahmen. Der Vergleichsmaßstab ist eine überarbeitete Eingabemaske. Das Fachteam darf nicht erst nach dem Test entscheiden, welchen Maßstab es für Erfolg halten möchte.

Die Revision schließt auch einen naheliegenden Fehlschluss aus. Wenn ein Sprachmodell mit zehn ausgedachten Beispielen überzeugende Antworten formuliert, hat es weder die Verteilung realer Anliegen noch die Folgen von Fehlleitungen gezeigt. Umgekehrt wäre ein misslungener kurzer Test kein Beweis, dass jedes denkbare KI-Verfahren ungeeignet ist. Der kleine Versuch soll eine eng beschriebene Frage beleuchten. Später müssten andere Daten, Rollen und Eingriffsrechte gesondert geprüft werden. Die Frage ist besser, weil ihre Widerlegbarkeit und ihre Grenzen deutlicher sind, nicht weil das Modell F schon eine richtige Lösung garantiert.

Wer das Fragenmodell im Kurs einsetzt, kann eine zusätzliche Gegenprobe machen: Die Hälfte einer Gruppe erhält die Rolle „Leitung, Ziel Wartezeit“, die andere „Kundenbetreuung, Ziel richtige Ausnahmebehandlung“. Beide bearbeiten dieselbe Anfangsfrage in A, B und D. Erst bei C vergleichen sie ihre neuen Fragen. Die pädagogische Auswertung sucht keine Einheitsformulierung; sie hält fest, welche Annahme jede Gruppe zuerst sah, welche sie überging und welches zusätzliche Material sie für eine Entscheidung bräuchte. Damit wird Fragenerweiterung als Methode des begründeten Widerspruchs erfahrbar und nicht als schöne Formulierungstechnik.

Wer fehlt, wenn nur die Leitung entscheidet?

Der Perspektivwechsel beginnt bei der Frage, wer eine Fehlentscheidung erlebt. Eine Kundin wartet vielleicht länger, weil ihre Nachricht falsch eingeordnet wird. Ein Mitarbeiter muss möglicherweise automatisierte Entwürfe unter Zeitdruck korrigieren. Eine Person mit ungewöhnlichem Anliegen findet sich in den vorgegebenen Kategorien nicht wieder. Und die Leitung trägt Kosten, wenn ein schneller Prozess neue Beschwerden erzeugt.

Das Konsultationsmodell bietet dafür einen weiteren Arbeitsrahmen [Original-PDF S. 7–8; ausführliche Fallszenarien S. 20–33]. Sein methodischer Grundzyklus besteht aus vier Schritten: Exploration, Reflexion und Analyse, Entscheidungsfindung/Handlungsempfehlungen und Feedback/Evaluierung. In späteren Fallabläufen folgen auf die Entwicklung von Empfehlungen eine getrennte Implementierungs-/Pilotphase und eine Abschlussbewertung. Dieser Artikel nutzt nur die erste Bewegung. Im Original ist Exploration vor allem Erkundung und Datenerhebung. Unsere didaktische Betroffenenkarte ergänzt: Wer ist betroffen, welches Problem wird aus welcher Position beschrieben, und wessen Einwand würde die Startfrage verändern? Die vollständige, an K anschließende Governance- und Pilotarbeit gehört zu späteren Artikeln dieser Reihe.

Die Perspektiven lassen sich nicht durch einen einzigen Befragungsbogen ersetzen. Ein Betrieb sollte auch fragen, wer einen Einwand gefahrlos äußern kann. Die Leitung könnte Geschwindigkeit priorisieren; die Kundenbetreuung sieht die Mehrarbeit durch falsch zugeordnete Fälle; Kunden brauchen einen Weg, Fehler zu melden. Ein begrenzter Pilot kann diese Unterschiede sichtbar machen, garantiert aber keine Einigung. Die UNESCO-Empfehlung richtet ihre Aussagen zu ethischen Folgenabschätzungen überwiegend an Staaten und öffentliche Stellen und benennt pluralistische und inklusive Perspektiven (Abs. 50–53). Sie schreibt diesem fiktiven Betrieb keinen bestimmten Befragungsprozess vor; der hier skizzierte Weg ist unser Vorschlag.

Dabei lohnt eine unbequeme Gegenfrage: Kann eine Organisation die Verantwortung auf die Person am Bildschirm abwälzen, obwohl diese die technische und organisatorische Gestaltung kaum beeinflussen konnte? Die Forscherin Madeleine Clare Elish beschreibt in ihrem Originalaufsatz „Moral Crumple Zones“ dieses Risiko bei komplexen automatisierten Systemen. Ihr Argument liefert keine gemessene Fehlerquote für unser KMU-Beispiel. Es stützt die Frage, ob eine bloße Unterschrift unter einem KI-Output in diesem Fall bereits eine gerechte Zuordnung von Verantwortung wäre.

Mitsprache ist ein Eingriff in den Plan

In der Konsultation wäre es leicht, vier Rollen aufzuzählen und danach denselben Pilot unverändert fortzusetzen. Das würde die Form erfüllen und den Sinn verfehlen. Angenommen, die Kundenbetreuung weist darauf hin, dass Reklamationen sprachlich oft wie einfache Statusfragen aussehen, aber eine verbindliche Zusage verlangen können. Dann muss sich die Testgrenze ändern: Ein Reklamationsverdacht geht in eine gesonderte manuelle Klasse; die Vorsortierung darf ihn nicht als Routinefall für eine automatische Antwort behandeln. Würde stattdessen eine betroffene Person berichten, dass die neue Eingabemaske mit ihren Angaben kaum nutzbar ist, wäre die Nicht-KI-Alternative selbst neu zu gestalten. Beide Einwände können die erste Empfehlung kippen. Ohne dokumentierte Änderung ist „Beteiligung“ nur eine Anwesenheitsliste.

Für einen kleinen Betrieb kann eine Konsultation knapp sein: eine Person aus der Bearbeitung, eine fachlich verantwortliche Person und ein bewusst gesuchter Ausnahmefall reichen als Start der Exploration, nicht als repräsentative Anhörung aller Betroffenen. Das Protokoll muss zeigen, welcher Einwand zu welcher Änderung führte und welcher offen blieb. Gibt es keine sichere Möglichkeit, einen Einwand zu äußern oder eine Entscheidung zu revidieren, wird die Beteiligung als Lücke festgehalten. Die Leitung kann eine abweichende Empfehlung begründet verwerfen; sie darf den Dissens nicht aus dem Protokoll löschen.

Ein möglicher Widerspruch muss außerdem einen erreichbaren Adressaten haben. Die UNESCO-Empfehlung verknüpft bei Entscheidungen mit möglichen Folgen für Sicherheit, Rechte oder Freiheiten Transparenz mit der Möglichkeit, diese wirksam zu hinterfragen, zu überprüfen und gegebenenfalls zu korrigieren (Abs. 37–38). Die OECD-Empfehlung zu KI nennt als Orientierung Information für nachteilig Betroffene zur Anfechtung eines Outputs und kontextgerechte Mechanismen zum Übersteuern, Reparieren oder Stilllegen (§§ 1.3–1.4). Für diesen Artikel folgt daraus als eigene Gestaltungsfrage: An wen könnte sich eine Person bei einer Fehlleitung wenden, und wer dürfte die Ursache tatsächlich beheben? Beide Empfehlungen begründen hier kein automatisch anwendbares Beschwerderecht für den fiktiven Betrieb; ein solches müsste für den konkreten Rechtsraum gesondert geprüft werden.

Hier wird die Grenze zwischen den drei Modellen sichtbar. F verändert die Frage. Die K-informierte Betroffenenkarte prüft Perspektiven und kann dadurch die Versuchsgrenze ändern; organisatorische Governance schließt daran an. Das gesonderte Beratungsmodell R würde bei einem konkreten produktiven Datenfluss den Fachprüfpfad strukturieren. Aus keinem der drei Modelle folgt allein eine Freigabe. Gerade die Übergabe ist lehrreich: Wer von F unmittelbar zum Test mit echten Nachrichten springt, überspringt die Perspektiven und Fachfragen, die durch die neue Frage erst sichtbar werden.

Vier verbundene Karten auf hellem Grund: ein Ring mit Mittelpunkt, drei Personen, ein Netzwerk neben Schiebereglern und eine Person neben einem Pausenschalter
Frage, Betroffene, System und Stopprecht — vier Karten, die erst verbunden eine Entscheidung tragen
Bild mit KI erzeugt

Ein ernstes Gegenargument: Zu viel Klärung kostet auch etwas

Ein kleines Team kann nicht jede interne Arbeit wie eine öffentliche Folgenabschätzung behandeln. Wenn jeder Test durch einen langen Ausschuss muss, bleiben nützliche Verbesserungen liegen. Gerade in einem Betrieb mit knappen Mitteln kann der schnellere Service selbst ein ethisch relevantes Gut sein: weniger Wartezeit, weniger repetitive Arbeit, mehr Zeit für schwierige Fälle.

Das Gegenargument trägt. Es rechtfertigt einen proportionalen Ablauf: zuerst eine enge Frage, ein kurzer Vergleich mit dem bestehenden Prozess, ein klar begrenzter Test ohne Außenwirkung und ein Stoppsignal bei unerwarteten Schäden. Es rechtfertigt nicht die Annahme, dass ein hübscher Demo-Output bereits den Betrieb, die betroffenen Menschen oder die Zuständigkeiten verstanden hat. Das NIST-Framework koppelt Risikomanagement an Kontext und Risikotoleranz (u. a. MAP 1 und GOVERN 1). Daraus folgern wir: Die Größe einer Firma allein ersetzt diese Kontextprüfung nicht.

Verhältnismäßigkeit braucht eine Grenze, nicht nur Tempo

Eine aufwändige Untersuchung ist nicht immer der beste erste Schritt. Im Beispiel genügt zunächst ein kleines Klärungsgespräch, das die betroffenen Fallklassen und das Stopprecht festhält. Danach kann das Team erfundene Nachrichten erstellen und zwei Abläufe vergleichen. Diese Proportion gilt nur, weil kein realer Kunde adressiert und keine echte Nachricht verarbeitet wird. Der Wechsel zu produktiven Daten oder Außenkommunikation ist eine neue Entscheidung. Das gilt auch dann, wenn die technische Vorordnung im Übungsfall gelungen ist.

Eine faire Prüfung erfasst Aufwand auf beiden Seiten: Wie viel Zeit kostet das Formulieren der Frage und das Dokumentieren der Ausnahmen? Wie viel Nacharbeit erzeugt eine Fehlleitung? Eine Leitung könnte zu Recht sagen, dass ein ausgefeilter Entscheidungsapparat einen kleinen internen Test unwirtschaftlich macht. Eine Mitarbeiterin könnte ebenso zu Recht einwenden, dass die Einsparung bei der ersten Antwort durch zusätzliche Korrekturarbeit erkauft wird. Beides sind zu prüfende Möglichkeiten, keine hier erhobenen Tatsachen. Schon ein einfacher Protokollbogen kann beide Arten von Aufwand sichtbar machen.

Praktisch lassen sich drei Entscheidungsschwellen unterscheiden. Schwelle 1: Ist die Problemdefinition hinreichend klar, um mit künstlichen Fällen zu lernen? Schwelle 2: Sind für einen echten Pilot Zwecke, Rollen, Datenflüsse, Betroffenenwege und Vergleichsmaßstab erhoben, und wurden fehlende Fakten sowie notwendige Fachprüfungen als Auftrag für R Phase 1 dokumentiert? Schwelle 3: Rechtfertigen tatsächliche Beobachtungen eine begrenzte Außenwirkung oder einen breiteren Betrieb? Das erste Ja ersetzt die beiden späteren Ja nicht. Wer diese Schwellen im Projektprotokoll getrennt führt, erkennt leichter, wo ein Demo-Erfolg unbemerkt zur Produktfreigabe umgedeutet wird.

Eine Entscheidungskarte statt einer Wertewand

Für den fiktiven Betrieb lässt sich die erste Besprechung auf einer Seite dokumentieren:

FeldAusgefüllte Arbeitsfassung für den erfundenen Fall
EntscheidungDürfen Nachrichten intern vorsortiert werden? Automatisches Versenden bleibt außerhalb des Tests.
Zweck und MaßRichtige Zuordnung, Wartezeit bis zur zuständigen Bearbeitung und nachvollziehbare Fehlwege; vorab mit dem bisherigen Prozess vergleichen. Keine behauptete Verbesserung ohne Messung.
GROW-ÜbergabeG: verlässlichere interne Zuordnung; R: Baseline und Fehlerwege offen; O: Maske oder begrenzter KI-Test; W: Fachteam bereitet erfundene Vergleichsfälle vor, Leitung benennt Stopprecht und dokumentiert das Ergebnis.
BetroffeneKunden mit Standard- und Ausnahmefällen, Kundenbetreuung, Fachteam und Leitung; ein erreichbarer Kanal für Rückmeldungen.
AlternativeBessere Eingabemaske und klarere Zuständigkeitsregeln ohne Sprachmodell.
Material und GrenzeZuerst ausschließlich neu erfundene Testnachrichten; keine realen Kundendaten, keine externe Nachricht.
VerantwortlicheLeitung entscheidet über den begrenzten Test; Fachteam bewertet Zuordnungen; Kundenbetreuung dokumentiert Ausnahmefälle; eine benannte Person darf stoppen.
StoppsignalEine Nachricht verlässt unerlaubt den Test, eine reale Nachricht gerät hinein oder ein folgenreicher Ausnahmefall wird als Routine ausgegeben: Test pausieren, Vorfall prüfen.
OffenBaseline, Vertrags- und Datenschutzfragen vor einem etwaigen Test mit echten Daten, Beteiligung betroffener Personen, Freigabe für einen späteren Piloten.

Das ist kein durchgeführter Pilot. Die Karte trennt einen ersten Lernversuch von einer produktiven Entscheidung. Sobald reale Daten, ein Dienstleister oder tatsächliche Kundenkommunikation ernsthaft erwogen werden, beginnt im gesonderten 5-Phasen-Beratungsmodell die erste Phase: Vorbereitung/Anamnese des Sachverhalts [Original-PDF S. 1–3, 20]. Dort erhebt das Team gerade erst Rollen, Datenflüsse, Verträge, Rechtsraum und Zeitpunkt; Fehlendes wird als Prüfauftrag dokumentiert. Erst darauf können Analyse, Lösungsentwicklung, Umsetzung/Dokumentation und Evaluation/Nachbereitung folgen. Das Modell liefert hier keine pauschale Rechtsauskunft; für die konkrete Fachbewertung müssen geeignete Fachpersonen hinzugezogen werden.

Aus der Karte wird ein überprüfbarer Mini-Versuch

Eine ausfüllbare Karte hilft erst, wenn sie Entscheidungen gegen spätere Schönfärbung schützt. Für eine Lehrübung kann das Team vor dem Test zwölf vollständig erfundene Nachrichten in drei Klassen entwerfen: vier eindeutige Statusfragen, vier unvollständige Anfragen und vier Fälle mit einem plausiblen Reklamations- oder Ausnahmehinweis. Die Zahlen beschreiben nur den Übungsaufbau, keine reale Fallverteilung. Vorab legen die Beteiligten für jede Nachricht fest, welche Fachklasse und welche Behandlung ein verantwortlicher Mensch erwarten würde. Uneinigkeit über die Sollbehandlung wird als offener Streitfall festgehalten, nicht nachträglich zugunsten eines Systems aufgelöst.

Danach erhalten zwei Teams denselben Fallbestand. Team A bearbeitet ihn mit der verbesserten Eingabemaske und klaren Zuständigkeitsregeln. Team B erhält eine ausschließlich interne KI-Vorsortierung, deren Vorschläge zunächst nicht verschickt und vor jeder Verwendung geprüft werden. Für jede Nachricht werden vorgeschlagene Klasse, menschliche Korrektur, Zeitaufwand und Grund einer Eskalation dokumentiert. Die Reihenfolge kann zwischen den Teams wechseln, um einen offensichtlichen Lerneffekt durch dieselben Fälle sichtbar zu machen. Ein gemeinsames Auswertungsgespräch betrachtet richtige Zuordnungen und übersehene Ausnahmefälle; eine reine Erfolgsquote wäre für das Stoppsignal zu grob.

Vor dem ersten Durchlauf bestimmt das Team, welche Fehler den Versuch unterbrechen. Eine Reklamation als einfache Statusfrage zu behandeln, obwohl ihr Text eine Entscheidung oder Zusage verlangt, ist im Übungsdesign ein ernsthafter Grenzfall. Ein versehentlicher Versand oder ein echter Datensatz löst unmittelbar die Pause aus. Ein einzelner Übungsfehler wäre dagegen nicht automatisch der Beweis gegen alle Formen von KI; er löst zunächst eine Ursachenprüfung aus: War die Klasse unklar, die Anleitung irreführend, der Fall ungeeignet oder das System tatsächlich unzuverlässig? Für jede dieser Erklärungen wäre eine andere Revision nötig.

Die Versuchsanordnung beweist wenig über den Alltag. Zwölf erfundene Nachrichten bilden keine reale Kundenpopulation ab, und bearbeitende Menschen kennen die Übung. Gerade diese Beschränkung schützt vor einer falschen Freigabe. Der Lerngewinn besteht darin, die spätere Prüfentscheidung präzise zu formulieren: Welche zusätzlichen Fälle wären nötig, wie würden Ausnahmen erfasst, wer dürfte echte Daten überhaupt einbringen, und welche Fachprüfung ist vor diesem Schritt noch offen? Ergibt sich kein klarer Vorteil gegenüber der Maske, bleibt die Nicht-KI-Lösung ernsthaft im Rennen.

Ein Unterrichtsblock mit sichtbarer Revision

Für einen Kurs kann eine 90-minütige Einheit so verlaufen: Zunächst schreiben die Lernenden fünf Minuten lang ihre spontane Prompt-Idee und markieren die darin schon getroffene Einsatzentscheidung. Danach bearbeiten Zweiergruppen F-A/B/D mit einer konkurrierenden Hypothese und einer offenen Widerlegungsmöglichkeit. Eine zweite Gruppe übernimmt für die K-informierte Betroffenenkarte eine übersehene Perspektive und versucht, die Testgrenze zu ändern. Erst darauf formuliert die erste Gruppe F-C/GROW als revidierte Frage und nächsten Schritt. Im Plenum wird nicht die eleganteste Formulierung ausgezeichnet, sondern die nachweisbar geänderte Entscheidung. Zum Schluss füllen die Gruppen die Karte aus und formulieren einen Satz, den sie einem skeptischen KMU-Team sachlich erklären könnten.

Als Prüfpunkt dient ein bewusst unangenehmer Fall: Die Vorsortierung beschleunigt die eindeutigen Statusfragen, weist aber einen ungewöhnlich formulierten Reklamationsfall falsch zu. Eine Gruppe muss die vorab festgelegte Stop-Regel anwenden; die andere muss die stärkste faire Begründung für einen weiteren, engeren Versuch formulieren. Beide sollen benennen, welche Aussage aus den künstlichen Fällen zulässig ist und welche gerade nicht. Eine gute Abgabe kann zum Ergebnis „derzeit keine KI“ kommen. Ebenso kann sie einen neuen, klar begrenzten Lernversuch vorschlagen, sofern Daten, Zuständigkeit, Vergleich und Revisionsmöglichkeit beschrieben sind.

Was am Ende wirklich entschieden wurde

Drei Arten von Aussage, drei Arten von Prüfung

Der kleine Versuch trennt Aussagen, die in KI-Projekten leicht vermischt werden. Empirisch ist die Frage, ob in einem festgelegten Fallbestand eine Variante häufiger richtig zuordnet und welche Nacharbeit entsteht. Dazu braucht es definierte Fälle, Beobachtungen und Vergleichsregeln. Normativ ist die Frage, ob ein Gewinn bei eindeutigen Fällen einen möglichen Nachteil für Menschen mit seltenen Anliegen rechtfertigen kann. Dazu braucht es Gründe, Betroffenenperspektiven und eine benannte Grenze; die Messung allein entscheidet den Wertkonflikt nicht. Institutionell ist die Frage, wer den Versuch genehmigt, wer widersprechen kann, wer bei einem Fehler handelt und ob die verantwortliche Person auch tatsächlich Zugriff, Zeit und Befugnis besitzt. Dazu braucht es Rollen und überprüfbare Eingriffswege.

Diese Trennung verhindert zwei spiegelbildliche Kurzschlüsse. Wer einen kleinen Zeitgewinn misst, hat noch keine ethische Rechtfertigung bewiesen. Wer einen Wert wie Fairness überzeugend verteidigt, kennt deshalb noch nicht die Häufigkeit eines Fehlers. Und selbst eine Einigung über Ziele garantiert nicht, dass im Betrieb jemand die notwendigen Rechte zur Korrektur erhält. Ein sorgfältiges Team lässt die drei Fragen nebeneinander stehen und verbindet sie erst in einer begründeten Entscheidung.

Ein solches Vorgehen ist auch für die spätere Agentik wichtig. Ein Agent könnte die Fallklasse vorschlagen, die Karte ausfüllen oder fehlende Angaben anfordern. Er sollte aber keine fehlende Baseline erfinden, einen offenen Wertkonflikt als „gelöst“ markieren oder aus einem Rollenfeld eine reale Freigabe ableiten. Für einen späteren Workflow wäre deshalb ein zulässiger Output etwa: „Sachverhalt unvollständig; diese Beobachtung und diese Fachfreigabe fehlen; nächster menschlicher Prüfschritt.“ Diese Form der Zurückhaltung ist ein brauchbares Ergebnis, wenn ein vermeintlich fertiger Output die Grenzen des Tests verwischen würde.

Auch eine Entscheidung gegen KI braucht Dokumentation. Wenn die neue Maske und klare Zuständigkeiten im Lernversuch ausreichen, kann die Leitung den Sprachmodell-Pfad begründet aussetzen. Wenn beide Varianten Schwächen zeigen, ist die nächste Handlung vielleicht eine andere Frage: Warum werden Ausnahmen erst so spät sichtbar? Der ursprüngliche Prompt-Wunsch hat dann immerhin ein Organisationsproblem aufgedeckt. Das Ergebnis des Ethikprozesses ist kein Pflichtfeld „KI ja/nein“, sondern eine belastbarere Beschreibung dessen, was als Nächstes verantwortbar geprüft werden darf.

Nach diesem ersten Durchgang hat das fiktive Team keine KI eingeführt. Es hat einen engeren Prüfgegenstand geschaffen: interne Vorsortierung mit künstlich erstelltem Material, verglichen mit einer Nicht-KI-Alternative; Außenkommunikation und echte Kundendaten bleiben vorerst ausgeschlossen. So ist klarer, welche Beobachtung eine spätere Entscheidung stützen oder widerlegen könnte.

Die in diesem Artikel entwickelte These lautet: Ethik beginnt vor dem Prompt, weil schon die Problemdefinition festlegt, was als Erfolg zählt, wessen Aufwand sichtbar wird und welcher Irrtum hinnehmbar erscheint. Ein guter Prompt kann eine sorgfältig gewählte Aufgabe unterstützen. Die Aufgabe selbst braucht Gründe, Gegenargumente, Betroffenenperspektiven und einen Weg zurück, wenn sich eine Annahme als falsch erweist.

Zum Weiterarbeiten

Die ausgefüllte und leere Entscheidungskarte vertieft den Fall für KMU und Unterricht. Ein späterer Artikel dieser Reihe untersucht die tatsächliche Verantwortung bei KI-gestützter Vorarbeit; ein weiterer führt das Fragenmodell vollständig vor; ein weiterer behandelt das Konsultationsmodell einschließlich Governance; ein weiterer gestaltet den begrenzten Pilot. Diese Vertiefungen sind als weitere Artikel geplant.

Quellen und Geltungsgrenzen

NIST (2023), Artificial Intelligence Risk Management Framework (AI RMF 1.0), besonders S. 1–2, 13 und 21–25. Freiwilliges Rahmenwerk; die Entscheidungskarte ist eine eigene didaktische Ableitung.

UNESCO (2021), Recommendation on the Ethics of Artificial Intelligence, besonders Abs. 35, 42 und 50–53. Internationale Empfehlung, keine fallbezogene Rechtsprüfung.

Madeleine Clare Elish (2019), „Moral Crumple Zones: Cautionary Tales in Human-Robot Interaction“, Engaging Science, Technology, and Society 5, DOI: 10.17351/ests2019.260. Begriffliche und fallanalytische Kritik; kein Wirksamkeitsbeleg für dieses Unterrichtsbeispiel.

Andrew D. Selbst et al. (2019), „Fairness and Abstraction in Sociotechnical Systems“, FAT ’19, DOI: 10.1145/3287560.3287598, besonders Abschnitt 2.1. Konzeptionelle Kritik an zu enger Systemabgrenzung; ihre Fallwelt ist nicht unser KMU.

UNESCO (2021), Abs. 37–38, und OECD (2019, geändert 2024), Recommendation of the Council on Artificial Intelligence, §§ 1.3–1.4. Normative Orientierung zu Anfechtung und Korrektur; keine pauschale Betriebsrechtsauskunft.

Drei vom Autor bereitgestellte deutsche Methoden-PDFs: Fragenerweiterung v5 (A/B/D/C, S. 1–3); Konsultationsmodell (methodischer Viererschritt, S. 7–8; Szenarien, S. 20–33); 5-Phasen-Beratungsmodell (S. 1–3). Sie belegen die Form der Modelle, nicht deren empirische Wirksamkeit oder die Rechtslage.

HTMLThemenübersicht: KI-Ethik beginnt vor dem ersten Prompt1 Seite↓DOCXArbeitsblatt: Eine Entscheidung vor dem ersten Prompt1 Seite↓

0 Kommentare

● Kommentare werden geladen…

Zum Kommentieren anmelden · Mitglied werden →