Welche Evidenz verdient einen Entschluss?
Empirie, Werte, Organisationsziel und Risikotoleranz auseinanderhalten – und begründet verbinden

Leitfrage: Wann trägt die verfügbare Evidenz eine organisatorische Entscheidung – und welche Gründe müssen zusätzlich offengelegt werden?
Der Moment, in dem „mehr Evidenz“ keine vollständige Antwort ist
Ein kleines, vollständig fiktives Weiterbildungsunternehmen überlegt, allgemeine Kursanfragen mit einem Sprachmodell vorsortieren zu lassen. Die Absicht klingt vernünftig: Routine soll weniger Zeit beanspruchen, damit das Team mehr Zeit für Beratung hat. In einer Besprechung fallen drei Sätze: „Das Modell wirkt in unseren Beispielen erstaunlich treffsicher.“ „Wir wollen keine Interessierten übersehen, die anders formulieren.“ „Wenn wir nicht schneller werden, verlieren wir Anfragen.“ Jeder Satz verweist auf etwas Relevantes. Keiner beantwortet für sich die Frage, ob die Organisation das System einsetzen soll.
„Treffsicher“ ist zunächst eine Behauptung über beobachtete Ausgaben. Sie benötigt eine definierte Aufgabe, Vergleichsmaßstäbe, Daten und eine begrenzte Aussage darüber, für welche Fälle der Befund gilt. „Niemanden übersehen“ ist eine normative Verpflichtung: Sie sagt, welche Art von Fehlern und welche betroffenen Gruppen besonderes Gewicht erhalten sollen. „Schneller werden“ ist ein Organisationsziel. Es kann sinnvoll sein, begründet werden und mit anderen Zielen in Konflikt geraten. Und ob eine verbleibende Fehlergefahr tragbar ist, ist eine Frage der Risikotoleranz, die zu Einsatz, Folgen und Korrekturmöglichkeiten passen muss.
Die Schwierigkeit beginnt, wenn diese Register unbemerkt ineinanderrutschen. Ein positiver Test wird dann als moralische Rechtfertigung behandelt; ein wirtschaftliches Ziel wird zur vermeintlichen Messung umgedeutet; ein besonders vorsichtiger Wertmaßstab gilt als „schlechte Datenqualität“; oder ein gutes Durchschnittsergebnis soll jede Einzelfolge entschuldigen. Das alles kann passieren, ohne dass jemand absichtlich täuscht. Gerade deshalb braucht eine gute Entscheidung eine sichtbare Begründungsstruktur.
Die Leitthese dieses Artikels lautet: Empirische Evidenz kann Tatsachenbehauptungen stützen und Handlungsmöglichkeiten begrenzen. Sie legt aber nicht allein fest, welche Folgen zählen, welchem Ziel Ressourcen dienen oder welches Folgenrisiko eine Organisation angesichts ausgewiesener Unsicherheit tragen darf. Ein vertretbarer KI-Entschluss macht diese verschiedenen Gründe sichtbar, prüft ihre Beziehungen und benennt die Person oder Rolle, die für die Entscheidung einsteht.
Das hier vorgestellte Vier-Register-Blatt ist ein didaktisches und redaktionelles Werkzeug. Es ist weder eine statistische Skala noch ein validiertes Governance-Verfahren und ersetzt keine fachliche Prüfung. Sein Zweck ist bescheidener: Es soll verhindern, dass eine einzelne Kennzahl oder eine überzeugende Formulierung die ganze Entscheidung zu tragen scheint.
Vier Register, vier verschiedene Aufgaben
Eine Entscheidung unter Unsicherheit wird klarer, wenn vier Fragen getrennt beantwortet werden. Sie dürfen in der Schlussfolgerung zusammengeführt werden; die Begründungen sollten dabei erkennbar bleiben.
| Register | Frage | Begründet | Begründet nicht |
|---|---|---|---|
| Empirische Evidenz | Was zeigen Quellen, Beobachtungen oder Tests – unter welchen Bedingungen? | Stärke, Reichweite und Grenzen einer Tatsachenbehauptung | Welche Schäden moralisch zählen oder welches Risiko akzeptabel ist |
| Normative Gründe | Welche Rechte, Interessen, Pflichten, Verteilungen und Schäden müssen berücksichtigt werden? | Warum bestimmte Folgen für Betroffene wichtig sind und welche Schranken gelten | Dass eine Tatsachenbehauptung wahr ist |
| Organisationsziel | Welches Problem will die Organisation lösen, und wie wird dieses Ziel begründet? | Warum eine Option Aufmerksamkeit und Ressourcen verdient | Eine Ausnahme von Rechten, Schutzpflichten oder geltenden Regeln |
| Risikotoleranz | Welches verbleibende Folgenrisiko darf die Organisation in diesem konkreten Einsatz und unter der ausgewiesenen Unsicherheit tragen? | Eine anwendungsbezogene Grenze für Handeln, Erproben oder Stoppen | Die Qualität oder den Wahrheitsgehalt der zugrunde liegenden Evidenz |
1. Evidenz braucht einen Geltungsbereich
„Wir haben es getestet“ ist noch kein ausreichender Befund. Zu einer prüfbaren Aussage gehören mindestens: Was wurde getestet? An welchen Fällen? Gegen welche Referenz? Mit welcher Version und welchem Verfahren? Welche Fälle fehlten? Welche Fehlerarten wurden sichtbar, welche möglicherweise nicht? Ein Befund kann für eine eng begrenzte Aufgabe nützlich sein, ohne eine allgemeine Eigenschaft „des Modells“ zu belegen.
Evidenz hat also nicht einfach die Form „ja“ oder „nein“. Sie kann eine Behauptung stärker oder schwächer stützen, bestimmte Anwendungen ausschließen und weitere Fragen eröffnen. Die Unsicherheit sollte nicht mit einem künstlichen Zahlenwert versehen werden, wenn Daten und Verfahren eine solche Zahl nicht tragen. „Unbekannt“ ist eine Information über den Stand der Prüfung, kein Platzhalter, der automatisch mit einer optimistischen Annahme gefüllt werden darf.
Dabei sind zwei Schwellen zu unterscheiden. Die epistemische Schwelle fragt, welche Aussage der Befund rechtfertigt: etwa, ob eine Behauptung gut gestützt, nur vorläufig plausibel oder weiterhin offen ist. Die Handlungsschwelle fragt, welche Option angesichts möglicher Folgen, Schutzpflichten und Korrekturmöglichkeiten verantwortbar ist. Ein Team kann für eine folgenarme, umkehrbare Übung mit begrenzter Evidenz weiterlernen und dieselbe Evidenz für eine reale automatisierte Sortierung für unzureichend halten. Umgekehrt kann ein klarer Befund gegen den Einsatz sprechen, ohne dass die Organisation jede Unsicherheit vollständig auflösen muss. Die Schwellen sind verwandt, aber sie beantworten unterschiedliche Fragen.
Diese Trennung verhindert eine verbreitete Scheingenauigkeit: Ein Test kann einen Befund über eine eng definierte Aufgabe liefern. Er bestimmt nicht automatisch, ob dessen Reichweite für die geplante Entscheidung genügt. Für jede Schlussfolgerung sollte deshalb feststehen, ob sie eine Beschreibung („in diesen Fällen trat X auf“), eine Vorhersage („unter diesen Bedingungen erwarten wir Y“) oder eine Empfehlung („wir sollten Option Z wählen“) ist. Wer von einem Satztyp zum anderen wechselt, muss die zusätzlichen Annahmen benennen.
2. Normative Gründe benennen Betroffene und Folgen
Ein Fehler ist nicht nur eine Abweichung in einer Tabelle. Er trifft Menschen, Teams, Prozesse oder öffentliche Güter auf unterschiedliche Weise. Eine falsche Sortierung kann bloß eine kleine Umleitung bedeuten; sie kann aber auch dazu führen, dass eine dringliche oder sprachlich ungewöhnliche Anfrage später gesehen wird. Diese Folgen müssen nicht alle gleich schwer wiegen. Wer sie bewertet, sollte benennen, welche Interessen und Schutzpflichten den Ausschlag geben und wessen Perspektive bislang fehlt.
Werte sind dabei keine dekorative Liste am Ende eines Projektplans. Sie können festlegen, welche Fehlerarten vor einer Entscheidung besonders genau betrachtet werden müssen und welche Nebenfolgen nicht als bloße Kostenstelle verschwinden dürfen. UNESCO beschreibt in seiner Empfehlung zu KI-Ethik unter anderem Menschenwürde und Menschenrechte, Inklusion, Verhältnismäßigkeit, Beteiligung, Verantwortung und menschliche Aufsicht als normative Bezugspunkte. Die Empfehlung ist ein globaler standardsetzender, rechtlich nicht verbindlicher Rahmen. Sie gibt keine automatische Einzelfallentscheidung vor und belegt weder die Wirkung noch die Zulässigkeit eines bestimmten Systems.
3. Ein Organisationsziel ist kein Beweis
Eine Organisation darf Ziele setzen: etwa Zugänglichkeit, Verlässlichkeit, Lernqualität oder eine tragfähige Arbeitslast. Diese Ziele müssen in der konkreten Lage miteinander abgewogen werden. Effizienz kann wichtig sein, aber sie sagt noch nicht, ob gerade KI die richtige Lösung ist. Die Ursache eines Engpasses könnte ebenso in unklaren Zuständigkeiten, uneinheitlichen Vorlagen oder fehlender Zeitplanung liegen.
Darum steht vor dem Werkzeug die Problemformulierung: Was soll sich für wen verbessern? Welche Nicht-KI-Option könnte dieselbe Verbesserung erreichen? Ein Ziel macht eine Investition verständlich. Es verwandelt keinen ungetesteten Nutzen in eine empirische Tatsache.
4. Risikotoleranz muss zum Einsatz passen
Risikotoleranz bezeichnet nicht die Qualität der Evidenz und auch nicht eine frei wählbare Genehmigungszahl. Sie bezeichnet die begründete Grenze, bis zu der eine Organisation in einem bestimmten Anwendungsfall Folgenrisiken zur Zielerreichung tragen darf. Wie groß diese Risiken sind, hängt unter anderem von der ausgewiesenen Evidenzunsicherheit ab. Relevante Fragen sind: Wie schwer wäre ein möglicher Schaden? Wie viele Personen wären betroffen? Ist der Schritt umkehrbar? Kann ein Mensch rechtzeitig eingreifen? Gibt es einen wirksamen Beschwerde- oder Korrekturweg? Welche Regeln und Rechte begrenzen den Spielraum unabhängig vom Geschäftsinteresse?
Der NIST AI Risk Management Framework 1.0 (2023) ordnet Risikotoleranz als kontext- und anwendungsabhängig ein und schreibt Organisationen keine allgemeingültige Schwelle vor. AI RMF 1.0 ist ein freiwilliger, nicht sektorspezifischer Managementrahmen; er ersetzt weder anwendbare Rechtsnormen noch die Begründung der jeweiligen Wert- und Schadensabwägung. NIST weist aktuell darauf hin, dass AI RMF 1.0 überarbeitet wird. Für diesen Artikel ist es daher die veröffentlichte Fassung von 2023, nicht eine vermeintlich fertige Neufassung von 2026.
Eine praktische Folge: Für eine niedrig folgenreiche, vollständig rücknehmbare Erkundung kann eine andere Evidenz genügen als für eine automatisierte Außenwirkung, eine Auswahlentscheidung oder einen Prozess, der Rechte und Chancen beeinflusst. Mehr Unsicherheit ist nicht automatisch unvertretbar; sie verlangt jedoch eine engere Handlung, klarere Schutzvorkehrungen oder einen Aufschub. Manchmal ist die verantwortliche Entscheidung gerade, vorerst nicht zu entscheiden.

Eine philosophische Spannung: Werte in der Wissenschaft oder Werte erst in der Handlung?
Die Frage, ob und wo Werte in wissenschaftliche Urteile eingehen, ist philosophisch umstritten. Richard Rudner argumentiert, dass beim Annehmen oder Zurückweisen empirischer Hypothesen Folgen möglicher Irrtümer eine Rolle spielen: Die Schwelle „genug Evidenz“ setzt mitunter voraus, welche Fehler wie schwer wiegen. Heather Douglas entwickelt das Argument des induktiven Risikos weiter. Nicht-epistemische Werte können danach indirekt begründen, wie streng Methoden gewählt, Daten charakterisiert und Befunde interpretiert werden müssen, wenn die Folgen möglicher Irrtümer berücksichtigt werden. Sie ersetzen keine Beobachtung und dürfen einen erwünschten Befund nicht an die Stelle eines belegten setzen.
Eine starke Gegenposition verteidigt eine schärfere Trennung. Richard Jeffrey schlägt vor, die Annahme oder Verwerfung einer Hypothese nicht als eigenen wissenschaftlichen Akt zu behandeln: Evidenz verändert Glaubensgrade; Handlungsentscheidungen berücksichtigen zusätzlich Folgen und Präferenzen. Das ist eine starke Trennungsposition. So kann eine Organisation zugleich sagen: „Wir wissen noch nicht, ob die Behauptung ausreichend gestützt ist“ und „Selbst wenn sie wahrscheinlich stimmt, ist die geplante Anwendung wegen ihrer Folgen nicht vertretbar.“
Daniel Steel vertritt keine einfache Jeffrey-Position. Er verteidigt die Unterscheidung epistemischer und nicht-epistemischer Werte gerade als Grundlage, um legitime und illegitime Einflüsse nicht-epistemischer Werte im Umgang mit induktivem Risiko zu unterscheiden. Die Gegenüberstellung macht die philosophische Spannung präziser: Einerseits die Frage, ob Folgen die Evidenzschwelle mitbestimmen dürfen; andererseits der Versuch, epistemische Bewertung und praktische Entscheidung stärker zu trennen.
Dieser Gegensatz lässt sich nicht durch ein Modellformular auflösen. Er schärft vielmehr zwei unterschiedliche Ebenen:
1. Evidenzebene: Welche Aussage folgt aus den Daten und Methoden – und welche nicht?
2. Handlungsebene: Welche Option ist angesichts möglicher Folgen, Pflichten und Ziele vertretbar?
Das Vier-Register-Blatt entscheidet nicht, welche philosophische Position endgültig richtig ist. Es nimmt die Gegenposition ernst, indem es Evidenzqualität und normative Handlungsschwelle getrennt dokumentiert. Die Frage nach Folgen darf transparent machen, warum eine Organisation mehr oder weniger Absicherung verlangt. Sie darf nicht nachträglich den Inhalt eines Messergebnisses ändern. So wird der Wertkonflikt sichtbar, ohne jede Tatsachenfrage zur bloßen Meinung zu erklären.
Warum eine Gesamtnote oft die falsche Abkürzung ist
Es liegt nahe, Evidenzstärke, Nutzen, Risiko und Aufwand in eine gemeinsame Punktzahl zu übersetzen. Ein einzelner Wert verspricht Vergleichbarkeit und eine schnelle Rangfolge. Doch wenn Kriterien und Gewichtungen nicht sachlich begründet, vorab festgelegt und für Betroffene nachvollziehbar sind, verschiebt die Punktzahl den Konflikt lediglich in eine Formel. Ein gravierender Einwand kann dabei durch mehrere kleine Pluspunkte rechnerisch verschwinden.
Eine Übersicht kann Optionen nebeneinanderstellen, aber nicht jede Entscheidung muss auf eine Rangliste hinauslaufen. Besonders bei unvollständigen oder nicht vergleichbaren Daten sind Ausschlussbedingungen oft hilfreicher: keine Nutzung ohne geklärten Zweck; keine Außenwirkung ohne menschliche Prüfung; kein realer Datensatz, solange Datenfluss und Zuständigkeit nicht geklärt sind; Stopp, wenn ein definierter Fehlerfall auftritt oder die Aufsicht nicht mehr funktioniert. Diese Bedingungen brauchen ebenfalls Begründung. Sie machen jedoch sichtbar, welche Schranke nicht gegen einen Effizienzgewinn verrechnet werden soll.
Auch ein qualitativer Begriff wie „niedriges Risiko“ genügt nicht allein. Die Organisation muss erklären, wessen Risiko gemeint ist, wer die Folgen trägt und wer die Entscheidung anfechten kann. Bei Uneinigkeit gehört der Dissens in das Protokoll, statt in einem Mittelwert zu verschwinden.
Durchgearbeitetes Beispiel: eine fiktive Weiterbildungseinrichtung
Ausgangslage
Ein kleines Weiterbildungsteam bearbeitet allgemeine Anfragen zu Kursinhalten, Terminen, Teilnahmevoraussetzungen und organisatorischen Abläufen. Die bestehende Sortierung ist uneinheitlich. Ein Sprachmodell wird als mögliche Hilfe diskutiert. Das Team hat keine repräsentative lokale Auswertung, keine festgelegte Referenzklassifikation und keinen Nachweis dafür, dass die Nutzung die Bearbeitungszeit verkürzt oder die Qualität verbessert. In einer kurzen Unterrichtssimulation wirken einige künstlich erzeugte Beispiele plausibel. Diese Demonstration ist kein Test der Produktleistung: Sie enthält keine repräsentative reale Verteilung, keine systematische Fehlerauswertung und keine belastbare Baseline.
Vier Register ausfüllen
Empirische Evidenz. Derzeit belegt ist nur, dass eine begrenzte Tischübung mit synthetischen Anfragen durchgespielt werden kann. Sie erlaubt Fragen über Rollen, Sortierregeln und mögliche Übergaben. Sie belegt nicht, wie ein bestimmtes Modell reale Anfragen einordnen würde, wie häufig Fehler aufträten oder ob Zeit gespart würde. Die Behauptung „KI verbessert unseren Prozess“ bleibt offen.
Normative Gründe. Niemand soll wegen ungewöhnlicher Formulierung, fehlender Fachbegriffe oder eines Sprachmusters systematisch später Hilfe erhalten. Anfragen mit Auswirkungen auf Teilnahme oder Zugänglichkeit dürfen nicht stillschweigend als „Routine“ verschwinden. Beschäftigte brauchen eine verständliche Eingriffsmöglichkeit. Die Betroffenen und möglichen Fehlerfolgen sind genauer zu untersuchen, bevor der Schritt über eine Simulation hinausgeht.
Organisationsziel. Das Team möchte Anfragen zuverlässiger bearbeiten und wiederholte Sortierarbeit reduzieren. Das Ziel lautet nicht „KI einsetzen“. Eine einheitliche manuelle Vorlage kann ein plausibler erster Schritt sein, weil uneinheitliche Regeln bereits als Prozessproblem sichtbar sind.
Risikotoleranz. Eine reine Prozessübung mit synthetischen Fällen und ohne Aufruf eines realen Systems ist reversibel. Eine Sortierung mit echten Anfragen oder gar automatisierte Antworten wären qualitativ andere Schritte. Bis Zweck, Datenfluss, Prüfmaßstab, Verantwortung, Einspruchsweg und Abbruchkriterium geklärt sind, wird keine produktive oder nach außen wirkende Nutzung freigegeben.
Optionen statt „KI oder Stillstand“
| Option | Was sie jetzt ermöglicht | Was sie nicht belegt oder löst | Status in der Simulation |
|---|---|---|---|
| A. Manuelle Sortierregeln vereinheitlichen | Das sichtbare Prozessproblem direkt angehen; Zuständigkeiten und Vorlagen klären | Ob zusätzlich ein KI-System Nutzen bringen würde | Sofort sinnvoll und reversibel |
| B. Synthetische Tischübung durchführen | Übergaben, Grenzfälle, fehlende Kriterien und Fragen für eine spätere Prüfung sichtbar machen | Reale Modellleistung, reale Fehlerraten oder Produktivitätsgewinn | Als Lern- und Governance-Übung freigegeben |
| C. Echtdaten-Pilot oder automatische Antwort | Könnte später einen realitätsnäheren Einsatz prüfen | Darf nicht ohne geklärten Zweck, Daten-/Vertragslage, Messdesign und Aufsicht gestartet werden | Zurückgestellt; keine Freigabe |
Die begründete Entscheidung lautet also weder „KI ist bewiesen nützlich“ noch „KI darf nie verwendet werden“. Das Team vereinheitlicht zuerst die manuelle Sortierung und führt eine synthetische Tischübung durch. Es dokumentiert dabei nicht eine vermeintliche Trefferquote, sondern offene Arbeitsfragen: Welche Anfrage braucht menschliche Beratung? Welche Kategorie ist zu grob? Wer korrigiert eine falsche Zuordnung? Welche Fälle müssen unabhängig von jeder Automatisierung priorisiert werden? Eine solche Tischübung ist weder ein Test mit realen Systemausgaben noch ein Beleg für die spätere Genauigkeit. Sie kann aber die Fragestellung für eine künftige Untersuchung enger und prüfbarer machen.
● Nur für Mitglieder
Lies den vollständigen Artikel und lade alle Dateien mit einer Mitgliedschaft herunter.
Vollständigen Artikel + Downloads freischalten → Abonnieren0 Kommentare
● Kommentare werden geladen…