← SAKIZLI AI
Article30. September 2026 · 22 Min. Lesezeit19 / 21Mitglieder · Abo

Menschliche Aufsicht, die eingreifen kann

Wie ein kleines Team an einem absichtlich falschen KI-Entwurf prüft, ob eine Person wirklich stoppen, korrigieren und begründen kann

FFurkan SakızlıKI-Forscher & Tutor · unabhängig
Auf hellem Papier führt ein Weg von einer dunklen Kugel über gläserne Scheiben zu einem Knoten; davor steht ein dunkelblauer Riegel vor einem gläsernen Pfeil, Abzweige führen zu einer goldenen Kugel und einer blauen Scheibe
Vor der Wirkung liegt ein Punkt, an dem jemand anhalten kann
Bild mit KI erzeugt

Eine KI bereitet eine Antwort vor. Eine Person sieht sie vor dem Versand und klickt auf „Freigeben“. Auf dem Organigramm steht damit vielleicht „menschliche Aufsicht“. In der tatsächlichen Arbeit kann dieser Klick aber fast leer sein: Die Person sieht die entscheidende Fallinformation nicht, darf den Versand nicht anhalten, hat keine Zeit zum Nachschlagen, kennt keinen verlässlichen Ersatzweg oder muss eine Unsicherheit allein verantworten. Dann ist ein Mensch zwar im Ablauf vorhanden, aber nicht in der Lage, den Ablauf zu verändern.

Die entscheidende Frage lautet deshalb nicht: Gibt es einen Menschen im Prozess? Sie lautet: Kann diese Person einen konkreten Fehloutput erkennen, dessen Wirkung vorzeitig stoppen, eine vertretbare Alternative wählen oder eine klar benannte Stelle einschalten und den Grund später nachvollziehbar machen? Diese Frage lässt sich nicht durch eine Rollenbezeichnung beantworten. Sie verlangt eine Probe unter Bedingungen, die den Eingriff überhaupt möglich machen.

Dieser Beitrag entwickelt eine solche Probe für ein kleines Team. Der Fall, alle Rollen, alle Produkte und alle Ergebnisse sind vollständig erfunden. Die Übung sendet nichts an Kundinnen oder Kunden und misst keine Leistung eines produktiven Systems. Ihr Ergebnis ist auch kein Gütesiegel für eine Organisation. Es zeigt nur, ob ein vorher festgelegter Aufsichtsweg bei einem bekannten Fehler im Unterricht oder in einer internen Trockenübung praktisch ausgeführt werden konnte.

Die Eingrenzung ist wichtig. „Wer trägt Verantwortung, wenn KI vorbereitet?“ behandelt die Frage, wie Verantwortung und Rechenschaft zwischen Rollen verteilt werden. „Urteilen unter Zeitdruck“ untersucht, wie Zeitdruck und Arbeitslast das Urteilen verändern können. „Schatten-KI und die Würde der Daten“ handelt von ungeklärter KI-Nutzung und Datenflüssen. Ein späterer Artikel dieser Reihe baut auf einem begrenzten Pilot mit Baseline, Schadensindikatoren und Abbruchschwelle auf. Hier geht es enger um eine beobachtbare Aufsichtsprobe vor einer Außenwirkung: Was muss vorhanden sein, damit ein Mensch einen falschen Vorschlag wirksam anhalten kann?

Ein Klick ist keine Aufsicht

Aufsicht ist kein Charakterzug. Sie ist eine Beziehung zwischen einer Person, einer Entscheidung und einem technisch-organisatorischen Weg. Damit sie mehr ist als symbolische Anwesenheit, müssen mindestens sechs Dinge zusammenkommen:

1. Sichtbarkeit: Die prüfende Person sieht den KI-Output und den Kontext, der ihn prüfbar macht.

2. Unabhängige Referenz: Sie kann die Ausgabe mit einer aktuellen, zugänglichen Fachinformation vergleichen, statt nur Plausibilität zu fühlen.

3. Befugnis: Sie darf vor Wirkung stoppen, übersteuern oder weitergeben; ein Hinweis ohne Handlungsmöglichkeit genügt nicht.

4. Zeit und Aufmerksamkeit: Das Zeitfenster erlaubt eine Prüfung, die der Tragweite der Entscheidung entspricht.

5. Können und Unterstützung: Die Person versteht Aufgabe, typische Fehlergrenzen und Eskalationsweg oder kann sie ohne Umweg klären.

6. Sicherer Fallback: Nach dem Stopp gibt es eine zulässige nächste Handlung, etwa eine manuelle Antwort, eine Rückfrage oder eine Fachprüfung.

Diese Liste ist keine gesetzliche Checkliste und keine empirisch bestätigte Mindestformel. Sie macht lediglich sichtbar, welche Voraussetzungen im Test fehlen können. Gerade das ist ihre Funktion: Ein Team soll nicht aus einem übersehenen Fehler schließen, die prüfende Person habe „nicht gut genug aufgepasst“, wenn die Informations- oder Befugniskette den Eingriff unmöglich machte.

Philosophisch steht dahinter ein einfacher, aber anspruchsvoller Punkt. Verantwortung setzt keine Allwissenheit voraus. Sie setzt jedoch voraus, dass jemand einen Unterschied machen kann und dass die Gründe für ihr Handeln nicht nachträglich erfunden werden müssen. Wer eine Entscheidung formal freigibt, ohne Zugriff auf den entscheidenden Grund, trägt eine Last ohne passende Handlungsmacht. Wer einen Fehler feststellt, aber den Versand nicht stoppen darf, ist Zeuge, nicht Aufsicht. Eine gerechte Gestaltung fragt daher nicht nur, wer am Ende unterschreibt, sondern auch, wer im entscheidenden Moment welche Möglichkeiten und welche Unterstützung besitzt.

Dieser Blick vermeidet zwei Verkürzungen. Die erste verlagert jede Pflicht auf die einzelne prüfende Person: Ein Fehler wird dann als individuelle Unaufmerksamkeit erklärt, obwohl Anzeige, Frist, Zugriff oder Berechtigung schlecht gestaltet waren. Die zweite spricht Menschen jede Rolle ab, weil KI-Systeme komplex sind. Komplexität macht menschliche Prüfung schwerer; sie hebt die Notwendigkeit zugeordneten Eingriffs nicht auf. Das Ziel ist kein Mensch, der jeden Output perfekt erkennt. Das Ziel ist ein Prozess, der bei erkennbarer Unsicherheit nicht zur voreiligen Außenwirkung zwingt.

Die EU-KI-Verordnung formuliert für Hochrisiko-KI-Systeme einen besonders konkreten Maßstab: Den zuständigen natürlichen Personen müssen je nach Umständen unter anderem die richtige Interpretation, das Nichtverwenden, Ignorieren, Übersteuern oder Umkehren einer Ausgabe sowie ein Eingriff in den Betrieb oder dessen Unterbrechung möglich sein. Betreiber solcher Systeme müssen Aufsicht Personen mit notwendiger Kompetenz, Ausbildung, Befugnis und Unterstützung übertragen.1 Diese Regel gilt nicht pauschal für jeden KI-Assistenten und jedes kleine Unternehmen. Ob ein konkretes System überhaupt in diesen Anwendungsbereich fällt, hängt von Rolle, Einsatz und Risikoeinstufung ab.

Kurze Rechtsbox, Stand 29. September 2026: Die folgenden Fallkarten behaupten nicht, der fiktive Textassistent sei Hochrisiko-KI. Die einschlägigen Anforderungen aus Kapitel III Abschnitten 2 und 3 gelten nach der konsolidierten Fassung für Systeme nach Art. 6 Absatz 2 in Verbindung mit Anhang III ab dem 2. Dezember 2027; für Systeme nach Art. 6 Absatz 1 in Verbindung mit Anhang I ab dem 2. August 2028. Die Änderungsverordnung (EU) 2026/1744 und der konsolidierte Text gehören deshalb bei realen Fällen zum Prüfmaterial. Eine konkrete Rechtsfrage braucht zusätzlich System, Rolle, Rechtsraum, Datum, Vertrag und Sachverhalt.1,2

Auch außerhalb dieses Rechtsrahmens ist der Gedanke nützlich: Eine Organisation kann an einem simulierten Fehler prüfen, ob ihr eigener Anspruch auf prüfbare Freigabe technisch und organisatorisch eingelöst wird. Das ist eine Gestaltungsentscheidung, keine Aussage über rechtliche Pflicht oder Wirksamkeit.

Was die Forschung nahelegt – und was nicht

Drei Originalstudien geben Anlass, die Aufsicht nicht auf eine Erklärungsschaltfläche zu reduzieren. Sie behandeln jeweils begrenzte experimentelle Aufgaben, keine echten Ersatzteilentscheidungen. Gerade deshalb darf aus ihnen keine allgemeine Erfolgszusage abgeleitet werden.

Eine Studie zu kognitiven Erzwingungsfunktionen untersuchte 199 Online-Teilnehmende bei der Wahl einer kohlenhydratärmeren Zutat aus Mahlzeitbildern. Die simulierte KI lag absichtlich in einem Viertel der Fälle falsch. Verglichen wurden unter anderem einfache Erklärungen mit Abläufen, die zuerst zu eigener Überlegung oder zu einer Begründung anhielten. Bei falschen Vorschlägen wurden diese in den Bedingungen mit solchen Eingriffen häufiger nicht übernommen; zugleich waren Vertrauen und Präferenz für diese Bedingungen geringer.4 Das ist kein Beweis, dass jede vorgeschaltete Frage im Betrieb Fehler verhindert. Es zeigt aber, warum „Vorschlag sofort zeigen, dann Freigabe verlangen“ nicht als neutrale Gestaltung behandelt werden sollte.

Eine weitere experimentelle Studie mit insgesamt 3.800 Teilnehmenden nutzte eine vereinfachte Wohnungspreis-Prognose. Ein transparent dargestelltes lineares Modell war leichter nachzuvollziehen, führte aber nicht automatisch zu angemessenerem Korrigieren. Bei großen Fehlern auf ungewöhnlichen Datenpunkten erkannten und korrigierten Teilnehmende die Fehler in einer klaren Modellbedingung schlechter.5 Die Autorinnen und Autoren diskutieren Überlastung als mögliche Erklärung. Der Befund gilt nicht automatisch für jede Visualisierung oder jedes Fachgebiet. Er mahnt jedoch zu einer praktischen Vorsicht: Mehr angezeigte Information ist nicht gleichbedeutend mit mehr Eingriffsfähigkeit.

Eine dritte Online-Studie ließ 600 Teilnehmende kurze Biografien klassifizieren. Keine der untersuchten Erklärungsbedingungen führte dazu, dass falsche Empfehlungen selektiv häufiger als richtige Empfehlungen übersteuert wurden. Bestimmte Erklärungen veränderten dennoch das Override-Verhalten; dadurch entstand keine selektiv richtige Korrektur.6 Eine Begründung am Bildschirm kann Menschen also beeinflussen, ohne ihre Fehlersuche in dieser Aufgabe verlässlich zu verbessern.

Der gemeinsame Schluss ist begrenzt: Sichtbare Vorschläge und sichtbare Erklärungen reichen nicht als Nachweis wirksamer Aufsicht. Für die Gestaltung eines Tests ist es vernünftig, die Person erst die Fallakte prüfen zu lassen, dann die KI-Ausgabe gegen eine unabhängige Referenz zu vergleichen und den tatsächlichen Stop- oder Eskalationsweg zu beobachten. Diese Reihenfolge ist eine Empfehlung aus begrenzter Evidenz und praktischer Vorsicht, keine geprüfte Universalregel.

Der freiwillige NIST AI Risk Management Framework passt zu dieser Bescheidenheit. Er fordert keine bestimmte Stopptaste für jeden Einsatz. Er beschreibt jedoch Rollen und Verantwortlichkeiten für Mensch-KI-Konfigurationen, dokumentierte Aufsichtsprozesse sowie Verfahren für Rückmeldung, Beschwerde, Override, Außerbetriebnahme und Änderungsmanagement.3 Zugleich weist der Rahmen darauf hin, dass untersucht werden muss, ob Menschen tatsächlich in der Lage und bereit sind, KI-Ausgaben anzufechten. Das ist ein guter Grund, nicht nur eine Richtlinie zu veröffentlichen, sondern ihren Eingriffsweg an einem Fehloutput zu üben.

Schaubild: links eine Karte mit einem Punkt und einem Pfeil, in der Mitte eine hohe gläserne Säule mit einem zentralen Knoten; von dort führt ein gestrichelter Weg zu einem Kreuz, ein goldener Bogen zu einem Punkt mit Pfeil nach oben und eine blaue Linie über ein Plus weiter nach rechts; ein gepunkteter Bogen führt vom Plus zurück zur ersten Karte
Stoppen, eskalieren oder begründet ersetzen – und das Ergebnis fließt in die Regel zurück
Bild mit KI erzeugt

Der vollständig fiktive A21/A12-Fall

Der Betrieb Nordwerk Ersatzteile ist erfunden. Er verkauft keine realen Produkte und hat keine reale Kundschaft. Das Team nutzt in dieser Übung einen freigegebenen Textassistenten ausschließlich in einer abgeschotteten Testumgebung. Der Assistent darf einen Antwortentwurf erzeugen, aber weder eine Nachricht versenden noch ein Lager ändern.

Eine fiktive Fallakte mit der Kennung F-217 enthält die Anfrage: „Bitte bestätigen Sie die Verfügbarkeit des Teiltyps A21 für eine Wartung.“ Die interne Referenzkarte der Übung nennt A21 als angefragten Teiltyp und vermerkt für diesen fiktiven Testfall den Status „verfügbar“. Ein absichtlich fehlerhafter KI-Entwurf antwortet dagegen: „Der Teiltyp A12 ist verfügbar und wird reserviert.“ A21 und A12 sind frei erfundene Zeichenfolgen. Der Unterschied ist absichtlich klein, damit die Probe nicht nur einen groben Unsinn testet, sondern die Verbindung aus Aufmerksamkeit, Quelle und Eingriffsrecht.

Der Fehloutput ist nicht dazu da, die KI vorzuführen oder die prüfende Person zu testen wie in einer Prüfungssituation. Er prüft den Weg zwischen Erkennen und Handeln. Deshalb werden vor Beginn vier Bedingungen festgelegt:

ElementFestlegung in der Übung
PrüfbasisFallakte F-217 und Referenzkarte mit Teiltyp und fiktivem Verfügbarkeitsstatus liegen neben dem Entwurf vor; keine Websuche, kein Modellwissen nötig.
WirkungssperreDer Versandknopf ist in der Simulation gesperrt, bis die Prüferin oder der Prüfer den Status „Freigabe“ setzt.
Eingriffswege„Stopp“ hält den Entwurf zurück. „Override“ ersetzt ihn durch eine manuelle, quellengestützte Antwort. „Eskalation“ erzeugt einen Klärungsauftrag an die Fachrolle.
FallbackWenn die Referenz fehlt oder widersprüchlich ist, wird keine Verfügbarkeit behauptet; der sichere Text lautet: „Wir klären die Verfügbarkeit und melden uns zurück.“

Die Übung trennt dabei drei Entscheidungen, die im Alltag leicht ineinanderfallen. Stopp bedeutet: Der konkrete Entwurf darf nicht wirken. Override bedeutet: Die aufsichtführende Rolle hat genug Referenz und Befugnis, um ihn begründet durch eine andere Antwort zu ersetzen. Eskalation bedeutet: Die Referenz oder Fachkompetenz reicht nicht aus; die nächste Handlung ist ein begrenzter Klärungsauftrag. Eskalation ist kein Versagen. Sie ist die richtige Entscheidung, wenn ein sicherer Ersatz fehlt.

Diese Unterscheidung schützt auch vor einem verbreiteten Missverständnis: Aufsicht verlangt nicht, dass jede Person jeden Fehler selbst löst. Sie verlangt, dass die Person erkennt, wann sie eine Entscheidung nicht sicher treffen kann, und den Vorgang ohne Außenwirkung in eine zuständige Prüfung überführt.

Musterlauf der fiktiven Aufsichtsprobe

Im Folgenden steht ein vollständig durchgespielter Musterlauf der fiktiven Unterrichtssimulation. Die Zeiten sind erfundene didaktische Arbeitsblattdaten, keine Messwerte aus einem Betrieb, keine personenbezogenen Leistungsdaten und kein Vergleich zwischen Menschen. Die Rolle „Prüfperson“ bezeichnet eine erfundene Rolle; keine reale Person nahm teil.

Vor der Probe erhielt die Prüfperson die knappe Aufsichtskarte, nicht aber den Hinweis, auf welcher Karte ein Fehler eingebaut war. Der Moderator stellte sicher, dass Stopp, Override und Eskalation in der Testoberfläche erreichbar waren. Die Probe bestand aus drei getrennten Karten:

KarteSichtbare LageSollhandlungtatsächlich dokumentierte HandlungErgebnis der Simulation
1: FehlerkarteAnfrage A21; Referenzkarte A21 verfügbar; Entwurf verspricht A12Widerspruch erkennen, Versand stoppen, A21-Text als Override schreibenNach 1 Minute 42 Sekunden: A21/A12 markiert; „Stopp“ gewählt; manueller Antwortentwurf mit Verweis auf die Referenzkarte erstelltSollhandlung erreicht; die Fehlwirkung blieb gesperrt
2: LückenkarteAnfrage A21; Referenzkarte fehlt; Entwurf behauptet A21 verfügbarNicht raten; stoppen und an Fachrolle eskalierenNach 58 Sekunden: „Stopp“ gewählt; Klärungsauftrag mit fehlender Referenz dokumentiert; kein Ersatzversprechen abgegebenSollhandlung erreicht; keine Scheinsicherheit erzeugt
3: GegenkarteAnfrage A21; Referenzkarte A21 verfügbar; Entwurf bestätigt A21 ohne ZusatzbehauptungReferenz vergleichen und begründet freigebenNach 1 Minute 16 Sekunden: Abgleich dokumentiert; Freigabe für die Simulation gesetztKonsistenter Entwurf wurde nicht reflexhaft blockiert

Das Protokoll zeigt nur, dass der geplante Weg in dieser kontrollierten Übung benutzt werden konnte. Es zeigt nicht, dass die Person unter Arbeitsdruck ebenso handeln würde, dass der Assistent in anderen Fällen zuverlässig erkennbar falsch läge oder dass die Organisation dadurch Risiken reduziert. Die Zeiten dienen der anschließenden Reflexion: War die Prüfzeit im Szenario ausreichend? Wurde die Referenz leicht gefunden? Erzeugte der Stopp eine sinnvolle Folgehandlung? Sie sind keine Kennzahl für eine produktive Zielzeit.

Die wichtigste Beobachtung liegt auf Karte 2. Eine reine Fehlererkennung würde dort zu kurz greifen. Der Entwurf enthält keine sichtbare A21/A12-Verwechslung, aber die Basis für eine Verfügbarkeitsaussage fehlt. Wäre die Prüfperson zum schnellen Korrigieren gezwungen gewesen, hätte sie vielleicht eine Behauptung erfunden. In dieser Übung besteht Aufsicht gerade darin, Unsicherheit zu erkennen und die Entscheidung zu begrenzen. Das unterscheidet verantwortliche Kontrolle von der Erwartung, immer sofort eine Antwort liefern zu müssen.

Nach jeder Karte wird eine kurze Spur festgehalten:

Welche Referenz war vorhanden oder fehlte? Welcher konkrete Widerspruch, welche Unklarheit oder welche Bestätigung wurde gesehen? Welche Wirkung war noch ausstehend? Wurde gestoppt, übersteuert, eskaliert oder freigegeben – und warum? War der vorgesehene Weg technisch und organisatorisch erreichbar? Welche Restunsicherheit bleibt und wer bearbeitet sie als Nächstes?

Eine vollständige Spur darf nicht zur bloßen Selbstdokumentation werden. Ihr Zweck ist, die Gestaltung zu revidieren. Hätte etwa der Stopp nur über eine nicht erreichbare Administratorrolle funktioniert, wäre der Test nicht „knapp bestanden“, sondern der Aufsichtsweg unzureichend. Hätte die Prüfperson A21 und A12 erkannt, aber keine Referenzkarte gefunden, wäre das kein bloßes Aufmerksamkeitsproblem. Die Fallgestaltung müsste dann Informationszugriff, Anzeige oder Zuständigkeit ändern.

K anwenden: der vierstufige Grundzyklus

Das K-Konsultationsmodell liefert hier eine Struktur für einen begründeten Aufsichtsweg. Sein Grundzyklus hat vier Schritte: Exploration, Reflexion/Analyse, Entscheidung/Empfehlung sowie Feedback/Evaluierung. Er ist keine Evidenz dafür, dass die Probe wirksam ist. Er hilft, eine Entscheidung nicht auf die Oberfläche eines Entwurfs zu verkürzen.

1. Exploration: Was soll unter menschlicher Kontrolle bleiben?

Nordwerk Ersatzteile legt zuerst fest: Der Assistent erzeugt nur Textentwürfe. Eine Verfügbarkeitsbehauptung wird erst wirksam, wenn eine Person sie in der Simulation freigibt. Betroffen sind im fiktiven Fall die anfragende Person, die Fachrolle, die Antwort bearbeitende Rolle und der Betrieb, der keine falsche Zusage machen soll. Die Übung erfasst zudem die tatsächlichen Eingriffspunkte: Entwurf zurückhalten, Text ersetzen, Fachfrage eröffnen und später die Regel ändern.

Die Exploration fragt nicht, ob das Tool „gut“ ist. Sie fragt, welche Entscheidung vorbereitet wird, welche Referenz sie trägt und wo ein Fehler Folgen hätte. Im A21/A12-Fall ist die überprüfbare Referenz die Fallkarte. In einem realen Fall könnte es eine freigegebene Fachquelle sein; wenn diese nicht zugänglich ist, darf der Prozess keine scheinbare Prüfung verlangen.

2. Reflexion und Analyse: Welcher Konflikt steckt im schnellen Entwurf?

Schnelle Antworten können für eine anfragende Person hilfreich sein. Eine ungesicherte Zusage kann aber Wartung, Disposition und Vertrauen beeinträchtigen. Beide Seiten sind ernst zu nehmen. Das Team notiert daher nicht nur „falsche Teilebezeichnung“, sondern auch: Was geschieht, wenn niemand eingreift? Wie lang ist das reale Zeitfenster? Welche Information braucht die prüfende Rolle? Wann ist eine Rückfrage fairer als eine geschmeidige, aber unbegründete Antwort?

● Nur für Mitglieder

Lies den vollständigen Artikel und lade alle Dateien mit einer Mitgliedschaft herunter.

Vollständigen Artikel + Downloads freischalten → Abonnieren

0 Kommentare

● Kommentare werden geladen…

Zum Kommentieren anmelden · Mitglied werden →