← SAKIZLI AI
Article30. September 2026 · 23 Min. Lesezeit20 / 21Mitglieder · Abo

Der begrenzte Pilot

Wie ein kleines Team KI probeweise nutzt, mit einer Nicht-KI-Basis vergleicht und bei einem schlechten Befund tatsächlich aufhört

FFurkan SakızlıKI-Forscher & Tutor · unabhängig
Auf hellem Papier drei gläserne Scheiben in einer Reihe, verbunden durch eine gerade Bahn und zwei Bögen mit goldenen Kugeln; links ein einfacher Weg, in der Mitte parallele Linien um einen blauen Punkt, rechts ein Ring aus blauen Punkten
Drei Wege nebeneinander, bevor einer weitergeht
Bild mit KI erzeugt

Ein KI-Vorschlag kann im Arbeitsalltag sehr schnell zur Gewohnheit werden. Zuerst heißt es: „Wir schauen nur einmal, ob es hilft.“ Wenige Wochen später ist die alte Arbeitsweise nicht mehr eingeübt, das Tool ist in Vorlagen eingebaut und niemand weiß mehr genau, wer den Versuch beendet hätte. Das ist keine kleine Einführung mit offenem Ausgang, sondern eine Einführung ohne klare Entscheidung.

Ein begrenzter Pilot setzt früher an. Er ist ein befristeter Vergleich zwischen konkreten Arbeitsweisen. Vor dem Start legt das Team fest, was es ausprobiert, was es nicht ausprobiert, welche Arbeit ohne KI weiter möglich bleibt, was es als Nutzen zählt, welche Fehler oder Belastungen relevant sind und welcher Befund zur Pause führt. Am Ende steht keine Erfolgserzählung, sondern eine begründete Entscheidung: beenden, enger neu aufsetzen, eine Fachfrage klären oder unter eng bestimmten Bedingungen weiter prüfen.

Dieser Artikel entwickelt dafür einen vollständig erfundenen Fall. „Nordwerk“ ist kein reales Unternehmen. Der Fall enthält keine Personen-, Kunden-, Beschäftigten- oder Vertragsdaten. Es geht nur um künstliche Anfragekarten, die intern einem von vier Bearbeitungswegen zugeordnet werden. Es gibt keinen Außenkontakt, keinen Versand, keinen Zugriff auf Lager oder Kundensysteme. Gerade diese Begrenzung macht den Fall für einen Kurs oder ein kleines Team brauchbar: Die Gruppe kann am Design der Entscheidung arbeiten, ohne einen produktiven Prozess als Übungsfeld zu benutzen.

Die Leitfrage lautet: Wie kann ein kleines Team einen KI-Einsatz so befristet erproben, dass Nutzen, Zusatzarbeit, Fehler und Schäden gegen eine Nicht-KI-Basis verglichen werden und ein negatives Ergebnis wirklich zum Stopp führt?

Die Antwort ist bewusst bescheiden. Ein achtwöchiger Pilot liefert Hinweise für die getesteten Karten, Rollen und Bedingungen. Er beweist weder allgemeine Wirksamkeit noch Sicherheit, ethische Angemessenheit oder Rechtskonformität. Eine gute Durchschnittszahl kann relevante Einzelfehler verdecken. Deshalb braucht der Pilot neben einer Gesamtbilanz Fehlerklassen, getrennte Auswertung schwieriger Fälle, einen erreichbaren Fallback und eine vorab beschlossene harte Stoppschwelle.

Nicht „Ist die KI gut?“, sondern „Welche Arbeitsentscheidung ist hier vertretbar?“

Nordwerk bearbeitet im Beispiel Ersatzteilanfragen zunächst als interne Kurznotiz. Für jede künstliche Anfragekarte ist eine erste Zuordnung nötig. Vier Wege stehen zur Wahl:

1. Standardfall: Die Karte enthält eine eindeutige Referenz; die Sachbearbeitung kann die normale interne Prüfroutine starten.

2. Fehlende Referenz: Wesentliche Angaben fehlen; die Karte wird zur Klärung zurückgelegt.

3. Fachliche Prüfung: Die Angaben sind vorhanden, aber die Zuordnung verlangt Fachwissen oder eine widersprüchliche Referenz.

4. Stop/Exception: Die Karte enthält einen Widerspruch, eine nicht vorgesehene Kategorie oder ein Signal, das im Test nicht bearbeitet werden darf.

Das Team erwägt einen KI-Assistenten, der nur einen dieser vier Wege vorschlägt. Die KI darf nichts auslösen. Eine Person übernimmt oder verwirft den Vorschlag in einer Testtabelle. Die Karten, die Referenzlösung und die Kriterien sind künstlich erstellt. Damit bleibt die entscheidende Frage klar: Verringert der Vorschlag im begrenzten Arbeitsabschnitt die gesamte Arbeit, ohne dass er Fehler, Nacharbeit oder ungleich verteilte Kontrolllast erzeugt?

Diese Formulierung unterscheidet diesen Artikel von einer einzelnen Aufsichtsprobe. Eine Aufsichtsprobe kann zeigen, ob eine Person bei einem bekannten Fehloutput tatsächlich stoppen, übersteuern oder eskalieren kann. Das ist wichtig, aber noch kein Pilot. Der Pilot fragt zusätzlich nach Vergleich, Dauer, Fallmischung, Aufwand über mehrere Wochen und Schlussentscheidung. Die Aufsichtsfähigkeit wird hier als Voraussetzung für den Schattenarm angenommen; sie wird nicht noch einmal als Einzeltest ausgeführt.

Auch eine Use-Case-Card allein reicht nicht. Sie kann Zweck, Datenzone, Rollen und Stoppmöglichkeiten festhalten. Dieser Artikel benutzt diese Vorarbeit, ergänzt aber eine überprüfbare Versuchslogik: eine manuelle Ausgangslage, eine strukturierte Regelkarte ohne KI, einen KI-Schattenarm, eine unabhängig festgelegte Referenz und Regeln dafür, wie beide Wege ausgewertet werden.

Das ist kein Misstrauen gegenüber jeder technischen Hilfe. Es ist eine Frage nach Zurechnung. Wer den Nutzen eines neuen Werkzeugs beansprucht, muss auch die Arbeit sehen, die dafür neu entsteht: Eingaben vorbereiten, Vorschläge prüfen, Referenzen suchen, Fehler korrigieren, Sonderfälle behandeln und den Prozess bei einem Stopp auf die Nicht-KI-Basis zurückführen. Wenn diese Arbeit verschwindet, weil sie nicht gezählt wird, entsteht eine scheinbare Zeitersparnis.

Warum eine schnelle mittlere Zahl nicht genügt

Philosophisch geht es um mehr als Messmethodik. Ein Pilot verteilt Zeit, Aufmerksamkeit und Risiko. Die Leitung kann sich über schnellere Durchläufe freuen, während eine prüfende Person zusätzliche Kontrollarbeit trägt. Ein häufiger, leicht zu korrigierender Vorschlag kann die mittlere Zeit senken und zugleich seltene Fälle in den falschen Weg schicken. Wer dann nur den Durchschnitt ausweist, behandelt unterschiedliche Folgen so, als wären sie austauschbar.

Eine verantwortbare Entscheidung muss diese Unterschiede nicht in eine einzige moralische Zahl pressen. Sie sollte aber offenlegen, welche Güter miteinander in Spannung stehen: Arbeitszeit, Verlässlichkeit, Möglichkeit zum Widerspruch, fachliche Sorgfalt und die Frage, wer im Zweifel die Last trägt. Reversibilität ist dabei ein praktischer Wert. Sie bedeutet, dass das Team die manuelle Arbeitsweise nicht zerstört, bevor es genügend Gründe für eine Änderung hat. Ein Stopp ist damit kein persönliches Scheitern der Personen, die den Pilot vorbereitet haben. Er ist eine der vorgesehenen Entscheidungen.

Die stärkste Gegenposition lautet dennoch: Ein kleines Team kann sich keinen aufwendigen Vergleich leisten. Die Dokumentation kostet Zeit. Bei wenigen Karten können Fallmischung, Lerneffekte und Zufälle den Befund prägen. Ein Schattenbetrieb verlangt doppelte Arbeit. Wenn ein Team erst acht Wochen misst, während andere längst schneller arbeiten, kann die Vorsicht selbst zum Schaden werden.

Diese Einwendung ist stark. Sie spricht gegen ein Ritual aus Tabellen, nicht gegen jeden begrenzten Test. Die passende Antwort ist kein immer größeres Kontrollsystem. Sie lautet: Nur so viel messen, wie zur konkreten Entscheidung nötig ist; die Messung vorab erklären; eine echte Nicht-KI-Option behalten; und die Schlussfolgerung klein halten. Wenn der Aufwand des Pilots bereits höher ist als sein möglicher Nutzen, kann die Entscheidung vor dem Start „kein Pilot“ heißen. Ein kurzer, eng begrenzter Vergleich kann auch zeigen, dass eine bessere Regelkarte, eine klarere Referenz oder zusätzliche Lernzeit mehr hilft als KI.

Was Quellen für einen Pilot nahelegen – und was sie nicht festlegen

Der NIST AI Risk Management Framework ist ein freiwilliger Rahmen, keine Rechtsnorm. Er fordert keine achtwöchige Dauer, keine Mindestzahl von Fällen und keine allgemeine Stopptaste. Er empfiehlt jedoch, Einsatzkontext und Risikotoleranzen zu dokumentieren, Messgrößen und Testbedingungen festzuhalten, Grenzen der Übertragbarkeit sichtbar zu machen und bei der Risikobehandlung auch brauchbare Nicht-KI-Alternativen zu berücksichtigen.1 Für Nordwerk folgt daraus eine Arbeitsregel, keine NIST-Pflicht: Der Vergleich braucht eine reale manuelle Alternative, nicht nur die Frage, ob der KI-Output plausibel klingt.

Warum eine einzige Gesamtzahl nicht ausreicht, zeigt eine Originalstudie aus der Pflegeausbildung und klinischen Simulation. In ihr beurteilten 450 Pflegestudierende und zwölf examinierte Pflegekräfte historische Fälle mit und ohne KI-Empfehlung. Die KI-Unterstützung konnte die gemeinsame Mensch-KI-Leistung verbessern oder verschlechtern, je nachdem, ob der jeweilige Algorithmus besonders richtig oder besonders irreführend war. Die Autor:innen warnen, dass eine repräsentativ gewichtete oder gemittelte Auswertung häufige kleine Vorteile gegen seltenere größere Schäden verrechnen und damit die schweren Folgen verdecken kann.2 Das ist keine Messung in einem Ersatzteilbetrieb. Es stützt aber die vorsichtige Gestaltungsidee, schwierige und fehlerträchtige Karten getrennt auszuwerten, statt sie im Mittelwert verschwinden zu lassen.

Eine zweite Originalstudie beobachtete 38 Intensivmediziner:innen in sechs simulierten Sepsis-Szenarien je Person. Nach einer eigenen Dosisentscheidung sahen sie eine sichere oder absichtlich unsichere KI-Empfehlung und entschieden erneut. Unsichere Empfehlungen wurden häufiger gestoppt als sichere, aber nicht ausnahmslos; unter Einbezug angeforderter zweiter Meinungen lag der Anteil gestoppter oder eskalierter unsicherer Empfehlungen höher; dieser Unterschied war statistisch nicht gesichert. Außerdem änderten die Ärzt:innen nach KI-Vorschlägen ihre Entscheidung in 105 von 228 Durchläufen.3 Die Zahlen sind kein Sollwert für Nordwerk. Der übertragbare Gedanke ist enger: Im Pilot ist nicht nur das Endergebnis interessant. Auch Änderungen nach einem Vorschlag, Overrides, Eskalationen und fehlende Eingriffe sind beobachtbare Prozessbefunde.

Eine dritte Studie, vorregistrierte Online-Experimente mit insgesamt 3.800 Teilnehmenden zur Schätzung von Wohnungspreisen, prüfte verständlich dargestellte gegenüber weniger transparenten linearen Modellen. Das leicht nachvollziehbare Modell half beim gedanklichen Nachvollziehen seiner Vorhersagen. Es verbesserte jedoch nicht passend das Folgen von Empfehlungen; bei großen Fehlern auf atypischen Datenpunkten erkannten und korrigierten Teilnehmende die Fehler schlechter.4 Auch das ist kein Test einer betrieblichen Anfragezuordnung. Es verhindert aber einen bequemen Schluss: Erklärung, Dashboard oder Freigabeklick sind keine Qualitätsmessung. Der Pilot muss prüfen, ob problematische Vorschläge gegen eine unabhängige Referenz erkannt und richtig behandelt werden.

Der EU AI Act gehört nur in einem engeren Sinn hierher. Bei Hochrisiko-KI verlangt die Verordnung für Anbieter ein fortlaufendes, iteratives Risikomanagement; sie enthält außerdem Vorgaben zur Beobachtung nach dem Inverkehrbringen. Betreiber müssen bei einem Risiko unter den genannten Bedingungen informieren und die Nutzung aussetzen. Für Hochrisiko-KI nach Anhang III gelten die entsprechenden Pflichten nach dem hier verwendeten Zeitstand ab 2. Dezember 2027, für bestimmte Systeme nach Anhang I ab 2. August 2028.5 Daraus folgt keine allgemeine Pilotpflicht für jedes KMU und keine gesetzliche Acht-Wochen-Regel. Ob diese Regeln in einem realen Fall greifen, hängt von System, Rolle, Verwendungszweck, Risikoeinstufung und Datum ab. Nordwerk erhebt deshalb keinen Compliance-Anspruch.

Schaubild: links eine Gruppe von Punkten, aus der drei Bahnen nach rechts führen – eine gerade, eine mit Stufen und hellen Ringen, eine mit einem hervorgehobenen Knoten; die untere Bahn endet an einem goldenen Sperrbalken, von dem eine goldene Linie zurück zum Anfang der oberen Bahn führt; oben verläuft eine dünne goldene Zeitlinie
Drei Arme im Vergleich – und ein vorher festgelegter Rückweg, wenn der KI-Arm stoppt
Bild mit KI erzeugt

Der achtwöchige Nordwerk-Pilot

Der Fall benutzt drei Vergleichsarme. Sie sind kein Versuch, mehrere KI-Produkte gegeneinander antreten zu lassen. Sie machen unterschiedliche Arbeitsweisen sichtbar.

ArmArbeitsweiseZweck im Vergleich
M: manuelle AusgangslageEine Person liest Karte und zugängliche Arbeitsinformationen, ordnet ohne Entscheidungshilfe zu.Zeigt die bisherige Baseline inklusive normaler Prüfung.
R: nicht-KI-RegelkarteEine strukturierte Karte führt durch feste Fragen: Referenz vorhanden? Widerspruch? Fachmerkmal? Exception?Prüft, ob Prozessklarheit den Nutzen schon ohne KI erreicht.
K: KI-SchattenarmDie KI schlägt einen Weg vor. Eine Person prüft ihn anhand derselben Arbeitsinformationen und dokumentiert Übernahme, Korrektur oder Stopp.Prüft Nutzen und Risiken der Mensch-KI-Konfiguration.

Alle drei Arme verwenden künstliche Karten derselben Aufgabengattung. Die KI bleibt im Schatten: Ihre Ausgabe erzeugt keinen Folgeprozess außerhalb der Testtabelle. Damit können auch absichtlich schwierige Karten geprüft werden, ohne dass ein realer Vorgang falsch geroutet wird.

Vor Beginn erstellt eine dafür benannte Person 240 Karten. Jede Karte enthält Arbeitsinformationen, die allen Armen im gleichen Umfang zugänglich sind: etwa eine Produktangabe oder deren ausdrücklich fehlende Referenz. Getrennt davon legt die Referenzrolle den richtigen der vier Wege als verborgenen Lösungsschlüssel fest. Die bearbeitende Rolle sieht den Schlüssel erst nach ihrer abgeschlossenen Zuordnung; sonst würde der Versuch das Ablesen der Lösung messen. Die Referenzrolle darf die Karten nicht während der Bearbeitung umformulieren. 144 Karten sind Standardfälle, 48 haben fehlende Arbeitsreferenzen, 24 verlangen fachliche Prüfung und 24 sind Stop/Exception-Karten. Diese Fallmischung ist eine erfundene Kursentscheidung, keine Aussage über reale Anfragehäufigkeiten. Jede Woche erhält jeder Arm 10 neue Karten: sechs Standardfälle, zwei Karten mit fehlender Referenz, eine Fachprüfung und eine Exception. Vor dem Start werden die Karten innerhalb jeder Klasse zusätzlich nach vorab definierter Schwierigkeit stratifiziert und zufällig auf M, R und K verteilt. Die Klassen und Schwierigkeitsstufen bleiben in jeder Woche gleich vertreten; gleiche Kartenversionen wandern nicht in zwei Arme. Über acht Wochen sind so je Arm höchstens 80 Karten und insgesamt höchstens 240 Bearbeitungen vorgesehen. Die Reihenfolge innerhalb einer Woche wird ebenfalls ausgelost. Die Zuteilung mindert offensichtliche Unterschiede, beseitigt aber bei dieser kleinen, künstlichen Menge nicht alle Verzerrungen.

Die Einweisung und Festschreibung des verborgenen Lösungsschlüssels geschehen vor Woche eins. In den Wochen eins bis sieben läuft der vereinbarte Vergleich mit je zehn Karten pro Arm; Woche acht enthält die letzten zehn Karten je Arm, die Rückmeldung und die Abschlussbewertung. Wenn K vorher pausiert, endet der Vergleich für alle drei Arme. Die bis dahin parallel abgeschlossenen Wochen bilden das gemeinsame Auswertungsfenster; die übrigen künstlichen Karten werden nicht bearbeitet. Im echten Arbeitsalltag ginge neue Arbeit auf den vorher gesicherten manuellen Weg zurück. Weder der Prompt noch die Regelkarte, Rollen oder der Lösungsschlüssel dürfen im laufenden Durchgang still geändert werden. Taucht ein echter Änderungsbedarf auf, wird K pausiert und die Änderung als neue Frage notiert. Ein späterer, klar getrennter Durchgang kann eine neue Version prüfen.

Die Rollen sind klein gehalten:

Pilot-Owner: plant die Termine, schützt Zeit für Bearbeitung und ruft den Abschlussentscheid ein.

Referenz-Owner: erstellt den verborgenen Lösungsschlüssel vorab und gibt während der Auswertung nur begründete Korrekturen frei.

Prüfrolle: bearbeitet die Karten und darf jeden KI-Vorschlag zurückweisen oder den K-Arm pausieren.

Log-Owner: zählt Zeiten und Fehlerklassen, ohne Rohtexte oder personenbezogene Angaben zu sammeln.

Fallback-Rolle: stellt bei Pause auf den manuellen Weg M um und dokumentiert, dass der K-Arm nicht weiter genutzt wird.

Eine Person kann in einem kleinen Team mehrere Rollen übernehmen. Der verborgene Lösungsschlüssel und die laufende Bearbeitung sollten aber nicht in derselben Hand und nicht gleichzeitig sichtbar sein. Die für alle Arme nutzbaren Arbeitsinformationen sind davon getrennt. Der Sinn ist nicht formale Unabhängigkeit wie in einer klinischen Studie. Es geht darum, dass die Person, die den KI-Vorschlag gesehen hat, die richtige Zuordnung nicht passend dazu erfindet oder abliest.

Vorab festlegen, was gezählt wird

Die zentrale Kennzahl ist Gesamtarbeitszeit je abgeschlossener Karte. Sie beginnt mit dem Öffnen der Karte und endet erst, wenn die Zuordnung einschließlich Prüfung, Korrektur, Logeintrag und nötiger Nacharbeit abgeschlossen ist. War eine Referenz fehlend und wurde korrekt der Weg „fehlende Referenz“ gewählt, gehört die Zeit für diese Entscheidung dazu. Es wäre irreführend, nur die Sekunden bis zum KI-Vorschlag zu zählen und die Prüfung einer anderen Person aus dem Nenner zu entfernen.

Für jeden Arm gilt als einfache Buchung: Gesamtzeit = Erstbearbeitung + Prüfung + Korrektur + Log + Nacharbeit. Der relative Zeitgewinn von K gegenüber R ist (mittlere Gesamtzeit R − mittlere Gesamtzeit K) / mittlere Gesamtzeit R. Eine negative Zahl wäre zusätzliche Zeit statt Einsparung.

Das Zeichen „Gewinn“ ist nur eine Beschreibung des Messwerts. Es ist keine Entscheidungsregel. Ein schneller K-Arm kann trotzdem scheitern.

Dafür zählen die Karten zusätzlich nach Fehlerklassen. Die Kategorien werden vor der ersten Karte festgeschrieben:

FehlerklasseDefinition im Nordwerk-FallFolge im Pilot
F1: Abweichung vor Abschluss korrigiertIn M, R oder K entsteht zunächst ein falscher Weg; die bearbeitende Rolle korrigiert ihn vor dem Abschließen.Korrekturzeit zählt in jedem Arm; noch kein finaler Qualitätsfehler.
F2: falscher Weg im Log abgeschlossenDie Testkarte wird entgegen der Referenz als abgeschlossen dokumentiert.Qualitätsfehler; Referenz-Owner prüft Ursache.
F3: unzulässige Weiterbehandlung einer ExceptionEine Stop/Exception-Karte erhält eine normale oder fachliche Zuordnung statt Stopp.Harte Sicherheitsverletzung; sofortige Pause.
F4: falsche Behandlung fehlender ReferenzEs wird trotz fehlender Referenz eine begründete Zuordnung behauptet.Harte Qualitätsverletzung; sofortige Pause.
F5: KontrolllastBei K überschreitet die gesondert gebuchte Prüfzeit je Karte in mindestens drei der zehn K-Karten einer Woche fünf Minuten, oder für zwei K-Karten derselben Woche fehlt die vorab reservierte Prüfzeit.Am Wochenreview Pause; ohne geschützte Prüfzeit keine Erweiterung.

Ein Log darf außerdem erfassen, ob ein K-Vorschlag übernommen, korrigiert, ignoriert oder eskaliert wurde. Das ist eine K-spezifische Diagnose, keine zwischen M, R und K vergleichbare Fehlerklasse. Eine hohe Zahl von Übernahmen beweist weder Qualität noch Vertrauen; sie kann auch zeigen, dass Vorschläge kaum geprüft werden. Eine hohe Zahl von Korrekturen kann ein nützliches Signal über Grenzen des Systems sein oder schlicht zusätzliche Arbeit. Erst mit dem nachträglichen Abgleich mit dem verborgenen Lösungsschlüssel, Zeit und Fehlerfolge erhält sie Bedeutung. F3 und F4 sind schwere Unterfälle eines falsch abgeschlossenen Weges und werden nicht zusätzlich zu F2 zu einer Gesamtfehlerzahl addiert.

● Nur für Mitglieder

Lies den vollständigen Artikel und lade alle Dateien mit einer Mitgliedschaft herunter.

Vollständigen Artikel + Downloads freischalten → Abonnieren

0 Kommentare

● Kommentare werden geladen…

Zum Kommentieren anmelden · Mitglied werden →