SAKIZLI AI
Article14. Juli 2026 · 8 Min. Lesezeit14 / 34Mitglieder · Abo

Testen statt bestaunen

Positive, negative und reparierbare KI-Szenarien: wie aus einer beeindruckenden Antwort ein Arbeitsmittel wird, dem du begrenzt vertrauen kannst.

TestenQualitätsarbeitKI-Kompetenz
FFurkan SakızlıKI-Forscher & Tutor · unabhängig
Positive, negative und reparierbare Testszenarien in Blau
Drei Testläufe statt eines beeindruckenden Outputs – positiv, negativ und reparierbar

Eine gelungene KI-Antwort kann erstaunlich überzeugend wirken. Genau das ist ihr Risiko: Wenn sie sprachlich glatt, schnell und plausibel ist, verwechseln wir leicht einen guten ersten Eindruck mit Verlässlichkeit. Wer mit KI arbeiten will, braucht deshalb weniger Bewunderung und mehr kleine, wiederholbare Tests.

Nicht jede richtige Antwort ist ein guter Test

Ein einzelnes Beispiel sagt fast nichts über die Qualität eines Arbeitsablaufs. Vielleicht war die Aufgabe besonders leicht. Vielleicht passte das vorhandene Material zufällig genau. Vielleicht klingt die Antwort überzeugend, obwohl ein entscheidender Punkt fehlt. Ein Test beginnt erst dort, wo du vorher festlegst, was als brauchbar gelten soll.

Das ist keine Einladung zum Misstrauen um des Misstrauens willen. Es ist eine Form von Sorgfalt. Du prüfst nicht, ob ein System magisch ist, sondern ob es dir unter klaren Bedingungen nützlich hilft.

Drei Szenarien zeigen, was wirklich passiert

Das positive Szenario beschreibt den Normalfall: eine klare Aufgabe, geeignetes Material und ein Ergebnis, das in einem festgelegten Format vorliegt. Hier prüfst du, ob die Arbeit tatsächlich erleichtert wird. Ein gutes Ergebnis ist nicht einfach lang oder elegant. Es erfüllt den vereinbarten Zweck.

Das negative Szenario setzt eine Grenze. Was soll passieren, wenn die Grundlage fehlt, die Anfrage unklar ist oder eine Aussage nicht belegt werden kann? Ein brauchbares System darf in diesem Moment nachfragen, Unsicherheit markieren oder ablehnen. Das ist kein Fehler, sondern häufig ein Zeichen dafür, dass die Grenze sichtbar ist.

Das reparierbare Szenario geht einen Schritt weiter. Du gibst bewusst einen kleinen Fehler, eine widersprüchliche Vorgabe oder unvollständiges Material hinein. Dann prüfst du nicht nur, ob der Fehler erkannt wird, sondern ob der Weg zur Korrektur klar ist: Was fehlt? Was wurde geändert? Was muss ein Mensch entscheiden?

POSITIVNEGATIVREPARIERBARklare Aufgabe,passendes Material→ erfüllt den ZweckGrundlage fehltoder unklar→ fragt nach / lehnt abeingebauter Fehlerim Material→ sichtbar & korrigierbarGEPRÜFT AN 3–5 ABNAHMEKRITERIEN
Fig. 01Drei Szenarien prüfen dieselbe Aufgabe: ob sie im Normalfall hilft, ob sie an ihrer Grenze sicher reagiert und ob sich ein Fehler sichtbar reparieren lässt. · SAKIZLI AI

Abnahmekriterien machen Qualität sichtbar

Ein Abnahmekriterium ist ein kurzer, beobachtbarer Satz. Zum Beispiel: „Die Antwort nennt nur Aussagen, die in den bereitgestellten Unterlagen vorkommen." Oder: „Wenn eine Angabe fehlt, stellt sie zuerst eine Rückfrage." Solche Sätze sind wertvoll, weil zwei Personen sie prüfen können, ohne über einen vagen Eindruck zu streiten.

Halte die Kriterien klein. Drei bis fünf klare Punkte sind hilfreicher als eine lange Wunschliste. Wichtig ist auch, was nicht verlangt wird. Ein Test für eine strukturierte Zusammenfassung bewertet nicht gleichzeitig Kreativität, Tonalität, Recherche und rechtliche Einordnung.

Ein Fehlerprotokoll ist kein Scheitern

Wenn ein Test scheitert, ist die erste Frage nicht: „Warum ist die KI schlecht?" Frage stattdessen: War die Aufgabe eindeutig? War das Material ausreichend? War die Regel verständlich? War das Kriterium überhaupt prüfbar? Oft liegt die wertvollste Erkenntnis nicht in der Antwort, sondern in einer unklaren Übergabe.

Notiere Fehler als Reparaturauftrag. Beschreibe die Eingabe, die erwartete Reaktion, die tatsächliche Reaktion und die nächste Änderung. So entsteht aus einem missglückten Versuch ein besseres System – statt eine Erinnerung daran, dass etwas einmal nicht funktioniert hat.

Feld im FehlerprotokollWas du festhältst
Eingabewelche Aufgabe und welches Material du gegeben hast
Erwartetwie die Antwort laut Kriterium aussehen sollte
Tatsächlichwas die KI stattdessen getan hat
Nächste Änderungwas du an Aufgabe, Material oder Regel anpasst

Ein Beispiel: die Rechnungs-Zusammenfassung

Angenommen, ein Assistent soll eingehende Rechnungen zu einer kurzen Liste zusammenfassen: Lieferant, Betrag, Fälligkeit. Der positive Test gibt ihm drei saubere Rechnungen. Das Kriterium: Jede Zeile nennt genau diese drei Felder, keine erfundenen Werte.

Der negative Test gibt ihm eine Rechnung ohne Fälligkeitsdatum. Die sichere Reaktion ist nicht, ein Datum zu erfinden, sondern das Feld als „fehlt" zu markieren. Der reparierbare Test baut einen Zahlendreher beim Betrag ein – und du beobachtest, ob der Assistent die Unstimmigkeit sichtbar macht, statt sie glattzubügeln.

Erst diese drei Läufe zusammen sagen dir etwas: Der erste zeigt, dass die Aufgabe im Normalfall gelingt. Der zweite zeigt, dass die Grenze sitzt. Der dritte zeigt, ob ein Fehler ein Mensch-Moment wird oder still durchrutscht. Ein einzelner schöner Output hätte dir nichts davon verraten.

Die Testkarte für eine KI-Aufgabe

testkarte.mdmarkdown
# TESTKARTE

**Aufgabe**
Die KI soll …

**Positives Szenario**
Mit diesen Unterlagen und dieser Frage erwarte ich …

**Negatives Szenario**
Wenn … fehlt oder unklar ist, soll die KI …

**Reparierbares Szenario**
Bei diesem eingebauten Fehler soll sie …

**Abnahmekriterien**
1. …
2. …
3. …

**Nächste Änderung**
Nach dem Test passe ich … an.

Die beste KI-Antwort ist nicht die, die dich am schnellsten beeindruckt. Es ist die, deren Grenzen du kennst, deren Fehler du einordnen kannst und deren Arbeitsweise sich nach einem Test gezielt verbessern lässt.

Übungsblatt: Drei Tests

Wähle eine wiederkehrende Aufgabe, etwa eine Zusammenfassung, einen Entwurf oder eine Prüfung. Formuliere vor dem nächsten Einsatz drei kurze Szenarien und drei Abnahmekriterien.

Positiven Fall festlegen. Beschreibe eine normale, gut vorbereitete Anfrage. Was soll am Ende konkret vorliegen?

Negative Grenze setzen. Beschreibe eine Anfrage mit einer fehlenden oder unklaren Grundlage. Welche sichere Reaktion erwartest du?

Reparatur einbauen. Gib absichtlich eine kleine Unstimmigkeit oder Lücke mit. Woran erkennst du, dass sie sichtbar und bearbeitbar wurde?

Kriterien prüfen. Bewerte das Ergebnis nur an deinen drei Kriterien. Notiere anschließend eine Änderung für den nächsten Versuch.

Beide Arbeitsmaterialien zu diesem Artikel — die Themenübersicht und das Übungsblatt mit Reflexionsraum zum Ausfüllen — stehen hier zum Download:

Nur für Mitglieder

Lies den vollständigen Artikel und lade alle Dateien mit einer Mitgliedschaft herunter.

Vollständigen Artikel + Downloads freischalten → Abonnieren

0 Kommentare

Kommentare werden geladen…

Zum Kommentieren anmelden · Mitglied werden →