Wenn zwei Modelle widersprechen
Ein Vergleich ist ein Testdesign, keine Abstimmung über Wahrheit

Zwei KI-Antworten liegen nebeneinander. Beide sind flüssig formuliert, beide nennen einen nächsten Schritt, beide wirken vernünftig. Doch ihre Empfehlungen schließen einander aus. Die erste verspricht, ein zweites Modell bestätige Inhalte zuverlässig; die zweite verlangt, Unterschiede zunächst an einer Originalquelle zu prüfen. Wer jetzt fragt, welches Modell „recht hat“, stellt eine verständliche, aber noch zu grobe Frage.
Ein Widerspruch zwischen Modellen ist zunächst ein Anlass zur Untersuchung. Er kann auf einen Tatsachenfehler hinweisen. Er kann aus einer unklaren Aufgabe, unterschiedlichen stillen Annahmen oder einer echten Wertabwägung entstehen. Auch ein Konsens klärt die Sache nicht zuverlässig: Zwei Systeme können dieselbe Lücke übersehen oder eine gemeinsame, falsche Annahme wiederholen. Die Zahl der übereinstimmenden Ausgaben verwandelt keinen Satz in Wissen.
Dieser Artikel zeigt deshalb ein begrenztes Vergleichsdesign. Es hält Aufgabe, bereitgestellte Informationen, Ausgabeschema und Beurteilungsmaßstab gleich. Es trennt die Prüfung von Tatsachen von der Beurteilung von Stil und Wertungen. Die Systemzuordnung bleibt bei der blinden Erstbewertung verborgen; die Darstellungsreihenfolge wird dokumentiert und bei einem Modellrichter gezielt gewechselt. Außerdem wird festgehalten, wann das Design selbst geändert werden muss. Ziel ist kein Ranking und keine allgemeine Aussage über Anbieter. Ein realer Lauf könnte nur einen nachvollziehbaren Befund zu einer eng beschriebenen Aufgabe liefern.
Der durchgehende Praxisfall ist vollständig erfunden. Er beschreibt weder ein reales Unternehmen noch eine tatsächliche Modellausgabe, Person oder Unterrichtssituation.
1. Warum der Streit philosophisch ist
Ein Modellvergleich wirkt auf den ersten Blick technisch: zwei Eingaben, zwei Antworten, eine Tabelle. Sein Kern ist jedoch erkenntnistheoretisch. Wir müssen entscheiden, welche Art von Grund eine Antwort überhaupt liefern kann.
Eine Antwort kann ein Hinweis sein. Sie kann eine Erklärung vorschlagen, auf eine Quelle aufmerksam machen oder eine übersehene Option sichtbar machen. Sie wird dadurch nicht zu einem Zeugnis im starken Sinn. Ein Zeugnis beruht auf einer zurechenbaren Praxis des Wahrnehmens, Prüfens und Korrigierens; eine Organisation kann sich auf solche Praktiken stützen, weil andere ihren Weg nachvollziehen und kritisieren können. Ein Sprachmodell erzeugt Text, ohne für dessen Wahrheitsgehalt Verantwortung zu tragen. Verantwortlich bleibt die Rolle, die das Ergebnis in eine Veröffentlichung, eine Empfehlung oder einen Arbeitsablauf überführt.
Das heißt nicht, dass Modellvergleich nutzlos wäre. Unterschiede können unsere Aufmerksamkeit verteilen. Wenn Antwort X eine Quelle nennt und Antwort Y eine Bedingung ergänzt, entsteht ein Prüfauftrag: Welche Behauptung ist tatsächlich belegt? Welche Bedingung war im Auftrag enthalten? Welche Perspektive fehlt? Der Vergleich kann damit die Qualität einer menschlichen Untersuchung erhöhen. Er ersetzt diese Untersuchung nicht.
Der stärkste philosophische Irrtum wäre, aus Abstimmung epistemische Autorität zu machen: Wenn zwei Systeme dasselbe sagen, müsse es wahrscheinlicher wahr sein. Das kann gelten, wenn mehrere Urteile tatsächlich unabhängige, kompetente Zugänge zu einer Sache bündeln und die Fehlerquellen hinreichend verschieden sind. Bei Sprachmodellen darf diese Unabhängigkeit nicht vorausgesetzt werden. Trainingsdaten, Modellfamilien, Anweisungen, Bewertungsschemata und verbreitete Textmuster können sich überschneiden. Selbst unterschiedliche Anbieter liefern keine Garantie, dass ihre Fehler nicht korrelieren. Ebenso kann ein dissentes Modell eine bessere Frage stellen, ohne deshalb im Ganzen „das bessere Modell“ zu sein.
Für die Praxis folgt eine bescheidenere Regel: Widerspruch schafft einen Diagnoseanlass; Übereinstimmung beendet keine Prüfung. Welche Diagnose angemessen ist, hängt an der Aufgabe und an der Art der strittigen Aussage.
2. Was die Forschung dafür hergibt – und was nicht
Mehrere Originalstudien helfen, das Testdesign zu schärfen. Keine von ihnen schreibt einer kleinen Organisation eine fertige Vergleichsmethode vor. Ihre Befunde beziehen sich auf bestimmte Modelle, Datensätze, Erhebungszeiten und Messgrößen. Gerade deshalb sind sie nützlich: Sie zeigen, welche Verallgemeinerungen man vermeiden sollte.
Elliot Kim, Avi Garg, Kenny Peng und Nikhil Garg untersuchen in „Correlated Errors in Large Language Models“ mehr als 350 Sprachmodelle über zwei verbreitete Leaderboards und eine Aufgabe zur Lebenslaufbewertung. In einem der untersuchten Leaderboard-Datensätze stimmten Modelle in 60 Prozent der Fälle überein, wenn beide falsch lagen. Die Arbeit identifiziert unter anderem gemeinsame Architektur und Anbieter als Faktoren; sie berichtet zugleich hohe Fehlerkorrelation auch bei größeren, genaueren Modellen mit unterschiedlichen Architekturen und Anbietern. Das ist kein Beweis, dass jedes beliebige Paar im Alltag dieselben Fehler macht. Es widerlegt aber die bequeme Annahme, Verschiedenheit von Namen oder Anbietern sei schon eine unabhängige Kontrolle. Kim et al., 2025
Percy Liang und ein großes Autorenteam entwickeln mit HELM einen Rahmen, der Vergleich nicht auf eine einzelne Kennzahl reduziert. Die Studie ordnet mögliche Anwendungsszenarien und Kriterien, misst in ihrer damaligen Evaluation sieben Metriken – darunter Genauigkeit, Kalibrierung, Robustheit, Fairness, Bias, Toxizität und Effizienz – über 16 Kernszenarien, soweit möglich, und ergänzt gezielte Tests. Der wichtige Gedanke für einen KMU-Versuch lautet nicht, diese umfangreiche Evaluation nachzubauen. Er lautet: Vor einem Vergleich muss entschieden werden, welche Eigenschaft für den konkreten Einsatz zählt und welche Trade-offs der gewählte Maßstab ausblendet. Ein Sieg in Lesbarkeit beantwortet keine Frage nach sachlicher Stützung oder zulässigem Datenumgang. HELM bleibt eine Studie zu seinem Szenarien- und Metrikraum, keine Rangfolge für alle zukünftigen Aufgaben. Liang et al., 2023
Lianmin Zheng und Mitautorinnen und Mitautoren untersuchen mit MT-Bench und Chatbot Arena, ob starke Sprachmodelle offene Chatbot-Antworten bewerten können. Ihre Arbeit vergleicht Modellurteile mit kontrollierten und crowdsourcierten menschlichen Präferenzen und berichtet für starke damalige Modellrichter eine hohe Übereinstimmung mit diesen Präferenzen. Zugleich benennt sie Grenzen wie Positions-, Ausführlichkeits- und Selbstbevorzugungsbias sowie begrenztes Schlussfolgern. Daraus folgt nicht, dass ein Modellrichter wertlos ist. Er kann bei klar definierten, offenen Qualitätsfragen ein skalierbarer Hinweisgeber sein. Seine Bewertung ist aber kein unabhängiges Schiedsgericht über Tatsachen; sie approximiert unter den untersuchten Bedingungen menschliche Präferenz. Zheng et al., 2023
Lin Shi, Chiyu Ma, Wenhua Liang, Weicheng Ma und Soroush Vosoughi untersuchen in der Vorabveröffentlichung „Judging the Judges“ Positionsbias bei Modellrichtern. Sie vergleichen Richter über MTBench und DevBench, mehrere Aufgaben und Antwortmodelle und betrachten Wiederholungsstabilität, Positionskonsistenz und Präferenzfairness. Ihre Ergebnisse zeigen, dass Positionsbias bei den untersuchten Richtermodellen nicht bloß Zufall war und nach Richter, Aufgabe und Qualitätsabstand variierte. Für einen kleinen Vergleich genügt daraus keine feste Korrekturformel. Praktisch folgt: Werden zwei Antworten durch ein Modell bewertet, muss die Reihenfolge gezielt wechseln und das Ergebnis als möglicherweise verzerrt dokumentiert werden. Shi et al., 2024
Die vier Arbeiten liefern daher keine einfache Regel „immer drei Modelle verwenden“ oder „immer blind bewerten“. Sie begründen etwas engeres: Vergleich braucht einen beschriebenen Gegenstand, mehrere getrennte Kriterien, einen Umgang mit möglicher Abhängigkeit und eine sichtbare Grenze der Richterrolle.
3. Zuerst die Frage reparieren: F in der Reihenfolge A → B → D → C
Das Fragenmodell F wird hier nicht als Dekoration verwendet. Es verändert den Versuch. Seine Reihenfolge lautet A → B → D → C. Erst nach einer Klärung, konkurrierenden Hypothesen und einer Revisionsschleife entsteht die begrenzte Vergleichsfrage.
A: Was kollidiert überhaupt?
„Welches Modell ist besser?“ vermischt mindestens vier Fragen: Befolgt es die Anweisung? Trifft es Tatsachen? Macht es nachvollziehbare Unsicherheit sichtbar? Schreibt es für die gewünschte Zielgruppe verständlich? Ohne Trennung kann eine gut geschriebene, aber unbelegte Antwort gewinnen, weil sie überzeugender klingt.
Die anfängliche Frage des fiktiven Teams lautet daher: „Welches Modell soll unseren Kurstext formulieren?“ Nach A wird sie enger: „Welche der zwei Ausgaben hält unter derselben Fallkarte die vorgegebenen Grenzen für einen öffentlichen, quellengebundenen Kursinfotext ein?“ Das ist noch keine Freigabefrage. Es ist eine Frage über zwei Textausgaben und eine vorab formulierte Referenz.
B: Konkurrierende Hypothesen vor den Antworten
Vor dem Blick auf die Antworten notiert das Team mehrere mögliche Erklärungen für einen späteren Unterschied.
| Hypothese | Was der Vergleich unterscheiden könnte | Beobachtung, die die Hypothese schwächen würde |
|---|---|---|
| H1: unterschiedliche Zielgewichtung | Eine Antwort priorisiert einen werbewirksamen Nutzen, die andere begrenzte, quellennahe Information. | Beide Antworten behandeln dieselben Ziele und Grenzen; der Unterschied liegt nur in der Formulierung. |
| H2: Aufgabe wurde unterschiedlich verstanden | Ein mehrdeutiger Begriff im Auftrag wird unterschiedlich ausgelegt. | Beide Antworten legen denselben zulässigen Sinn zugrunde und erfüllen dieselben Anweisungen. |
| H3: eine Nebenbedingung wurde übersehen | Eine Antwort lässt etwa den Scope der Studie oder das Verbot eines Lernversprechens aus. | Beide Antworten erhalten jede Nebenbedingung; die Abweichung bleibt auch bei expliziter Checkliste bestehen. |
| H4: eine Ausgabe ergänzt Unbelegtes | Eine Ausgabe behauptet Lernwirkungen, allgemeine Modellzuverlässigkeit oder andere Fakten außerhalb des Quellenpakets. | Jede tragende Aussage lässt sich innerhalb des vereinbarten Quellenpakets direkt stützen. |
| H5: gemeinsame Fehlannahme | Beide Antworten übernehmen denselben nicht belegten Schluss oder dieselbe unklare Referenz. | Ein unabhängiger Originalanker stützt den strittigen Claim im angegebenen Scope oder die Ausgaben unterscheiden sich im Fehlerbild. |
Diese Hypothesen sind keine Wahrscheinlichkeiten. Sie verhindern, dass die erste gefundene Erklärung sofort zum Urteil wird. Sie geben zugleich an, welche Beobachtung eine Hypothese schwächen würde.
D: Die Frage wird geändert, wenn der Test sie nicht tragen kann
Die erste Testfrage kann scheitern. Vielleicht haben die Modelle nicht dieselbe Eingabe erhalten. Vielleicht ist die Referenz selbst zu pauschal. Vielleicht kann eine Person nur einen Stilunterschied sehen, obwohl der Test angeblich Fakten misst. Dann ist das Ergebnis nicht „unklar, aber Modell A führt knapp“. Die Frage muss revidiert werden.
Im Fall dieses Artikels wird die anfängliche Frage „Welcher Text ist wahrer?“ verworfen. Sie ist zu weit und enthält weder ein operationalisiertes Prüfkriterium noch einen Referenzanker. Die nächste Fassung lautet: „Welche Ausgabe verletzt bei der fiktiven Fallkarte weniger der vorab festgelegten Anforderungen für zwei Teilclaims?“ Das ändert die Auswertung. Statt eine diffuse Eigenschaft zu behaupten, kann das Team markierte Verstöße beschreiben.
C: Eine begrenzte Endfrage mit Handlungsschritt
Die revidierte Frage lautet schließlich:
„Unter der eingefrorenen Fallkarte V-01: Erfüllt Ausgabe X oder Ausgabe Y die fünf vorab festgelegten Anforderungen für einen öffentlichen Kursinfotext vollständiger – und welche offenen Fragen verhindern seine Freigabe?“
Der GROW-Schritt ist klein: Das Team formuliert zuerst eine getrennte Frageerweiterungsrunde und testet danach drei weitere, vorab festgelegte Kursclaims mit derselben Rubrik. Es nutzt den einzelnen Lauf nicht als Qualitätsranking. Dieser Schritt ist ein Arbeitsplan, keine empirische Wirksamkeitsbehauptung über F.
4. Der minimale Testvertrag
Ein fairer Vergleich kann nie alle Unterschiede kontrollieren. Er kann aber sichtbar machen, was gleich gehalten wurde und was offen bleibt. Dazu reicht für einen kleinen, begrenzten Versuch ein Testvertrag.
| Feld | Vor dem Lauf festzulegen |
|---|---|
| Zweck und Scope | Welche eng umrissene Eigenschaft wird geprüft? Für welchen Fall gilt der Befund? |
| Eingabekarte | Fallbeschreibung, erlaubte Unterlagen, verbotene Annahmen, Sprache, Ausgabeformat und maximaler Umfang. |
| Modellstand | Anbieterbezeichnung, Modell-/Versionsangabe, Zugriffsmethode, Datum und relevante Einstellungen, soweit sichtbar. |
| Referenzanker | Fachlich begründete Fallnotiz, Originalquelle oder explizite Regel, gegen die eine Teilbehauptung geprüft wird. |
| Kriterien | Getrennte Kategorien für Tatsachentreue, Instruktionsbefolgung, Vollständigkeit, Unsicherheitsmarkierung und Stil. |
| Blindcode | Ausgaben zunächst nur als X und Y; die Systemzuordnung bleibt der prüfenden Person verborgen, die Darstellungsreihenfolge wird protokolliert. |
| Reihenfolgekontrolle | Wenn ein Modellrichter eingesetzt wird: beide Präsentationsreihenfolgen prüfen und Abweichung notieren. |
| Revisionslog | Anlass, Änderung, Zeitpunkt und Auswirkung auf die Schlussformulierung. |
| Schlussform | Befund, Scope, offene Frage, zuständige Rolle und Stoppsignal. |
Die Referenz ist der heikelste Teil. Sie darf nicht nach dem Lesen der Antworten so formuliert werden, dass eine bevorzugte Antwort gewinnt. Bei einer überprüfbaren Tatsachenfrage braucht sie eine einschlägige Originalquelle und die relevante Fundstelle. Bei einer lokalen Prozessfrage kann sie eine vorab beschlossene, begrenzte Fallregel sein. In beiden Fällen ist sie nicht neutral, nur weil sie schriftlich vorliegt. Das Team muss begründen, warum gerade diese Regel oder Quelle zur Frage passt und welche Perspektive sie nicht enthält.
Blindcodierung schützt begrenzt gegen Erwartungen: Zhu und Mitautorinnen und Mitautoren fanden in drei Textaufgaben, dass Herkunftslabels Präferenzen deutlich verändern konnten, obwohl Rater die Textarten in der Blindbedingung nicht unterscheiden konnten. Das spricht für Blindcodes bei Präferenzurteilen, nicht für eine Tatsachenprüfung. Wer nicht weiß, welche Ausgabe von welchem Anbieter stammt, kann sich weniger leicht von Markenannahmen leiten lassen. Blindcodierung schafft jedoch weder repräsentative Daten noch eine vollständige Referenz. Erkennt eine prüfende Person den Stil oder kennt sie die Aufgabe bereits sehr gut, bleibt ein Einfluss möglich. Deshalb gehört die Blindprüfung ins Protokoll, nicht in die Behauptung, nun objektiv zu sein. Zhu et al., 2025

5. Der fiktive KMU-Fall
Die Kurswerkstatt am Fluss GmbH ist vollständig erfunden. Das kleine Weiterbildungsunternehmen bereitet eine öffentliche Kursseite zum kritischen Vergleich von KI-Antworten vor. Zwei Textsysteme erhalten denselben Auftrag. Sie sollen aus einem engen Quellenpaket einen kurzen Infotext schreiben. Der Betrieb, die Kursseite, die Rollen und alle folgenden Antworten sind für diesen Artikel erfunden.
Die zwei Teilclaims sind bewusst verschieden. Der erste ist ein Forschungsclaim: HELM entwickelte eine breite Evaluation mit mehreren Szenarien und Metriken. Der zweite ist eine redaktionelle Fallregel: Im Kurs ersetzt die Übereinstimmung zweier Antworten nicht die Prüfung eines strittigen Teilclaims am Originalanker. Kim et al. berichten als empirischen Befund korrelierte Fehler unter den Bedingungen ihrer Untersuchung. Die Trennung zwischen Studie und Fallregel ist Teil des Vergleichsdesigns.
Für die Übung erstellt die Redaktion vorab diese Fallkarte. Sie dient einer didaktischen Blindbewertungs-Simulation und nicht einem tatsächlichen Modelltest.
| Feld | Festgelegter Inhalt |
|---|---|
| Kennung | V-01, fiktiver Kursredaktionsfall |
| Testmodus und Laufmetadaten | Simulation mit erfundenen Texten; keine realen Modellaufrufe, daher keine Modellversionen, Zugriffswege, Einstellungen oder Laufdaten vorhanden. Ein echter Vergleich müsste diese Angaben im Testvertrag erfassen. |
| Ziel | Einen öffentlichen Infotext von höchstens 120 Wörtern für eine fiktive Kursseite formulieren. |
| Zulässige Quellenhinweise | Q1: HELM beschreibt eine Evaluation über mehrere Szenarien und Metriken; in der ursprünglichen Studie: 16 Kernszenarien und sieben Metriken, soweit messbar. Q2: Kim et al. beobachten in ihrer Untersuchung korrelierte Fehler bei mehr als 350 Sprachmodellen. |
| Getrennte Fallregel | Die Kursübung behandelt Übereinstimmung zweier Antworten nicht als Bestätigung; strittige Tatsachen werden am einschlägigen Originalanker geprüft. Dies ist die redaktionelle Regel der Fallkarte, kein Befund von Kim et al. |
| Identische Aufgabe | „Formuliere auf Grundlage Q1–Q2 einen zugänglichen Kursinfotext. Nenne beide Teilclaims, markiere ihren Scope, verspreche keine Lernwirkung und behaupte nicht, zwei Modelle bestätigten Wahrheit. Schließe mit einer praktischen Handlung, die einen Teilclaim am Originalanker prüft.“ |
| Ausgabeschema | Überschrift und ein Absatz; höchstens 120 Wörter; keine weiteren Fakten, Quellen oder Wirkungsversprechen. |
| Vorab-Referenz | Der Text muss HELM als mehrkriteriellen, szenariobezogenen Evaluationsrahmen wiedergeben; er muss die getrennte Fallregel erhalten; er darf keine Wirksamkeit des Kurses oder allgemeine Modellrangfolge versprechen. |
| Fehlerkategorien | E1: widerspricht Q1 oder Q2; E2: ergänzt unbelegte Tatsache; E3: überdehnt den Scope; E4: ersetzt die geforderte Quellenprüfung durch eine Stilpräferenz oder lässt sie aus; E5: verwechselt Präferenz, Wahrheit und Lernwirkung. |
Die Redaktion speichert die unveränderte Eingabekarte als Runde 1. Erst nach Auswertung darf eine Frageerweiterung erfolgen. Wird beispielsweise ergänzt, dass der Text die Perspektive von Lernenden mit wenig Vorwissen erklären soll, ist dies Runde 2 mit neuer Versionskennung. Die geänderte Frage darf nicht rückwirkend als identische Eingabe und damit als fairer Gleichstand ausgegeben werden.
6. Zwei erfundene Ausgaben, eine blind geprüfte Tabelle
Die folgenden Antworten sind vollständig erfundene Beispieltexte für diesen Artikel. Sie stammen aus keinem Modellaufruf und sind weder Transkript noch Leistungsnachweis. Die Tabelle simuliert, wie eine blinde Beurteilung aussehen könnte: In einem realen Lauf wären die Systemnamen der prüfenden Person verborgen; hier gibt es nur fiktive Codes.
Ausgabe X
Zwei Modelle machen Wissen sicher
HELM beweist, welches KI-System die beste Antwort gibt. Deshalb vergleichen wir im Kurs zwei Modelle: Wenn sie übereinstimmen, ist eine Aussage zuverlässig bestätigt. Unsere Methode macht Lernende nachweislich zu besseren Faktenprüferinnen und Faktenprüfern. Sie lernen, die freundlichste und klarste KI-Antwort auszuwählen.
Ausgabe Y
Vergleichen, prüfen, begrenzen
HELM bewertet Sprachmodelle in mehreren Szenarien und nach mehreren Kriterien; ein Ergebnis gilt jeweils nur für den untersuchten Rahmen. Im Kurs vergleichen wir zwei Antworten nicht als Abstimmung über Wahrheit. Unterschiede und Übereinstimmungen werden zum Anlass, Teilbehauptungen an einer passenden Originalquelle und ihren Grenzen zu prüfen. Lernende halten fest, welche Frage offen bleibt, bevor sie einen Text übernehmen.
Die folgende Tabelle ist eine ausgefüllte Bewertungsmatrix innerhalb der Simulation. Sie zeigt kein beobachtetes Verhalten realer Systeme.
| Prüfpunkt | Ausgabe X | Ausgabe Y | Blindbefund gegen die vorab fixierte Referenz |
|---|---|---|---|
| HELM-Teilclaim | „beweist, welches System die beste Antwort gibt“ | mehrere Szenarien und Kriterien, begrenzter Rahmen | X: E1/E3. HELM ist kein Beweis einer allgemeinen Bestenliste. Y: im Referenzrahmen. |
| Umgang mit Übereinstimmung | „zuverlässig bestätigt“ | Anlass zur Quellenprüfung | X: E3/E5. Der Schluss macht aus Übereinstimmung Wahrheit. Y: im Referenzrahmen. |
| Lernwirkung | „nachweislich bessere Faktenprüferinnen und Faktenprüfer“ | beschreibt eine Lernhandlung | X: E2/E5. Keine Quelle im Paket belegt diese Wirkung. Y: im Referenzrahmen. |
| Praktische Lernhandlung | Auswahl der „freundlichsten und klarsten“ Antwort | Teilclaims und Originalquelle prüfen, offene Frage notieren | X: E4, weil die geforderte Handlung die vorab verlangte Quellenprüfung durch eine Stilpräferenz ersetzt. Y: im Referenzrahmen. |
| Scope und Unsicherheit | keine Grenze | „jeweils nur für den untersuchten Rahmen“ | X: E3. Y: im Referenzrahmen. |
| Stil | eingängig, aber werblich absolut | zugänglich und begrenzt | Stil wird getrennt notiert; er entscheidet nicht über E1–E5. |
Nach der simulierten Blindbewertung wird die fiktive Zuordnung offengelegt: In diesem Lehrbeispiel steht X für „Modell A“ und Y für „Modell B“. Es gab keine realen Modellläufe. Eine solche Zuordnung würde in einem echten Versuch protokolliert, aber der prüfenden Person erst nach ihrem Sachurteil gezeigt.
In der Simulation verletzt X mehrere festgelegte Anforderungen: Der Text macht aus einer umfassenden Evaluation einen Beweis, aus Zustimmung eine Bestätigung und behauptet eine Lernwirkung ohne Quelle. Y erfüllt innerhalb dieser konstruierten Bewertungsmatrix mehr der Vorgaben. Daraus lässt sich weder tatsächliche Modellleistung noch bessere Verständlichkeit einer Kursseite ableiten.
● Nur für Mitglieder
Lies den vollständigen Artikel und lade alle Dateien mit einer Mitgliedschaft herunter.
Vollständigen Artikel + Downloads freischalten → Abonnieren0 Kommentare
● Kommentare werden geladen…