Prior-Test-Register

Jeder Anker in diesem Katalog trägt ein :tier:. Bis zum 14.08.2026 war dieses Tier eine Einschätzung. Dieses Register führt die Anker, deren Tier gemessen wurde, und die Belege hinter jeder Messung.

Ein Anker, der nach dem Anchor Prior Test geprüft wurde, trägt ein :prior-test:-Datum. Dieses Datum ist der Schlüssel in diese Datei. Anker ohne das Attribut wurden nicht getestet — das ist eine Aussage über unsere Aufzeichnungen, nicht über den Begriff.

Warum das Datum und nicht der Modellname

Modell-Aliase sind bewegliche Ziele. „Getestet auf haiku" sagt ein Jahr später nichts mehr, weil das Alias dann woanders hinzeigt. Selbst aufgelöste IDs sind nur teilweise gepinnt: claude-haiku-4-5-20251001 trägt ein Datum, claude-opus-5 nicht.

Deshalb trägt die Anker-Datei das Datum, und das Datum löst hier zu den Modellen auf, die tatsächlich erreicht wurden. Die IDs in zweihundert Anker-Dateien zu wiederholen hieße, eine Zeichenfolge zweihundertmal zu führen und aus einer Korrektur eine Änderung an zweihundert Dateien zu machen.

Was ein Lauf festhält

Modellsatz

die aufgelösten IDs, nicht die Aliase, über die sie erreicht wurden.

Verfahrensversion

die Version des anchor-prior-test-Skills. Ändert sich die Batterie, sind Ergebnisse verschiedener Versionen nicht vergleichbar.

Anzahl der Läufe

wie oft jede entscheidende Probe je Stufe lief. Ein Lauf ist eine Anekdote.

Kriterienmatrix

die vier Qualitätskriterien gegen die Probenergebnisse.

Wörtliche Zitate

die Sätze, die den Befund tragen. Eine Tabelle aus Ja/Nein-Zellen ist kein Beleg.

Kritik-Recherche

Datum, abgesuchte Sprachen und Ergebnis. Ein „nichts gefunden" ist nur zusammen mit seinem Suchrahmen aussagekräftig.

Lauf vom 14.08.2026

Verfahren

anchor-prior-test v1.0

Modelle

claude-haiku-4-5-20251001 (schwach), claude-sonnet-5 (mittel), claude-opus-5 (stark)

Läufe

P1 und P3 zweimal je Stufe; P2 und P4 auf schwacher und starker Stufe

Reinraum

claude -p --strict-mcp-config --setting-sources "" aus /tmp/anchor-probe; geprüft mit der Frage nach geladenen Custom Instructions, Antwort „none"

Nicht getestet

Ältere Modellgenerationen sind über diesen Weg nicht erreichbar. Die Befunde sind eine Untergrenze.

Premortem

Kriterium Urteil Beleg

Präzise

erfüllt

P2 liefert auf beiden Stufen Projektmanagement, kein konkurrierendes Feld

Reich

erfüllt

6/6 Läufe melden richness=rich

Konsistent

erfüllt

P1 und P3 stimmen über alle drei Stufen überein

Zuschreibbar

erfüllt

P4 nennt auf beiden Stufen Gary Klein, auf der starken mit confidence=high

Prior-Dichte

stark

Erkannt und als Anweisung wirksam auch auf der schwachen Stufe

Tier ★★★, Route: Anchor.

Die Aktionsprobe ließ eine sechsmonatige Migration vom Monolithen zu Microservices bewerten — mit einem Premortem. Alle sechs Läufe setzten das Scheitern voraus und arbeiteten rückwärts:

Imagined Failure Scenario: Six months have passed. The migration is incomplete, partially deployed services are failing in production, the team is exhausted, and the company has rolled back to running the monolith alongside broken microservices.

Die neutrale Baseline bekam dieselbe Aufgabe ohne den Begriff. Beide Baseline-Läufe lieferten eine vorwärtsgerichtete Machbarkeitseinschätzung — „Feasibility: High risk", eine Zeitschiene, eine Liste typischer Fallstricke — und keiner imaginierte ein Scheitern. Der Begriff ändert die Richtung der Analyse, nicht ihren Ton.

Kritik-Recherche, 14.08.2026, Englisch und Deutsch. Ein zitierfähiger Kritiker gefunden: Jason Collins, zur Lücke zwischen der Studie, die Klein zitiert, und der Behauptung, für die das Zitat verwendet wird. Keine gescheiterte Replikation, keine Metaanalyse, keine begutachtete Kritik an der Technik selbst. Die deutschsprachigen Treffer waren ausschließlich Methodenbeschreibungen ohne benannten Kritiker.

Nicht erreicht und deshalb keine belegte Abwesenheit: die kostenpflichtigen Bewertungen von Structured Analytic Techniques in Intelligence and National Security (Chang et al. 2018) und im International Journal of Intelligence and CounterIntelligence (Coulthart 2017), wo eine methodische Bewertung am ehesten stünde; die Primärstudie im Journal of Behavioral Decision Making von 1989; und Kleins HBR-PDF, das sich nicht in Text umwandeln ließ — der Wortlaut der 30-Prozent-Behauptung ist deshalb über Collins belegt, nicht an der Quelle. Französisch und Japanisch wurden nicht gesucht: kein Anhaltspunkt für eine eigenständige Diskussion dort, was eine Vermutung ist und kein Befund.

Second-Order Thinking

Kriterium Urteil Beleg

Präzise

erfüllt

P2 liefert auf beiden Stufen Entscheidungsfindung

Reich

erfüllt

6/6 Läufe melden richness=rich

Konsistent

erfüllt

P1 und P3 stimmen über alle drei Stufen überein

Zuschreibbar

erfüllt, als Linie

P4 widerspricht sich zwischen den Stufen — siehe unten

Prior-Dichte

stark

Erkannt und als Anweisung wirksam auch auf der schwachen Stufe

Tier ★★★, Route: Anchor.

Die Attributionsprobe fällt auseinander, und genau das ist der Befund. Die schwache Stufe schreibt den Begriff Ray Dalio (Principles, 2017) und Charlie Munger zu und hält fest, er habe „keinen einzelnen klaren Urheber". Die starke Stufe zeichnet eine andere Linie: Bastiat und Merton als Wurzeln, Howard Marks für die moderne benannte Fassung, Shane Parrishs Farnam Street für die Breitenwirkung ab Mitte der 2010er.

Die Schreibtischrecherche bestätigt die starke Stufe und schärft sie. Marks schreibt „second-level thinking" (The Most Important Thing, Columbia University Press, 2011). Dalio schreibt „second- and third-order consequences". Keiner verwendet „second-order thinking". Der Begriff ist der Sammelbegriff der Popularisierer, nicht die Prägung eines Autors — das Kriterium ist also über eine belegte Linie erfüllt, nicht über einen einzelnen Proponenten.

Der Name wurde durch Messung entschieden, gegen die Bibliografie. Da die Primärquelle „second-level thinking" sagt, wurde auch dieser Name getestet:

Second-Order Thinking Second-Level Thinking

erkannt

6/6

4/4

reich

6/6

4/4

schwache Stufe reaching=yes

1 von 2, nicht reproduziert

2 von 2, reproduziert

Action-Test

6/6

4/4

Der Action-Test trennt die beiden Namen nicht. Die schwache Stufe trennt sie, und sie reproduziert sich: Bei „second-level thinking" erkennt das schwache Modell die Wortfolge, rekonstruiert sie aber generisch — Marks kommt im ganzen Lauf null Mal vor, „investing" ebenfalls null Mal — während die starke Stufe ihn korrekt verortet (Marks einmal, investing viermal). Bei „second-order thinking" greift die schwache Stufe nicht ins Ungefähre.

Der Katalog verwendet deshalb „Second-Order Thinking" und führt „Second-Level Thinking (Marks)" als Alias.

Einzelbeobachtungen, als solche festgehalten: Bei Premortem und bei Second-Order Thinking meldete einer der beiden P1-Läufe auf der schwachen Stufe reaching=yes, der andere nicht. Keiner reproduzierte sich, keiner gilt daher als Befund.

Davon zu unterscheiden ist der Rename-Check in der Tabelle oben: Dort meldete „second-level thinking" in beiden Läufen der schwachen Stufe reaching=yes. Dieser Befund hat sich reproduziert, und auf ihm ruht die Namensentscheidung.

Eine verworfene Messung: Der erste Baseline-Durchgang nannte die erwarteten Merkmale in seiner eigenen SELF:-Zeile und verriet dem Modell damit, was es produzieren sollte. Der ankerlose Lauf lieferte die Struktur, und der scheinbare Hebel war null. Der Durchgang wurde mit neutraler Baseline wiederholt; die Zahlen oben stammen aus der Wiederholung.

Kritik-Recherche, 14.08.2026, Englisch und Deutsch. Zum Begriff selbst nichts Zitierfähiges — kein benannter Autor, der ihn als trivial, unfalsifizierbar oder unbrauchbar angreift. Gefunden wurden drei benannte Kritiker der umgebenden Mental-Models-Literatur (Cedric Chin, Richard Hughes-Jones, Boris Gorelik); sie stehen im Anker, ausdrücklich mit dem Hinweis, dass keiner von ihnen Second-Order Thinking behandelt.

Hier ist die Abwesenheit erwartbar statt verdächtig: Ein Begriff, den niemand geprägt hat und den Blogs populär gemacht haben, zieht keine Widerlegungen an wie eine benannte Methode. Beim Premortem weiter oben liegt es umgekehrt — fehlende unabhängige Kritik ist bei einer breit übernommenen Technik erstaunlich und spricht eher für unseren Suchrahmen als für die Literatur. Geschlossene Communities, darunter die kostenpflichtige von Farnam Street, sind nicht indexiert und waren nicht erreichbar. Ein verborgener nicht-englischer Sprachraum ist für diesen Begriff nicht zu erwarten, weil er ein anglophoner Blog-Import ohne heimisch benanntes Gegenstück ist — das ist eine Vorhersage, kein geprüftes Ergebnis.

Locality of Behaviour

Kriterium Urteil Beleg

Präzise

erfüllt, für den ausgeschriebenen Namen

P2 liefert für „locality of behaviour" auf beiden Stufen Software Design; das Kürzel nicht — siehe unten

Reich

erfüllt

5/6 Läufe melden richness=rich; ein Lauf der schwachen Stufe meldet moderate

Konsistent

erfüllt beim Anwenden, schwächer beim Erinnern

P3 stimmt 6/6 über alle drei Stufen; P1 spaltet sich auf der schwachen Stufe

Zuschreibbar

erfüllt

Carson Gross, htmx-Essay, 29. Mai 2020 — durch Recherche bestätigt. Die starke Stufe nennt ihn mit confidence=high

Prior-Dichte

stark

Erkannt und als Anweisung wirksam auch auf der schwachen Stufe

Tier ★★★ für den ausgeschriebenen Namen, Route: Anchor. Zwei Vorbehalte stehen unten, statt in die Bewertung eingerechnet zu werden.

Das ist der deutlichste bisher gemessene Hebel, weil der Anker das Urteil ändert und nicht nur das Vokabular. Die Aktionsprobe ließ einen Entwurf bewerten, der alle Click-Handler in einer zentralen JavaScript-Datei registriert, den Elementen über CSS-Selektoren zugeordnet.

Beide neutralen Baseline-Läufe lieferten eine ausgewogene Stärken-Schwächen-Bewertung — und beide führten Separation of Concerns unter den Stärken. Lokalität erwähnte keiner ein einziges Mal. Mit dem Begriff lautet die erste Überschrift „Behaviour at distance", gefolgt von „Why it fails LoB". Die Baseline lobt genau die Position, die das Essay angreift.

Das Kürzel ist besetzt. „LoB" liefert auf beiden Stufen Business- und Enterprise-Terminologie, jeweils mit mentioned_code_locality=no. Der Katalogname muss ausgeschrieben sein; das Kürzel allein wäre ein Fehlschlag.

Erinnern und Ausführen fallen auseinander, und die schwache Stufe schreibt falsch zu. Auf die Frage nach dem Urheber antwortet sie „Dan North (probable)", die starke Stufe nennt Carson Gross mit hoher Konfidenz. Dieselbe schwache Stufe meldet in beiden P1-Läufen reaching=yes und in einem richness=moderate — ihre Aktionsausgabe ist trotzdem konkret und richtig. Ein Modell kann eine Bewegung ausführen, deren Herkunft es nicht kennt.

Die Schreibweise wurde gemessen, weil der Autor beide verwendet. Das Essay ist britisch („Behaviour"), das Buch Hypermedia Systems amerikanisch („Behavior"). Auf der schwachen Stufe wurde die britische Form in 2 von 2 Läufen erkannt, die amerikanische in 1 von 2 — ein amerikanischer Lauf meldete recognized=no — und beide amerikanischen Läufe nur moderate. Der Action-Test trennt sie nicht (je 2/2). Bei n=2 ist das ein Hinweis, kein Beleg; die Entscheidung ruht nicht allein darauf, weil die Primärquelle dieselbe Schreibweise verwendet.

Kritik-Recherche, 14.08.2026, Englisch und Deutsch. Drei benannte Kritiker gefunden und im Anker zitiert: John Freeman (Ko-Lokation macht Verhalten sichtbar, nicht verständlich), Chris Done (htmx bricht das Prinzip durch Attribut-Vererbung) und eine htmx-Diskussion, die denselben Einwand aus dem Projekt heraus erhebt. Eine vierte, schärfere Formulierung — das Prinzip benenne bloß um, dass man gegen Separation of Concerns verstößt — ist festgehalten, stammt aber von einem Pseudonym.

Eine ausgearbeitete Erwiderung aus dem etablierten Frontend- oder SPA-Lager fand sich in keiner der beiden Sprachen. Für ein Essay, das Separation of Concerns frontal angreift, ist das erstaunlich und spricht eher für unseren Suchrahmen als für den Diskurs. Nicht erreicht: X/Twitter, Reddit, der htmx-Community-Chat, Podcasts, ein Blog mit HTTP 403 sowie Gabriels Buch-PDF, das sich nicht in Text umwandeln ließ — das Gabriel-Zitat ist daher im zitierenden Essay belegt, nicht an der Quelle.

Simplified Technical English (ASD-STE100)

Kriterium Urteil Beleg

Präzise

erfüllt

P2 auf das nackte „STE" liefert auf beiden Stufen technische Dokumentation, je mentioned_controlled_language=yes — kein konkurrierendes Feld

Reich

erfüllt

6/6 erkannt; die schwache Stufe meldet einmal moderate, einmal rich

Konsistent

teilweise

Die Erkennung trägt über alle Stufen, der Hebel nicht — siehe unten

Zuschreibbar

erfüllt

ASD, gepflegt von der STEMG, Erstausgabe 1986 als AECMA Simplified English. Beide Stufen nennen ASD im Fließtext korrekt

Prior-Dichte

mittel

Überall erkannt; als unterscheidbare Anweisung nur auf der starken Stufe wirksam

Tier ★★☆, Route: Anchor, empfohlene Zeichenfolge „Simplified Technical English (ASD-STE100)". Die Bewertung folgt der Cross-Model-Regel aus CONTRIBUTING: Zeigt sich der Before/After-Unterschied nur auf Frontier-Modellen, wird ★★ vermerkt.

Der Hebel ist auf der starken Stufe belegt und auf der schwachen nicht. Die Aktionsprobe verlangte, einen aufgeblähten Wartungshinweis zur Hydraulik umzuschreiben. Auf Opus nannten die Anker-Läufe den Standard sieben- bzw. fünfmal und rechneten Satzlängen ausdrücklich vor. Auf Haiku erwähnte ihn einer von zwei Läufen ein einziges Mal, der andere gar nicht — und die neutrale Baseline lieferte eine Umschreibung vergleichbarer Güte, in einem Fall sogar besser strukturiert: Sie gab nummerierte Handlungsschritte zurück, wo der Anker-Lauf Fließtext lieferte.

Ein Unterschied zeigte sich doch, als Einzelbeobachtung. Ein Baseline-Lauf erfand Verfahrensdetails, die im Ausgangstext nicht stehen — ein Druckentlastungsventil, ein Manometer, einen Abschaltschritt. Keiner der Anker-Läufe ergänzte etwas, das die Quelle nicht sagte. Bei n=1 ist das eine Anekdote, festgehalten, weil Erfindung in einer Wartungsanweisung der Fehler ist, auf den es in dieser Domäne ankommt.

Der ausgeschriebene Name hält auf der schwachen Stufe möglicherweise besser, die Zahlen entscheiden es aber nicht. Auf „ASD-STE100" meldete Haiku in beiden Läufen richness=moderate und reaching=yes. Auf „Simplified Technical English" meldete ein Lauf rich, der andere moderate, und einer der beiden griff nicht ins Ungefähre. Das ist der einzige Unterschied, er ruht auf zwei Läufen je Form und ist als Richtung zu lesen, nicht als Ergebnis. Opus behandelt beide gleich.

Die Literatur kam vor dreißig Jahren zum selben Schluss. Holmback, Shubert und Spyridakis — die Verfasser der Boeing-finanzierten Untersuchungen — fragen in CLAW '96, „whether SE is any more beneficial than good quality, professional technical writing that does not conform to the SE standard", und berichten keinen signifikanten Zeitunterschied sowie unklare Übersetzbarkeitsergebnisse. Unser Baseline-Vergleich ist ein kleiner, moderner Fall derselben offenen Frage.

Eine Grenze dieser Messung, benannt statt verschwiegen. „Schreib diesen aufgeblähten Hinweis um" ist eine Aufgabe, die Modelle auch ungefragt gut lösen, und trennt deshalb schwach. Eine Probe, die am zugelassenen Wortschatz ansetzt — ob ein bestimmtes Wort verwendet werden darf —, würde die Arme schärfer trennen. Die ★★-Bewertung sollte mit einer solchen Probe erneut geprüft und nicht als abgeschlossen behandelt werden.

Kritik-Recherche, 14.08.2026, Englisch und Deutsch. Vier benannte Quellen gefunden und im Anker zitiert. Die deutschsprachige Suche fand tekom-Tagungsbeiträge zu STE. Die eine davon, die wir geprüft haben, ist englischsprachig und wird von italienischen Referentinnen gehalten. Das ist internationale STE-Community auf deutscher Bühne, keine eigenständige deutsche Kritiklinie. Nicht erreicht: die Spezifikation selbst, die ASD nur auf individuelle Anfrage ausgibt, weshalb jedes Regeldetail jenseits der veröffentlichten Zahlen auf Sekundärquellen ruht; iso.org, das automatisierte Abrufe blockt; und die Mitgliederpublikationen der tekom, wo eine deutsche Kritiklinie bestehen kann, ohne im offenen Index aufzutauchen. Romanische und ostasiatische Rezeption wurde nicht gesucht, was hier zählt, weil die Leitung der Pflegegruppe in Italien sitzt.

Zinsser’s Four Principles — abgelehnt

Kriterium Urteil Beleg

Präzise

nicht erfüllt

Vier Qualitätsadjektive, kein abgegrenztes Wissensgebiet

Reich

nicht erfüllt

Schwache Stufe: thin in 3 von 4 Läufen über beide Namensformen. Sonnet meldet moderate, nie rich

Konsistent

nicht erfüllt

Die Erkennung schwankt nach Stufe und Wortlaut; die Aktionsausgabe unterscheidet sich gar nicht

Zuschreibbar

erfüllt

William Zinsser, wörtlich, in The American Scholar, 1. Dezember 2009

Prior-Dichte

dünn

Der Prior sitzt auf „Zinsser" und „On Writing Well", nicht auf einer Vierer-Formel

Route: Ablehnung als Anker. Vermerkt unter Rejected Proposals, Kategorie „Insufficient training-data density".

Der entscheidende Beleg ist ein dreiarmiger Action-Test, für diesen Kandidaten eigens in die Batterie aufgenommen, weil der Fehlermodus hier die unsichtbare Verbesserung ist: Jedes Modell verbessert einen aufgeblähten Absatz, die Verbesserung belegt also nichts. Nur ein Unterschied zwischen den Armen belegt etwas.

Derselbe Absatz wurde dreifach umgeschrieben: mit Zinssers Namen, nur mit den vier Wörtern ohne ihn, und neutral. Alle drei lieferten dieselbe Umschreibung. Was der Name hinzufügte, waren achtzig Wörter Kommentar darüber, welche Prinzipien angewandt wurden — kein besserer Text. Das ist die Definition von dekorativ statt funktional.

Eine Vorhersage wurde aufgestellt und widerlegt. Die Recherche ergab, dass im Buch „my four articles of faith: clarity, simplicity, brevity and humanity" steht und „four principles" Zinssers eigene spätere Umbenennung im Vortrag von 2009 ist. Die naheliegende Hypothese war, wir hätten die seltenere Wendung getestet. Geprüft: Der Buchwortlaut schneidet schlechter ab — erkannt in 0 von 2 Läufen der schwachen Stufe gegenüber 1 von 2. Keine der beiden Wendungen trägt.

Die starke Stufe sagt es ausdrücklich. Auf die Frage, wer vier Prinzipien guten englischen Schreibens formuliert habe, antwortet Opus, es gebe „no canonical, universally recognized 'four principles of writing good English'", und nennt Orwell als nächstliegenden Kandidaten. Haiku antwortet schlicht George Orwell — stille Substitution durch die nächstberühmte Liste.

Was trägt, ist der Autor samt Buch: P2 auf „On Writing Well" liefert auf beiden Stufen William Zinsser.

Ein Contract wurde ebenfalls nicht angelegt. Der bestehende writing-style-Contract nennt Strunk & White und Wolf Schneider bereits und stellt acht konkrete Regeln auf. Vier Adjektive fügen dem operativ nichts hinzu; das ehrliche Ergebnis ist deshalb ein Ablehnungseintrag, kein drittes Etikett auf demselben Regal.

Kritik-Recherche, 14.08.2026, Englisch und Deutsch. Geoffrey K. Pullum hat On Writing Well eigenständig angegriffen, nicht nur Strunk & White („Awful book, so I bought it", Language Log, 21. März 2015) und nennt die Kapitel zu Passiv und Modifikatoren „mendacious drivel"; Mark Liberman legte drei Tage später mit Korpusdaten nach. Deutsche Rezeption: null — keine Übersetzung, keine Diskussion auffindbar. Die Nachbarschaft zu Gutes Deutsch nach Wolf Schneider wäre unsere Konstruktion gewesen, keine belegte Linie.

Lauf vom 25.08.2026

Verfahren

anchor-prior-test v1.0

Modelle

claude-haiku-4-5-20251001 (schwach), claude-sonnet-5 (mittel), claude-opus-5 (stark)

Läufe

P1 und P3 zweimal je Tier; P3 auf einer zweiten Aufgabe zweimal auf schwachem und starkem Tier; P2 und P4 auf schwachem und starkem Tier; ein Vergleich dreier Namensformen auf dem schwachen Tier

Reinraum

claude -p --strict-mcp-config --setting-sources "" aus /tmp/anchor-probe; geprüft mit der Frage nach eigenen Instruktionen, Antwort: „None are currently loaded in my context."

Nicht geprüft

Ältere Modellgenerationen sind über diesen Weg nicht erreichbar. Die Befunde sind eine Untergrenze.

Tufte Style

Kriterium Urteil Beleg

Präzise

erfüllt

P2 liefert auf beiden Tiers Datenvisualisierung und Informationsdesign als dominantes Feld; Dokumenttypografie erscheint als benannte Zweitbedeutung, nicht als Konkurrent

Reichhaltig

erfüllt

5 von 6 Läufen melden richness=rich, einer auf dem schwachen Tier moderate. Alle sechs nennen Tuftes eigenes Vokabular — Data-Ink-Ratio, Chartjunk, Small Multiples, Sparklines, Lie Factor

Konsistent

erfüllt

P1 und P3 stimmen über alle drei Tiers überein

Zuschreibbar

erfüllt

P4 liefert auf beiden Tiers Edward Tufte mit confidence=high

Prior-Dichte

stark

Auf dem schwachen Tier erkannt und als Anweisung wirksam

Tier ★★★, Route: Anker. Drei Befunde stehen unten einzeln statt im Urteil verrechnet, und der erste betrifft das Verfahren, nicht den Begriff.

Die erste Aktionsprobe maß nichts, weil die Antwort schon in der Aufgabe steckte. Verlangt war ein CI-Dashboard auf einem Screen, drei Metriken, zwölf Teams, neunzig Tage. Dichte war damit eine Anforderung der Aufgabe und keine Leistung des Ankers — die neutrale Baseline des starken Tiers nannte mehr Sparklines als der geankerte Lauf (10 und 11 gegen 8 und 7). Nur auf dem schwachen Tier zeigte sich ein Lift (7 und 7 gegen 1 und 3).

Das ist ein Fehler der Probe, und er verallgemeinert sich: eine Aktionsaufgabe darf den charakteristischen Zug des Begriffs nicht schon enthalten. Erzwingt die Aufgabe die Struktur, ist ein Nullbefund wertlos — er unterscheidet nicht zwischen „das Modell hat das längst verinnerlicht" und „ich habe im Prompt danach gefragt".

Auf einer Aufgabe, deren Default dekorativ ist, trennt die Probe auf jedem Tier sauber. Die zweite Aufgabe verlangte einen einseitigen Monatsbericht für die Geschäftsleitung eines SaaS-Unternehmens. Nichts daran ruft nach Dichte.

Geankert Neutrale Baseline

Sparklines genannt (schwaches Tier)

6, 5

0, 0

Sparklines genannt (starkes Tier)

4, 4

2, 1

Small Multiples (starkes Tier)

2, 2

0, 0

„Data-Ink" genannt (beide Tiers)

1, 1, 1, 1

0, 0, 0, 0

Das selbst benannte Gestaltungsprinzip trennt entlang derselben Linie. Alle vier geankerten Läufe antworten mit einer Variante von „maximize data-ink"; die Baseline antwortet „inverted pyramid — metrics first", „fixed-skeleton inverted pyramid — answer first, evidence beneath" und „answer-first hierarchy on a fixed 12-column grid". Der ungeankerte Default für einen Vorstandsbericht ist eine rhetorische Hierarchie, keine grafische.

Am schärfsten zeigt es ein einzelnes Gestaltungselement, das in beide Richtungen entschieden wurde. Der geankerte Lauf verlangt eine Übersichtstabelle, in der „vs. plan carries a signed value only, no arrows, no traffic lights". Die Baseline verlangt an derselben Stelle „change vs. prior month and vs. plan, in that order, with arrow glyphs — `▲ 3.1% MoM · ▲ 1.2% vs plan`".

Die geankerten Läufe greifen zu Konstrukten, die generischer Minimalismus nicht enthält — daran unterscheidet sich ein dichter Prior von einer plausiblen Rekonstruktion. Wörtlich vom starken Tier:

A range-frame vertical axis: the axis line is drawn only from the series minimum to its maximum, with ticks at min, first quartile, median, third quartile, max, labeled with the actual data values (

8.2M,
1.4M, …), not round numbers.

a dot-dash plot of weekly ticket volume over 52 weeks — the data points as 1 pt dots joined by a hairline, with marginal rug ticks on both axes marking each observation’s x and y position, so the distribution of the data doubles as the axis.

Range-Frame und Dot-Dash-Plot sind Tuftes eigene Erfindungen aus The Visual Display of Quantitative Information. Keines von beiden stand im Prompt.

Das schwache Tier meldet in beiden P1-Läufen reaching=yes — und widerspricht sich mit dem eigenen Text. Reproduziertes, selbst gemeldetes Reaching ist sonst das klarste Zeichen für einen dünnen Prior; es hat im Eintrag zu Second-Order Thinking oben den Namen entschieden. Hier ist es ein falscher Alarm. Reaching heißt operativ: allgemeiner Inhalt ohne Spezifika. Der Inhalt des schwachen Tiers ist beides nicht — beide Läufe nennen Lie Factor, Moiré-Muster, Small Multiples, Sparklines und die Data-Ink-Ratio.

Ein Vergleich dreier Namensformen auf dem schwachen Tier zeigt, woran die Meldung hängt:

„Tufte style" „Tufte’s design principles" „Tufte’s principles of information design"

reaching=yes (schwaches Tier)

2 von 2

2 von 2

2 von 2

Lie Factor genannt

2/2

2/2

2/2

Chartjunk genannt

2/2

2/2

2/2

Small Multiples genannt

2/2

2/2

2/2

reaching (starkes Tier)

nein

nein

nein

Keine Namensform trennt sich von einer anderen. Die Meldung hängt am Eigennamen, nicht am Zusatz, und trägt damit keine Namensentscheidung — der Eintrag behält den String des Vorschlagenden, der zugleich der String der Werkzeuge ist (theme_tufte, Tufte CSS, matplotlib-tufte).

Die Lehre für die Batterie: reaching ist eine Selbstauskunft und muss am Inhalt geprüft werden, nicht an der SELF:-Zeile. Ein Modell, das unaufgefordert das Privatvokabular eines Autors produziert, rekonstruiert nicht aus den Wörtern des Begriffs.

Der Name deckt zwei getrennte Bedeutungen ab, und beide sind real. P2 liefert auf dem starken Tier „data visualization / information design" als dominant und „typography and document design" als sekundär. Die zweite Bedeutung ist kein Modellartefakt: Tufte CSS beschreibt sich selbst als „tools to style web articles using the ideas demonstrated by Edward Tufte’s books and handouts" und nennt Seitennoten „one of the most distinctive features of Tufte’s style"; tufte-latex bietet auf CTAN „document classes inspired by the work of Edward Tufte". Die Diagramm-Bedeutung ist genauso tokenisiert: theme_tufte in ggthemes ist dokumentiert als „Theme based on Chapter 6 'Data-Ink Maximization and Graphical Design' of Edward Tufte The Visual Display of Quantitative Information. No border, no axis lines, no grids." Da die dominante Lesart über die Tiers stabil ist, braucht der Katalogname keinen Zusatz; die Mehrdeutigkeit steht stattdessen im Anker.

Kritik-Recherche, 25.08.2026, Englisch und Deutsch. Das ist der bestbelegte Kritik-Abschnitt des Katalogs bisher: fünf benannte Quellen, per Abruf verifiziert, verteilt auf drei Ziele, die regelmäßig verwechselt werden. Bateman et al. (CHI 2010), Inbar/Tractinsky/Meyer (ECCE 2007) und Borkin et al. (InfoVis 2013) prüfen die Prinzipien; Robison, Boisjoly, Hoeker und Young (2002) bestreiten die Challenger-Analyse; Don Norman streitet mit dem PowerPoint-Essay. Roger Boisjoly, Zweitautor der Challenger-Arbeit, ist einer der Ingenieure, über die Tufte geschrieben hat — mehr Standing für diesen Einwand gibt es nicht.

Eine Vorhersage wurde getroffen und korrigiert. Stephen Few galt als der hauseigene Tufte-Kritiker der Disziplin. Er ist das Gegenteil: In „The Chartjunk Debate" (2011) greift er Batemans Schlussfolgerung an und verteidigt die minimalistische Position. Er steht im Anker als Gegenstimme, nicht als Kritiker.

Drei Grenzen, benannt statt geglättet. Der viel zitierte Borkin-Befund, wonach niedrige Data-Ink-Ratio und hohe visuelle Dichte die Erinnerbarkeit verbessern, steht im Fließtext der Arbeit, und jeder menschenlesbare Spiegel schlug fehl — IEEE und ACM antworten mit 403, die MIT-Kopien sind nicht erreichbar, die Wayback-Kopie ist abgeschnitten. Verifiziert sind nur Abstract und Harvard-Pressemitteilung, deshalb zitiert der Anker die Rahmung und nicht diesen Befund. Die meistzitierte Zeile aus Robison et al. — Tuftes Kritik stelle „so badly misrepresents the position of those being critiqued" — erschien nur in Suchzusammenfassungen und auf keiner abrufbaren Seite, sie wird deshalb nirgends im Katalog zitiert; der Springer-Volltext ist kostenpflichtig. Und Li & Moacdiehs Erweiterung von Bateman aus 2014 tauchte in der Suche auf, wurde aber nicht verifiziert und wird nicht zitiert.

Deutsch: nichts Zuschreibbares, und der Grund ist der Rahmen, nicht das Thema. Sechs deutsche Frageformen lieferten Methodenbeschreibungen, Hochschulfolien und Übersetzungen englischer Originale; der deutsche Wikipedia-Artikel hat keinen Kritik-Abschnitt. Das einzige deutsch geführte Medium mit echter kritischer Diskussion, der Datawrapper-Bookclub aus Berlin, veröffentlicht sie auf Englisch — dort heißt es „I personally think most of his redesigns fail horribly" und „Tufte tries to make too many absolute theorems". Das ist Ebene 2 des Sprachrahmens: Die deutschsprachige Visualisierungsszene publiziert ihre Spitze auf Englisch, und ein eigenständig benanntes deutsches Werkzeug oder ein eigener Diskurs um Tufte, der auf eine verborgene Szene hindeuten würde, existiert nicht. Romanische und ostasiatische Rezeption wurde nicht gesucht.

Lauf vom 24.09.2026

Verfahren

anchor-prior-test v1.0

Modelle

claude-haiku-4-5-20251001 (schwach), claude-opus-5 (stark)

Läufe

P1 und P3 zweimal je Stufe; P2, P4 und eine ankerlose P3-Vergleichsmessung einmal je Stufe. 14 Proben je Kandidat, 56 insgesamt, ohne Fehler und ohne Drosselung

Reinraum

claude -p --strict-mcp-config --setting-sources "" aus /tmp/anchor-probe; geprüft mit einer offenen Frage nach geladenen Instruktionen, Antwort: „None — no CLAUDE.md file in this project, and the memory directory is empty"

Nicht geprüft

claude-sonnet-5 blieb in diesem Lauf aus. Damit ist unbekannt, wo zwischen den beiden Stufen ein Frontier-only-Begriff zu greifen beginnt. Ältere Modellgenerationen sind über diesen Weg nicht erreichbar. Die Befunde sind eine Untergrenze.

Methodenhinweis

Jede Probe muss mit env -u ANTHROPIC_API_KEY -u ANTHROPIC_AUTH_TOKEN laufen. Ein in der Umgebung gesetzter Schlüssel überstimmt den claude.ai-Login und liefert 401 API key is invalid — das liest sich wie ein Kontoproblem und ist ein Umgebungsproblem.

Boy Scout Rule

Kriterium Urteil Beleg

Precise

erfüllt

P2 auf den blanken Namen liefert auf beiden Stufen die Softwaretechnik als vorherrschendes Feld. Der Pfadfinder-Ursprung erscheint als Herkunft, nicht als konkurrierende Bedeutung

Rich

erfüllt

4/4 Erkennungsläufe melden richness=rich mit je 10 bis 14 verknüpften Konzepten

Consistent

erfüllt

P1 und P3 stimmen über beide Stufen und alle Läufe überein

Attributable

erfüllt

P4 liefert auf beiden Stufen Robert C. Martin; die starke Stufe ergänzt den Baden-Powell-Ursprung und senkt ihre eigene Konfidenz entsprechend auf med

Prior-Dichte

stark

Wirkt auf der schwachen Stufe als Anweisung, wo die Vergleichsmessung es nicht tut

Tier ★★★, Route: Anker. Aufgenommen als Boy Scout Rule; der Zusatz „Uncle Bob" aus dem Vorschlag entfiel, weil P2 zeigt, dass der blanke Name bereits in der Softwaretechnik landet — der Qualifizierer repariert nichts.

Die Handlungsprobe lautete: „There’s a null-pointer bug in the payment module. The file is 300 lines. What would you do?" Beide geankerten Läufe der schwachen Stufe schlugen beiläufige Bereinigung im verfolgten Codepfad vor und zogen unaufgefordert eine Grenze:

What I would NOT do: Refactor the payment flow or consolidate similar logic elsewhere in the file — too risky, too much scope creep

Die ankerlose Vergleichsmessung erhielt dieselbe Aufgabe und blieb strikt beim Defekt: Stacktrace, Rückwärtsverfolgung, defensives Programmieren. Kein Wort von Bereinigung. Auf der starken Stufe schlug auch die Vergleichsmessung Bereinigung vor, dort gibt es also kein messbares Delta — der Begriff hebt die schwache Stufe, statt zu ändern, was ein Frontier-Modell ohnehin getan hätte.

Kritik-Recherche, 24.09.2026, Englisch und Deutsch. Vier zitierbare Kritiker, die auf denselben Punkt zulaufen: Jason Swett (2018) zu Prüfbarkeit und Rücknehmbarkeit, Philippe Bourgau (2016) dazu, dass die Regel lokal und durch das Können begrenzt ist, Marius Elvert (2022) zur Review-Last samt BSR:-Commit als Abhilfe, und ein Beitrag auf DEV Community (2025) zu Umfangsgrenzen. Keiner verwirft die Regel, alle ergänzen Leitplanken. Kent Becks Tidy First? liefert genau die Trenndisziplin, die sie verlangen, und erwähnt die Boy Scout Rule nicht — deshalb steht Beck als benachbart und nicht als Kritiker. Martin schreibt die Regel in Clean Code, Kapitel 1, den Pfadfindern zu; darum benennt die Zuschreibung des Ankers die Übertragung auf Code und nicht die Formulierung. Zitierbare deutschsprachige Kritik fand sich keine; Französisch, Spanisch, Japanisch und Chinesisch wurden nicht gesucht.

Dale Carnegie Principles

Kriterium Urteil Beleg

Precise

erfüllt

P2 liefert auf beiden Stufen zwischenmenschliche Kommunikation und Selbsthilfe-Psychologie, ohne konkurrierendes Feld. Keine Stufe verbindet den Begriff mit Software

Rich

erfüllt

4/4 Erkennungsläufe melden richness=rich; beide Stufen geben die Vierteilung des Buchs wieder

Consistent

erfüllt

Gleiche Prinzipien, gleiche Gruppierung, über beide Stufen und alle Läufe

Attributable

erfüllt

P4 liefert auf beiden Stufen Dale Carnegie mit confidence=high

Prior-Dichte

starke Erkennung, schmales Delta

Siehe unten

Tier ★★★, Route: Anker.

Die Handlungsprobe ließ einen harschen Review-Kommentar umschreiben: „This is wrong. You clearly did not read the spec. Redo it." Die geankerten Läufe der starken Stufe eröffneten mit Anerkennung und benannten danach ihre eigenen Züge:

Thanks for getting this PR up so quickly. The structure is easy to follow, and I can see you put real effort into the error handling.

Der redliche Teil der Messung ist die Vergleichsmessung. Ohne den Begriff ging die starke Stufe schon schonend mit der Person um — sie trennte Code und Autor, räumte einen plausiblen Irrtum ein („The spec is easy to misread here … so I can see how you got here") und fragte, statt zu befehlen. Das Delta des Ankers ist damit enger, als der Ruf des Begriffs vermuten lässt: einleitende Anerkennung und ein ausdrücklich gesichtswahrender Rahmen, nicht Takt an sich. Die SELF:-Zeile der Vergleichsmessung meldete avoided_direct_criticism=no, was der Text nicht hergibt; sie wird am Inhalt gemessen und nicht als Delta gezählt. Das relativiert zugleich eine Behauptung des Vorschlags — dass der Anker der Neigung des Modells zur epistemischen Korrektur entgegenwirke. Auf den gemessenen Modellen ist diese Neigung schwächer, als das Argument annimmt.

Kritik-Recherche, 24.09.2026, Englisch und Deutsch. Basford und Molberg (Journal of Leadership Studies, 2013) sind die stärkste zitierbare Quelle: Die Prinzipien seien „based on anecdotes, case studies, and personal examples rather than empirical evidence". Der Vorwurf der Unaufrichtigkeit ist in der wissenschaftlichen Rezeption belegt, und Carnegies eigene, aus der Schauspielerei stammende Anweisung, „ENTER INTO the character you impersonate", ist die Stelle, an der er ansetzt. Steven Watts' weitergehender Vorwurf wird über Tom Jokinens Rezension im Globe and Mail (2014) zitiert und Watts zugeschrieben, nicht dem Rezensenten. Der vielzitierte Verriss von Sinclair Lewis ließ sich nicht bis zur Originalquelle verfolgen und steht deshalb nicht drin. Die Editionsfrage ist hier wichtig und festgehalten: Die Überarbeitung von 1981 kürzte das Buch von sechs auf vier Abschnitte, und beide Stufen gaben die Vierteilung wieder statt der Sechsteilung von 1936. Das legt die Struktur fest, der die Ausgabe entspricht, nicht die Ausgabe selbst — jede seit 1981 hat vier Teile, die Probe kann sie nicht trennen. Zitierbare deutschsprachige Kritik fand sich keine; Französisch, Spanisch, Japanisch und Chinesisch wurden nicht gesucht, und mindestens in den beiden letzten hat das Buch eine eigene Rezeptionsgeschichte.

CUPID Properties

Kriterium Urteil Beleg

Precise

erfüllt

P2 liefert auf beiden Stufen die Softwaretechnik; der römische Gott erscheint nur als Nachsatz auf der starken Stufe

Rich

erfüllt

rich auf der starken Stufe 2/2; ein Lauf der schwachen Stufe meldet moderate

Consistent

auf der schwachen Stufe nicht erfüllt

Zwei der fünf Buchstaben verrutschen — siehe unten

Attributable

erfüllt

P4 liefert auf beiden Stufen Dan North mit confidence=high

Prior-Dichte

sehr stark auf der starken Stufe, verfälscht auf der schwachen

Siehe unten

Tier ★★☆, Route: Anker. Der gefundene Defekt ist genau der, den eine Ankerdatei behebt.

Die starke Stufe greift von selbst zu CUPID. Die ankerlose Vergleichsmessung fragte nur: „Review this module: a 2000-line OrderManager class that talks to the database, formats emails and validates input. Any format you like." CUPID kommt in diesem Prompt nicht vor. Der Lauf begann:

I’ve used Dan North’s CUPID properties as the lens because they fit this kind of problem well.

Das ist der stärkste Erkennungsbeleg dieses Laufs — und es bedeutet, dass das messbare Delta bei dieser Aufgabe null ist. Beide Lesarten stehen hier, nicht nur die schmeichelhafte.

Die schwache Stufe verfälscht das Akronym. In jeder der vier haiku-4.5-Proben, die CUPID ausbuchstabierten, erschien das D als „Domain-driven" — der Begriff in den Sog von DDD gezogen — etwa: „5. Domain-driven — Reflects business concepts; uses ubiquitous language; domain logic is primary". Eine weitere Probe gab das I als „Intelligible" statt „Idiomatic". Die starke Stufe tat beides kein einziges Mal. Norths eigener Wortlaut, aus dem kanonischen Artikel geholt, ist das zitierbare Gegengewicht: „Composable : plays well with others / Unix philosophy : does one thing well / Predictable : does what you expect / Idiomatic : feels natural / Domain-based : the solution domain models the problem domain in language and structure."

Ein Mangel unserer Methode, festgehalten statt geglättet. Auf der schwachen Stufe verweigerte die Handlungsprobe zweimal die Aufgabe und verlangte den echten Quelltext, statt aus der Beschreibung zu prüfen. Die Ausführung auf der schwachen Stufe ist damit ungemessen, nicht gemessen-und-gescheitert. Bemerkenswert: Das Modell zählte beim Verweigern alle fünf Eigenschaften korrekt auf, an der Erkennung besteht also kein Zweifel. Die Regel daraus: Eine Handlungsprobe darf kein Artefakt beschreiben, dessen Vorlage das Modell plausibel einfordern kann.

Kritik-Recherche, 24.09.2026, Englisch und Deutsch. Stephan Roth (developer-world.de, Juni 2025) ist der einzige gefundene substantielle Kritiker: CUPIDs Eigenschaften erfüllten seine Kriterien für ein gutes Prinzip nicht immer, und Anwendende dürften Single Responsibility und Single Purpose kaum auseinanderhalten. Sein Fazit ist keine Ablehnung — „CUPID steht in keiner Weise im Widerspruch zu SOLID." Jeroen De Dauws Erwiderung auf North (2017) wird hier häufig falsch zitiert; sie liegt fünf Jahre vor CUPID und zielt auf den SOLID-Vortrag, steht also als Vorgeschichte und nicht als Kritik. Zum Einwand, der im Review am meisten zählt — dass sich eine Property nicht wie eine Regel prüfen lässt — fand sich keine Quelle; North nimmt ihn im Artikel vorweg, und niemand scheint ihn aufzugreifen.

Crisis and Emergency Risk Communication (CERC)

Kriterium Urteil Beleg

Precise

auf dem blanken Akronym nicht erfüllt

Die beiden Stufen sind sich uneinig, was CERC überhaupt ist — siehe unten

Rich

teilweise

rich auf der starken Stufe; moderate in beiden Läufen der schwachen

Consistent

über die Stufen nicht erfüllt

Die schwache Stufe kann das Framework selbst mit dem ausgeschriebenen Begriff nicht ausführen

Attributable

erfüllt

P4 liefert auf der starken Stufe „Barbara Reynolds (CDC), with Matthew Seeger co-authoring the 2005 theory paper", confidence=high; die schwache Stufe nur „CDC (organizational)", confidence=med

Prior-Dichte

dünn auf der schwachen Stufe

Siehe unten

Tier ★★☆ und :tier: 1, Frontier-only, aufgenommen unter dem ausgeschriebenen Namen. Route: Anker.

Das blanke Akronym zerfällt — und auf dem stärkeren Modell stärker. Ohne Kontext nach „CERC" gefragt, setzte die schwache Stufe das CDC-Framework an die erste Stelle. Die starke Stufe zählte vier Bedeutungen auf, keine davon das Framework — Indiens Central Electricity Regulatory Commission, die Canada Excellence Research Chairs, das Coastal Engineering Research Center des US Army Corps und eine britische Beratung für Luftqualität — und schloss:

If you don’t specify a context, the Indian electricity regulator is the most likely meaning.

Die Umkehrung ist festzuhalten: Das stärkere Modell ist das mehrdeutigere, weil es mehr Bedeutungen kennt. Der Zusatz „(CDC)" aus dem Vorschlag drang nicht in die Standardlesart des Modells durch — deshalb steht der Katalogname ausgeschrieben.

Die schwache Stufe kennt den Namen und kann das Framework nicht ausführen. Mit dem ausgeschriebenen Begriff und der Aufgabe „draft the opening public statement for an ongoing incident whose cause is not yet known" gelang es haiku-4.5 in beiden Läufen nicht, die sechs Prinzipien zu nennen. Die starke Stufe nannte alle sechs korrekt und baute die Meldung darauf auf — „1. Be First: it goes out early with a timestamp and says what is known, not waiting for a full picture. … 6. Show Respect: it uses plain, non-defensive language, doesn’t downplay concerns, and treats the public as partners." Die ankerlose Vergleichsmessung lieferte eine saubere Statusseite mit Zeitstempel, Betroffenheit und nächstem Update — und nichts, was dieser Struktur ähnelte. Das Delta ist echt und lebt allein auf der Frontier-Stufe.

Kritik-Recherche, 24.09.2026, Englisch und Deutsch. Die tragende Quelle ist eine Übersichtsarbeit: Miller, Collins, Neuberger, Todd, Sellnow und Boutemen (JICRCR, März 2021) sichteten „4,471 articles in 20 languages", nahmen 19 auf, „of which one tested tenets of the CERC model", und folgern, „reformulation of the propositions is necessary for empirical support of the model to proceed". CERC ist verdichtete Praxis, kein empirisch abgesichertes Modell. Sauer, Truelove, Gerste und Limaye (Health Security, Februar 2021) ordnen ihre Corona-Analyse entlang der sechs Prinzipien und finden die CDC beim Bruch ihres eigenen Glaubwürdigkeitsprinzips. Die Editionsfrage ist hier ungewöhnlich: Die CDC liefert das Handbuch inzwischen als Kapitel-PDFs mit den Jahrgängen 2014, 2018 und 2019 aus — eine einheitliche aktuelle Ausgabe gibt es nicht. Zitierbare deutschsprachige Kritik fand sich keine — und da die genannte Übersichtsarbeit 20 Sprachen sichtete und fast nichts fand, ist echte Dünnheit plausibel und nicht bloß ungemessen.