Marin T. Kael
DE / EN

Research · Methodologie-Lab

Wie liest die Maschine einen Autor?

Seit dem 11. Mai 2026 beantworten drei Antwortmaschinen mit Websuche – OpenAI, Gemini und Claude – dieselben 16 Fragen zu einem neuen Autor. Dazu werden Wissensgraphen, Suchindizes und Lese-Plattformen täglich beprobt. Gemessen wird, ob und wie zuverlässig die Maschinen den Autor finden, und wie stabil die Messung selbst ist. Phase 1 endet mit dem Buch-Launch am 8. Oktober 2026; ab dann misst Phase 2 die Wirkung des erschienenen Buches.

Methoden werden vor-registriert, Quellcode und Roh-Daten sind offen, Failure-Logs zählen gleichgewichtig mit Befunden. Adressiert sind Autorinnen und Autoren mit Sichtbarkeits-Frage — und Praktiker:innen der Such- und Antwort-Maschinen-Optimierung (SEO, AEO, GEO), die nach einer validierten Mess-Grundlage statt Anekdoten suchen.

Programmleitung
Marin T. Kael
Aktiv seit
2026-05-11
Kadenz
Messung alle 3 Tage · Berichte quartalsweise
Lizenz
CC BY 4.0 · MIT · CC0
Untersuchungslinien · Aktives 3-Phasen-Design

Aktives Programm in drei zeitlich überlappenden Phasen.

Marin T. Kael’s Forschungsprogramm operiert in drei zeitlich überlappenden Phasen. Phase 1 (Mai bis Oktober 2026) verbindet sieben vor-registrierte Eingriffe Q0–Q6 mit der Prüfung der Mess-Instrumente. Phase 2 (ab dem Buch-Launch am 8. Oktober 2026 bis Q3 / 2027) misst die Wirkung des erschienenen Buches. Phase 3 (ab Q3 / 2027) führt Langzeit-Kontrollexperimente auf der geprüften Apparatur. Wirkungsaussagen in Phase 2 stehen unter dem Vorbehalt der Instrument-Validierung, die bis Q1 / 2027 parallel weiterläuft.

Linie 01

Zitations-Inventur

Was zeigt jedes Mess-Instrument heute überhaupt? Acht Mess-Flächen werden täglich beprobt und die Sichtbarkeit der Autor-Identität pro Identitäts-Cluster — Person, Werk, Genre, Welt-Mechanik — als Abdeckungs-Matrix dokumentiert. In Phase 1 ohne Wirkungs-Interpretation: zuerst zählen, was die Instrumente überhaupt abbilden.

Kern ist die Zitations-Messung: 16 feste Fragen in vier Gruppen (direkt nach Autor und Werk, nach Begriffen aus dem Werk, nach Genre-Empfehlungen, nach dem Forschungsprogramm) an drei Antwortmaschinen mit Websuche – OpenAI, Gemini und Claude (claude.ai, drei Modellstufen) – alle drei Tage. Daneben täglich: Wikidata, Wikipedia, Google Knowledge Graph, Bing, Google Search Console, Common Crawl, Goodreads, Hardcover, Reddit und Bluesky. Jede Antwort wird nach festem Schema von −3 (Halluzination) bis +3 (vollständige, belegte Zitation) bewertet; Kopfzahl ist der Anteil zitierender Antworten je Anbieter (deskriptiv).

Linie 02

Mess-Instrument-Validierung

Reliabel ist ein Instrument, wenn es bei wiederholter Messung gleicher Realität gleiche Werte liefert. Phase 1 prüft jedes Mess-Fläche auf Wiederhol-Reliabilität, intra-Set-Konsistenz und Modell-Drift — und stellt fest, welche Mess-Flächen überhaupt für spätere Wirkungs-Mess­ungen geeignet sind.

Wiederhol-Korrelation r über 24-h-Wiederholungs-Proben (Schwelle r ≥ 0,9 für API-Quellen, ≥ 0,7 für Sprachmodell-Proben). Cronbach’s α intra-Query-Set ≥ 0,7 als Vorbedingung. CUSUM-Karten auf Hit-Rate über 90-Tage-Fenster mit Alarm-Schwelle h = 5. Modell-Versions-Logs werden separat protokolliert; Drift­ereignisse werden mit Drift-Profilen pro Mess-Fläche ausgewiesen.

Linie 03

Codebuch-Iteration

Was zählt überhaupt als „korrekte Citation"? Welche Antwort gilt als Halluzination, welche als korrekt-aber-unvollständig? Phase 1 versioniert das Annotations-Schema öffentlich, dokumentiert Grenzfälle und holt öffentliche Rückmeldungen ein — als Voraussetzung dafür, dass spätere Wirkungs-Aussagen auf einem eindeutigen Mess-Schema beruhen.

Codebuch v0.x → v1.0 als publizierter Meilenstein; bis zur Freigabe von v1.0 (geplant Q1 / 2027) gelten Ergebnisse als deskriptiv. Jede neue Schema-Version erscheint mit Beispiel-Annotationen, Grenzfall-Diskussion und Differenz zur Vorgänger-Version. Inter-Rater-Übereinstimmung (Cohen’s κ) wird ab Q4 / 2026 mit externen Annotator:innen erhoben; Schwelle κ ≥ 0,7 als Bedingung für die Codebuch-Versions-Freigabe.

Linie 04

Offene Materialien

Alles, was das Programm produziert, ist offen: Methoden-Notizen, Vor-Registrierungen, Mess-Quellcode, Roh-Daten, Quartalsberichte, Fehlschlag-Logs, Codebuch-Versionen. Methodik-Reviewer:innen mit Python-Umgebung und Internet-Zugang können jede Auswertung nachvollziehen — das ist der einzige Audit-Mechanismus, den eine Einzelfall-Studie hat.

Methoden-Notizen und Quartalsberichte unter CC BY 4.0, Quellcode auf GitHub unter MIT, Roh-Daten unter CC0 (sofern Plattform-AGB konform). Berichte und Methoden-Notizen erhalten eine Zenodo-DOI. Pro Quartalsbericht ein Replikations-Archiv mit eingefrorenen Versions-Pins, environment.yml, User-Agent-Strings und Endpunkt-Schnappschüsse.

Beispiel-Auswertung · Phase 1

So sieht ein Validierungs-Befund aus.

Phase 1 misst nicht Wirkungen, sondern Mess-Eigenschaften. Wiederhol-Reliabilität r sagt, ob ein Mess-Fläche bei wiederholter Probe gleicher Realität gleiche Werte liefert. Schwelle r ≥ 0,9 wird für API-Quellen angesetzt, r ≥ 0,7 für sprachmodell­basierte Browser-Schnappschüsse.

Die Auswertung steht im Validierungs-Bericht Q3 / 2026. Laufend zeigt die Ergebnisseite die laufenden Messwerte und je Frage, wie oft wiederholte Messungen dieselbe Bewertung ergeben.

Publikationen

Veröffentlicht und in Vorbereitung.

Berichte, Working Papers, Methodenpapiere und Vor-Registrierungen, neueste zuerst. Jede Publikation hat eine stabile URL und ein Zitierschema; Berichte und Methoden-Notizen zusätzlich eine Zenodo-DOI.

Validierungs-Bericht · Q3 / 2026 DOI 10.5281/zenodo.23145378

Wie verlässlich misst das Programm? Prüfung der sechs Instrument-Hypothesen aus der Vorregistrierung Q0-INST

Erster Validierungs-Bericht. Keine der sechs vorregistrierten Instrument-Hypothesen ist bestätigt: drei sind mit dem Datenstand nicht prüfbar, drei nicht bestätigt. Wiederholte Messungen ergeben je Anbieter in 87 bis 94 Prozent dieselbe Bewertung, das Fragenset bildet aber keine einheitliche Skala (Cronbachs α 0,41 bis 0,61). Mit Abdeckungsbilanz, Drift-Alarmen und dem Stand aller Vor-Registrierungen.

Bericht · 03 DOI 10.5281/zenodo.22015495

Gefunden, nicht empfohlen: Wie Sprachmodelle einen neuen Autor in 99 Tagen kennenlernen

Auswertung von 99 Messtagen und 11.130 bewerteten Antworten dreier Antwortmaschinen mit Websuche. Fragen nach Autor und Werk erreichen nach sieben Wochen rund 71 Prozent Zitationsrate und bleiben dort; Fragen nach Begriffen aus dem Werk wachsen langsamer; bei Genre-Empfehlungen wird der Autor in 0,6 Prozent der Antworten genannt. Mit Konfidenzintervallen, Kontrollkanal und offenen Daten.

Working Paper · WP-04

Fünf versteckte Failure-Modes in AEO/GEO-Mess-Pipelines: Lessons from a 7-Day Experiment

Ein siebentägiges vor-registriertes Experiment legte fünf systematische Fehlerquellen offen, die Zitationsraten künstlich stabil oder künstlich niedrig erscheinen lassen. Je Fehlerquelle: Reproduktion, Erkennung und Korrektur. Die korrigierte Auswertung liegt im Mittel 10,6 Prozentpunkte über der fehlerhaften.

Working Paper · WP-02

Pre-Launch LLM Citation: Top-3 Sprachmodelle erreichen 19,8–24,0 % Hit-Rate für einen Pre-Launch-Autor ohne veröffentlichtes Werk

Eine Autor-Identität ohne veröffentlichtes Buch, ohne Rezensionen und ohne Presse erreicht innerhalb von sieben Tagen messbare Zitationsraten: OpenAI-Suche 24,0 Prozent, Claude Haiku und Sonnet je 19,8 Prozent. Einziger Input war Identitäts-Arbeit (Wikidata, ORCID, Zenodo, llms.txt).

Feld-Bericht · T+23 DOI 10.5281/zenodo.20549020

Von Null zu zitiert in sechs Tagen — eine 23-Tage-Messung der KI-Sichtbarkeit

Feld-Bericht über die ersten 23 Tage: Wie schnell beginnen KI-Suchsysteme und Sprachmodelle, einen brandneuen Autor zu lesen, zu verstehen und zu zitieren? Mit Tempo-, Provider-, Kategorie- und Grounding-Auswertung. Offene Daten, Code und der vollständige bilinguale Bericht verlinkt.

Projekt-Journal · Living

Projekt-Herausforderungen und Lösungen

Engineering-Journal der ersten zehn Tage: Pipeline-Hürden, methodische Drift und Reichweiten-Bremsen mit Symptom, Ursache, Lösung und methodischer Folge. Spätere Messausfälle und Methodik-Korrekturen stehen mit Datum und Ursache im Lückenregister der Ergebnisseite.

Methoden-Notiz · 01 DOI 10.5281/zenodo.20170615

Baseline-Messung: Autor-Identität im Zitations-Verhalten von Sprachmodellen (Aktives Pre-Launch-Design)

v2.0 revidiert das Phasen-Modell: Das Programm operiert nicht in „erst Validierung, dann Aktion“, sondern in drei zeitlich überlappenden Phasen mit kontinuierlich pre-registrierten Interventionen. Sieben aktive Pre-Registrationen (Q0–Q6) auf elf Mess-Flächen — incl. Cross-LLM-Trust-Graph, Common-Crawl-Snapshot-Probe, machine-readable Identity-Surfaces.

Vor-Registrierung · Q0 DOI 10.5281/zenodo.20125967

Pre-Launch-Instrument-Validierung · Pre-Launch-Aktivitäts-Fenster 2026-05 → 2026-09

Lockt vor Datenerfassung den vollen Phase-1-Mess­plan: sechs Instrument-Hypothesen H-Q0-INST-01 bis 06 (Wiederhol-Reliabilität, Multi-Schnappschuss-Aggregation, CUSUM-Drift-Sensitivität, Cronbach’s α, Wikidata-Ankerstabilität, Inter-Mess-Flächen-Übereinstimmung), Stichprobenplan, Stop-Kriterien, Kontingenz-Plan und Reproduzierbarkeits-Spezifikation. CC BY 4.0.

Codebuch · v0.1 DOI 10.5281/zenodo.20125976

Annotations-Schema für KI-Zitations-Verhalten

Operationalisiert vor jeder Mess-Probe was als „korrekte Citation“ zu zählen ist: vier binäre Dimensionen (Hit, Korrekt, Halluzination, Vollständigkeit), Anti-Pattern-Katalog, vier dokumentierte Grenzfall-Klassen, Versions-Plan v0.1 → v1.0 mit Inter-Rater-Schwelle Cohen’s κ ≥ 0,7. CC BY 4.0.

Software-Release · v0.3 DOI 10.5281/zenodo.20262669

marin-research-tools — Phase-1 Tooling

Quellcode-Veröffentlichung der Phase-1-Instrument-Validierungs-Werkzeuge: style_lint.py (Style-Sheet-Linter für Outbound), source_attribution_parser.py (Cross-LLM-Trust-Graph), Pre-Registrations Q0–Q6, Operator-Policy-Dokumentation. MIT-Lizenz. GitHub-Tag v0.3. Vorgänger v0.1 (10.5281/zenodo.20126017) und v0.2 (10.5281/zenodo.20189714) bleiben permanent zitierbar; v0.3 supersedes v0.2 by design refactor (siehe CHANGELOG).

Datensatz · T+0 DOI 10.5281/zenodo.20126038

Wikidata Identitäts-Snapshot · Nullpunkt

Wikidata-Items Q139720807 (Autor) und Q139720798 (Buch) zum Stichtag 11.05.2026 als Vollständiger EntityData-Export und SPARQL-Property-Listing. Dient als Ground-Truth-Anker für H-Q0-INST-05 (Coverage-Stabilität > 0,85 über das Pre-Launch-Aktivitäts-Fenster). CC0 1.0.

Validierungs-Bericht · Q4 / 2026 Forthcoming

Inter-Rater-Übereinstimmung & Codebuch v0.2

Zweiter Validierungs-Bericht: Inter-Rater-Übereinstimmung (Cohen’s κ) mit externen Annotator:innen, Codebuch-Versions-Differenz von v0.1 zu v0.2, fortschreibende Drift-Statistiken pro Mess-Fläche, erste Aussagen zu Inter-Mess-Flächen-Übereinstimmung (welche Mess-Flächen sind redundant, welche orthogonal?).

Validierungs-Bericht · Q1 / 2027 Forthcoming

Konsolidierung der Mess-Apparatur

Dritter Validierungs-Bericht: zusammengeführte Reliabilitäts-, Drift- und Inter-Rater-Befunde aus drei Quartalen. Entscheidung über Codebuch v1.0, auf dem belastbare Wirkungsaussagen zu Phase 2 beruhen. Falls einzelne Mess-Flächen die Validierungs-Schwellen nicht erreichen, werden sie für Phase 2 ausgeschlossen oder durch Alternativen ersetzt.

Übergangs-Notiz Forthcoming

Abschluss der Instrument-Validierung · Phase-3-Vor-Registrierungen

Methoden-Notiz mit dem Schluss der Instrument-Validierung und den ersten vor-registrierten Hypothesen für Phase-3-Long-Term-Kontrollexperimente ab Q3 / 2027 auf der validierten Apparatur.

Offene Materialien

Replikation und Auditierbarkeit.

Style-Sheet (kanonische Wahrheit)
Das gegen jede Erhebung verglichene Referenz­dokument wird versioniert gepflegt. Der aktuelle Stand ist auf Anfrage erhältlich.
Mess-Pipeline (Quellcode)
Erhebungs- und Linter-Skripte sind öffentlich auf GitHub: github.com/marintkael/marin-research-tools (Python, MIT-Lizenz). Mit jedem Quartalsbericht erscheint zusätzlich ein Replikations-Archiv mit eingefrorenen Versions-Pins.
Pre-Registrierungen
Jede Erhebung wird vor Datenerfassung mit Hypothese, Mess-Operationalisierung und Stopp-Kriterium veröffentlicht. Spätere Änderungen werden kenntlich gemacht.
Fehlschlag-Protokoll
Jedes durch den Linter blockierte Material wird mit Grund und Datum geloggt. Aggregierte Auszüge sind Teil der Quartals­berichte. Die Politik-Grenze der Pipeline bleibt von außen prüfbar.

Über das Programm

Marin T. Kael ist Autor — und führt parallel ein offen dokumentiertes Feldlabor zur Frage, wie Sprachmodell-basierte Suchsysteme und KI-Antwort­maschinen eine literarische Autor-Identität aufnehmen, verstehen und zitieren. Phase 1 (Mai bis Oktober 2026): vor-registrierte Eingriffe Q0–Q6 vor dem Launch und Prüfung der Mess-Instrumente. Phase 2 (ab dem Buch-Launch am 8. Oktober 2026): Wirkung des erschienenen Buches. Phase 3 (ab Q3 / 2027): Langzeit-Kontrollexperimente auf der geprüften Apparatur.

Adressiert sind Autor:innen, die ihre Sichtbarkeit in der KI-Suche verstehen wollen, sowie Praktiker:innen der Such- und Antwort- Maschinen-Optimierung (SEO / AEO / GEO), die nach einer reproduzierbaren Mess-Grundlage statt anekdotischer Behauptungen suchen. Die Arbeit ist eigenfinanziert und nicht an eine akademische Einrichtung angebunden.

Eine ausführliche Beschreibung — Mission, Methodik, Ethik, Veröffentlichungs­plan — steht unter /research/programme.

Kontakt

Anfragen zu Methodik, Replikation oder Auditierung: research@marin-t-kael.de. Quellcode und Replikations-Archive auf GitHub.