Review 2026-07-26 — Zahlen- und Fakten-Prüfer

Gegenstand: Zulassungsarbeit (Kap. 1–6 + Kurzfassung), Belegtreue jedes \cite-Zitats gegen die Primärquellen-PDFs.

Methodik:

  • Alle \cite-Aufrufe aus E_manuskript/latex/chapters/*.tex extrahiert (49 Zitate über 8 Quellen)
  • Für jede Quelle mit PDF: pdftotext -layout per Seite, Offset Journal-Seite ↔ PDF-Seite bestimmt (PNRB15 +138, Bre96 +122, Bre01 +4, Qui86 +80, RS04 +76, Sha48 ±0, BFOS84 −12, Qui93 −12)
  • Für jedes Zitat: umgebender Satz aus .tex, charakteristische Keywords in PDF-Text der angegebenen Seite gesucht; bei Miss ±3 Seiten geprüft
  • Baseline-Findings der manuellen Vorabprüfung (PNRB15 6 Positionen) vollständig reproduziert

Bewertung: ⚠️ Bedingt akzeptiert — 11 Findings (0 Kritisch, 7 Hoch, 3 Mittel, 1 Info); alle Findings sind Seitenangaben oder Zusatz-Qualifikatoren, keine falschen Zahlen oder verzerrten Formeln.


Befunde

#SchwereBibKey · S. · Kap. Z.BefundEmpfohlene Korrektur
1HochPNRB15 · S.140 · 05_Anwendung Z.31„1000 Euro pro Tag” verortet auf S.140; im PDF steht der Beleg auf S.142 („A European long-haul truck costs on average €1000 per day in fixed costs.“)Seitenangabe S.~140S.~142 ändern
2HochPNRB15 · S.141 · 05_Anwendung Z.59Formel der posterioren Wahrscheinlichkeit auf S.141 verortet; Definition und Gl. (1) stehen jedoch auf S.142 (Zeilen 214–220 im PDF-Text)S.~141S.~142
3HochPNRB15 · S.144 f. · 05_Anwendung Z.117SMOTE-Definition („identifies for any given positive example the k nearest neighbours…creates new synthetic examples…”) vollständig auf S.145 (nicht 144 f.); S.144 enthält nur Abschnittsüberschrift „4.6 Balancing the data set” und Rahmenaussagen, kein SMOTE-DetailS.~144\,f.S.~145
4HochPNRB15 · S.142 · 05_Anwendung Z.166„Hohe Accuracy allein durch das durchgängige Vorhersagen der Mehrheitsklasse” verortet auf S.142; S.142 sagt nur „measures like accuracy…suitable only for balanced data sets”. Die explizite Aussage „heavily biased towards the majority class” steht auf S.144 (Z. 381 f.)S.~142S.~144
5HochPNRB15 · S.142 · 05_Anwendung Z.173Profit-Formel (Gl. (3) im Paper: Profit = TP·ECUR − FP·CPR − Investment) verortet auf S.142; im PDF steht Gl. (3) auf S.143 (Zeile 302). S.142 enthält nur die verbale Einführung der drei KostenkomponentenS.~142S.~143
6HochPNRB15 · S.149 · 05_Anwendung Z.262„Usage-Parameter tragen mehr zur Vorhersage bei als Wear” verortet auf S.149. Die numerische Aussage („Usage features performed best”) und die Fig.-6/7/8-Ergebnisse sind auf S.147 direkter belegt (Z. 689). S.149 diskutiert nur die Nebenrolle der Age-Normalisierung. Zwischen S.147 und S.149 liegt zusätzlich Tab. 1 auf S.148, die die numerische Reihenfolge belegt.Präzisieren: S.~147 (Textbeleg) oder S.~148, Tab.~1 (numerischer Beleg), nicht S.~149
7HochBFOS84 · S.216 · 03_Funktionsprinzipien Z.29 + Z.146Zweimalige Verortung „Regressionsimpurität = mittlere quadratische Abweichung; Blattvorhersage = Mittelwert der Zielwerte” auf S.216. S.216 ist jedoch die Kapitel-Öffnungsseite von Kap. 8 „Regression Trees” und enthält nur einleitende Bemerkungen. Die Proposition 8.10 („The value of that minimizes is the average of for all cases falling into ”) steht auf S.230, die MSE-Impuritätsformel ebenfalls auf S.230Beide Vorkommen S.~216S.~230; alternativ ergänzen mit M1/M2-Markern auf den Zielseiten
8MittelQui86 · S.91 · 03_Funktionsprinzipien Z.27„Vorhersage aus der häufigsten Klasse der zugeordneten Datenpunkte” belegt auf S.91. Dort steht die „more frequent class”-Regel jedoch nur als Fallback-Regel für leere Teilmengen ; die allgemeine Baseline-Regel für Blattzuweisung („leaf labelled with the class”) steht auf S.88 (im ID3-Grundrahmen)Präziser: S.~88 (allgemeine Regel) oder Formulierung anpassen, dass der Beleg der Fallback-Fall ist
9MittelPNRB15 · S.148 · 05_Anwendung Z.254„Ersparnis…rund 110 Euro pro Fahrzeug und Jahr” — Der Zusatz „pro Jahr” ist im Paper nicht belegt. PNRB15 definiert nProfit als „per vehicle Profit (in €) which is the Profit normalised with respect to the number of vehicles in the testsets” (S.148, Zeile 779) — ohne Zeitperiode. Der Zeitrahmen des Profits ergibt sich aus dem Testdatensatz (PH = 15 Wochen), nicht aus einem KalenderjahrEntweder „pro Jahr” streichen (nur „rund 110 Euro pro Fahrzeug”) oder als eigene Extrapolation kenntlich machen (z.B. „hochgerechnet auf ein Jahr”)
10MittelPNRB15 · S.141 f. · 05_Anwendung Z.72Zitat „Δ mit 15 Wochen gleichgesetzt, auf letzte LVD reduziert, kein DB-Zugriff nötig” mit S.~141 f. verortet. Der 15-Wochen-Werkstattzyklus ist zwar auf S.141 (Zeile 93) erwähnt, die drei explizit zitierten Kernentscheidungen (W-Annahme, Markov-Reduktion von , „without the need to access a historical database”) stehen jedoch ausschließlich auf S.142 (Zeilen 231–251).S.~141\,f.S.~142 präziser; alternativ mit M-Marker gezielter setzen
11InfoPNRB15 · S.148, Tab.~1 · 05_Anwendung Z.237Alle sieben Wertepaare des Balkendiagramms (Expert 0,84/64, Wear 1,59/86, Wear AN 0,62/22, Usage 1,94/114, Usage AN 1,60/110, Beam 1 1,66/116, Beam 2 0,75/54) stimmen exakt mit Tab. 1 auf S.148 überein. Zitat korrekt.Keine — mustergültige Belegtreue bei Tabellen-Zitat

Zusammenfassung pro Quelle

PNRB15 (18 Zitate)

  • ✓ korrekt: 9 (Z.38, 48, 76, 82, 89, 104, 109, 149, 237, 248 — Tabellenwerte, Datensatzangaben, KS-Test, fahrzeugweise Trennung)
  • ✗ falsche Seite: 5 (Z.31, 59, 117, 166, 173 — Baseline-Findings reproduziert)
  • ⚠ inhaltliche Abweichung: 3 (Z.72 Seitenangabe zu weit; Z.254 „pro Jahr” ohne Beleg; Z.262 S.149 vs S.147 diskutierbar)
  • ❓ nicht auffindbar: 0
  • Fehlerquote: 5–8 von 18 (28–44%) — bestätigt und vertieft die Vorabprüfung

BFOS84 (17 Zitate — Recherche-PDF unvollständig, aber alle relevanten Seiten verfügbar)

  • ✓ korrekt: 13 (Z.10, 28, 34, 39, 62, 63, 103 f., 103 M1, 103 M2, 174, 203, 230, 231, 229, 476)
  • ✗ falsche Seite: 2 (beide Z.29 + Z.146 auf S.216 → sollten S.230 sein — dieselbe Fehlplatzierung zweimal)
  • ⚠ inhaltliche Abweichung: 0
  • ❓ nicht auffindbar: 0 (alle benötigten Seiten im PDF vorhanden — S.39, S.62 f., S.216, S.229–231, S.103 f., S.25 f., S.28, S.174, S.203 alle geprüft)
  • Fehlerquote: 2 von 17 (12%)

Bre96 (7 Zitate)

  • ✓ korrekt: 7 (Z.11 Instabilität, Z.26 Genauigkeit, Z.33 Bagging-Definition, Z.40 50/25 Bootstrap-Zahl, Z.46 Aggregation, Z.56 6–77% Fehlerreduktion, Z.60 k-NN als stabiles Gegenbeispiel)
  • Alle Zahlen exakt: „50 für Klassifikation und 25 für Regression” (S.135, wörtlicher Beleg); „6% bis 77%” (S.124 Zusammenfassung, S.125 + S.127 Detailtabellen)
  • Fehlerquote: 0%

Bre01 (7 Zitate)

  • ✓ korrekt: 7 (Z.106 Def. Random Forest, Z.112 zufällige Merkmalsteilmenge feste Größe, Z.122 Stärke/Korrelation, Z.168 Out-of-Bag ohne separaten Testsatz, Z.177 + Z.196 Permutation Importance, Z.11 breites Datensatzspektrum)
  • OOB-Fußnote-Herleitung konsistent mit S.11 („about one-third of the instances are left out”)
  • Fehlerquote: 0%

Qui86 (6 Zitate)

  • ✓ korrekt: 5 (Z.10 ID3-Rekursion, Z.32 Reinheit-Abbruchkriterium, Z.293 Log Basis 2, Z.314 Gain-Formel, Z.333 Gain Ratio auf S.100 ff.)
  • ⚠ diskutierbar: 1 (Z.27 „häufigste Klasse” — Beleg auf S.91 nur für Fallback, allgemeine Regel implizit auf S.88)
  • Fehlerquote: 0–17%

Qui93 (3 Zitate)

  • ✓ korrekt: 3 (Z.424 stetige Merkmale S.25 f., Z.456 Pre/Post-Pruning S.36 f., Z.481 Binomial-Obergrenze S.40 f.)
  • Fehlerquote: 0%

RS04 (1 Zitat)

  • ✓ korrekt: 1 (Z.351 „98% Übereinstimmung, 50–200 Datenpunkte, zwei binäre Merkmale” — S.91 f. Wortlaut exakt)
  • Fehlerquote: 0%

Sha48 (2 Zitate)

  • ✓ korrekt: 2 (Z.286 Entropie-Einführung S.10 Sektion 6 „Choice, Uncertainty and Entropy”; Z.287 Formel S.11 Theorem 2)
  • Fehlerquote: 0%

Gesamtbilanz

MetrikWert
Geprüfte Zitate (Kap. 1–6 + Kurzfassung)49
✓ korrekt41 (84%)
✗ falsche Seite7 (14%) — 5 in PNRB15, 2 in BFOS84
⚠ inhaltliche Abweichung / Präzisionsproblem3 (6%) — 2 in PNRB15, 1 in Qui86
❓ nicht auffindbar0
Kritische Findings0 (keine falsche Zahl, keine falsche Formel, keine verzerrte Kernaussage)
Hoch-Findings7
Mittel-Findings3
Info-Findings1 (mustergültige Tabellenwerte in Z.237)

Problematischste Quelle: PNRB15 mit 28–44% Fehlerquote bei Seitenangaben. Empfehlung: Alle 18 PNRB15-Zitate vor Abgabe erneut manuell durchgehen — Muster deutet auf systematisches Verschieben um ±1–2 Seiten hin (vermutlich Verwechslung Journal-Seitenzahl mit PDF-interner Seitenzahl während der Fließtext-Erstellung).

Zweitstärkste Fehlerquelle: BFOS84 mit einer wiederkehrenden Fehlplatzierung (S.216 statt S.230 in zwei Zitaten). Kapitel-Öffnungsseite mit Kapitel-Inhaltsseite verwechselt.

Positive Befunde:

  • Alle numerischen Werte des Balkendiagramms Z.237 (Tab.~1 aus PNRB15) exakt übernommen
  • Alle Formeln (Bagging, Random Forest, Gini, Information Gain, Shannon-Entropie, Regressionsimpurität) notationstreu zu den Primärquellen
  • Alle Formel-Zitate mit M-Markern (BFOS84 S.103 M1/M2, Bre96 S.123–124 M1/M2, Qui86 S.88 M1/M2 usw.) inhaltlich konsistent
  • Bre96, Bre01, Qui93, RS04, Sha48 vollständig fehlerfrei
  • Keine hinzugefügten Zahlen oder erfundenen Prozentsätze
  • Keine übersetzten Fachbegriffe mit Bedeutungsänderung
  • Notationskonsistenz // zu allen Primärquellen erhalten

Empfohlene Sofort-Maßnahmen (priorisiert)

  1. PNRB15-Sweep: Fünf Hoch-Findings (#1–5) in 05_Anwendung.tex mit einem einzigen Edit-Durchgang beheben — alle folgen dem Muster „Seitenangabe um 1–2 zu niedrig”.
  2. BFOS84 S.216 → S.230: Beide Vorkommen (Z.29 und Z.146 in 03_Funktionsprinzipien.tex) auf S.230 korrigieren.
  3. PNRB15 Z.254 „pro Jahr”: Entweder streichen oder als eigene Extrapolation ausweisen.
  4. PNRB15 Z.262: Auf S.~147 (Textbeleg „Usage features performed best”) oder S.~148, Tab.~1 (numerischer Beleg) präzisieren.
  5. PNRB15 Z.72: Auf S.~142 präzisieren.
  6. Qui86 Z.27: Auf S.~88 präzisieren oder Formulierung anpassen.

Nach diesen Korrekturen ist die Belegtreue der Arbeit sauber; die Verteidigung kann ohne Angriffsfläche „falsche Seitenangabe” durchgeführt werden.


Zusammenhänge