DSR-Rechner
Deflated Sharpe Ratio Rechner: Backtest-Overfitting mathematisch aufdecken
Wer Handelsstrategien auf historischen Marktdaten optimiert, läuft Gefahr, reines Marktrauschen als profitables Muster zu interpretieren. Der finanzen.ai Overfitting-Checker berechnet auf Basis der mathematischen Modelle von David H. Bailey und Prof. Marcos López de Prado (2014), wie viel deiner gemessenen Sharpe Ratio auf echtem Marktvorteil (Alpha) beruht – und ob dein Backtest die Schwelle zur statistischen Signifikanz überschreitet.
Deflated Sharpe Ratio Rechner
Experten-Parameter (Schiefe, Kurtosis, Trials-Varianz)
Methodik: Bailey & López de Prado (2014) · SSRN Paper → Alle Berechnungen client-seitig, keine Datenweitergabe.
Das Multiple-Testing-Problem: Warum Backtests mit hoher Sharpe Ratio im Live-Handel scheitern
In der quantitativen Strategieentwicklung existiert ein bekanntes Dilemma: Ein Handelssystem wird an historischen Marktdaten so lange optimiert, bis der Backtest eine exzellente Sharpe Ratio (oft über 2,0) und eine makellose Performance-Kurve zeigt. Sobald die Strategie jedoch mit echtem Kapital am Live-Markt gehandelt wird, bricht die Performance ein oder führt zu untragbaren Drawdowns.
Die Ursache ist fast nie ein plötzlicher Regimewechsel der Märkte, sondern ein statistischer Methodikfehler: Backtest-Overfitting durch multiples Testen (Data-Snooping Bias).
- Die statistische Täuschung: Wer hunderte Kombinationen von Indikatoren (RSI-Perioden, Gleitende Durchschnitte, Stop-Loss-Levels) auf denselben historischen Kursverlauf anwendet, findet rein stochastisch immer eine Variante, die in der Vergangenheit perfekt funktioniert hat. Das geschieht selbst auf vollständig zufallsgenerierten Zeitreihen (Random Walk).
- Rauschen statt Kausalität: Der Algorithmus lernt die spezifischen Zufallsschwankungen des Testzeitraums auswendig, anstatt echte, wiederkehrende Marktineffizienzen (Alpha) zu erfassen.
- Selektionsverzerrung (Selection Bias): Gängige Plattformen wie MetaTrader oder TradingView zeigen im Bericht nur das beste Ergebnis an. Alle 500 oder 1.000 verworfenen Fehlversuche vor diesem finalen Parametersatz werden ignoriert, als hätten sie nie existiert.
Wissenschaftliche Methodik: Wie die Deflated Sharpe Ratio (DSR) funktioniert
Um dieser statistischen Verzerrung entgegenzuwirken, entwickelten David H. Bailey und Prof. Marcos López de Prado (2014) in ihrer Forschungsarbeit „The Deflated Sharpe Ratio: Correcting for Selection Bias, Backtest Overfitting and Non-Normality“ ein mathematisches Bereinigungsverfahren.
Die Deflated Sharpe Ratio bereinigt die gemeldete Sharpe Ratio um drei entscheidende Störfaktoren:
1. Kompensation für die Anzahl der Versuche (N)
Je mehr Parameterkombinationen getestet werden, desto höher ist die Sharpe Ratio, die rein durch Zufall entstehen muss. Über die Extremwerttheorie (Extreme Value Theory) und die Euler-Mascheroni-Konstante berechnet das Modell den Erwartungswert dieser Zufalls-Performance (SR0). Nur die Rendite, die statistisch signifikant über diesem Benchmark liegt, darf als echtes Alpha gewertet werden.
2. Korrektur von Fat Tails und Asymmetrie (Schiefe und Kurtosis)
Die klassische Sharpe Ratio unterstellt stillschweigend eine Normalverteilung der Renditen. Reale Finanzdaten weisen jedoch extreme Ausreißer (Fat Tails) und asymmetrische Kursverläufe auf. Die DSR bezieht die Schiefe (Skewness) und die Wölbung (Kurtosis) direkt in den Nenner der Teststatistik ein, wodurch asymmetrische Crash-Risiken adäquat berücksichtigt werden.
3. Stichprobenlänge und Zeithorizont (T)
Kurze Backtests über wenige Monate unterliegen enormer Zufallsvarianz. Die DSR setzt die Sharpe Ratio ins Verhältnis zur effektiven Anzahl der Beobachtungsperioden. Kurze Testphasen werden dadurch mathematisch streng abgewertet; je länger der krisenerprobte Track-Record, desto belastbarer das Ergebnis.
Minimum Track Record Length (MinTR): Die erforderliche Backtest-Dauer
Die Minimum Track Record Length (MinTR) beziffert, wie lange ein Backtest bei einer gegebenen Sharpe Ratio und einer bestimmten Anzahl an Versuchen mindestens hätte laufen müssen, um statistische Signifikanz auf dem 95%-Niveau (p < 0,05) zu erreichen.
- Fehlende Datenbasis: Liegt die tatsächliche Backtest-Dauer unter der MinTR, reicht die Datenmenge schlichtweg nicht aus, um Zufall von echter Systematik zu unterscheiden.
- Typisches Praxisbeispiel: Ein Trader testet 300 Varianten und erreicht eine Sharpe Ratio von 1,8. Die MinTR fordert in diesem Fall oft eine Mindesthistorie von 4,5 Jahren. Lief der Backtest nur 18 Monate, ist die Strategie statistisch nicht abgesichert.
- Unendliche MinTR: Liegt die gemeldete Sharpe Ratio unterhalb oder exakt auf dem reinen Zufalls-Benchmark (SR ≤ SR0), wird die MinTR unendlich. Die Strategie kann bei diesem Versuchsaufbau auch bei unbegrenzter Datenmenge keine statistische Signifikanz erlangen.
Woher stammen die Eingabewerte? Anleitung für MetaTrader 5 & TradingView
Die für den Rechner benötigten Daten lassen sich direkt aus den Standard-Reports gängiger Trading-Software ablesen:
MetaTrader 5 (MT5)
- Sharpe Ratio (SR): Öffne den Strategy Tester > Reiter Bericht > Kennzahl Sharpe Ratio.
- Getestete Varianten (N): Bei automatisierten Optimierungen entspricht dieser Wert der Gesamtzahl der Durchläufe im Reiter Optimierungsergebnisse (z. B. „1.200 Passes“). Wurde manuell getestet, trage die geschätzte Gesamtzahl der Testläufe ein.
- Backtest-Dauer: Start- und Enddatum im Kopf des Testberichts (z. B. Start 01/2023 bis 01/2026 = 3 Jahre).
TradingView (Pine Script)
- Sharpe Ratio (SR): Unten im Tab Strategietester > Reiter Performanceübersicht > Kennzahl Sharpe Ratio.
- Getestete Varianten (N): Zähle zusammen, wie oft Skript-Variablen, Indikatoren oder Zeitfenster modifiziert wurden, bis die Strategie stand.
- Backtest-Dauer: Entspricht der Zeitspanne der im Chart geladenen Datenhistorie zwischen dem ersten und letzten Trade.
Python (Backtrader / VectorBT)
Über die Zeitreihe der Strategierenditen lassen sich Schiefe und Wölbung direkt ermitteln (z. B. returns.skew() und returns.kurtosis()) und im Experten-Modus unseres Rechners millimetergenau hinterlegen. Die Anzahl der Versuche entspricht der Anzahl der simulierten Parameter-Kombinationen im Grid- oder Random-Search.
Interpretation der Ergebnisse: Handlungsanweisungen für Trader
Die DSR-Konfidenz liefert klare Entscheidungskriterien für den Übergang von der Entwicklung zur Kapitalallokation:
DSR-Score > 95 % (Grün – Statistisch signifikant):
- Diagnose: Die Wahrscheinlichkeit für reines Overfitting liegt unter 5 %. Der ermittelte Marktvorteil ist robust gegenüber Selektionsverzerrungen.
- Empfohlene Maßnahme: Freigabe für Out-of-Sample-Forward-Tests auf einem Live-Konto mit Kleinstpositionen (Micro-Lots) oder im Demobetrieb unter Echtzeit-Bedingungen.
DSR-Score 50 % bis 95 % (Gelb – Erhöhtes Overfitting-Risiko):
- Diagnose: Die Strategie befindet sich in einer statistischen Grauzone. Es ist unklar, ob Alpha oder Data-Snooping überwiegt.
- Empfohlene Maßnahme: Freie Parameter reduzieren, eine Walk-Forward-Analyse (WFA) durchführen oder den Testzeitraum auf zusätzliche Marktzyklen ausweiten.
DSR-Score < 50 % (Rot – Kritisches Overfitting):
- Diagnose: Die gemessene Performance liegt im Bereich des reinen Zufallserwartungswerts. Das Ergebnis ist ein statistisches Artefakt.
- Empfohlene Maßnahme: Live-Einsatz zwingend stoppen. Die Strategielogik muss von Grund auf neu konzipiert werden; weiteres Nachoptimieren verstärkt das Overfitting nur weiter.
Häufig gestellte Fragen zur Deflated Sharpe Ratio (FAQ)
Die traditionelle Sharpe Ratio bewertet isoliert das Rendite-Risiko-Verhältnis eines einzelnen Testlaufs, setzt eine Normalverteilung voraus und ignoriert den Entstehungsprozess. Die Deflated Sharpe Ratio (DSR) bereinigt das Ergebnis um das Multiple-Testing-Problem (die Anzahl vorangegangener Fehlversuche), asymmetrische Verteilungen (Fat Tails, Schiefe) und die zeitliche Dauer des Tests.
Wenn eine Sharpe Ratio von 2,0 erst nach 500 Iterationen erzielt wurde, liegt der statistische Erwartungswert für das reine Zufallsmaximum bei gegebener Versuchsanzahl oft schon bei 2,1. Die Strategie schneidet somit schlechter ab als der reine Zufall und verliert im Live-Handel typischerweise Geld.
Auch bei genetischen Algorithmen entspricht N der Gesamtzahl aller tatsächlich berechneten Durchläufe (Generationen X Individuen). In MetaTrader 5 entspricht dies der Zahl der abgeschlossenen Passes im Optimierungsbericht.
Eine unendliche MinTR bedeutet, dass die gemeldete Sharpe Ratio kleiner oder gleich dem reinen Zufalls-Benchmark (SR0) ist. In diesem Fall kann die Strategie selbst bei jahrzehntelangem Backtesting niemals statistische Signifikanz erreichen.
Ja, gerade in diesen Märkten ist die DSR unverzichtbar. Krypto- und Devisenrenditen weisen extreme Wölbungen (hohe Kurtosis) und ungleichmäßige Verteilungen auf. Die klassische Sharpe Ratio unterschätzt Verlustrisiken in diesen Märkten systematisch, während die DSR diese Fat Tails mathematisch einpreist.
