Deflated Sharpe Ratio (DSR): Definition, Berechnung und Schutz vor Backtest-Overfitting

Offizielle Definition

Die Deflated Sharpe Ratio (DSR) ist eine von David H. Bailey und Marcos López de Prado (2014) entwickelte statistische Kennzahl der quantitativen Finanzanalyse. Sie korrigiert den nominalen Sharpe-Quotienten einer Anlagestrategie um zwei fundamentale Verzerrungen: das multiple Testen im Rahmen von Optimierungsläufen (Data-Snooping-Bias bzw. Selection Bias) sowie die Abweichung der Renditen von der Normalverteilung durch Schiefe und Wölbung (Fat Tails). Die DSR quantifiziert als Wahrscheinlichkeitswert zwischen 0 und 1, mit welcher statistischen Signifikanz die Performance eines Handelsmodells über reinem Zufall liegt.

Steckbrief: Deflated Sharpe Ratio auf einen Blick

Kategorie: Quantitative Metriken & Risiko / Backtest-Statistik
Begründer: David H. Bailey und Marcos López de Prado (2014)
Mathematische Basis: Extremwerttheorie, Probabilistic Sharpe Ratio (PSR), Euler-Mascheroni-Approximation
Primäre Input-Parameter: Nominaler Sharpe-Quotient, Anzahl der Versuche (N), Stichprobenlänge (T), Schiefe (γ3), Kurtosis (γ4), Varianz der Versuche
Schwellenwert für Signifikanz: DSR > 0,95 (äquivalent zu p < 0,05)
Interaktive Validierung: Verfügbar im DSR-Rechner von finanzen.ai

Mathematische Funktionsweise: Vom Standard-Quotienten zur Deflation

Die klassische Sharpe Ratio setzt voraus, dass Renditen unabhängig und identisch normalverteilt sind (IID Gaussian Distribution) und dass lediglich eine einzige Strategie isoliert getestet wurde. In der Realität quantitativer Entwicklungsprozesse treffen beide Annahmen praktisch nie zu. Quantitative Researcher testen Hunderte oder Tausende von Parameterkombinationen, bevor sie die profitabelste Variante auswählen. Dieser Prozess erzeugt zwingend Scheinerfolge durch reinen Zufall.

Das fundamentale Selektionsdilemma (Data Snooping Bias)

Wird eine große Anzahl N unabhängiger Handelsmodelle auf demselben historischen Datensatz evaluiert, folgt der maximale beobachtete Sharpe-Quotient unter der Nullhypothese (keine echte Vorhersagekraft vorhanden) einer extremwertstatistischen Verteilung. Selbst wenn jede einzelne Strategie in Wirklichkeit einen Erwartungswert von null besitzt, steigt der Spitzenwert mit wachsendem N monoton an.

Die Deflated Sharpe Ratio löst dieses Selektionsproblem. Sie prüft nicht, ob der gemessene Quotient größer als null ist, sondern ob er signifikant größer ist als der Erwartungswert des Maximums aus N Zufallsversuchen.

Die stochastische Formulierung nach Bailey und López de Prado

Der Schwellenwert der Nullhypothese entspricht dem erwarteten Maximum aus N Versuchen. López de Prado leitet diesen Erwartungswert über die Extremwerttheorie (Gumbel-Grenzverteilung) unter Nutzung der Euler-Mascheroni-Konstante ab:

$$E[\max_N \{SR\}] \approx \sqrt{\text{Var}(\{SR_n\})} \cdot \left[ (1 - \gamma)\,\Phi^{-1}\left(1 - \frac{1}{N}\right) + \gamma\,\Phi^{-1}\left(1 - \frac{1}{N \cdot e}\right) \right]$$

In dieser Gleichung bezeichnet Var({SR_n}) die Varianz der Sharpe Ratios über alle durchgeführten Modelltests, γ ≈ 0,5772156649 die Euler-Mascheroni-Konstante, e die Eulersche Zahl und Φ-1 die inverse Standardnormalverteilung.

Die finale Deflated Sharpe Ratio berechnet sich anschließend über die kumulierte Verteilungsfunktion der Probabilistic Sharpe Ratio (PSR), ausgewertet an diesem inflationsbereinigten Benchmark-Wert:

$$\text{DSR} = \text{PSR}(E[\max_N \{SR\}]) = \Phi\left( \frac{(SR - E[\max_N \{SR\}]) \cdot \sqrt{T - 1}}{\sqrt{1 - \gamma_3 \cdot SR + \frac{\gamma_4 - 1}{4} \cdot SR^2}} \right)$$

Hierbei repräsentiert T die Anzahl der Renditebeobachtungen in der Stichprobe, γ3 die Schiefe (Skewness) und γ4 die Wölbung (Kurtosis) der empirischen Renditeverteilung.

Einfluss von Fat Tails: Schiefe und Wölbung

Strategien mit asymmetrischen Verlustprofilen wie Short-Volatility-Ansätze oder eng getaktete Grid-Systeme weisen häufig eine stark negative Schiefe gepaart mit hoher Kurtosis auf. Dies erzeugt auf den ersten Blick optisch glatte Equity-Kurven und nominal hohe Sharpe Ratios.

Die DSR bestraft solche Verteilungen im Nenner der Formel rigoros. Erhöhte Kurtosis vergrößert die Varianz des Schätzers dramatisch. In der Folge sinkt der resultierende DSR-Wert selbst bei hoher nominaler Rendite drastisch ab und entlarvt das inhärente Tail-Risk.

Einsatz am Kapitalmarkt: Institutional Due Diligence und Algo-Trading

Im institutionellen Asset Management, bei quantitativen Hedgefonds sowie bei Prop-Trading-Firmen hat sich die DSR als zwingendes Audit-Kriterium etabliert. Klassische Backtest-Berichte aus Handelsplattformen wie MetaTrader oder Python-Backtesting-Frameworks spiegeln selten die statistische Wahrheit wider.

Entlarvung von P-Hacking in Backtests

Entwickler neigen unbewusst zum sogenannten P-Hacking. Dabei werden Indikator-Perioden, Take-Profit-Level und Zeiteinheiten so lange variiert, bis die historische Simulation maximale Performance zeigt. Ein Backtest mit einer nominalen Sharpe Ratio von 2,20 wirkt isoliert betrachtet exzellent. Wurde dieser Wert jedoch aus 2.500 Iterationen extrahiert, sinkt die Deflated Sharpe Ratio oft auf unter 0,40 ab. Das Modell hat eine Wahrscheinlichkeit von über 60 Prozent, ein reines Zufallsprodukt ohne realen Edge zu sein.

Auditierung von Handelsmodellen und Prop-Trading

Moderne Risikoprüfungen fordern das vollständige Logging aller verworfenen Hypothesen. Nur wenn die Varianz und die Gesamtanzahl der Tests transparent in die DSR einfließen, lässt sich beurteilen, ob ein Algorithmus im Live-Handel kapitalisierbar ist. Auf der Plattform finanzen.ai übernimmt das Analysewerkzeug finanzen.ai Lab diese stochastische Bereinigung vollautomatisiert per Datei-Upload.

Statistische Systemgrenzen und Mindesthistorie

Trotz ihrer mathematischen Überlegenheit unterliegt auch die Deflated Sharpe Ratio methodischen Rahmenbedingungen, die bei der praktischen Anwendung beachtet werden müssen:

Erstens erfordert die DSR die ehrliche Erfassung aller Testläufe N. Werden Vorab-Experimente oder informelle Parameter-Scans verschwiegen, wird die Deflation unterschätzt.

Zweitens setzt die geschlossene Formel nach Bailey und López de Prado näherungsweise voraus, dass die Strategieversuche aus einer zusammenhängenden Familie stammen. Bei hochgradig korrelierten Versuchsreihen kann die effektive Anzahl unabhängiger Tests geringer sein als die reine Zählung N.

Drittens benötigt die DSR eine ausreichende Historie. Bei sehr kurzen Datenreihen verbleibt die Schätzunsicherheit für höhere statistische Momente so groß, dass selbst reale Marktanomalien keine Signifikanz erreichen. Zur exakten Bestimmung des minimal notwendigen Zeithorizonts dient die Minimum Track Record Length (MinTR).

Häufig gestellte Fragen zu Deflated Sharpe Ratio

Ein Backtest gilt im wissenschaftlichen und institutionellen Kontext ab einem DSR-Wert von 0,95 als statistisch signifikant. Dies entspricht einem Signifikanzniveau von p < 0,05. Ein Wert von 0,95 bedeutet, dass die Wahrscheinlichkeit, dass die gefundene Sharpe Ratio durch reines Data-Snooping entstanden ist, bei unter 5 Prozent liegt.

Die Probabilistic Sharpe Ratio (PSR) korrigiert die Sharpe Ratio lediglich für Nicht-Normalität (Schiefe und Kurtosis) und die Länge des Track Records bezogen auf einen festen Benchmark-Wert wie null. Die Deflated Sharpe Ratio (DSR) geht einen entscheidenden Schritt weiter: Sie ersetzt die feste Benchmark durch den stochastischen Erwartungswert des Maximums aus N Optimierungsläufen und neutralisiert dadurch zusätzlich den Selection Bias.

Wenn ein Algorithmus von Dritten gekauft oder ohne Dokumentation der Optimierungsphase bereitgestellt wurde, muss N konservativ geschätzt werden. In der quantitativen Praxis wird untersucht, wie viele freie Parameter das System besitzt. Bei drei variierten Parametern mit je 10 Abstufungen liegt N bereits bei mindestens 1.000 Versuchen.

Ja. Die DSR belegt ausschließlich, dass das Modell in den historischen Testdaten mit hoher Wahrscheinlichkeit einen echten statistischen Zusammenhang gefunden hat. Ändert sich das makroökonomische Regime, trocknet die Marktliquidität aus oder treten unvorhergesehene strukturelle Brüche auf (Out-of-Distribution Events), kann auch eine statistisch solide Strategie Verluste erleiden.

Erstellt am: Zuletzt aktualisiert & geprüft am: Autor & Prüfung: Volker Diermann (Informatiker & Quantitative Analyst)