バックテストの検証
きれいな資産曲線は何も証明しません。組み合わせを試し続ければ手に入るからです。素人のバックテストとプロのそれを分けるのは結果ではなく、自分を騙さないために何をしたかです。このモジュールはその後半の6つの道具と、それらがすでに実装されている3つの画面です。
TradingCalculator.Pro チーム · 更新日 · 運営者について
7日間の無料体験を始める →学べること
偽の優位性を作り出す4つのバイアス
先読み:当時は存在しなかった情報を使うこと(場中の判断に終値を使うなど)。生存バイアス:まだ上場している銘柄だけで検証し、破綻した銘柄を無視すること。データスヌーピング:千通り試して最良を採ること — それが最良なのは偶然です。過剰適合:過去にぴったり合うまでルールを足すこと。ノイズごと合わせてしまいます。4つとも素晴らしい結果を出し、どれも市場では生き残りません。
イン/アウトオブサンプル
履歴の一部 — たとえば末尾30 % — を取り分け、パラメータ探索は一切触れません。最良のルールセットが決まったら、そこで一度だけ評価します。その部分を見てから調整し直したなら、それはもうアウトオブサンプルではなく、学習の一部になっています。イン側にしか存在しない結果は、予測ではなく過去の記述です。
ウォークフォワード:実際にどう運用されたか
履歴全体に合わせた1組のパラメータは、未来の情報を使っています。1月の時点で、12月にどの移動平均が効くかは知りようがありません。ウォークフォワードは窓ごとに再最適化します — 最初の窓で学習し、次の窓で運用し、前へ進む。実際の運用に一番近い形です。見るべき数字は効率、つまり学習期の優位性のうち前方適用で残る割合。0.5 を下回ればカーブフィッティングの典型です。
取引の「順序」に対するモンテカルロ
バックテストが見せたのは取引の「1つの並び」であり、目にしたドローダウンはその順序に左右されます。同じ取引を数千回シャッフルすれば、そのシステムが生み出しえたドローダウンの分布が得られます。見るべきは平均ではなく95パーセンタイル。「どこまで耐える覚悟が要るか」に答えるのはそちらです。実際に経験した1本より、ほぼ必ずかなり悪くなります。
何取引あれば足りるか
30取引未満では何もわかりません。判断の最低ラインが100、説得力が出るのが200、強い有意性は500です。そしてほとんど誰も適用しない割引があります。相関した取引 — 同じトレンド、同じ日、同じセクターの複数 — は独立したサンプルより価値が低い。強く相関した300取引は、相関のない80取引より情報が少ないのです。小さなサンプルでは、推定勝率の5ポイントの誤差が、算出されるケリー比率を3倍にすることがあります。
探索の多さで割り引く
まったくランダムなデータで47通り試せば、最良のものはよく見えます。それは算術であって腕前ではありません。デフレーテッド・シャープは、優位性のまったくない系に対して同じ規模の探索を行ったとき偶然だけでどこまで出るかを計算し、あなたの結果がそれを超えることを要求します。「バックテストで40 %」と「バックテストで40 %、しかも偶然が与える以上」を分けるのがこれです。試行が20通り未満なら補正自体が不正確で、そこを超えるのは示唆であって証明ではありません。
なぜ公表された優位性は効かなくなるのか
最もきれいな例が「pre-FOMC ドリフト」です。2015年の研究は、米国株のリスクプレミアムのかなりの部分がFRB発表前の24時間で得られていたと記録しました。その後、標本期間を延ばした研究では2015年以降ほぼ消えています。発見が誤りだったのではなく、公表がそれを裁定してしまったのです。だから過去の優位性は将来を保証せず、いま使っているものを監視する価値があります。日誌の分析は、あなたのシステムの直近の低下が偶然で説明できる範囲を超えているかを計算します。