バックテストの説明:10の間違いが結果を良く見せる
バックテストは、すべての投資において最も説得力のあるチャートです。取引ルールを取り、10年間の歴史的価格に適用すると、左下隅から右上隅に向かって上昇する滑らかなエクイティカーブが得られます。それは証拠のように見えます。証拠のように感じます。そして、多くの場合、それはあなたが気づかないうちに自分自身のために作り上げた幻想です。
それが投資戦略のバックテストに関する不快な真実です:プロセスは、あなたがルールを調整し続けることで、励ましの答えを手に入れるように設計されています。数学は現実ですが、通常欠けているのは規律です。バックテストは、あなたに本当に役立つことを教えてくれる可能性がありますが、それはあなたが何を証明でき、何を証明できないかを正確に理解している場合に限ります。また、ライブ市場があなたに支払うことのない結果をはるかに良く見せる間違いを積極的に探す場合に限ります。
このガイドでは、両方をカバーします。まず、バックテストが実際に示すもの。次に、株式バックテストが静かに自己膨張する10の方法 — 先見のバイアスから歴史的カーブを予測として扱うことまで — 各トラップと修正が明記されています。次に誰かが見せてくれる美しいエクイティカーブ、あなた自身が描いたものを含めて、信頼する前にこれを読んでください。
バックテストが証明できること — そしてできないこと#
バックテストは仮説検定であり、水晶玉ではありません。適切に実行すれば、特定の仮定の下で特定の歴史のスライスにおいて、ルールが生み出したであろう結果を教えてくれます。それは本当に価値があります — 悪いアイデアを実際のお金を失う前に却下するための安価な方法です。しかし、それは過去についての声明であり、条件法で表現されており、チャートがどれだけ自信に満ちて見えても、そのままです。
有用なメンタルシフトは、パフォーマンスからキャリブレーションへです。あなたは戦略が「お金を稼ぐ」ことを証明しようとしているのではありません。あなたはそれがどのように振る舞うかを理解しようとしています:どれだけ深くドローダウンが発生するか、どれだけ頻繁に間違えるか、どれだけ取引するか、そしてどの市場条件で崩れるか。ルールが苦しむ場所を教えてくれるバックテストは、数値を約束するものよりも価値があります。なぜなら、その数値は未来との接触に耐えられず、振る舞いはしばしば耐えられるからです。
それが本当に教えてくれること#
- ルールが実際に一貫性があり、当時実際に持っていたデータで実行可能であるかどうか。
- リスクプロファイルの大まかな感覚 — ボラティリティ、最悪のドローダウン、回転率、そして悪化する期間。
- アイデアを反証するための安価な方法:ルールが歴史を生き残れないなら、未来も生き残れないことは確実です。
それが教えてくれないこと#
- 戦略が今後どのようなリターンをもたらすか。完全にストップ。
- あなたが見つけたパターンが、1つのデータセットにおける偶然ではなく、実際の原因であること。
- ライブドローダウンが到来し、チャートがもはや滑らかでなくなったときに、あなたが実際にどのように振る舞うか。
その区別を保持してください。なぜなら、以下のすべての間違いは「これは一度起こった、私の仮定の下で」を「これは再び起こる、私のために」に静かに変換する方法だからです。
バックテストを美化する10の誤り#
1. 先見のバイアス#
先見のバイアスは株式バックテストの大罪です:戦略が取引を行った瞬間に知ることができなかった情報を「見る」ことを許すことです。古典的な例は、1月1日に企業の年間利益を使用することですが、実際にはその数字は数週間または数ヶ月後に提出されました。また、事後に再表記される指標で株式をランク付けし、再表記された値を使用することです。
その結果、時間を欺いているため、予言的に見える戦略が生まれます。修正策は厳格な時点データです — シミュレーションされた各瞬間において、ルールはその日までに公にされ、最終的なものであったものだけを使用することができます。データがタイムラインを尊重しているか確認できない場合は、尊重していないと仮定してください。
2. 生存者バイアス#
過去20年間の「現在のインデックスに含まれる株式」で戦略をテストすると、すでにそれを操作しています。破産した企業、上場廃止になった企業、または崩壊した企業は、あなたのユニバースから静かに消えています — あなたは生存者だけをテストしています。結果が素晴らしく見えるのは当然です;開始する前に敗者を削除したからです。
実際の歴史的株式分析には、死亡した企業も含まれます。テストユニバースには、各時点で存在していたすべての企業が含まれている必要があります。後に失敗した企業も含めて、さもなければバックテストは「私がすでに勝った勝者だけを所有していた場合、どれだけうまくいったか」を測定していることになります。
3. 過剰適合#
バックテストの過剰適合は、ルールを追加し続け、パラメータを調整して戦略が歴史的データに完全にフィットするようになることです — ランダムノイズを含めて。過去の転換点をすべて捉える15の条件を持つルールは発見ではなく、特定のデータセットの詳細な説明に過ぎません。
その兆候は脆弱性です:パラメータをわずかに変更するか、テストウィンドウを移動すると、美しい結果が消えます。堅牢なルールは、特定の魔法の組み合わせではなく、範囲の設定と期間で機能します。シンプルさはここでの防御です — 追加のパラメータは、信号ではなくノイズにフィットする別の機会です。
4. 取引コストとスリッページの無視#
正確な終値で無料で売買することを前提としたバックテストは、存在しない市場を描写しています。実際の取引は手数料を支払い、ビッド・アスクスプレッドを越え、スリッページに苦しみます — 期待した価格と実際に得た価格のギャップで、特に取引したいときに広がります。
アクティブ戦略にとって数学は厳しいです。ルールが年間50回ポートフォリオを回転させ、各往復取引がスプレッドとスリッページを加えると0.2%のコストがかかると仮定しましょう。これは50 × 0.2% = 年間10パーセントポイントのリターンを市場に渡すことになります — しばしばバックテストされたスターを実際の資金の損失者に変えるのに十分です。常に現実的なコストをモデル化し、取引コストよりも薄いエッジを持つ高頻度戦略には特に懐疑的であるべきです。
5. データ品質の低下#
ゴミが入れば、見た目は美しいゴミが出ます。不均一に適用された分割調整、無視された配当、悪いティック、誤ラベルのティッカー、企業行動を考慮しない価格は、バックテストを静かに腐敗させます — 通常は結果を悪化させるエラーをより容易に見つけて削除するため、結果を美化する方向に。
出力を信頼する前に、データ自体を確認してください:どこから来たのか、分割や配当をどのように扱っているのか、主要なソースに対して監査されているかどうか。戦略はその下にある数字と同じくらい信頼できるものであり、「データは問題なさそうだった」というのは確認するのとは異なります。
6. 選択された開始日と終了日#
2009年3月にバックテストを開始すると、ほとんどすべての株を購入する戦略が素晴らしく見えます。なぜなら、世代の底から始まったからです。崩壊の直前に終了すると、ルールが完全に捕らえたであろうものが防御的に見えます。どちらかの境界を数ヶ月移動させると、物語が逆転することがあります。
誠実なテストは、複数の市場サイクル — ブルラン、崩壊、横ばいの年 — を含む長く、代表的なウィンドウを使用します。ルールを美化する偶然のストレッチではありません。戦略が非常に特定の日付の間だけ機能する場合、その日付が機能しているのではなく、戦略が機能しているのです。
7. あまりにも多くの戦略をテストすること (p-hacking)#
十分な実験を行うと、偶然だけで勝者が得られます。これは多重テストの罠であり、定量的研究の至る所に存在します。20の無関係な戦略を5%の有意水準でテストすると、平均して20 × 0.05 = そのうちの1つが純粋に運で「統計的に有意」に見えることを期待します — たとえすべてが無価値であっても。
今、数百のパラメータの組み合わせを試し、最良のものだけを報告することを想像してください。それは研究ではなく、失敗したチケットが隠された宝くじです。規律は、事前にテストするものを決定し、すべての試みを数え、千回の試行の後にのみ輝く戦略をノイズとして扱うことです。
8. サンプル外またはウォークフォワード検証の無視#
ルールを設計し、それを設計したデータでテストすると、もちろんフィットします — あなたはそれを構築したのです。唯一の意味のある質問は、それが見たことのないデータでどのように機能するかです。これがサンプル外テストの全ポイントです:戦略が調整されていない歴史の一部を予約し、そのエッジが生き残るかどうかを確認します。
さらに良いのはウォークフォワード分析です — 一つの期間で繰り返しフィットし、次の未使用の期間でテストし、その後前進します。時間の経過とともにルールを実際に使用する方法を模倣します。サンプル内で繁栄し、サンプル外で崩壊する戦略は信号を見つけていません;データを見つけただけです。このステップをスキップすることが、最も印象的なバックテストが生まれる方法です。
9. レジームの変化を無視する#
市場は単一の安定した機械ではありません。金利環境が変化し、ボラティリティレジームが変わり、10年間持続した相関が崩れ、ある条件下で繁栄したルールが別の条件下で静かに機能を停止することがあります。すべてを平均化するバックテストは、すべてのリターンが現在は終了した1つのレジームから来たことを隠すことができます。
あなたの戦略がいつお金を稼いだのかを見てください。全てのエッジが、例えば、長いゼロ金利の期間や特定のセクターの歴史的なランから来ている場合、それらの条件がまだ存在するかどうかを尋ねてください。堅牢性は、ルールがレジーム全体で理にかなった動作をすることを意味します — あるいは少なくとも、どのレジームに依存しているかを正確に知っていることです。
10. 過去のパフォーマンスを予測として扱う#
最後で最も魅力的な誤りは、すべての免責事項が警告し、誰もが犯してしまうものです:バックテストされたリターンを予測として読むことです。「これは10年間で年18%のリターンをもたらしました」は、あなたの仮定の下での過去に関する事実です。それは約束ではなく、あなたが受け取るべき平均でもなく、頼りにできるフロアでもありません。
バックテストは行動の期待値を設定しますが、リターンのターゲットではありません。戦略の特性を理解し、その弱点をストレステストするために使用し、その後、結論を緩く保ってください。未来には投票権があり、過去と韻を踏む義務は一度もありません。
研究と願望的思考を分ける規律#
上記のほとんどの間違いが同じテーマのバリエーションであることに注意してください:戦略が持っていなかった情報を覗き見させること、またはそれを構築するために使用されたデータで判断することです。解決策は心構えです — パフォーマンスよりもキャリブレーション、そしてサンプル外の規律を譲れない習慣として持つことです。
| 魅力的なバックテスト | 規律あるバックテスト | |
|---|---|---|
| 目標 | 利益を出すことを証明する | どのように機能するかを理解する |
| データウィンドウ | 手選びの、1つのレジーム | 長期、多サイクル、時点 |
| 検証 | 設計データでテストされた | 保留およびウォークフォワード |
| コスト | 無視または理想化された | 手数料 + スプレッド + スリッページをモデル化 |
| 判決 | 予測されたリターン | キャリブレーションされた結果の範囲 |
これは周辺的な意見ではありません。定量的およびAI駆動の投資を研究する学者や実務者は、常に同じ短いガードレールのリストに戻ってきます — サンプル外テストを主張し、モデルの取引コストを正直に評価し、信号のタイミングを尊重して、持っていなかったデータで取引しないようにし、先見のバイアスを隠れている場所から排除します。具体的な内容は異なりますが、メッセージは驚くほど一貫しており、「曲線を信じる」ということとは正反対です。AI生成の信号にこの議論の深いバージョンを適用したい場合は、私たちのバックテストモードのウォークスルーが、規律ある検証が実際にどのようなものかを示しています。
これが実際の研究にどのようにフィットするか#
バックテストは、ビジネスを理解することの上にあるのではなく、隣に位置しています。ルールは上記のすべての統計テストを通過することができ、あなたが何も知らない企業を指し示すことがあります — これが定量的検証が唯一の入力であり、私たちの12ステップの研究チェックリストのような基本的な作業と組み合わせるのが最良の理由です。数字は信号がどのように機能したかを教えてくれますが、ビジネスはその背後にあるストーリーが持続可能かどうかを教えてくれます。
これはおおよそValarnが教育的研究ツールとして物事にアプローチする方法です。単一の自信ある答えの代わりに、5つのカテゴリー — コア研究、市場構造、専用の議論とリスク委員会、財務品質レビューア、イベント、セクター、マクロカバレッジ — にわたって約25人の専門AIアナリストを動員し、構造化された強気対弱気の議論を行い、1つの中立的な研究見解(強気、慎重な強気、中立、慎重、または弱気 — 決して購入または売却の指示ではありません)を合成します。すべての事実の主張は、日付付きの提出書類またはライセンスされたソースに追跡可能であり、これはバックテストから先見のバイアスを排除する同じ時点の規律です。品質保証ゲートは、レポートがあなたに届く前に実行されます。
重要なのは、レポートが予測ではなくキャリブレーションの言語を話すことです。単一の価格目標の代わりに、シナリオ範囲 — 弱気、ベース、強気の参照レベル — に加え、参照価格とリスクレベルが提供されます。2つの別々の0–100スコアが誠実さを可視化します:データの完全性と信頼性を反映する信頼度スコア(価格予測ではありません)と、アナリストが実際にどれだけ収束したかを示す合意スコアです。そして、単一の実行は独自の小さなサンプルであるため、アンサンブルランは、より安定した読み取りのために全体の分析を最大3回再実行できます — データの1回の抽出を信じないことの研究的相当物です。AI出力の圧力テストのためのより広いフレームワークが必要な場合は、AI株分析を信頼するための10のチェックも書きました。
これらすべてを実際の企業の完全なサンプル研究レポートで見ることができますし、提出書類に掘り下げる前に自分を整えるために企業研究ページを閲覧することもできます。途中で用語に躓いた場合は、Valarn用語集が正にそのために作られています。
結論#
バックテストは、過去についての規律ある質問をするためのツールであり、未来を予測するための機械ではありません。うまく使えば、悪いアイデアを安価に拒否し、戦略がうまくいかないときにどのように機能するかを理解するのに役立ちます。無頓着に使用すると — 先見のバイアス、生存者バイアス、過剰適合、無視されたコスト、選りすぐりの日付、サンプル外チェックなし — 、非常に説得力のあるチャートで自分を欺くための複雑な方法になります。
したがって、すべての株式曲線、あなた自身のものを含めて、検証されるべき主張として扱い、信じるべき結果として扱わないでください。クリーンな時点データ、現実的なコスト、戦略が決して見なかったデータでの検証を主張してください。パフォーマンスではなくキャリブレーションを目指してください。それを行えば、投資戦略のバックテストは本来あるべき姿になります:より少なく欺かれる方法です。チェック可能で正直にヘッジされた分析がどのようなものか興味がありますか?完全なサンプルレポートを探るか、自分の無料研究レポートを実行することで、上記のすべてに対して評価してください。
Valarnは教育的研究ツールであり、投資アドバイスではありません。購入、売却、または保持するように指示するものではなく、ここにあるものは推奨や結果の約束ではありません。常に自分で調査を行い、ライセンスを持つ金融専門家に相談することを検討してください。
Valarn
Research
Valarn Research Team