AI 予測市場バックテスト: 未来の情報漏洩なしにLLM戦略をテスト
AIが生成した戦略はバックテストではありません。モデル、情報境界、意思決定プロトコル、ポートフォリオ状態、実行可能な約定はすべて、過去の時点で制御される必要があります。
AI予測市場バックテストは、LLMが生成したルールやモデルの意思決定を、各過去のタイムスタンプで利用可能な情報のみを用いて評価します。信頼できるテストでは、プロンプトと市場ユニバースを凍結し、確定した結果や将来の事実を遮断し、記録された深度に基づいて注文を再現し、ポートフォリオ状態を保持し、すべての決定、拒否、約定を報告します。
AIバックテストが別の問題である理由
決定論的なルールは行ごとにレビューできます。LLMはプロンプト、モデルバージョン、コンテキスト、ツールの結果、サンプリング設定によって推論を変える可能性があります。また、トレーニングデータや接続された検索ツールが過去の時点を越えるため、シミュレートされた日付以降に発生した事実を知っている可能性もあります。通常の取引バックテストでは、これらのリスクを自動的に制御しません。
予測市場では情報漏洩が特に深刻です。市場の質問と最終的な結果は決済後に公開されるため、モデルは後の情報から回答を思い出したり推測したりしながら、イベントを予測しているように見える可能性があります。テストでは、市場時点の整合性とモデル時点の整合性の両方を維持する必要があります。
2つのAIバックテストワークフロー
DepthFeedの現在公開されているワークフローは、最初のパスをサポートします。モデルに明確な仮説を提案させ、それをプリセットまたはカスタムルールに変換し、パラメータを凍結して、Backtest Labで実行します。これにより、アイデアの生成と評価が分離され、リプレイが再現可能になります。
モデルインザループリプレイには、追加の制御が必要です。閉じた情報環境、逐次的なポートフォリオ状態、永続的なモデル呼び出し記録、各サイクルのポイントインタイムテープです。決済済み市場に関するチャットの記録を、このより強力な形式のバックテストとして説明しないでください。
| ワークフロー | 凍結されるもの | 最適な用途 |
|---|---|---|
| AI生成ルール | プロンプト出力が一度明示的な決定論的ロジックになる | AIの仮説が市場データと執行に耐えるかをテストする |
| モデルインザループリプレイ | モデル、プロンプト、ツール、ポイントインタイムコンテキストが各意思決定で実行される | 自律的な予測者またはポートフォリオエージェントを評価する |
過去の情報境界を構築する
最も安全な実装は、as-of境界を使用します:ソースタイムスタンプが意思決定時間以下。すべての特徴量、要約、ツール応答はその境界を継承する必要があります。今日の市場状況や最終結果ラベルのような単一の境界のない便宜的なフィールドが、実行全体を無効にする可能性があります。
- 意思決定タイムスタンプを設定し、その時点以前に観測された市場行のみを含めます。
- トレーリングルックバックを明示的に制限し、将来から来る可能性のある最も近い行は決して使用しないでください。
- 決済結果、最終価格、後の見出し、現在のウェブ検索を除外します。
- モデルに表示された正確な市場ユニバースを、スキップした契約も含めて記録します。
- 入力テープをハッシュ化またはバージョン管理して、後で同じ決定を再構成できるようにします。
- 欠損データは、後の観測から埋めるのではなく、欠損として報告します。
回答とプロンプトの漏洩を防ぐ
システムプロンプト、顧客指示、モデル識別子、サンプリングモード、構造化出力スキーマ、利用可能なツールを凍結します。最終市場状況、決済の文言、回顧的な記事の要約、決済後に作成されたファイル名など、間接的に結果を明らかにする表現を削除します。
過去のイベントに関する質問では、ブラウジングが無効であっても事前学習済みモデルのメモリに後の事実が含まれている可能性があると想定します。可能な限りカットオフ安全な質問を使用し、漏洩制御を個別に評価し、より新しい期間や非公開のホールドアウト期間でのパフォーマンスを比較します。よく知られた解決済みイベントでの高スコアは、それ自体が予測スキルの証拠にはなりません。
意思決定プロトコルを監査可能にする
自由形式の推奨ではなく、構造化されたアクションを要求します。有用な意思決定には、市場識別子、サイド、推定確率、信頼度、最大エントリー価格、要求元本、短い論拠が含まれます。サーバーサイドのルールは、現金、エクスポージャー、信頼度、エッジ、価格制限に従って、提案を承認、リサイズ、または拒否する必要があります。
約定だけでなく、パスや拒否された取引も保存します。最終レポートにモデルが選択した勝者のみが含まれている場合、選択性、カバレッジ、失敗分析の分母がありません。永続的な記録は、各アクションを正確な入力境界と結果のポートフォリオ状態に結び付ける必要があります。
ポートフォリオを逐次的にリプレイする
ポートフォリオサイクルは時系列順に実行する必要があります。なぜなら、ある意思決定が次の意思決定に利用可能な現金とオープンエクスポージャーを変更するからです。必要に応じてタイムスタンプ内で市場の発見を並列化しますが、1つの凍結テープに対して1つの最終ポートフォリオ決定を統合します。独立したモデル呼び出しが同じ現金を使うことを許可しないでください。
オープンポジション、実現損益、リスク制限を繰り越します。次に、カテゴリ別、会場別、および総計で損益を報告します。これにより、一見知的なポートフォリオが、相関する契約全体で繰り返される1つの集中した方向性ベットであるかどうかが明らかになります。
モデルの提示価格ではなく、実行可能な約定を使用する
モデルは最大価格を提示するかもしれませんが、自身の約定を捏造することは許可されるべきではありません。定義された実行遅延を追加し、そのシミュレート時間以降の最初の記録されたブックを見つけ、利用可能なアスクまたはビッドを制限までのみ歩きます。VWAP、約定割合、観測時間、使用されたブックを保存します。
最終ポートフォリオを保守的に評価します。中間価格での評価は、スプレッドを越えたりサイズを消費したりせずに清算できると仮定します。深度を考慮した実行可能な清算は、ポートフォリオが実現できた可能性をよりよく示します。古いブックや存在しないブックは、明示的な失敗条件として残すべきです。
実践的なワークフロー:LLM仮説からリプレイへ
境界のあるプロンプトから始めます:モデルに、反証可能なPolymarketまたはKalshiの仮説、必要な観測可能な入力、正確なエントリールール、ポジションサイズ、エグジットまたは決済の動作、およびパスすべき条件を尋ねます。利益の主張を禁止し、回顧的な例を要求しないでください。
回答をBacktest Labのプリセットまたはカスタムルールに変換し、結果を見た後に閾値を変更しないでください。目的の会場と市場ファミリーを選択し、時系列サンプルを使用し、中間価格、固定スリッページ、記録された深度を比較します。すべての取引を検査し、後のホールドアウトを保持します。それが生き残った場合、凍結されたルールをペーパートレーディングに展開し、ルールが作成された時点でモデルが知り得なかった結果に対して評価します。
予測と取引を区別する指標
予測の質と取引パフォーマンスは関連していますが同一ではありません。キャリブレーションされたモデルは、既に情報を反映した価格を支払うことで損失を被る可能性があります。キャリブレーションが不十分なモデルは、運や1つの集中ポジションによって一時的に利益を上げることができます。両方の層を報告し、評価をリーダーボードの見出しに縮小しないでください。
| 質問 | 指標 | 捕捉する失敗 |
|---|---|---|
| 確率は有用でしたか? | ブライアスコア、対数損失、キャリブレーション | 自信があるが不正確な予測 |
| 実行後にアクションは利益を生みましたか? | 純損益、ROI、実行可能なエッジ | 悪い価格で購入された良い予測 |
| 結果は集中していましたか? | 会場、カテゴリ、時間別の損益 | 単一のイベントやレジームがパフォーマンスを支えている |
| リスクは管理されていましたか? | ドローダウン、エクスポージャー、ポジション数 | 過度な集中によって生み出された利益 |
| モデルは選択的でしたか? | 取引、パス、拒否率 | 分母のない恣意的な報告 |
| 実行は再現可能でしたか? | プロンプト、モデル、テープ、ブックのハッシュ | 独立して再現できない結果 |
ゴールポストを動かさずにモデルを比較する
- すべてのモデルに同じ凍結された市場テープ、ツールセット、出力スキーマ、ポートフォリオ制限を与えます。
- 同じ意思決定タイムスタンプ、実行遅延、約定エンジン、最終評価ルールを使用します。
- プロバイダーの失敗、無効な出力、リスクルールによる拒否を市場損失から分離します。
- パフォーマンスとともにトークンとモデルのコストを記録します。わずかな利益が、はるかに高い推論コストを正当化しない可能性があります。
- 確率的な実行を繰り返すか、サポートされている場合は決定論的な設定を使用し、分散を報告します。
- モデルバージョンと可用性が変更されるため、名前付きモデルのページと主張を最新の状態に保ちます。
失敗を隠すのではなく分類する
これらの結果は異なる意味を持ちます。プロバイダーのタイムアウトを自信のあるパスとして扱うと選択性が膨らみます。未約定の注文を削除すると実行可能なパフォーマンスが過大評価されます。不正なモデル出力を黙って修復すると、あるモデルに他のモデルが受けられない人間の助けを与えることになります。評価では、実行前に各クラスを定義し、機械的に適用する必要があります。
完全なファネルを公開します:対象市場、表示された市場、提案されたアクション、パス、無効な出力、ガードレール拒否、執行拒否、部分約定、完了したポジション。その分母により、慎重なモデルと信頼できないモデルを区別することが可能になります。
| 失敗クラス | 例 | 報告方法 |
|---|---|---|
| 情報の失敗 | 将来の事実、決済フィールド、後の相場がコンテキストに入った | 影響を受けたサイクルまたは実行を無効にする |
| プロバイダーの失敗 | タイムアウト、レート制限、または利用不可のモデル | 市場のパスとは別にカウントする |
| スキーマの失敗 | 無効なアクション、市場IDの欠落、解析不能な確率 | 生の応答と拒否を保存する |
| リスク拒否 | 要求サイズが現金、エクスポージャー、または価格制限を超えた | ガードレールによって拒否されたモデル提案として報告する |
| 執行拒否 | 適時のブックがない、制限未満に深度がない、または全く約定しない | 取引の分母に含める |
| 市場損失 | 有効な約定決定が選択されたサイドに基づいて決済された | 損益と予測スコアリングに通常通り含める |
最低限の再現性記録
すべての実行について、モデルプロバイダーと正確なモデルスラッグ、プロンプトテンプレート、ツール定義、構造化出力スキーマ、サンプリング設定、顧客指示を保存します。開始日と終了日、意思決定間隔、ルックバック、会場、カテゴリ、開始現金、エクスポージャー制限、実行遅延、最終評価方法を記録します。
すべての意思決定サイクルについて、意思決定タイムスタンプ、テープバージョン、テープのas-of時間、対象市場数、入力ハッシュ、前後のポートフォリオ、モデル使用状況、エラー状態を保存します。提案されたすべての取引について、その論拠と確率を、観測された市場確率、信頼度、制限価格、要求サイズ、拒否コード、および約定に使用された過去のブックとともに保存します。
プロバイダーモデルは安定した名前の背後で更新される可能性があるため、後で正確な再実行が異なる場合があります。永続的な記録はそのプラットフォームのばらつきを排除できませんが、明らかにすることはできます。決定論的なシードや固定バージョンが利用できない場合は、同じテストを十分な回数繰り返して、1つの好ましいサンプルを提示する代わりに実行間のばらつきを報告します。
- モデルスラッグ、プロバイダー、プロンプト、ツール、スキーマ、サンプリング設定。
- 過去の境界、市場ユニバース、意思決定間隔、ルックバック。
- ポートフォリオ制限、実行遅延、約定エンジン、最終評価。
- すべての意思決定と約定に結び付けられた入力ハッシュとブックハッシュ。
- トークン使用量、モデルコスト、無効な出力、すべての拒否理由。
- モデルまたはプロバイダーが確率的である場合の繰り返し実行の分散。
AIパフォーマンスの主張を行う前にフォワードテストを実施する
過去のAIテストは、モデルの記憶、研究者のプロンプト調整、繰り返しの実験から依然として利益を得る可能性があります。最もクリーンな次のステップは、ロックされたフォワードペーパー期間です。プロンプトまたは抽出されたルールを凍結し、設定が確定した後に開始し、ライブで表示されるブックからすべてのアクションを評価し、完全な分母を公開します。
DepthFeed ペーパートレーディングは、決定論的ルールと外部ボットシグナルに対して利用可能なフォワードパスを提供します。仮想現金を使用し、ライブの取引所注文を発注しません。その区別は、AIワークフローが説明されるすべての場所で明確に表示されるべきです。
DepthFeedが現在提供するもの
今日、研究者はAIモデルを使用して明示的な戦略を作成または改良し、記録された予測市場ブックに対してBacktest Labでその凍結ルールをリプレイし、3つの約定仮定を比較し、リスクと個別取引を検査し、適合する生き残りをライブペーパートレーディングに移行できます。履歴データAPIとMCPサーバーは、ダッシュボード外でのカスタムエージェント研究もサポートします。
DepthFeedは現在、公開の自律的なモデルインザループバックテストAPIやライブAI取引執行を宣伝していません。より狭いワークフローは意図的でテスト可能です:モデルが提案し、記録された市場証拠が評価し、ペーパートレーディングがフォワード記録を提供します。
Key takeaways
- 01AIアイデア生成とAIモデルインザループリプレイは異なる製品であり、異なる証拠が必要です。
- 02すべての過去の意思決定で、決済、将来の行、現在の検索、後の事実をブロックします。
- 03結果を比較する前に、モデル、プロンプト、ツール、スキーマ、ユニバース、ポートフォリオ制約を凍結します。
- 04パス、拒否、モデル呼び出し、入力境界、および利益のある約定を保存します。
- 05現金とポジションを逐次的にリプレイし、定義された遅延後に記録された深度に対して執行します。
- 06キャリブレーション、損益、リスク、集中度、推論コスト、再現性を個別に報告します。
- 07AIパフォーマンスの主張を行う前に、ロックされたフォワードペーパー期間を使用します。
AIが生成した戦略はバックテストではありません。モデル、情報境界、意思決定プロトコル、ポートフォリオ状態、実行可能な約定はすべて、過去の時点で制御される必要があります。
無料で始める