予測市場データダウンロード:CSV、Parquet、およびAPIのエクスポート
ダウンロード可能なデータセットが有用であるのは、その形式が分析に必要なエビデンスを保持している場合のみです。ラダーを1つの価格に平坦化すると、ファイルサイズは小さくなりますが、不正なバックテストにつながる可能性があります。
検査と小さなフラットな抽出にはCSV、大規模なカラム型の調査にはParquet、境界または増分クエリにはRESTを使用してください。 どの配信方法を選択しても、市場識別子、ソースと受信のタイムスタンプ、Bid/Ask価格-サイズ配列、決済フィールド、および明示的なギャップを保持してください。 形式はバイトの配信方法を変更するものであり、記録された市場の意味を変更するものではありません。
ワークロードに合わせて形式を一致させる
| 形式 | 最適 | 注意点 |
|---|---|---|
| CSV | 手動検査と小さな相互運用可能なサンプル | ネストされたラダーには、ドキュメント化されたエンコーディングまたは子テーブルが必要です |
| Parquet | 大規模なスキャン、カラムのプルーニング、および調査データウェアハウス | スキーマの進化とパーティションキーは安定している必要があります |
| REST JSON | 境界クエリ、アプリケーション、および増分プル | ページネーション、制限、および再試行セマンティクス |
| WebSocket | 現在の更新とライブシステム | 再接続、シーケンスギャップ、および完全な板情報のシード |
失ってはならないフィールド
- 会場、イベント、市場、および結果の識別子を、ネイティブおよび正規化された形式で保持します。
- 取引所/ソース時間と受信/観察時間を別々のフィールドとして保持します。
- Bid価格、Bidサイズ、Ask価格、およびAskサイズを一致する配列位置に保持します。
- ケイデンスを解釈するために必要なキャプチャ方法、間隔、またはイベントシーケンスをキャプチャします。
- 決済結果と参照値を、以前の行にリークすることなく保存します。
- 常にサイレントにゼロにならない安定したnullまたは欠損規約。
実際に尋ねる質問でパーティション分割します
大規模な深さアーカイブは、会場と日付などの高い選択性を持つフィールドでパーティション分割し、次にワークロードに一致する安定した市場または資産キーでパーティション分割する必要があります。 100万の小さなファイルは、パーティション分割されていないエクスポートと同じくらいコストがかかる可能性があるため、一般的なレイクレイアウトをコピーするのではなく、クエリエンジンを測定してください。
バルクエクスポートの横にマニフェストを置いてください。 スキーマバージョン、生成時間、要求されたフィルター、行または観察数、および不完全なパーティションを記録する必要があります。 そのマニフェストは、不透明なダウンロードを再現可能な研究入力に変えます。
DepthFeed配信の選択肢
DepthFeedの通常の調査パスは、フィルタリングされた履歴ウィンドウの場合はREST、現在の正規化されたフレームの場合はWebSocketです。 デスクワークフローは、完全なアーカイブとカラム型の配信パターンを使用して大規模な研究を行うことができます。 ブラウザツールは同じ基盤となるスキーマを使用しているため、アイデアはサンプルから再現可能なバックテストに、ブックを再定義することなく移行できます。
最小の代表的なスライスから開始します。1つの会場、1つの市場ウィンドウ、および解析、順序付け、およびサイズのフィルをテストするのに十分な観察を行います。 これらの不変性がパスするまでスケールしないでください。
Key takeaways
- 01CSV、Parquet、REST、およびWebSocketは配信の選択肢であり、交換可能なデータ意味ではありません。
- 02完全な価格-サイズラダーと、ソースと受信の両方のタイムスタンプを保持します。
- 03バルクエクスポートは、再現性を維持するためにスキーマバージョンとマニフェストが必要です。
- 04明示的なnullとギャップは、合成ゼロまたはフィルよりも安全です。
- 05ダウンロードをスケールする前に、代表的な市場を検証します。
ダウンロード可能なデータセットが有用であるのは、その形式が分析に必要なエビデンスを保持している場合のみです。ラダーを1つの価格に平坦化すると、ファイルサイズは小さくなりますが、不正なバックテストにつながる可能性があります。
無料で始める