DepthFeed/Both venues·資料工程

預測市場資料下載:CSV、Parquet 和 API 匯出

可下載的資料集只有在其格式保留分析所需證據時才有用。將階梯展平為單一價格可以產生一個小檔案和一個不誠實的回測。

DepthFeed··8 min

使用 CSV 進行檢查和小型扁平提取,使用 Parquet 進行大型欄式研究,使用 REST 進行有界或增量查詢。無論您選擇哪種交付方法,都要保留市場識別碼、來源和接收時間戳、買/賣價量陣列、結算欄位和明確的間隙。格式應改變位元組的交付方式,而不應改變記錄市場的意義。

將格式與工作負載匹配

格式最適合注意
CSV手動檢查和小型可互操作樣本巢狀階梯需要記錄的編碼或子表
Parquet大型掃描、欄式修剪和研究資料倉儲Schema 演進和分割區鍵必須穩定
REST JSON有界查詢、應用程式和增量提取分頁、限制和重試語義
WebSocket即時更新和即時系統重新連接、序列間隙和完整書籍種子

不應遺失的欄位

  • 場地、事件、市場和結果識別碼,以其原生和標準化形式。
  • 交易所/來源時間和接收/觀察時間作為單獨的欄位。
  • 在匹配的陣列位置處的買價、買量、賣價和賣量。
  • 捕獲方法、間隔或事件序列,以解釋頻率。
  • 結算結果和參考值儲存時,不會洩露到較早的列中。
  • 一個穩定的 null 或缺失約定,永遠不會靜默地變成零。

根據您實際提出的問題進行分割。

大型深度檔案應按高選擇性欄位(例如場地和日期)進行分割,然後按穩定的市場或資產鍵進行分割,如果它匹配工作負載。一百萬個小檔案的成本可能與一個未分割的匯出一樣高,因此請測量查詢引擎,而不是複製通用的湖泊佈局。

在批量匯出旁邊保留一份 manifest。它應記錄 schema 版本、生成時間、請求的篩選器、列或觀察計數以及任何不完整的分割區。該 manifest 將一個不透明的下載轉化為可重現的研究輸入。

DepthFeed 交付選項

DepthFeed 的常規研究路徑是 REST,用於過濾的歷史視窗,以及 WebSocket,用於當前的標準化框架。桌面工作流程可以使用完整的檔案和欄式交付模式進行大型研究。瀏覽器工具使用相同的底層 schema,因此一個想法可以從樣本轉化為可重現的回測,而無需重新定義書籍。

從最小的代表性切片開始:一個場地、一個市場視窗和足夠的觀察結果來測試解析、排序和大小填充。只有在這些不變式通過後才進行縮放。

Key takeaways

  • 01CSV、Parquet、REST 和 WebSocket 是交付選項,而不是可互換的資料意義。
  • 02保留完整的價量階梯以及來源和接收時間戳。
  • 03批量匯出需要 schema 版本和 manifest 才能保持可重現性。
  • 04明確的 null 值和間隙比合成零或填充更安全。
  • 05在擴展下載之前,驗證一個代表性的市場。

可下載的資料集只有在其格式保留分析所需證據時才有用。將階梯展平為單一價格可以產生一個小檔案和一個不誠實的回測。

免費開始

問題,一一解答。

CSV 適用於小型扁平提取,但完整的階梯需要記錄的巢狀編碼或單獨的層級表。對於大型深度歷史記錄,欄式格式(例如 Parquet)通常更有效。

開始在真實深度上回測 Polymarket & Kalshi。

免費開始,免信用卡。等策略準備好面對完整委託簿時再升級。

免費開始