預測市場資料下載:CSV、Parquet 和 API 匯出
可下載的資料集只有在其格式保留分析所需證據時才有用。將階梯展平為單一價格可以產生一個小檔案和一個不誠實的回測。
DepthFeed··8 min
使用 CSV 進行檢查和小型扁平提取,使用 Parquet 進行大型欄式研究,使用 REST 進行有界或增量查詢。無論您選擇哪種交付方法,都要保留市場識別碼、來源和接收時間戳、買/賣價量陣列、結算欄位和明確的間隙。格式應改變位元組的交付方式,而不應改變記錄市場的意義。
將格式與工作負載匹配
| 格式 | 最適合 | 注意 |
|---|---|---|
| CSV | 手動檢查和小型可互操作樣本 | 巢狀階梯需要記錄的編碼或子表 |
| Parquet | 大型掃描、欄式修剪和研究資料倉儲 | Schema 演進和分割區鍵必須穩定 |
| REST JSON | 有界查詢、應用程式和增量提取 | 分頁、限制和重試語義 |
| WebSocket | 即時更新和即時系統 | 重新連接、序列間隙和完整書籍種子 |
不應遺失的欄位
- 場地、事件、市場和結果識別碼,以其原生和標準化形式。
- 交易所/來源時間和接收/觀察時間作為單獨的欄位。
- 在匹配的陣列位置處的買價、買量、賣價和賣量。
- 捕獲方法、間隔或事件序列,以解釋頻率。
- 結算結果和參考值儲存時,不會洩露到較早的列中。
- 一個穩定的 null 或缺失約定,永遠不會靜默地變成零。
根據您實際提出的問題進行分割。
大型深度檔案應按高選擇性欄位(例如場地和日期)進行分割,然後按穩定的市場或資產鍵進行分割,如果它匹配工作負載。一百萬個小檔案的成本可能與一個未分割的匯出一樣高,因此請測量查詢引擎,而不是複製通用的湖泊佈局。
在批量匯出旁邊保留一份 manifest。它應記錄 schema 版本、生成時間、請求的篩選器、列或觀察計數以及任何不完整的分割區。該 manifest 將一個不透明的下載轉化為可重現的研究輸入。
DepthFeed 交付選項
DepthFeed 的常規研究路徑是 REST,用於過濾的歷史視窗,以及 WebSocket,用於當前的標準化框架。桌面工作流程可以使用完整的檔案和欄式交付模式進行大型研究。瀏覽器工具使用相同的底層 schema,因此一個想法可以從樣本轉化為可重現的回測,而無需重新定義書籍。
從最小的代表性切片開始:一個場地、一個市場視窗和足夠的觀察結果來測試解析、排序和大小填充。只有在這些不變式通過後才進行縮放。
Key takeaways
- 01CSV、Parquet、REST 和 WebSocket 是交付選項,而不是可互換的資料意義。
- 02保留完整的價量階梯以及來源和接收時間戳。
- 03批量匯出需要 schema 版本和 manifest 才能保持可重現性。
- 04明確的 null 值和間隙比合成零或填充更安全。
- 05在擴展下載之前,驗證一個代表性的市場。
可下載的資料集只有在其格式保留分析所需證據時才有用。將階梯展平為單一價格可以產生一個小檔案和一個不誠實的回測。
免費開始