预测市场数据下载:CSV、Parquet 和 API 导出
可下载的数据集只有在其格式保留分析所需证据时才有用。将阶梯展平为一个价格可以生成一个小型文件和一个不诚实的回测。
DepthFeed··8 min
使用 CSV 进行检查和小型平面提取,使用 Parquet 进行大型列式研究,使用 REST 进行有界或增量查询。无论您选择哪种交付方法,都要保留市场标识符、源和接收时间戳、买/卖价位数组、结算字段和明确的间隙。格式应该改变字节的交付方式,而不改变记录市场的含义。
将格式与工作负载匹配
| 格式 | 最适合 | 注意 |
|---|---|---|
| CSV | 手动检查和小型可互操作样本 | 嵌套阶梯需要记录的编码或子表 |
| Parquet | 大型扫描、列修剪和研究仓库 | 模式演变和分区键必须稳定 |
| REST JSON | 有界查询、应用程序和增量拉取 | 分页、限制和重试语义 |
| WebSocket | 当前更新和实时系统 | 重新连接、序列间隙和完整书籍播种 |
不应丢失的字段
- 场馆、事件、市场和结果标识符,以其原生和规范化形式。
- 交易所/源时间与接收/观察时间作为单独的字段。
- 在匹配的数组位置处,买价、买量、卖价和卖量。
- 解释频率所需的捕获方法、间隔或事件序列。
- 结算结果和参考值存储,不会泄露到较早的行中。
- 稳定的空值或缺失约定,绝不会静默地变为零。
根据您实际提出的问题进行分区
大型深度存档应按高选择性字段(如场馆和日期)进行分区,然后按稳定的市场或资产键进行分区,前提是它与工作负载匹配。百万个小文件可能与一个未分区的导出一样昂贵,因此请测量查询引擎,而不是复制通用的湖泊布局。
在批量导出旁边保留清单。它应记录模式版本、生成时间、请求的过滤器、行或观察计数以及任何不完整的分区。该清单将不透明的下载转换为可重现的研究输入。
DepthFeed 交付选项
DepthFeed 的常规研究路径是 REST,用于过滤历史窗口,WebSocket 用于当前规范化帧。桌面工作流程可以使用完整的存档和列式交付模式进行大型研究。浏览器工具使用相同的底层模式,因此一个想法可以从一个样本移动到一个可重现的回测,而无需重新定义书籍。
从最小的代表性切片开始:一个场馆、一个市场窗口和足够的观察结果来测试解析、排序和大小填充。仅在这些不变性通过后才进行扩展。
Key takeaways
- 01CSV、Parquet、REST 和 WebSocket 是交付选项,而不是可互换的数据含义。
- 02保留完整的价位阶梯以及源和接收时间戳。
- 03批量导出需要模式版本和清单才能保持可重现性。
- 04显式空值和间隙比合成零或填充更安全。
- 05在扩展下载之前,验证一个代表性市场。
可下载的数据集只有在其格式保留分析所需证据时才有用。将阶梯展平为一个价格可以生成一个小型文件和一个不诚实的回测。
免费开始