Загрузки данных о прогнозных рынках: CSV, Parquet и API Exports
Полезный загружаемый набор данных полезен только в том случае, если его формат сохраняет доказательства, необходимые для анализа. Сглаживание лестницы в одну цену может создать небольшой файл и нечестный бэктест.
Используйте CSV для проверки и небольших плоских извлечений, Parquet для больших колоночных исследований и REST для ограниченных или инкрементных запросов. Независимо от выбранного вами метода доставки, сохраняйте идентификаторы рынка, исходные и полученные временные метки, массивы цен-размеров bid/ask, поля урегулирования и явные пробелы. Формат должен изменять способ доставки байтов, а не значение записанного рынка.
Сопоставьте формат с рабочей нагрузкой
| Формат | Лучше всего для | Следите за |
|---|---|---|
| CSV | Ручная проверка и небольшие взаимозаменяемые образцы | Вложенные лестницы требуют задокументированного кодирования или дочерней таблицы |
| Parquet | Большие сканирования, обрезка столбцов и исследовательские хранилища | Эволюция схемы и ключи разделения должны быть стабильными |
| REST JSON | Ограниченные запросы, приложения и инкрементные извлечения | Пагинация, лимиты и семантика повторных попыток |
| WebSocket | Текущие обновления и живые системы | Переподключения, пробелы в последовательности и начальная загрузка полной книги |
Поля, которые не следует терять
- Идентификаторы площадки, события, рынка и исхода в их родных и нормализованных формах.
- Время биржи/источника и время получения/наблюдения как отдельные поля.
- Цены bid, размеры bid, цены ask и размеры ask в соответствующих позициях массива.
- Метод захвата, интервал или последовательность событий, необходимые для интерпретации каденса.
- Исход урегулирования и опорные значения хранятся без утечки в более ранние строки.
- Стабильная нулевая или отсутствующая конвенция, которая никогда не станет синтетическим нулем.
Разделяйте вопросы, которые вы на самом деле задаете
Большие архивы глубины следует разделять по высокоселективным полям, таким как площадка и дата, а затем по стабильному ключу рынка или актива, где это соответствует рабочей нагрузке. Миллион крошечных файлов может быть таким же дорогим, как и один неразделенный экспорт, поэтому измерьте движок запроса, а не копируйте шаблон озера общего назначения.
Храните манифест рядом с массовыми экспортами. Он должен записывать версию схемы, время создания, запрошенные фильтры, количество строк или наблюдений и любые неполные разделы. Этот манифест превращает непрозрачную загрузку в воспроизводимый исследовательский ввод.
Выбор доставки DepthFeed
Обычный исследовательский путь DepthFeed - это REST для отфильтрованных исторических окон и WebSocket для текущих нормализованных кадров. Рабочие процессы стола могут использовать полный архив и шаблоны колоночной доставки для больших исследований. Браузерные инструменты используют одну и ту же основную схему, поэтому идея может перейти от образца к воспроизводимому бэктесту, не переопределяя книгу.
Начните с наименьшего представительного среза: одна площадка, одно окно рынка и достаточное количество наблюдений, чтобы протестировать разбор, упорядочивание и заполнение размером. Масштабируйте только после того, как эти инварианты пройдут.
Key takeaways
- 01CSV, Parquet, REST и WebSocket - это варианты доставки, а не взаимозаменяемые значения данных.
- 02Сохраняйте полные лестницы цен-размеров и как исходные, так и полученные временные метки.
- 03Массовый экспорт требует версии схемы и манифеста, чтобы оставаться воспроизводимым.
- 04Явные нулевые значения и пробелы безопаснее, чем синтетические нули или заполнения.
- 05Проверьте один представительный рынок перед масштабированием загрузки.
Полезный загружаемый набор данных полезен только в том случае, если его формат сохраняет доказательства, необходимые для анализа. Сглаживание лестницы в одну цену может создать небольшой файл и нечестный бэктест.
Начать бесплатно