DepthFeed/Both venues·Инженерия данных

Загрузки данных о прогнозных рынках: CSV, Parquet и API Exports

Полезный загружаемый набор данных полезен только в том случае, если его формат сохраняет доказательства, необходимые для анализа. Сглаживание лестницы в одну цену может создать небольшой файл и нечестный бэктест.

DepthFeed··8 min

Используйте CSV для проверки и небольших плоских извлечений, Parquet для больших колоночных исследований и REST для ограниченных или инкрементных запросов. Независимо от выбранного вами метода доставки, сохраняйте идентификаторы рынка, исходные и полученные временные метки, массивы цен-размеров bid/ask, поля урегулирования и явные пробелы. Формат должен изменять способ доставки байтов, а не значение записанного рынка.

Сопоставьте формат с рабочей нагрузкой

ФорматЛучше всего дляСледите за
CSVРучная проверка и небольшие взаимозаменяемые образцыВложенные лестницы требуют задокументированного кодирования или дочерней таблицы
ParquetБольшие сканирования, обрезка столбцов и исследовательские хранилищаЭволюция схемы и ключи разделения должны быть стабильными
REST JSONОграниченные запросы, приложения и инкрементные извлеченияПагинация, лимиты и семантика повторных попыток
WebSocketТекущие обновления и живые системыПереподключения, пробелы в последовательности и начальная загрузка полной книги

Поля, которые не следует терять

  • Идентификаторы площадки, события, рынка и исхода в их родных и нормализованных формах.
  • Время биржи/источника и время получения/наблюдения как отдельные поля.
  • Цены bid, размеры bid, цены ask и размеры ask в соответствующих позициях массива.
  • Метод захвата, интервал или последовательность событий, необходимые для интерпретации каденса.
  • Исход урегулирования и опорные значения хранятся без утечки в более ранние строки.
  • Стабильная нулевая или отсутствующая конвенция, которая никогда не станет синтетическим нулем.

Разделяйте вопросы, которые вы на самом деле задаете

Большие архивы глубины следует разделять по высокоселективным полям, таким как площадка и дата, а затем по стабильному ключу рынка или актива, где это соответствует рабочей нагрузке. Миллион крошечных файлов может быть таким же дорогим, как и один неразделенный экспорт, поэтому измерьте движок запроса, а не копируйте шаблон озера общего назначения.

Храните манифест рядом с массовыми экспортами. Он должен записывать версию схемы, время создания, запрошенные фильтры, количество строк или наблюдений и любые неполные разделы. Этот манифест превращает непрозрачную загрузку в воспроизводимый исследовательский ввод.

Выбор доставки DepthFeed

Обычный исследовательский путь DepthFeed - это REST для отфильтрованных исторических окон и WebSocket для текущих нормализованных кадров. Рабочие процессы стола могут использовать полный архив и шаблоны колоночной доставки для больших исследований. Браузерные инструменты используют одну и ту же основную схему, поэтому идея может перейти от образца к воспроизводимому бэктесту, не переопределяя книгу.

Начните с наименьшего представительного среза: одна площадка, одно окно рынка и достаточное количество наблюдений, чтобы протестировать разбор, упорядочивание и заполнение размером. Масштабируйте только после того, как эти инварианты пройдут.

Key takeaways

  • 01CSV, Parquet, REST и WebSocket - это варианты доставки, а не взаимозаменяемые значения данных.
  • 02Сохраняйте полные лестницы цен-размеров и как исходные, так и полученные временные метки.
  • 03Массовый экспорт требует версии схемы и манифеста, чтобы оставаться воспроизводимым.
  • 04Явные нулевые значения и пробелы безопаснее, чем синтетические нули или заполнения.
  • 05Проверьте один представительный рынок перед масштабированием загрузки.

Полезный загружаемый набор данных полезен только в том случае, если его формат сохраняет доказательства, необходимые для анализа. Сглаживание лестницы в одну цену может создать небольшой файл и нечестный бэктест.

Начать бесплатно

Ответы на вопросы.

CSV практичен для небольших плоских извлечений, но полные лестницы требуют задокументированного вложенного кодирования или отдельной таблицы уровней. Для истории большой глубины обычно более эффективен колоночный формат, такой как Parquet.

Начните тестировать Polymarket & Kalshi на реальной глубине.

Бесплатный старт, без карты. Переходите на платный тариф, когда стратегия готова к полному стакану.

Начать бесплатно