DepthFeed/Both venues·Data engineering

Descargas de Datos de Mercados de Predicción: CSV, Parquet y Exportaciones de API

Un conjunto de datos descargable es útil solo si su formato preserva la evidencia que el análisis necesita. Aplanar una escalera en un solo precio puede generar un archivo pequeño y una prueba retrospectiva deshonesta.

DepthFeed··8 min

Use CSV para la inspección y pequeñas extracciones planas, Parquet para grandes investigaciones columnares y REST para consultas limitadas o incrementales. Cualquiera que sea el método de entrega que elija, mantenga los identificadores del mercado, la fuente y los sellos de tiempo de recepción, los arreglos de precio/tamaño de oferta/demanda, los campos de liquidación y las brechas explícitas. El formato debe cambiar la forma en que se entregan los bytes, no el significado del mercado registrado.

Adapte el formato a la carga de trabajo

FormatoIdeal paraTenga en cuenta
CSVInspección manual y muestras pequeñas interoperablesLas escaleras anidadas requieren una codificación documentada o una tabla secundaria
ParquetAnálisis a gran escala, poda de columnas y almacenes de investigaciónLa evolución del esquema y las claves de partición deben ser estables
REST JSONConsultas limitadas, aplicaciones y extracciones incrementalesPaginación, límites y semántica de reintento
WebSocketActualizaciones actuales y sistemas en vivoReconexiones, brechas de secuencia y siembra del libro completo

Campos que no deben perderse

  • Identificadores de lugar, evento, mercado y resultado en sus formas nativas y normalizadas.
  • Hora del intercambio/fuente y hora de recepción/observación como campos separados.
  • Precios de oferta, tamaños de oferta, precios de demanda y tamaños de demanda en posiciones de arreglo coincidentes.
  • Método de captura, intervalo o secuencia de eventos necesarios para interpretar el ritmo.
  • Resultado de liquidación y valores de referencia almacenados sin filtrarse en filas anteriores.
  • Una convención nula o faltante estable que nunca se convierte silenciosamente en cero.

Particione para las preguntas que realmente hace

Los archivos de profundidad grandes deben particionarse por campos de alta selectividad como el lugar y la fecha, y luego por una clave de mercado o activo estable donde coincida con la carga de trabajo. Un millón de archivos pequeños puede ser tan costoso como una exportación no particionada, por lo que mida el motor de consulta en lugar de copiar un diseño de lago genérico.

Mantenga un manifiesto junto a las exportaciones masivas. Debe registrar la versión del esquema, la hora de generación, los filtros solicitados, los recuentos de filas u observaciones y las particiones incompletas. Ese manifiesto convierte una descarga opaca en una entrada de investigación reproducible.

Opciones de entrega de DepthFeed

La ruta de investigación regular de DepthFeed es REST para ventanas históricas filtradas y WebSocket para fotogramas actuales normalizados. Los flujos de trabajo de escritorio pueden usar el archivo completo y los patrones de entrega columnar para estudios a gran escala. Las herramientas del navegador utilizan el mismo esquema subyacente, por lo que una idea puede pasar de una muestra a una prueba retrospectiva reproducible sin volver a definir el libro.

Comience con la porción representativa más pequeña: un lugar, una ventana de mercado y suficientes observaciones para probar el análisis, el orden y un relleno dimensionado. Escala solo después de que esos invariantes pasen.

Key takeaways

  • 01CSV, Parquet, REST y WebSocket son opciones de entrega, no significados de datos intercambiables.
  • 02Preserve las escaleras de precio/tamaño completas y los sellos de tiempo de origen y recepción.
  • 03Una exportación masiva necesita una versión de esquema y un manifiesto para permanecer reproducible.
  • 04Los nulos y las brechas explícitos son más seguros que los ceros o los rellenos sintéticos.
  • 05Valide un mercado representativo antes de escalar una descarga.

Un conjunto de datos descargable es útil solo si su formato preserva la evidencia que el análisis necesita. Aplanar una escalera en un solo precio puede generar un archivo pequeño y una prueba retrospectiva deshonesta.

Empieza gratis

Preguntas, respondidas.

CSV es práctico para pequeñas extracciones planas, pero las escaleras completas necesitan una codificación anidada documentada o una tabla de niveles separada. Para la historia de profundidad a gran escala, un formato columnar como Parquet suele ser más eficiente.

Empieza a hacer backtesting de Polymarket & Kalshi sobre profundidad real.

Gratis para empezar, sin tarjeta. Mejora tu plan cuando tu estrategia esté lista para el libro completo.

Empieza gratis