DepthFeed/Both venues·Data engineering

Downloads de Dados de Mercados de Previsão: CSV, Parquet e Exports de API

Um conjunto de dados baixável é útil apenas se seu formato preservar a evidência que a análise precisa. Achatar uma escada em um único preço pode criar um arquivo pequeno e um backtest desonesto.

DepthFeed··8 min

Use CSV para inspeção e pequenas extrações planas, Parquet para pesquisa de coluna grande e REST para consultas limitadas ou incrementais. Seja qual for o método de entrega que você escolher, mantenha os identificadores de mercado, a origem e os carimbos de data/hora de recebimento, os arrays de preço/tamanho de compra/venda, os campos de liquidação e as lacunas explícitas. O formato deve mudar como os bytes são entregues, não o significado do mercado registrado.

Combine o formato com a carga de trabalho

FormatoMelhor paraObserve
CSVInspeção manual e amostras pequenas e interoperáveisEscadas aninhadas requerem uma codificação documentada ou tabela filha
ParquetGrandes varreduras, poda de coluna e data warehouses de pesquisaA evolução do esquema e as chaves de partição devem ser estáveis
REST JSONConsultas limitadas, aplicativos e extrações incrementaisPaginação, limites e semântica de repetição
WebSocketAtualizações atuais e sistemas ao vivoReconexões, lacunas de sequência e semeadura do livro completo

Campos a não perder

  • Identificadores de local, evento, mercado e resultado em suas formas nativas e normalizadas.
  • Tempo da bolsa/fonte e tempo de recebimento/observação como campos separados.
  • Preços de compra, tamanhos de compra, preços de venda e tamanhos de venda em posições de array correspondentes.
  • Método de captura, intervalo ou sequência de eventos necessários para interpretar o ritmo.
  • Resultado de liquidação e valores de referência armazenados sem vazar para linhas anteriores.
  • Uma convenção nula ou ausente estável que nunca se torna silenciosamente zero.

Particione para as perguntas que você realmente faz

Grandes arquivos de profundidade devem ser particionados por campos de alta seletividade, como local e data, e, em seguida, por uma chave de mercado ou ativo estável onde corresponda à carga de trabalho. Um milhão de arquivos pequenos pode ser tão caro quanto uma exportação não particionada, então meça o mecanismo de consulta em vez de copiar um layout de lago genérico.

Mantenha um manifesto próximo às exportações em massa. Ele deve registrar a versão do esquema, o tempo de geração, os filtros solicitados, as contagens de linhas ou observações e as partições incompletas. Esse manifesto transforma um download opaco em uma entrada de pesquisa reproduzível.

Escolhas de entrega DepthFeed

O caminho regular de pesquisa do DepthFeed é REST para janelas históricas filtradas e WebSocket para quadros atuais normalizados. Os fluxos de trabalho de desktop podem usar o arquivo completo e padrões de entrega de coluna para estudos grandes. As ferramentas do navegador usam o mesmo esquema subjacente, para que uma ideia possa se mover de uma amostra para um backtest reproduzível sem redefinir o livro.

Comece com a menor fatia representativa: um local, uma janela de mercado e observações suficientes para testar a análise, a ordem e um preenchimento dimensionado. Aumente a escala somente depois que esses invariantes passarem.

Key takeaways

  • 01CSV, Parquet, REST e WebSocket são escolhas de entrega, não significados de dados intercambiáveis.
  • 02Preserve as escadas de preço/tamanho completas e os carimbos de data/hora de origem e recebimento.
  • 03Uma exportação em massa precisa de uma versão e manifesto de esquema para permanecer reproduzível.
  • 04Nulos e lacunas explícitos são mais seguros do que zeros ou preenchimentos sintéticos.
  • 05Valide um mercado representativo antes de aumentar a escala de um download.

Um conjunto de dados baixável é útil apenas se seu formato preservar a evidência que a análise precisa. Achatar uma escada em um único preço pode criar um arquivo pequeno e um backtest desonesto.

Começar grátis

Perguntas, respondidas.

CSV é prático para pequenas extrações planas, mas as escadas completas precisam de uma codificação aninhada documentada ou uma tabela de níveis separada. Para histórico de profundidade grande, um formato de coluna como Parquet é geralmente mais eficiente.

Comece a fazer backtest de Polymarket & Kalshi sobre profundidade real.

Grátis para começar, sem cartão. Faça upgrade quando sua estratégia estiver pronta para o livro completo.

Começar grátis