Download di dati di mercati predittivi: esportazioni CSV, Parquet e API
Un dataset scaricabile è utile solo se il suo formato preserva le evidenze di cui l'analisi ha bisogno. Appiattire una scala in un unico prezzo può creare un file piccolo e un backtest disonesto.
Usa CSV per l'ispezione e le estrazioni piatte di piccole dimensioni, Parquet per la ricerca colonnare di grandi dimensioni e REST per query limitate o incrementali. Qualunque metodo di consegna tu scelga, mantieni gli identificatori di mercato, i timestamp di origine e ricezione, gli array di prezzo-dimensione di bid/ask, i campi di regolamento e i gap espliciti. Il formato dovrebbe cambiare il modo in cui i byte vengono consegnati, non il significato del mercato registrato.
Abbina il formato al carico di lavoro
| Formato | Migliore per | Fai attenzione a |
|---|---|---|
| CSV | Ispezione manuale e piccoli campioni interoperabili | Le scale nidificate richiedono una codifica documentata o una tabella secondaria |
| Parquet | Scansioni di grandi dimensioni, pruning di colonne e data warehouse di ricerca | L'evoluzione dello schema e le chiavi di partizione devono essere stabili |
| REST JSON | Query limitate, applicazioni e estrazioni incrementali | Paginazione, limiti e semantica di retry |
| WebSocket | Aggiornamenti correnti e sistemi live | Riconnessioni, gap di sequenza e seeding di book completi |
Campi da non perdere
- Identificatori di sede, evento, mercato e risultato nelle loro forme native e normalizzate.
- Tempo di scambio/origine e tempo di ricezione/osservazione come campi separati.
- Prezzi di bid, dimensioni di bid, prezzi di ask e dimensioni di ask in posizioni di array corrispondenti.
- Metodo di acquisizione, intervallo o sequenza di eventi necessari per interpretare la cadenza.
- Risultato di regolamento e valori di riferimento memorizzati senza divulgazione in righe precedenti.
- Una convenzione stabile per valori nulli o mancanti che non diventano mai silenziosamente zero.
Partiziona per le domande che poni effettivamente
Gli archivi di profondità di grandi dimensioni dovrebbero essere partizionati per campi ad alta selettività come sede e data, quindi per una chiave di mercato o asset stabile dove corrisponde al carico di lavoro. Un milione di file piccoli può essere costoso quanto un'esportazione non partizionata, quindi misura il motore di query piuttosto che copiare un layout di lake generico.
Mantieni un manifest accanto alle esportazioni di massa. Dovrebbe registrare la versione dello schema, l'ora di generazione, i filtri richiesti, il conteggio delle righe o delle osservazioni e le partizioni incomplete. Quel manifest trasforma un download opaco in un input di ricerca riproducibile.
Opzioni di consegna DepthFeed
Il percorso di ricerca regolare di DepthFeed è REST per finestre storiche filtrate e WebSocket per frame normalizzati correnti. I workflow di desk possono utilizzare l'archivio completo e i modelli di consegna colonnare per studi di grandi dimensioni. Gli strumenti del browser utilizzano lo stesso schema sottostante, quindi un'idea può passare da un campione a un backtest riproducibile senza ridefinire il book.
Inizia con la fetta rappresentativa più piccola: una sede, una finestra di mercato e osservazioni sufficienti per testare l'analisi, l'ordinamento e un riempimento dimensionato. Scala solo dopo che queste invarianti sono superate.
Key takeaways
- 01CSV, Parquet, REST e WebSocket sono scelte di consegna, non significati di dati intercambiabili.
- 02Preserva le scale complete di prezzo-dimensione e sia i timestamp di origine che di ricezione.
- 03Un'esportazione di massa necessita di una versione dello schema e di un manifest per rimanere riproducibile.
- 04I null e i gap espliciti sono più sicuri degli zeri o dei riempimenti sintetici.
- 05Valida un mercato rappresentativo prima di scalare un download.
Un dataset scaricabile è utile solo se il suo formato preserva le evidenze di cui l'analisi ha bisogno. Appiattire una scala in un unico prezzo può creare un file piccolo e un backtest disonesto.
Inizia gratis