DepthFeed/Both venues·Data engineering

Pobieranie danych z rynków prognoz: CSV, Parquet i eksporty API

Pobierany zestaw danych jest przydatny tylko wtedy, gdy jego format zachowuje dowody, których potrzebuje analiza. Spłaszczenie drabiny w jedną cenę może stworzyć mały plik i nieuczciwe testy wsteczne.

DepthFeed··8 min

Użyj CSV do inspekcji i małych, płaskich wyciągów, Parquet do dużych, kolumnowych badań i REST do ograniczonych lub przyrostowych zapytań. Niezależnie od wybranej metody dostarczania, zachowaj identyfikatory rynku, źródłowe i odbierane znaczniki czasu, tablice cen/rozmiarów bid/ask, pola rozliczeniowe i jawne luki. Format powinien zmieniać sposób dostarczania bajtów, a nie znaczenie zarejestrowanego rynku.

Dopasuj format do obciążenia

FormatNajlepszy doZwróć uwagę na
CSVRęczna inspekcja i małe, interoperacyjne próbkiZagnieżdżone drabiny wymagają udokumentowanego kodowania lub tabeli potomnej
ParquetDuże skany, przycinanie kolumn i hurtownie badawczeEwolucja schematu i klucze partycji muszą być stabilne
REST JSONOgraniczone zapytania, aplikacje i przyrostowe pobieraniaPaginacja, limity i semantyka ponownych prób
WebSocketAktualizacje bieżące i systemy na żywoPonowne połączenia, luki sekwencyjne i seeding pełnej księgi

Pola, których nie należy tracić

  • Identyfikatory miejsca, zdarzenia, rynku i wyniku w ich natywnej i znormalizowanej formie.
  • Czas wymiany/źródła i czas odbioru/obserwacji jako oddzielne pola.
  • Ceny bid, rozmiary bid, ceny ask i rozmiary ask w pasujących pozycjach tablicy.
  • Metoda przechwytywania, interwał lub sekwencja zdarzeń potrzebna do interpretacji rytmu.
  • Wynik rozliczenia i wartości referencyjne przechowywane bez wycieku do wcześniejszych wierszy.
  • Stabilna konwencja null lub brakujących danych, która nigdy automatycznie nie stanie się zerem.

Partycjonuj dla pytań, na które faktycznie odpowiadasz

Duże archiwa głębokości powinny być partycjonowane według pól o wysokiej selektywności, takich jak miejsce i data, a następnie według stabilnego klucza rynku lub aktywa, gdzie to pasuje do obciążenia. Milion małych plików może być tak samo kosztowne, jak jeden niepartycjonowany eksport, więc mierz silnik zapytań, a nie kopiuj ogólny układ jeziora.

Przechowuj manifest obok masowych eksportów. Powinien on rejestrować wersję schematu, czas generowania, żądane filtry, liczbę wierszy lub obserwacji oraz wszelkie niekompletne partycje. Ten manifest przekształca nieprzejrzysty pobieranie w reprodukowalne wejście badawcze.

Wybory dostarczania DepthFeed

Regularna ścieżka badawcza DepthFeed to REST dla przefiltrowanych historycznych okien i WebSocket dla bieżących znormalizowanych ramek. Workflowy biurowe mogą używać pełnego archiwum i wzorców dostarczania kolumnowego do dużych badań. Narzędzia przeglądarkowe używają tego samego schematu, dzięki czemu pomysł może przejść z próbki do reprodukowalnego testu wstecznego bez ponownego definiowania księgi.

Zacznij od najmniejszego reprezentatywnego fragmentu: jednego miejsca, jednego okna rynku i wystarczającej liczby obserwacji, aby przetestować parsowanie, sortowanie i wypełnienie o określonym rozmiarze. Skaluj tylko po tym, jak te niezmienniki przejdą.

Key takeaways

  • 01CSV, Parquet, REST i WebSocket to wybory dostarczania, a nie zamienne znaczenia danych.
  • 02Zachowaj pełne drabiny cen-rozmiarów i zarówno źródłowe, jak i odbierane znaczniki czasu.
  • 03Masowy eksport wymaga wersji schematu i manifestu, aby pozostać reprodukowalnym.
  • 04Jawne null i luki są bezpieczniejsze niż syntetyczne zera lub wypełnienia.
  • 05Zweryfikuj jeden reprezentatywny rynek przed skalowaniem pobierania.

Pobierany zestaw danych jest przydatny tylko wtedy, gdy jego format zachowuje dowody, których potrzebuje analiza. Spłaszczenie drabiny w jedną cenę może stworzyć mały plik i nieuczciwe testy wsteczne.

Zacznij za darmo

Pytania i odpowiedzi.

CSV jest praktyczne dla małych, płaskich wyciągów, ale pełne drabiny wymagają udokumentowanego kodowania zagnieżdżonego lub oddzielnej tabeli poziomów. W przypadku dużej historii głębokości format kolumnowy, taki jak Parquet, jest zwykle bardziej wydajny.

Zacznij backtestować Polymarket & Kalshi na realnej głębokości.

Darmowy start, bez karty. Przejdź na wyższy plan, gdy Twoja strategia będzie gotowa na cały arkusz.

Zacznij za darmo