Tải xuống dữ liệu thị trường dự đoán: CSV, Parquet và Xuất API
Một bộ dữ liệu có thể tải xuống chỉ hữu ích nếu định dạng của nó bảo toàn bằng chứng mà phân tích cần. Làm phẳng một thang giá thành một mức giá có thể tạo ra một tệp nhỏ và một bài kiểm tra lại không trung thực.
Sử dụng CSV để kiểm tra và trích xuất phẳng nhỏ, Parquet cho nghiên cứu cột lớn và REST cho các truy vấn có giới hạn hoặc gia tăng. Bất kể phương pháp phân phối nào bạn chọn, hãy giữ lại các định danh thị trường, dấu thời gian nguồn và nhận, mảng giá-khối lượng bid/ask, các trường thanh toán và các khoảng trống rõ ràng. Định dạng nên thay đổi cách byte được phân phối, không phải ý nghĩa của thị trường được ghi lại.
Khớp định dạng với khối lượng công việc
| Định dạng | Tốt nhất cho | Cần lưu ý |
|---|---|---|
| CSV | Kiểm tra thủ công và các mẫu tương tác nhỏ | Thang giá lồng nhau yêu cầu mã hóa hoặc bảng con được ghi lại |
| Parquet | Quét lớn, cắt cột và kho nghiên cứu | Tiến hóa lược đồ và khóa phân vùng phải ổn định |
| REST JSON | Truy vấn có giới hạn, ứng dụng và kéo gia tăng | Phân trang, giới hạn và ngữ nghĩa thử lại |
| WebSocket | Cập nhật hiện tại và hệ thống trực tiếp | Kết nối lại, khoảng trống chuỗi và khởi tạo sổ lệnh hoàn chỉnh |
Các trường không được làm mất
- Địa điểm, sự kiện, thị trường và định danh kết quả ở dạng gốc và chuẩn hóa của chúng.
- Thời gian trao đổi/nguồn và thời gian nhận/quan sát dưới dạng các trường riêng biệt.
- Giá bid, kích thước bid, giá ask và kích thước ask ở các vị trí mảng tương ứng.
- Ghi lại phương pháp, khoảng thời gian hoặc chuỗi sự kiện cần thiết để diễn giải tần suất.
- Kết quả thanh toán và giá trị tham chiếu được lưu trữ mà không làm rò rỉ vào các hàng trước đó.
- Một quy ước null hoặc thiếu ổn định không bao giờ thầm lặng trở thành số không.
Phân vùng cho các câu hỏi bạn thực sự đặt ra
Các kho lưu trữ độ sâu lớn nên được phân vùng theo các trường có độ chọn lọc cao như địa điểm và ngày tháng, sau đó là một khóa thị trường hoặc tài sản ổn định khi nó khớp với khối lượng công việc. Một triệu tệp nhỏ có thể tốn kém như một xuất không phân vùng, vì vậy hãy đo lường công cụ truy vấn thay vì sao chép bố cục hồ chung.
Giữ một tệp kê bên cạnh các xuất hàng loạt. Nó nên ghi lại phiên bản lược đồ, thời gian tạo, bộ lọc được yêu cầu, số lượng hàng hoặc quan sát và bất kỳ phân vùng không hoàn chỉnh nào. Tệp kê đó biến một bản tải xuống không rõ ràng thành một đầu vào nghiên cứu có thể tái tạo.
Các lựa chọn phân phối DepthFeed
Đường dẫn nghiên cứu thông thường của DepthFeed là REST cho các cửa sổ lịch sử được lọc và WebSocket cho các khung chuẩn hóa hiện tại. Các quy trình làm việc trên bàn có thể sử dụng toàn bộ kho lưu trữ và các mẫu phân phối cột cho các nghiên cứu lớn. Các công cụ trình duyệt sử dụng cùng một lược đồ cơ bản, vì vậy một ý tưởng có thể chuyển từ một mẫu sang một bài kiểm tra lại có thể tái tạo mà không cần xác định lại sổ lệnh.
Bắt đầu với một lát cắt đại diện nhỏ nhất: một địa điểm, một cửa sổ thị trường và đủ các quan sát để kiểm tra phân tích cú pháp, sắp xếp và một khối lượng điền có kích thước. Chỉ mở rộng quy mô sau khi các bất biến đó vượt qua.
Key takeaways
- 01CSV, Parquet, REST và WebSocket là các lựa chọn phân phối, không phải ý nghĩa dữ liệu có thể thay thế.
- 02Bảo toàn đầy đủ các thang giá và cả dấu thời gian nguồn và nhận.
- 03Một xuất hàng loạt cần một phiên bản lược đồ và tệp kê để vẫn có thể tái tạo.
- 04Null và khoảng trống rõ ràng an toàn hơn số không hoặc điền tổng hợp.
- 05Xác thực một thị trường đại diện trước khi mở rộng quy mô tải xuống.
Một bộ dữ liệu có thể tải xuống chỉ hữu ích nếu định dạng của nó bảo toàn bằng chứng mà phân tích cần. Làm phẳng một thang giá thành một mức giá có thể tạo ra một tệp nhỏ và một bài kiểm tra lại không trung thực.
Bắt đầu miễn phí