Backtesting Pasar Prediksi AI: Uji Strategi LLM Tanpa Kebocoran Masa Depan
Strategi yang dihasilkan AI bukanlah backtest. Model, batas informasi, protokol keputusan, status portofolio, dan isian yang dapat dieksekusi semua perlu dikendalikan pada jam historis.
Backtesting pasar prediksi AI mengevaluasi aturan yang dihasilkan LLM atau keputusan model hanya menggunakan informasi yang tersedia pada setiap cap waktu historis. Pengujian yang kredibel membekukan prompt dan semesta pasar, memblokir hasil yang telah diselesaikan dan fakta masa depan, memutar ulang pesanan terhadap kedalaman yang tercatat, mempertahankan status portofolio, dan melaporkan setiap keputusan, penolakan, dan isian.
Mengapa backtesting AI adalah masalah terpisah
Aturan deterministik dapat ditinjau baris demi baris. LLM dapat mengubah penalarannya dengan prompt, versi model, konteks, hasil alat, dan pengaturan pengambilan sampel. Ia juga mungkin mengetahui fakta yang terjadi setelah tanggal yang disimulasikan karena data pelatihannya atau alat pencarian yang terlampir mencapai di luar jam historis. Backtest perdagangan normal tidak secara otomatis mengendalikan risiko tersebut.
Pasar prediksi menjadikan kebocoran sangat parah. Pertanyaan pasar dan resolusi akhir bersifat publik setelah penyelesaian, sehingga model dapat tampak meramalkan suatu peristiwa sambil mengingat atau menyimpulkan jawabannya dari informasi kemudian. Pengujian harus mempertahankan integritas waktu pasar dan integritas waktu model.
Dua alur kerja backtesting AI
Alur kerja publik DepthFeed saat ini mendukung jalur pertama: minta model untuk mengusulkan hipotesis yang jelas, terjemahkan ke dalam aturan prasetel atau kustom, bekukan parameternya, dan jalankan melalui Backtest Lab. Ini memisahkan pembangkitan ide dari evaluasi dan menjadikan pemutaran ulang dapat diulang.
Pemutaran ulang model-dalam-lingkaran memerlukan kontrol tambahan: lingkungan informasi tertutup, status portofolio berurutan, catatan panggilan model yang tahan lama, dan pita titik waktu untuk setiap siklus. Jangan menggambarkan transkrip obrolan di atas pasar yang telah diselesaikan sebagai bentuk backtest yang lebih kuat ini.
| Alur Kerja | Apa yang dibekukan | Penggunaan terbaik |
|---|---|---|
| Aturan yang dihasilkan AI | Keluaran prompt menjadi logika deterministik eksplisit satu kali | Uji apakah hipotesis AI bertahan terhadap data pasar dan eksekusi |
| Pemutaran ulang model-dalam-lingkaran | Model, prompt, alat, dan konteks titik waktu dijalankan pada setiap keputusan | Evaluasi peramal otonom atau agen portofolio |
Bangun batas informasi historis
Implementasi paling aman menggunakan batas as-of: cap waktu sumber kurang dari atau sama dengan waktu keputusan. Setiap fitur, ringkasan, dan respons alat harus mewarisi batas tersebut. Satu bidang kemudahan tanpa batas, seperti status pasar hari ini atau label hasil akhir, dapat membatalkan seluruh proses.
- Tetapkan cap waktu keputusan dan sertakan hanya baris pasar yang diamati pada atau sebelum itu.
- Batasi setiap lookback trailing secara eksplisit; jangan pernah menggunakan baris terdekat yang bisa berasal dari masa depan.
- Kecualikan hasil penyelesaian, harga akhir, berita utama kemudian, dan pencarian web saat ini.
- Catat semesta pasar yang persis ditampilkan kepada model, termasuk kontrak yang dilewatinya.
- Buat hash atau versi pita input sehingga keputusan yang sama dapat direkonstruksi nanti.
- Laporkan data yang hilang sebagai hilang alih-alih mengisinya dari pengamatan kemudian.
Cegah kebocoran jawaban dan prompt
Bekukan prompt sistem, instruksi pelanggan, pengenal model, mode pengambilan sampel, skema keluaran terstruktur, dan alat yang tersedia. Hapus bahasa yang mengungkapkan hasil secara tidak langsung, termasuk status pasar akhir, kata-kata penyelesaian, ringkasan artikel retrospektif, atau nama file yang dibuat setelah resolusi.
Untuk pertanyaan peristiwa historis, asumsikan bahwa memori model pralatih mungkin berisi fakta-fakta kemudian bahkan ketika penjelajahan dinonaktifkan. Gunakan pertanyaan yang aman batas jika memungkinkan, evaluasi kontrol kebocoran secara terpisah, dan bandingkan kinerja pada periode yang lebih baru atau dirahasiakan secara pribadi. Skor tinggi pada peristiwa yang telah diselesaikan dan terkenal bukanlah bukti kemampuan peramalan dengan sendirinya.
Buat protokol keputusan dapat diaudit
Minta tindakan terstruktur daripada rekomendasi bebas bentuk. Keputusan yang berguna mencakup identitas pasar, sisi, probabilitas taksiran, keyakinan, harga masuk maksimum, nosional yang diminta, dan tesis singkat. Aturan sisi server kemudian harus menerima, mengubah ukuran, atau menolak proposal sesuai dengan batasan kas, eksposur, keyakinan, keunggulan, dan harga.
Simpan lolos dan perdagangan yang ditolak, bukan hanya isian. Jika laporan akhir hanya berisi pemenang yang dipilih model, tidak ada penyebut untuk analisis selektivitas, cakupan, atau kegagalan. Catatan yang tahan lama harus menghubungkan setiap tindakan ke batas input yang tepat dan status portofolio yang dihasilkan.
Putar ulang portofolio secara berurutan
Siklus portofolio harus berjalan dalam urutan kronologis karena satu keputusan mengubah kas dan eksposur terbuka yang tersedia untuk keputusan berikutnya. Paralelkan penemuan pasar di dalam cap waktu jika diperlukan, tetapi sintesiskan satu keputusan portofolio akhir terhadap satu pita beku. Jangan biarkan panggilan model independen menghabiskan kas yang sama.
Bawa posisi terbuka, kas yang direalisasi, dan batas risiko ke depan. Kemudian laporkan P&L berdasarkan kategori dan tempat serta secara agregat. Ini mengungkapkan apakah portofolio yang tampak cerdas adalah satu taruhan terarah yang terkonsentrasi yang diulang di seluruh kontrak berkorelasi.
Gunakan isian yang dapat dieksekusi, bukan harga yang dikutip model
Model dapat menyatakan harga maksimum; tidak boleh diizinkan membuat isian sendiri. Tambahkan penundaan eksekusi yang ditentukan, temukan buku tercatat pertama pada atau setelah waktu yang disimulasikan, dan jelajahi penawaran jual atau beli yang tersedia hanya hingga batas. Simpan VWAP, fraksi terisi, waktu pengamatan, dan buku yang digunakan.
Tandai portofolio akhir secara konservatif. Tanda titik tengah mengasumsikan likuidasi tanpa melintasi spread atau mengonsumsi ukuran. Likuidasi yang dapat dieksekusi yang sadar kedalaman lebih baik menjawab apa yang bisa direalisasikan oleh portofolio; buku yang kadaluwarsa atau tidak ada harus tetap menjadi kondisi kegagalan eksplisit.
Alur kerja yang berhasil: dari hipotesis LLM hingga pemutaran ulang
Mulai dengan prompt yang dibatasi: minta model untuk satu hipotesis yang dapat difalsifikasi Polymarket atau Kalshi, input yang dapat diamati yang diperlukan, aturan masuk yang tepat, ukuran posisi, perilaku keluar atau penyelesaian, dan kondisi di mana ia harus lolos. Larang klaim keuntungan dan minta tanpa contoh retrospektif.
Terjemahkan jawaban ke dalam prasetel Backtest Lab atau aturan kustom tanpa mengubah ambang batasnya setelah melihat hasil. Pilih tempat dan keluarga pasar yang dimaksud, gunakan sampel kronologis, dan bandingkan titik tengah, slippage tetap, dan kedalaman yang tercatat. Periksa setiap perdagangan dan pertahankan holdout kemudian. Jika bertahan, terapkan aturan beku ke perdagangan kertas dan evaluasi pada hasil yang tidak mungkin diketahui model saat aturan dibuat.
Metrik yang membedakan peramalan dari perdagangan
Kualitas peramalan dan kinerja perdagangan terkait tetapi tidak identik. Model yang terkalibrasi dapat merugi dengan membayar harga yang sudah mencerminkan informasinya. Model yang kurang terkalibrasi dapat menghasilkan uang sejenak melalui keberuntungan atau satu posisi terkonsentrasi. Laporkan kedua lapisan dan hindari mereduksi evaluasi menjadi judul papan peringkat.
| Pertanyaan | Metrik | Kegagalan yang ditangkapnya |
|---|---|---|
| Apakah probabilitas berguna? | Skor Brier, log loss, kalibrasi | Ramalan yang percaya diri tetapi tidak akurat |
| Apakah tindakan menguntungkan setelah eksekusi? | P&L bersih, ROI, keunggulan yang dapat dieksekusi | Ramalan bagus dibeli pada harga buruk |
| Apakah hasilnya terkonsentrasi? | P&L berdasarkan tempat, kategori, dan waktu | Satu peristiwa atau rezim yang membawa jalannya |
| Apakah risiko terkendali? | Drawdown, eksposur, jumlah posisi | Keuntungan yang diciptakan oleh konsentrasi berlebihan |
| Apakah model selektif? | Perdagangan, lolos, dan tingkat penolakan | Pelaporan yang dipilih-pilih tanpa penyebut |
| Apakah proses dapat direproduksi? | Prompt, model, pita, dan hash buku | Hasil yang tidak dapat diputar ulang secara independen |
Bandingkan model tanpa mengubah tiang gawang
- Berikan setiap model pita pasar beku yang sama, set alat, skema output, dan batas portofolio.
- Gunakan cap waktu keputusan yang sama, latensi eksekusi, mesin isian, dan aturan penandaan akhir.
- Pisahkan kegagalan penyedia, output tidak valid, dan penolakan aturan risiko dari kerugian pasar.
- Catat biaya token dan model bersamaan dengan kinerja; keuntungan marjinal mungkin tidak membenarkan biaya inferensi yang jauh lebih tinggi.
- Ulangi proses stokastik atau gunakan pengaturan deterministik jika didukung, dan laporkan variansnya.
- Jaga halaman model bernama dan klaim tetap terkini karena versi model dan ketersediaan berubah.
Klasifikasikan kegagalan alih-alih menyembunyikannya
Hasil-hasil ini berarti hal yang berbeda. Memperlakukan timeout penyedia sebagai lolos percaya diri membesar-besarkan selektivitas; menghilangkan pesanan yang tidak terisi melebih-lebihkan kinerja yang dapat dieksekusi; dan memperbaiki secara diam-diam output model yang cacat memberikan bantuan manusia kepada satu model yang mungkin tidak diterima oleh yang lain. Evaluasi harus mendefinisikan setiap kelas sebelum proses dan menerapkannya secara mekanis.
Publikasikan corong penuh: pasar yang memenuhi syarat, pasar yang ditampilkan, tindakan yang diusulkan, lolos, output tidak valid, penolakan pagar pengaman, penolakan eksekusi, isian parsial, dan posisi yang diselesaikan. Penyebut itu memungkinkan membedakan model yang hati-hati dari yang tidak dapat diandalkan.
| Kelas kegagalan | Contoh | Cara melaporkannya |
|---|---|---|
| Kegagalan informasi | Fakta masa depan, bidang penyelesaian, atau kuotasi kemudian masuk ke konteks | Batalkan siklus atau proses yang terpengaruh |
| Kegagalan penyedia | Timeout, batas laju, atau model tidak tersedia | Hitung secara terpisah dari lolos pasar |
| Kegagalan skema | Tindakan tidak valid, ID pasar hilang, atau probabilitas tidak dapat diuraikan | Simpan respons mentah dan penolakan |
| Penolakan risiko | Ukuran yang diminta melebihi batas kas, eksposur, atau harga | Laporkan sebagai proposal model yang ditolak oleh pagar pengaman |
| Penolakan eksekusi | Tidak ada buku tepat waktu, tidak ada kedalaman di bawah batas, atau isian nol | Simpan dalam penyebut perdagangan |
| Kerugian pasar | Keputusan terisi yang valid diselesaikan terhadap sisi yang dipilih | Sertakan secara normal dalam P&L dan penilaian peramalan |
Catatan reprodusibilitas minimum
Untuk setiap proses, simpan penyedia model dan slug model yang tepat, template prompt, definisi alat, skema output terstruktur, konfigurasi pengambilan sampel, dan instruksi pelanggan. Catat awal dan akhir historis, interval keputusan, lookback, tempat, kategori, kas awal, batas eksposur, latensi eksekusi, dan metode penandaan akhir.
Untuk setiap siklus keputusan, simpan cap waktu keputusan, versi pita, waktu as-of pita, jumlah pasar yang memenuhi syarat, hash input, portofolio sebelum dan sesudah, penggunaan model, dan status kesalahan. Untuk setiap perdagangan yang diusulkan, simpan tesis dan probabilitasnya bersamaan dengan probabilitas pasar yang diamati, keyakinan, harga batas, ukuran yang diminta, kode penolakan, dan buku historis yang digunakan untuk isian apa pun.
Model penyedia dapat diperbarui di balik nama yang stabil, sehingga pengulangan yang tepat mungkin masih berbeda nanti. Catatan yang tahan lama tidak dapat menghilangkan varians platform itu, tetapi dapat mengungkapkannya. Jika seed deterministik atau versi yang disematkan tidak tersedia, ulangi pengujian yang sama cukup kali untuk melaporkan dispersi antar-proses alih-alih menyajikan satu sampel yang menguntungkan.
- Slug model, penyedia, prompt, alat, skema, dan pengaturan pengambilan sampel.
- Batas historis, semesta pasar, interval keputusan, dan lookback.
- Batas portofolio, latensi eksekusi, mesin isian, dan tanda akhir.
- Hash input dan buku yang terikat pada setiap keputusan dan isian.
- Penggunaan token, biaya model, output tidak valid, dan semua alasan penolakan.
- Varians pengulangan proses ketika model atau penyedia bersifat stokastik.
Uji maju sebelum membuat klaim kinerja AI
Pengujian AI historis masih dapat memperoleh manfaat dari memori model, penyetelan prompt peneliti, dan eksperimen berulang. Langkah selanjutnya yang paling bersih adalah periode kertas maju yang terkunci. Bekukan prompt atau aturan yang diekstraksi, mulai setelah konfigurasi final, beri harga setiap tindakan dari buku yang ditampilkan langsung, dan publikasikan penyebut penuh.
DepthFeed Paper Trading menyediakan jalur maju yang tersedia untuk aturan deterministik dan sinyal bot eksternal. Ini menggunakan kas virtual dan tidak menempatkan pesanan bursa langsung. Perbedaan itu harus tetap terlihat di mana pun alur kerja AI dijelaskan.
Apa yang ditawarkan DepthFeed hari ini
Hari ini, peneliti dapat menggunakan model AI untuk membuat atau menyempurnakan strategi eksplisit, memutar ulang aturan beku itu di Backtest Lab terhadap buku pasar prediksi yang direkam, membandingkan tiga asumsi isian, memeriksa risiko dan perdagangan individu, dan memindahkan yang selamat yang kompatibel ke perdagangan kertas langsung. Data historis API dan server MCP juga mendukung penelitian agen kustom di luar dasbor.
DepthFeed saat ini tidak mengiklankan backtest model-dalam-lingkaran otonom publik API atau eksekusi perdagangan AI langsung. Alur kerja yang lebih sempit disengaja dan dapat diuji: model mengusulkan; bukti pasar yang direkam mengevaluasi; perdagangan kertas menyediakan catatan maju.
Key takeaways
- 01Pembangkitan ide AI dan pemutaran ulang model-dalam-lingkaran AI adalah produk yang berbeda dan memerlukan bukti yang berbeda.
- 02Blokir penyelesaian, baris masa depan, pencarian saat ini, dan fakta kemudian pada setiap keputusan historis.
- 03Bekukan model, prompt, alat, skema, semesta, dan batasan portofolio sebelum membandingkan hasil.
- 04Simpan lolos, penolakan, panggilan model, dan batas input serta isian yang menguntungkan.
- 05Putar ulang kas dan posisi secara berurutan, lalu eksekusi terhadap kedalaman yang direkam setelah latensi yang ditentukan.
- 06Laporkan kalibrasi, P&L, risiko, konsentrasi, biaya inferensi, dan reprodusibilitas secara terpisah.
- 07Gunakan periode kertas maju yang terkunci sebelum membuat klaim kinerja AI apa pun.
Strategi yang dihasilkan AI bukanlah backtest. Model, batas informasi, protokol keputusan, status portofolio, dan isian yang dapat dieksekusi semua perlu dikendalikan pada jam historis.
Mulai gratis