DepthFeed/Both venues·AI geriye dönük testi

AI Tahmin Piyasası Geriye Dönük Testi: LLM Stratejilerini Gelecek Sızıntısı Olmadan Test Edin

AI tarafından oluşturulan bir strateji bir geriye dönük test değildir. Model, bilgi sınırı, karar protokolü, portföy durumu ve gerçekleştirilebilir emir işlemi, tarihsel saatte kontrol edilmelidir.

DepthFeed··15 min

AI tahmin piyasası geriye dönük testi, LLM tarafından oluşturulan bir kuralı ya da model kararını yalnızca her tarihsel zaman damgasında mevcut bilgileri kullanarak değerlendirir. Güvenilir bir test, istemi ve piyasa evrenini dondurur, çözümlenmiş sonuçları ve geleceğe ait olguları engeller, emirleri kaydedilmiş derinliğe karşı yeniden oynatır, portföy durumunu korur ve her kararı, reddi ve gerçekleşmeyi raporlar.

AI geriye dönük testi neden ayrı bir sorundur

Belirleyici bir kural satır satır incelenebilir. Bir LLM, istem, model sürümü, bağlam, araç sonuçları ve örnekleme ayarlarıyla muhakemesini değiştirebilir. Ayrıca, eğitim verileri veya ekli bir arama aracı tarihsel saatin ötesine ulaştığı için simüle edilen tarihten sonra gerçekleşmiş olguları bilebilir. Normal bir alım satım geriye dönük testi bu riskleri otomatik olarak kontrol etmez.

Tahmin piyasaları sızıntıyı özellikle şiddetli hale getirir. Piyasa sorusu ve nihai çözüm, uzlaşma sonrasında kamuya açıktır; bu nedenle bir model, daha sonraki bilgilere dayanarak cevabı hatırlayarak veya çıkarım yaparak bir olayı öngörüyor gibi görünebilir. Test, hem piyasa zamanı bütünlüğünü hem de model zamanı bütünlüğünü korumalıdır.

İki AI geriye dönük test iş akışı

DepthFeed'in şu anda kamuya açık iş akışı ilk yolu destekler: bir modelden net bir hipotez önermesini isteyin, bunu bir ön ayarlı ya da özel kurala çevirin, parametreleri dondurun ve Backtest Lab'de çalıştırın. Bu, fikir üretimini değerlendirmeden ayırır ve yeniden oynatımı tekrarlanabilir kılar.

Döngüdeki model yeniden oynatımı ek kontroller gerektirir: kapalı bir bilgi ortamı, sıralı portföy durumu, kalıcı model çağrı kayıtları ve her döngü için zamanındaki bir kayıt. Çözümlenmiş piyasalar üzerinden bir sohbet transkriptini bu daha güçlü geriye dönük test biçimi olarak tanımlamayın.

İş akışıNe dondurulurEn iyi kullanım
AI tarafından oluşturulan kuralİstem çıktısı bir kez açık belirleyici mantık haline gelirBir AI hipotezinin piyasa verileri ve gerçekleşme karşısında ayakta kalıp kalmadığını test edin
Döngüdeki model yeniden oynatımıModel, istem, araçlar ve zamanındaki bağlam her kararda çalıştırılırOtonom bir tahminciyi veya portföy ajanını değerlendirin

Tarihsel bilgi sınırını oluşturun

En güvenli uygulama, bir 'zamanı itibarıyla' sınırı kullanır: kaynak zaman damgası karar zamanından küçük veya eşit olmalıdır. Her özellik, özet ve araç yanıtı bu sınırı miras almalıdır. Bugünün piyasa durumu veya nihai sonuç etiketi gibi tek bir sınırsız kolaylık alanı, tüm çalışmayı geçersiz kılabilir.

  • Bir karar zaman damgası belirleyin ve yalnızca bu zamanda veya öncesinde gözlemlenen piyasa satırlarını dahil edin.
  • Herhangi bir takip eden geçmişe bakışı açıkça sınırlayın; gelecekten gelebilecek en yakın satırı asla kullanmayın.
  • Uzlaşma sonuçlarını, nihai fiyatları, sonraki manşetleri ve güncel web aramasını hariç tutun.
  • Modele gösterilen tam piyasa evrenini, atladığı sözleşmeler de dahil olmak üzere kaydedin.
  • Girdi kaydını karma veya sürümle işaretleyin ki aynı karar daha sonra yeniden oluşturulabilsin.
  • Eksik verileri, daha sonraki bir gözlemle doldurmak yerine eksik olarak raporlayın.

Cevap ve istem sızıntısını önleyin

Sistem istemini, müşteri talimatlarını, model tanımlayıcıyı, örnekleme modunu, yapılandırılmış çıktı şemasını ve mevcut araçları dondurun. Nihai piyasa durumu, uzlaşma ifadeleri, geriye dönük makale özetleri veya çözüm sonrası oluşturulan dosya adları gibi sonucu dolaylı olarak ortaya çıkaran dili kaldırın.

Tarihsel olay soruları için, önceden eğitilmiş model belleğinin, tarama devre dışı bırakılsa bile daha sonraki olguları içerebileceğini varsayın. Mümkün olduğunda kesme güvenli sorular kullanın, sızıntı kontrollerini ayrı olarak değerlendirin ve daha yeni veya özel olarak ayrılmış dönemlerdeki performansı karşılaştırın. İyi bilinen çözümlenmiş olaylarda yüksek bir puan, kendi başına tahmin becerisinin kanıtı değildir.

Karar protokolünü denetlenebilir hale getirin

Serbest biçimli tavsiyeler yerine yapılandırılmış eylemler isteyin. Yararlı bir karar; piyasa kimliği, taraf, tahmini olasılık, güven, maksimum giriş fiyatı, talep edilen nominal değer ve kısa bir tez içerir. Sunucu tarafı kuralları daha sonra teklifi nakit, risk, güven, avantaj ve fiyat limitlerine göre kabul etmeli, yeniden boyutlandırmalı veya reddetmelidir.

Yalnızca gerçekleşmeleri değil, geçişleri ve reddedilen işlemleri de saklayın. Nihai rapor yalnızca modelin seçtiği kazananları içeriyorsa, seçicilik, kapsam veya başarısızlık analizi için bir payda yoktur. Kalıcı kayıt, her eylemi tam girdi sınırına ve sonuçta ortaya çıkan portföy durumuna bağlamalıdır.

Portföyü sırayla yeniden oynatın

Portföy döngüleri kronolojik sırada çalıştırılmalıdır çünkü bir karar, bir sonraki için mevcut nakit ve açık riski değiştirir. Gerekirse bir zaman damgası içinde piyasa keşfini paralelleştirin, ancak bir donmuş kayda karşı tek bir nihai portföy kararı sentezleyin. Bağımsız model çağrılarının aynı nakdi harcamasına izin vermeyin.

Açık pozisyonları, gerçekleşmiş nakdi ve risk limitlerini ileriye taşıyın. Ardından kâr/zararı (P&L) kategori ve mekâna göre ve toplamda raporlayın. Bu, görünüşte akıllı bir portföyün, ilişkili sözleşmeler arasında tekrarlanan tek bir yoğun yönlü bahis olup olmadığını ortaya çıkarır.

Modelin teklif ettiği fiyatı değil, gerçekleştirilebilir işlem fiyatlarını kullanın

Model bir maksimum fiyat belirtebilir; kendi işlem fiyatını uydurmasına izin verilmemelidir. Tanımlı bir gerçekleşme gecikmesi ekleyin, simüle edilen zamanda veya sonrasında ilk kaydedilmiş defteri bulun ve yalnızca limite kadar mevcut satış veya alış fiyatlarını ilerletin. VWAP, gerçekleşen kısım, gözlem zamanı ve kullanılan defteri saklayın.

Nihai portföyü ihtiyatlı bir şekilde değerleyin. Orta nokta değerlemesi, spread'i geçmeden veya büyüklüğü tüketmeden tasfiyeyi varsayar. Derinlik farkında gerçekleştirilebilir bir tasfiye, portföyün neyi gerçekleştirebileceğini daha iyi yanıtlar; bayat veya eksik defterler açık bir başarısızlık koşulu olarak kalmalıdır.

Çalışan iş akışı: bir LLM hipotezinden yeniden oynatıma

Sınırlı bir istemle başlayın: modelden yanlışlanabilir bir Polymarket veya Kalshi hipotezi, gerekli gözlemlenebilir girdiler, kesin bir giriş kuralı, pozisyon büyüklüğü, çıkış veya uzlaşma davranışı ve geçmesi gereken koşulları isteyin. Kâr iddialarını yasaklayın ve geriye dönük örnek talep etmeyin.

Cevabı, sonuçları gördükten sonra eşiklerini değiştirmeden bir Backtest Lab ön ayarına veya özel kurala çevirin. Hedeflenen mekânı ve piyasa ailesini seçin, kronolojik bir örneklem kullanın ve orta nokta, sabit kayma ve kaydedilmiş derinliği karşılaştırın. Her işlemi inceleyin ve daha sonraki bir test dönemini saklayın. Hayatta kalırsa, dondurulmuş kuralı kâğıt üzerinde alım satıma dağıtın ve modelin kural oluşturulduğunda bilemeyeceği sonuçlar üzerinde değerlendirin.

Tahmini alım satımdan ayıran metrikler

Tahmin kalitesi ve alım satım performansı ilişkilidir ancak aynı değildir. Kalibre edilmiş bir model, bilgisini zaten yansıtan fiyatları ödeyerek kaybedebilir. Kötü kalibre edilmiş bir model, şans veya tek bir yoğun pozisyon yoluyla kısa süreliğine para kazanabilir. Her iki katmanı da raporlayın ve değerlendirmeyi bir lider tablosu başlığına indirgemekten kaçının.

SoruMetrikYakaladığı başarısızlık
Olasılıklar faydalı mıydı?Brier skoru, log kaybı, kalibrasyonKendinden emin ancak hatalı tahminler
Eylemler gerçekleşme sonrası kârlı mıydı?Net K/Z, ROI, gerçekleştirilebilir avantajKötü fiyatlardan alınan iyi tahminler
Sonuç yoğunlaşmış mıydı?Mekân, kategori ve zamana göre K/ZÇalışmayı taşıyan tek bir olay veya rejim
Risk kontrol edildi mi?Düşüş, risk, pozisyon sayısıAşırı yoğunlaşma ile yaratılan kâr
Model seçici miydi?İşlemler, geçişler ve ret oranlarıPaydası olmayan özenle seçilmiş raporlama
Çalışma tekrarlanabilir miydi?İstem, model, kayıt ve defter karmalarıBağımsız olarak yeniden oynatılamayan bir sonuç

Hedefleri değiştirmeden modelleri karşılaştırın

  • Her modele aynı dondurulmuş piyasa kaydını, araç setini, çıktı şemasını ve portföy limitlerini verin.
  • Aynı karar zaman damgalarını, gerçekleşme gecikmesini, işlem motorunu ve nihai değerleme kuralını kullanın.
  • Sağlayıcı hatalarını, geçersiz çıktıyı ve risk kuralı retlerini piyasa kayıplarından ayırın.
  • Token ve model maliyetini performansla birlikte kaydedin; marjinal bir kazanç, çok daha yüksek çıkarım maliyetini haklı çıkarmayabilir.
  • Stokastik çalıştırmaları tekrarlayın veya destekleniyorsa belirleyici ayarları kullanın ve varyansı raporlayın.
  • Model sürümleri ve kullanılabilirlik değiştiği için adlandırılmış model sayfalarını ve iddiaları güncel tutun.

Hataları gizlemek yerine sınıflandırın

Bu sonuçlar farklı anlamlara gelir. Bir sağlayıcı zaman aşımını kendinden emin bir geçiş olarak değerlendirmek seçiciliği şişirir; gerçekleşmemiş bir emri çıkarmak gerçekleştirilebilir performansı olduğundan fazla gösterir; ve hatalı model çıktısını sessizce onarmak, bir modele diğerlerinin almayabileceği insan yardımı vermiş olur. Değerlendirme, çalıştırmadan önce her sınıfı tanımlamalı ve mekanik olarak uygulamalıdır.

Tam huniyi yayınlayın: uygun piyasalar, gösterilen piyasalar, önerilen eylemler, geçişler, geçersiz çıktılar, koruma redleri, gerçekleşme redleri, kısmi gerçekleşmeler ve tamamlanan pozisyonlar. Bu payda, temkinli bir modeli güvenilmez bir modelden ayırt etmeyi mümkün kılar.

Hata sınıfıÖrnekNasıl raporlanır
Bilgi hatasıGeleceğe ait olgu, uzlaşma alanı veya daha sonraki bir fiyat bağlama girdiEtkilenen döngüyü veya çalışmayı geçersiz kılın
Sağlayıcı hatasıZaman aşımı, hız limiti veya kullanılamayan modelPiyasa geçişinden ayrı olarak sayın
Şema hatasıGeçersiz eylem, eksik piyasa kimliği veya ayrıştırılamayan olasılıkHam yanıtı ve reddi saklayın
Risk reddiTalep edilen büyüklük nakit, risk veya fiyat limitlerini aştıKoruma kuralları tarafından reddedilen bir model teklifi olarak raporlayın
Gerçekleşme reddiZamanında defter yok, limitin altında derinlik yok veya sıfır gerçekleşmeAlım satım paydasında tutun
Piyasa kaybıSeçilen tarafa göre uzlaşan geçerli gerçekleşmiş kararK/Z ve tahmin puanlamasına normal şekilde dahil edin

Minimum tekrarlanabilirlik kaydı

Her çalıştırma için, model sağlayıcıyı ve tam model adını, istem şablonlarını, araç tanımlarını, yapılandırılmış çıktı şemasını, örnekleme yapılandırmasını ve müşteri talimatlarını koruyun. Tarihsel başlangıç ve bitişi, karar aralığını, geçmişe bakışı, mekânları, kategorileri, başlangıç nakdini, risk limitlerini, gerçekleşme gecikmesini ve nihai değerleme yöntemini kaydedin.

Her karar döngüsü için, karar zaman damgasını, kayıt sürümünü, kaydın zamanı itibarıyla zamanını, uygun piyasa sayısını, girdi karmasını, önceki ve sonraki portföyü, model kullanımını ve hata durumunu koruyun. Önerilen her işlem için, tezini ve olasılığını; gözlemlenen piyasa olasılığı, güven, limit fiyatı, talep edilen büyüklük, ret kodu ve herhangi bir gerçekleşme için kullanılan tarihsel defterle birlikte saklayın.

Sağlayıcı modelleri sabit bir adın arkasında güncellenebilir, bu nedenle tam bir yeniden çalıştırma daha sonra farklılık gösterebilir. Kalıcı bir kayıt, bu platform varyansını ortadan kaldıramaz, ancak onu ortaya çıkarabilir. Belirleyici tohumların veya sabitlenmiş sürümlerin mevcut olmadığı durumlarda, tek bir olumlu örneği sunmak yerine, çalıştırmadan çalıştırmaya dağılımı raporlamak için aynı testi yeterince tekrarlayın.

  • Model adı, sağlayıcı, istem, araçlar, şema ve örnekleme ayarları.
  • Tarihsel sınır, piyasa evreni, karar aralığı ve geçmişe bakış.
  • Portföy limitleri, gerçekleşme gecikmesi, işlem motoru ve nihai değerleme.
  • Her karar ve gerçekleşmeye bağlı girdi ve defter karmaları.
  • Token kullanımı, model maliyeti, geçersiz çıktılar ve tüm ret nedenleri.
  • Model veya sağlayıcı stokastik olduğunda tekrarlanan çalıştırma varyansı.

Bir AI performans iddiasında bulunmadan önce ileriye dönük test yapın

Tarihsel bir AI testi, model belleğinden, araştırmacı istem ayarlamasından ve tekrarlanan deneylerden hâlâ faydalanabilir. En temiz sonraki adım, kilitli bir ileriye dönük kâğıt üzerinde dönemdir. İstemi veya çıkarılan kuralı dondurun, yapılandırma kesinleştikten sonra başlayın, her eylemi canlı gösterilen defterden fiyatlandırın ve tam paydayı yayınlayın.

DepthFeed Kâğıt Üzerinde Alım Satım, belirleyici kurallar ve harici bot sinyalleri için mevcut ileriye dönük yolu sağlar. Sanal nakit kullanır ve canlı borsa emirleri yerleştirmez. Bu ayrım, bir AI iş akışının tanımlandığı her yerde görünür kalmalıdır.

DepthFeed bugün ne sunuyor

Bugün araştırmacılar, açık bir strateji oluşturmak veya iyileştirmek için bir AI modeli kullanabilir, bu dondurulmuş kuralı Backtest Lab'de kaydedilmiş tahmin piyasası defterlerine karşı yeniden oynatabilir, üç gerçekleşme varsayımını karşılaştırabilir, riski ve bireysel işlemleri inceleyebilir ve uyumlu hayatta kalanları canlı kâğıt üzerinde alım satıma taşıyabilir. Tarihsel veri API ve MCP sunucusu, gösterge paneli dışında özel ajan araştırmasını da destekler.

DepthFeed şu anda halka açık otonom bir döngüdeki model geriye dönük testi API veya canlı AI alım satım gerçekleştirmesini duyurmamaktadır. Daha dar iş akışı kasıtlı ve test edilebilirdir: model önerir; kaydedilmiş piyasa kanıtı değerlendirir; kâğıt üzerinde alım satım ileriye dönük kaydı sağlar.

Key takeaways

  • 01AI fikir üretimi ve AI döngüdeki model yeniden oynatımı farklı ürünlerdir ve farklı kanıt gerektirir.
  • 02Her tarihsel kararda uzlaşmayı, gelecek satırlarını, güncel aramayı ve daha sonraki olguları engelleyin.
  • 03Sonuçları karşılaştırmadan önce modeli, istemi, araçları, şemayı, evreni ve portföy kısıtlamalarını dondurun.
  • 04Kârlı gerçekleşmelerin yanı sıra geçişleri, retleri, model çağrılarını ve girdi sınırlarını saklayın.
  • 05Nakit ve pozisyonları sırayla yeniden oynatın, ardından tanımlı bir gecikmeden sonra kaydedilmiş derinliğe karşı gerçekleştirin.
  • 06Kalibrasyonu, K/Z'yi, riski, yoğunlaşmayı, çıkarım maliyetini ve tekrarlanabilirliği ayrı ayrı raporlayın.
  • 07Herhangi bir AI performans iddiasında bulunmadan önce kilitli bir ileriye dönük kâğıt üzerinde dönem kullanın.

AI tarafından oluşturulan bir strateji bir geriye dönük test değildir. Model, bilgi sınırı, karar protokolü, portföy durumu ve gerçekleştirilebilir emir işlemi, tarihsel saatte kontrol edilmelidir.

Ücretsiz başla

Sorular, yanıtlandı.

Yalnızca her simüle edilen zamanda mevcut bilgileri kullanarak AI tarafından oluşturulan bir kuralın veya model karar sürecinin tarihsel bir değerlendirmesidir. Test, gelecek sızıntısını kontrol etmeli, portföy durumunu korumalı, tarihsel piyasa likiditesine karşı gerçekleştirmeli ve gerçek sözleşme sonucundan uzlaştırmalıdır.

Polymarket & Kalshi'ı gerçek derinlikte backtest etmeye başlayın.

Başlaması ücretsiz, kart yok. Stratejiniz tam defter için hazır olduğunda yükseltin.

Ücretsiz başla