DepthFeed/Both venues·Backtesting AI

Testowanie historyczne predykcyjnych rynków AI: Testuj strategie LLM bez wycieku przyszłości

Strategia wygenerowana przez AI nie jest backtestem. Model, granica informacyjna, protokół decyzyjny, stan portfela i wykonalne wypełnienie muszą być kontrolowane według historycznego zegara.

DepthFeed··15 min

Testowanie historyczne rynków predykcyjnych AI ocenia regułę wygenerowaną przez LLM lub decyzję modelu, używając tylko informacji dostępnych w każdym historycznym znaczniku czasu. Wiarygodny test zamraża prompt i uniwersum rynków, blokuje rozstrzygnięte wyniki i przyszłe fakty, odtwarza zlecenia wobec zarejestrowanej głębokości, zachowuje stan portfela i raportuje każdą decyzję, odrzucenie i wypełnienie.

Dlaczego testowanie historyczne AI jest odrębnym problemem

Regułę deterministyczną można przejrzeć linijka po linijce. LLM może zmieniać swoje rozumowanie w zależności od promptu, wersji modelu, kontekstu, wyników narzędzi i ustawień próbkowania. Może również znać fakty, które wystąpiły po dacie symulacji, ponieważ jego dane treningowe lub dołączone narzędzie wyszukiwania sięga poza historyczny zegar. Zwykły backtest handlowy nie kontroluje automatycznie tych ryzyk.

Rynki predykcyjne sprawiają, że wyciek jest szczególnie dotkliwy. Pytanie rynkowe i ostateczne rozstrzygnięcie są publiczne po rozliczeniu, więc model może sprawiać wrażenie, że prognozuje zdarzenie, podczas gdy przypomina sobie lub wnioskuje odpowiedź z późniejszych informacji. Test musi zachować zarówno integralność czasu rynkowego, jak i integralność czasu modelu.

Dwa przepływy pracy testowania historycznego AI

Obecnie publiczny przepływ pracy DepthFeed obsługuje pierwszą ścieżkę: poproś model o zaproponowanie jasnej hipotezy, przekształć ją w predefiniowaną lub niestandardową regułę, zamroź parametry i uruchom ją w Backtest Lab. To oddziela generowanie pomysłów od oceny i sprawia, że powtórka jest powtarzalna.

Powtórka z modelem w pętli wymaga dodatkowych kontroli: zamkniętego środowiska informacyjnego, sekwencyjnego stanu portfela, trwałych zapisów wywołań modelu i taśmy punktowej w czasie dla każdego cyklu. Nie opisuj transkrypcji czatu na rozstrzygniętych rynkach jako tej silniejszej formy backtestu.

Przepływ pracyCo jest zamrożoneNajlepsze zastosowanie
Reguła wygenerowana przez AIWynik promptu staje się raz jawną logiką deterministycznąSprawdź, czy hipoteza AI przetrwa dane rynkowe i wykonanie
Powtórka z modelem w pętliModel, prompt, narzędzia i kontekst punktowy w czasie są uruchamiane przy każdej decyzjiOceń autonomicznego prognozującego lub agenta portfelowego

Zbuduj historyczną granicę informacyjną

Najbezpieczniejsza implementacja używa granicy według stanu na: znacznik czasu źródła mniejszy lub równy czasowi decyzji. Każda cecha, podsumowanie i odpowiedź narzędzia muszą dziedziczyć tę granicę. Pojedyncze nieograniczone pole pomocnicze, takie jak dzisiejszy status rynku lub etykieta ostatecznego wyniku, może unieważnić cały bieg.

  • Ustaw znacznik czasu decyzji i uwzględnij tylko wiersze rynkowe zaobserwowane w tym czasie lub przed nim.
  • Wyraźnie ogranicz zakres spojrzenia wstecz; nigdy nie używaj najbliższego wiersza, który może pochodzić z przyszłości.
  • Wyklucz wyniki rozliczenia, ceny końcowe, późniejsze nagłówki i bieżące wyszukiwanie internetowe.
  • Zapisz dokładne uniwersum rynków pokazane modelowi, w tym kontrakty, które pominął.
  • Zahaszuj lub oznacz wersję taśmy wejściowej, aby tę samą decyzję można było odtworzyć później.
  • Zgłoś brakujące dane jako brakujące, zamiast wypełniać je późniejszą obserwacją.

Zapobiegaj wyciekowi odpowiedzi i promptu

Zamroź prompt systemowy, instrukcje klienta, identyfikator modelu, tryb próbkowania, schemat wyjścia strukturalnego i dostępne narzędzia. Usuń język, który pośrednio ujawnia wynik, w tym ostateczny status rynku, sformułowania rozliczenia, retrospektywne podsumowania artykułów lub nazwy plików utworzone po rozstrzygnięciu.

W przypadku pytań o zdarzenia historyczne załóż, że pamięć wstępnie wytrenowanego modelu może zawierać późniejsze fakty, nawet gdy przeglądanie jest wyłączone. Używaj pytań bezpiecznych przed odcięciem, gdzie to możliwe, osobno oceniaj kontrolę wycieku i porównuj wydajność na świeższych lub prywatnie wyodrębnionych okresach. Wysoki wynik na dobrze znanych rozstrzygniętych zdarzeniach sam w sobie nie jest dowodem umiejętności prognozowania.

Uczyń protokół decyzyjny poddającym się audytowi

Proś o ustrukturyzowane działania, a nie o swobodne rekomendacje. Użyteczna decyzja zawiera tożsamość rynku, stronę, szacowane prawdopodobieństwo, pewność, maksymalną cenę wejścia, żądaną wartość nominalną i krótką tezę. Reguły po stronie serwera powinny następnie akceptować, zmieniać rozmiar lub odrzucać propozycję zgodnie z limitami gotówki, ekspozycji, pewności, przewagi i ceny.

Przechowuj przepustki i odrzucone transakcje, nie tylko wypełnienia. Jeśli raport końcowy zawiera tylko zwycięskie transakcje wybrane przez model, nie ma mianownika dla selektywności, pokrycia ani analizy niepowodzeń. Trwały zapis powinien łączyć każde działanie z jego dokładną granicą wejściową i wynikającym stanem portfela.

Odtwórz portfel sekwencyjnie

Cykle portfela muszą być wykonywane w porządku chronologicznym, ponieważ jedna decyzja zmienia gotówkę i otwartą ekspozycję dostępną dla następnej. Zrównoleglij odkrywanie rynków wewnątrz znacznika czasu, jeśli to konieczne, ale zsyntetyzuj jedną ostateczną decyzję portfelową wobec jednej zamrożonej taśmy. Nie pozwól, aby niezależne wywołania modelu wydawały tę samą gotówkę.

Przenieś otwarte pozycje, zrealizowaną gotówkę i limity ryzyka do przodu. Następnie raportuj P&L według kategorii i miejsca, a także łącznie. To ujawnia, czy pozornie inteligentny portfel jest jednym skoncentrowanym zakładem kierunkowym powtórzonym na skorelowanych kontraktach.

Używaj wykonalnych wypełnień, a nie ceny podanej przez model

Model może podać cenę maksymalną; nie powinno się pozwalać mu na wymyślanie własnego wypełnienia. Dodaj zdefiniowane opóźnienie wykonania, zlokalizuj pierwszą zarejestrowaną księgę w tym symulowanym czasie lub po nim i przejdź przez dostępne oferty sprzedaży lub kupna tylko do limitu. Przechowuj VWAP, wypełnioną część, czas obserwacji i używaną księgę.

Oznacz ostateczny portfel konserwatywnie. Znak punktu środkowego zakłada likwidację bez przechodzenia przez spread lub zużywania rozmiaru. Likwidacja wykonalna z uwzględnieniem głębokości lepiej odpowiada na to, co portfel mógłby zrealizować; nieaktualne lub nieobecne księgi powinny pozostać jawnym warunkiem niepowodzenia.

Przepracowany przepływ pracy: od hipotezy LLM do powtórki

Zacznij od ograniczonego promptu: poproś model o jedną falsyfikowalną hipotezę Polymarket lub Kalshi, wymagane obserwowalne dane wejściowe, precyzyjną regułę wejścia, rozmiar pozycji, zachowanie wyjścia lub rozliczenia oraz warunki, w których powinna przejść. Zabroń roszczeń o zyski i nie proś o retrospektywne przykłady.

Przekształć odpowiedź w predefiniowaną lub niestandardową regułę Backtest Lab bez zmiany jej progów po zobaczeniu wyników. Wybierz zamierzone miejsce i rodzinę rynków, użyj chronologicznej próbki i porównaj punkt środkowy, stały poślizg i zarejestrowaną głębokość. Sprawdź każdą transakcję i zachowaj późniejszy okres wstrzymania. Jeśli przetrwa, wdróż zamrożoną regułę do handlu papierowego i oceń ją na wynikach, których model nie mógł znać, gdy reguła była tworzona.

Metryki odróżniające prognozowanie od handlu

Jakość prognoz i wyniki handlowe są powiązane, ale nie identyczne. Skalibrowany model może stracić, płacąc ceny, które już odzwierciedlają jego informacje. Źle skalibrowany model może zarobić krótko przez szczęście lub jedną skoncentrowaną pozycję. Raportuj obie warstwy i unikaj sprowadzania oceny do nagłówka tabeli liderów.

PytanieMetrykaNiepowodzenie, które wychwytuje
Czy prawdopodobieństwa były użyteczne?Wynik Briera, strata logarytmiczna, kalibracjaPewne, ale niedokładne prognozy
Czy działania były zyskowne po wykonaniu?Netto P&L, ROI, wykonalna przewagaDobre prognozy kupione po złych cenach
Czy wynik był skoncentrowany?P&L według miejsca, kategorii i czasuJedno zdarzenie lub reżim niosący bieg
Czy ryzyko było kontrolowane?Spadek, ekspozycja, liczba pozycjiZysk stworzony przez nadmierną koncentrację
Czy model był selektywny?Transakcje, przepustki i wskaźniki odrzuceńWybrane selektywnie raportowanie bez mianownika
Czy bieg był odtwarzalny?Hasze promptu, modelu, taśmy i księgiWynik, którego nie można niezależnie odtworzyć

Porównuj modele bez przesuwania słupków bramki

  • Daj każdemu modelowi tę samą zamrożoną taśmę rynkową, zestaw narzędzi, schemat wyjścia i limity portfela.
  • Używaj tych samych znaczników czasu decyzji, opóźnienia wykonania, silnika wypełniania i ostatecznej reguły oznaczania.
  • Oddziel awarie dostawcy, nieprawidłowe wyniki i odrzucenia reguł ryzyka od strat rynkowych.
  • Zapisuj koszt tokenów i modelu obok wydajności; marginalny zysk może nie uzasadniać znacznie wyższego kosztu wnioskowania.
  • Powtarzaj przebiegi stochastyczne lub używaj ustawień deterministycznych, gdzie są obsługiwane, i raportuj wariancję.
  • Aktualizuj strony i twierdzenia dotyczące nazwanych modeli, ponieważ wersje modeli i dostępność się zmieniają.

Klasyfikuj niepowodzenia zamiast je ukrywać

Te wyniki oznaczają różne rzeczy. Traktowanie przekroczenia czasu dostawcy jako pewnej przepustki zawyża selektywność; usuwanie niewypełnionego zlecenia zawyża wykonalną wydajność; a ciche naprawianie nieprawidłowego wyniku modelu daje jednemu modelowi ludzką pomoc, której inne mogą nie otrzymać. Ocena powinna zdefiniować każdą klasę przed biegiem i stosować ją mechanicznie.

Opublikuj pełny lejek: kwalifikujące się rynki, pokazane rynki, proponowane działania, przepustki, nieprawidłowe wyniki, odrzucenia barier, odrzucenia wykonania, częściowe wypełnienia i zakończone pozycje. Ten mianownik umożliwia odróżnienie ostrożnego modelu od niewiarygodnego.

Klasa niepowodzeniaPrzykładJak to zgłosić
Niepowodzenie informacyjnePrzyszły fakt, pole rozliczenia lub późniejszy cytat wszedł do kontekstuUnieważnij dotknięty cykl lub bieg
Awaria dostawcyPrzekroczenie czasu, limit szybkości lub niedostępny modelLicz oddzielnie od przepustki rynkowej
Niepowodzenie schematuNieprawidłowe działanie, brakujący identyfikator rynku lub nieparsowalne prawdopodobieństwoPrzechowuj surową odpowiedź i odrzucenie
Odrzucenie ryzykaŻądany rozmiar przekroczył limity gotówki, ekspozycji lub cenyZgłoś jako propozycję modelu odrzuconą przez bariery ochronne
Odrzucenie wykonaniaBrak terminowej księgi, brak głębokości poniżej limitu lub zerowe wypełnienieZachowaj w mianowniku handlowym
Strata rynkowaWażna wypełniona decyzja rozliczona wobec wybranej stronyUwzględnij normalnie w P&L i punktacji prognoz

Minimalny rekord odtwarzalności

Dla każdego biegu zachowaj dostawcę modelu i dokładny identyfikator modelu, szablony promptów, definicje narzędzi, schemat wyjścia strukturalnego, konfigurację próbkowania i instrukcje klienta. Zapisz historyczny początek i koniec, interwał decyzyjny, spojrzenie wstecz, miejsca, kategorie, początkową gotówkę, limity ekspozycji, opóźnienie wykonania i ostateczną metodę oznaczania.

Dla każdego cyklu decyzyjnego zachowaj znacznik czasu decyzji, wersję taśmy, czas taśmy według stanu na, liczbę kwalifikujących się rynków, hasz wejściowy, portfel przed i po, użycie modelu i stan błędu. Dla każdej proponowanej transakcji przechowuj jej tezę i prawdopodobieństwo wraz z obserwowanym prawdopodobieństwem rynkowym, pewnością, ceną limitową, żądanym rozmiarem, kodem odrzucenia i historyczną księgą używaną do wszelkich wypełnień.

Modele dostawców mogą być aktualizowane za stabilną nazwą, więc dokładne ponowne uruchomienie może się później różnić. Trwały zapis nie może wyeliminować tej wariancji platformy, ale może ją ujawnić. Tam, gdzie deterministyczne ziarna lub przypięte wersje są niedostępne, powtórz ten sam test wystarczającą liczbę razy, aby zgłosić rozproszenie między przebiegami zamiast przedstawiać jedną korzystną próbkę.

  • Identyfikator modelu, dostawca, prompt, narzędzia, schemat i ustawienia próbkowania.
  • Historyczna granica, uniwersum rynków, interwał decyzyjny i spojrzenie wstecz.
  • Limity portfela, opóźnienie wykonania, silnik wypełniania i ostateczny znak.
  • Hasze wejściowe i księgi powiązane z każdą decyzją i wypełnieniem.
  • Użycie tokenów, koszt modelu, nieprawidłowe wyniki i wszystkie powody odrzucenia.
  • Wariancja powtarzanych przebiegów, gdy model lub dostawca jest stochastyczny.

Przetestuj w przód przed zgłoszeniem roszczenia o wydajności AI

Historyczny test AI może nadal korzystać z pamięci modelu, dostrajania promptu przez badacza i wielokrotnego eksperymentowania. Najczystszym następnym krokiem jest zablokowany okres papierowy w przód. Zamroź prompt lub wyodrębnioną regułę, rozpocznij po zakończeniu konfiguracji, wyceń każde działanie na podstawie wyświetlanej na żywo księgi i opublikuj pełny mianownik.

DepthFeed Handlu papierowy zapewnia dostępną ścieżkę w przód dla reguł deterministycznych i sygnałów zewnętrznych botów. Używa wirtualnej gotówki i nie składa zleceń na żywo na giełdzie. To rozróżnienie powinno być widoczne wszędzie, gdzie opisywany jest przepływ pracy AI.

Co DepthFeed oferuje dzisiaj

Dzisiaj badacze mogą używać modelu AI do tworzenia lub udoskonalania jawnej strategii, odtwarzać tę zamrożoną regułę w Backtest Lab wobec zarejestrowanych ksiąg rynków predykcyjnych, porównywać trzy założenia wypełnienia, sprawdzać ryzyko i poszczególne transakcje oraz przenosić kompatybilne ocalałe do handlu papierowego na żywo. Dane historyczne API i serwer MCP obsługują również niestandardowe badania agentów poza panelem sterowania.

DepthFeed obecnie nie reklamuje publicznego autonomicznego backtestu z modelem w pętli API ani wykonywania transakcji AI na żywo. Węższy przepływ pracy jest celowy i testowalny: model proponuje; zarejestrowane dowody rynkowe oceniają; handel papierowy dostarcza zapis w przód.

Key takeaways

  • 01Generowanie pomysłów AI i powtórka AI z modelem w pętli to różne produkty i wymagają różnych dowodów.
  • 02Blokuj rozliczenie, przyszłe wiersze, bieżące wyszukiwanie i późniejsze fakty przy każdej historycznej decyzji.
  • 03Zamroź model, prompt, narzędzia, schemat, uniwersum i ograniczenia portfela przed porównaniem wyników.
  • 04Przechowuj przepustki, odrzucenia, wywołania modelu i granice wejściowe, a także zyskowne wypełnienia.
  • 05Odtwórz gotówkę i pozycje sekwencyjnie, a następnie wykonaj wobec zarejestrowanej głębokości po zdefiniowanym opóźnieniu.
  • 06Raportuj kalibrację, P&L, ryzyko, koncentrację, koszt wnioskowania i odtwarzalność osobno.
  • 07Użyj zablokowanego okresu papierowego w przód przed zgłoszeniem jakiegokolwiek roszczenia o wydajności AI.

Strategia wygenerowana przez AI nie jest backtestem. Model, granica informacyjna, protokół decyzyjny, stan portfela i wykonalne wypełnienie muszą być kontrolowane według historycznego zegara.

Zacznij za darmo

Pytania i odpowiedzi.

Jest to historyczna ocena reguły wygenerowanej przez AI lub procesu decyzyjnego modelu, wykorzystująca tylko informacje dostępne w każdym symulowanym czasie. Test musi kontrolować wyciek przyszłości, zachowywać stan portfela, wypełniać wobec historycznej płynności rynkowej i rozliczać na podstawie rzeczywistego wyniku kontraktu.

Zacznij backtestować Polymarket & Kalshi na realnej głębokości.

Darmowy start, bez karty. Przejdź na wyższy plan, gdy Twoja strategia będzie gotowa na cały arkusz.

Zacznij za darmo