Backtesting dei mercati di previsione con AI: testare strategie LLM senza fuga di informazioni future
Una strategia generata dall'AI non è un backtest. Il modello, il confine informativo, il protocollo decisionale, lo stato del portafoglio e l'esecuzione effettiva devono essere tutti controllati all'orologio storico.
Il backtesting dei mercati di previsione con AI valuta una regola generata da LLM o una decisione del modello utilizzando solo le informazioni disponibili a ogni timestamp storico. Un test credibile congela il prompt e l'universo di mercato, blocca gli esiti risolti e i fatti futuri, riproduce gli ordini rispetto alla profondità registrata, preserva lo stato del portafoglio e riporta ogni decisione, rifiuto ed esecuzione.
Perché il backtesting AI è un problema separato
Una regola deterministica può essere rivista riga per riga. Un LLM può cambiare il suo ragionamento con il prompt, la versione del modello, il contesto, i risultati degli strumenti e le impostazioni di campionamento. Potrebbe anche conoscere fatti accaduti dopo la data simulata perché i suoi dati di addestramento o uno strumento di ricerca collegato vanno oltre l'orologio storico. Un normale backtest di trading non controlla automaticamente questi rischi.
I mercati di previsione rendono la fuga di informazioni particolarmente grave. La domanda di mercato e la risoluzione finale sono pubbliche dopo il regolamento, quindi un modello può sembrare prevedere un evento mentre ricorda o deduce la risposta da informazioni successive. Il test deve preservare sia l'integrità del tempo di mercato che l'integrità del tempo del modello.
Due flussi di lavoro per il backtesting AI
Il flusso di lavoro attualmente pubblico di DepthFeed supporta il primo percorso: chiedere a un modello di proporre un'ipotesi chiara, tradurla in una regola preimpostata o personalizzata, congelare i parametri ed eseguirla attraverso Backtest Lab. Questo separa la generazione dell'idea dalla valutazione e rende la riproduzione ripetibile.
Una riproduzione con modello nel ciclo richiede controlli aggiuntivi: un ambiente informativo chiuso, uno stato del portafoglio sequenziale, registrazioni durevoli delle chiamate al modello e un nastro puntuale per ogni ciclo. Non descrivere una trascrizione di chat su mercati risolti come questa forma più forte di backtest.
| Flusso di lavoro | Cosa viene congelato | Miglior utilizzo |
|---|---|---|
| Regola generata dall'AI | L'output del prompt diventa una logica deterministica esplicita una volta | Verificare se un'ipotesi AI sopravvive ai dati di mercato e all'esecuzione |
| Riproduzione con modello nel ciclo | Modello, prompt, strumenti e contesto puntuale vengono eseguiti a ogni decisione | Valutare un previsore autonomo o un agente di portafoglio |
Costruire il confine informativo storico
L'implementazione più sicura utilizza un confine 'as-of': timestamp di origine minore o uguale al tempo decisionale. Ogni caratteristica, riepilogo e risposta dello strumento deve ereditare quel confine. Un singolo campo di convenienza non delimitato, come lo stato del mercato odierno o un'etichetta di esito finale, può invalidare l'intera esecuzione.
- Impostare un timestamp decisionale e includere solo le righe di mercato osservate in quel momento o prima.
- Delimitare esplicitamente qualsiasi lookback mobile; non utilizzare mai una riga più vicina che potrebbe provenire dal futuro.
- Escludere i risultati di regolamento, i prezzi finali, i titoli successivi e la ricerca web corrente.
- Registrare l'esatto universo di mercato mostrato al modello, inclusi i contratti che ha saltato.
- Hash o versione del nastro di input in modo che la stessa decisione possa essere ricostruita in seguito.
- Segnalare i dati mancanti come mancanti invece di riempirli da un'osservazione successiva.
Prevenire la fuga di risposte e prompt
Congelare il prompt di sistema, le istruzioni del cliente, l'identificatore del modello, la modalità di campionamento, lo schema di output strutturato e gli strumenti disponibili. Rimuovere il linguaggio che rivela indirettamente l'esito, inclusi lo stato finale del mercato, la formulazione del regolamento, i riepiloghi di articoli retrospettivi o i nomi di file creati dopo la risoluzione.
Per le domande su eventi storici, presumere che la memoria del modello pre-addestrato possa contenere fatti successivi anche quando la navigazione è disabilitata. Utilizzare domande sicure rispetto al cut-off ove possibile, valutare separatamente i controlli di fuga e confrontare le prestazioni su periodi più recenti o tenuti privati. Un punteggio elevato su eventi risolti ben noti non è di per sé una prova di abilità previsionale.
Rendere il protocollo decisionale verificabile
Richiedere azioni strutturate piuttosto che raccomandazioni libere. Una decisione utile include l'identità del mercato, il lato, la probabilità stimata, la confidenza, il prezzo massimo di entrata, il nozionale richiesto e una breve tesi. Le regole lato server dovrebbero quindi accettare, ridimensionare o rifiutare la proposta in base a liquidità, esposizione, confidenza, vantaggio e limiti di prezzo.
Memorizzare i passaggi e le operazioni rifiutate, non solo le esecuzioni. Se il rapporto finale contiene solo i vincitori scelti dal modello, non c'è un denominatore per l'analisi di selettività, copertura o fallimento. La registrazione durevole dovrebbe collegare ogni azione al suo esatto confine di input e allo stato del portafoglio risultante.
Riprodurre il portafoglio in sequenza
I cicli di portafoglio devono essere eseguiti in ordine cronologico perché una decisione modifica la liquidità e l'esposizione aperta disponibili per la successiva. Parallelizzare la scoperta del mercato all'interno di un timestamp se necessario, ma sintetizzare una decisione di portafoglio finale rispetto a un nastro congelato. Non consentire a chiamate di modello indipendenti di spendere la stessa liquidità.
Portare avanti le posizioni aperte, la liquidità realizzata e i limiti di rischio. Quindi riportare il P&L per categoria e sede, nonché in aggregato. Questo rivela se un portafoglio apparentemente intelligente è una scommessa direzionale concentrata ripetuta su contratti correlati.
Utilizzare esecuzioni effettive, non il prezzo quotato dal modello
Il modello può indicare un prezzo massimo; non dovrebbe essere autorizzato a inventare la propria esecuzione. Aggiungere un ritardo di esecuzione definito, individuare il primo book registrato in corrispondenza o dopo quel tempo simulato e percorrere le offerte o le domande disponibili solo fino al limite. Memorizzare VWAP, la frazione eseguita, il tempo di osservazione e il book utilizzato.
Valutare il portafoglio finale in modo conservativo. Un mark a metà prezzo presuppone la liquidazione senza attraversare lo spread o consumare dimensione. Una liquidazione eseguibile consapevole della profondità risponde meglio a ciò che il portafoglio avrebbe potuto realizzare; book obsoleti o assenti dovrebbero rimanere una condizione di fallimento esplicita.
Flusso di lavoro operativo: da un'ipotesi LLM a una riproduzione
Iniziare con un prompt delimitato: chiedere al modello un'ipotesi falsificabile Polymarket o Kalshi, gli input osservabili richiesti, una regola di entrata precisa, la dimensione della posizione, il comportamento di uscita o regolamento e le condizioni in cui dovrebbe passare. Vietare affermazioni di profitto e non richiedere esempi retrospettivi.
Tradurre la risposta in un preset o regola personalizzata di Backtest Lab senza modificarne le soglie dopo aver visto i risultati. Selezionare la sede e la famiglia di mercato previste, utilizzare un campione cronologico e confrontare il prezzo medio, lo slippage fisso e la profondità registrata. Ispezionare ogni operazione e preservare un periodo di controllo successivo. Se sopravvive, distribuire la regola congelata al paper trading e valutarla su esiti che il modello non avrebbe potuto conoscere quando la regola è stata creata.
Metriche che distinguono la previsione dal trading
La qualità della previsione e la performance di trading sono correlate ma non identiche. Un modello calibrato può perdere pagando prezzi che già riflettono le sue informazioni. Un modello scarsamente calibrato può guadagnare brevemente per fortuna o una posizione concentrata. Riportare entrambi i livelli ed evitare di ridurre la valutazione a un titolo da classifica.
| Domanda | Metrica | Fallimento che rileva |
|---|---|---|
| Le probabilità erano utili? | Brier score, log loss, calibrazione | Previsioni sicure ma inaccurate |
| Le azioni sono state redditizie dopo l'esecuzione? | P&L netto, ROI, vantaggio eseguibile | Buone previsioni acquistate a prezzi sbagliati |
| Il risultato era concentrato? | P&L per sede, categoria e tempo | Un evento o regime che sostiene l'esecuzione |
| Il rischio era controllato? | Drawdown, esposizione, numero di posizioni | Profitto creato da un'eccessiva concentrazione |
| Il modello era selettivo? | Operazioni, passaggi e tassi di rifiuto | Report selezionati senza un denominatore |
| L'esecuzione era riproducibile? | Hash di prompt, modello, nastro e book | Un risultato che non può essere riprodotto indipendentemente |
Confrontare i modelli senza spostare i paletti
- Fornire a ogni modello lo stesso nastro di mercato congelato, set di strumenti, schema di output e limiti di portafoglio.
- Utilizzare gli stessi timestamp decisionali, latenza di esecuzione, motore di esecuzione e regola di valutazione finale.
- Separare i guasti del provider, l'output non valido e i rifiuti delle regole di rischio dalle perdite di mercato.
- Registrare il costo dei token e del modello insieme alla performance; un guadagno marginale potrebbe non giustificare un costo di inferenza molto più elevato.
- Ripetere esecuzioni stocastiche o utilizzare impostazioni deterministiche dove supportate, e riportare la varianza.
- Mantenere aggiornate le pagine e le affermazioni sui modelli nominati perché le versioni e la disponibilità dei modelli cambiano.
Classificare i fallimenti invece di nasconderli
Questi esiti significano cose diverse. Trattare un timeout del provider come un passaggio sicuro gonfia la selettività; eliminare un ordine non eseguito sopravvaluta la performance eseguibile; e riparare silenziosamente l'output malformato del modello fornisce a un modello un aiuto umano che gli altri potrebbero non ricevere. La valutazione dovrebbe definire ogni classe prima dell'esecuzione e applicarla meccanicamente.
Pubblicare l'intero imbuto: mercati idonei, mercati mostrati, azioni proposte, passaggi, output non validi, rifiuti dei guardrail, rifiuti di esecuzione, esecuzioni parziali e posizioni completate. Quel denominatore consente di distinguere un modello cauto da uno inaffidabile.
| Classe di fallimento | Esempio | Come segnalarlo |
|---|---|---|
| Fallimento informativo | Un fatto futuro, un campo di regolamento o una quotazione successiva è entrato nel contesto | Invalidare il ciclo o l'esecuzione interessata |
| Guasto del provider | Timeout, limite di velocità o modello non disponibile | Contare separatamente da un passaggio di mercato |
| Fallimento dello schema | Azione non valida, ID di mercato mancante o probabilità non analizzabile | Memorizzare la risposta grezza e il rifiuto |
| Rifiuto per rischio | La dimensione richiesta ha superato i limiti di liquidità, esposizione o prezzo | Segnalare come proposta del modello rifiutata dai guardrail |
| Rifiuto di esecuzione | Nessun book tempestivo, nessuna profondità sotto il limite o esecuzione zero | Mantenere nel denominatore di trading |
| Perdita di mercato | Decisione valida eseguita e regolata rispetto al lato selezionato | Includere normalmente nel P&L e nel punteggio di previsione |
Il record minimo di riproducibilità
Per ogni esecuzione, conservare il provider del modello e lo slug esatto del modello, i modelli di prompt, le definizioni degli strumenti, lo schema di output strutturato, la configurazione di campionamento e le istruzioni del cliente. Registrare l'inizio e la fine storici, l'intervallo decisionale, il lookback, le sedi, le categorie, la liquidità iniziale, i limiti di esposizione, la latenza di esecuzione e il metodo di valutazione finale.
Per ogni ciclo decisionale, conservare il timestamp decisionale, la versione del nastro, il tempo 'as-of' del nastro, il conteggio dei mercati idonei, l'hash di input, il portafoglio prima e dopo, l'utilizzo del modello e lo stato di errore. Per ogni operazione proposta, memorizzare la sua tesi e probabilità insieme alla probabilità di mercato osservata, confidenza, prezzo limite, dimensione richiesta, codice di rifiuto e il book storico utilizzato per qualsiasi esecuzione.
I modelli dei provider possono essere aggiornati dietro un nome stabile, quindi una riesecuzione esatta potrebbe comunque differire in seguito. Un record durevole non può eliminare quella varianza di piattaforma, ma può rivelarla. Dove semi deterministici o versioni bloccate non sono disponibili, ripetere lo stesso test un numero sufficiente di volte per riportare la dispersione tra esecuzioni invece di presentare un campione favorevole.
- Slug del modello, provider, prompt, strumenti, schema e impostazioni di campionamento.
- Confine storico, universo di mercato, intervallo decisionale e lookback.
- Limiti di portafoglio, latenza di esecuzione, motore di esecuzione e valutazione finale.
- Hash di input e book legati a ogni decisione ed esecuzione.
- Utilizzo dei token, costo del modello, output non validi e tutti i motivi di rifiuto.
- Varianza tra esecuzioni ripetute quando il modello o il provider è stocastico.
Test in avanti prima di fare affermazioni sulle prestazioni dell'AI
Un test storico dell'AI può ancora beneficiare della memoria del modello, della messa a punto del prompt da parte del ricercatore e della sperimentazione ripetuta. Il passo successivo più pulito è un periodo di paper trading in avanti bloccato. Congelare il prompt o la regola estratta, iniziare dopo che la configurazione è definitiva, prezzare ogni azione dal book visualizzato in tempo reale e pubblicare l'intero denominatore.
DepthFeed Paper Trading fornisce il percorso in avanti disponibile per regole deterministiche e segnali di bot esterni. Utilizza liquidità virtuale e non effettua ordini di borsa reali. Questa distinzione dovrebbe rimanere visibile ovunque venga descritto un flusso di lavoro AI.
Cosa offre DepthFeed oggi
Oggi, i ricercatori possono utilizzare un modello AI per creare o perfezionare una strategia esplicita, riprodurre quella regola congelata in Backtest Lab rispetto ai book dei mercati di previsione registrati, confrontare tre ipotesi di esecuzione, ispezionare il rischio e le singole operazioni e spostare i sopravvissuti compatibili al paper trading live. I dati storici API e il server MCP supportano anche la ricerca personalizzata sugli agenti al di fuori della dashboard.
DepthFeed attualmente non pubblicizza un backtest pubblico autonomo con modello nel ciclo API né un'esecuzione di trading AI live. Il flusso di lavoro più ristretto è intenzionale e testabile: il modello propone; le prove di mercato registrate valutano; il paper trading fornisce il record in avanti.
Key takeaways
- 01La generazione di idee AI e la riproduzione con modello AI nel ciclo sono prodotti diversi e richiedono prove diverse.
- 02Bloccare il regolamento, le righe future, la ricerca corrente e i fatti successivi a ogni decisione storica.
- 03Congelare il modello, il prompt, gli strumenti, lo schema, l'universo e i vincoli di portafoglio prima di confrontare i risultati.
- 04Memorizzare passaggi, rifiuti, chiamate al modello e confini di input, nonché le esecuzioni redditizie.
- 05Riprodurre liquidità e posizioni in sequenza, quindi eseguire rispetto alla profondità registrata dopo una latenza definita.
- 06Riportare separatamente calibrazione, P&L, rischio, concentrazione, costo di inferenza e riproducibilità.
- 07Utilizzare un periodo di paper trading in avanti bloccato prima di fare qualsiasi affermazione sulle prestazioni dell'AI.
Una strategia generata dall'AI non è un backtest. Il modello, il confine informativo, il protocollo decisionale, lo stato del portafoglio e l'esecuzione effettiva devono essere tutti controllati all'orologio storico.
Inizia gratis