DepthFeed/Both venues·KI-Backtesting

KI-Vorhersagemarkt-Backtesting: LLM-Strategien ohne Zukunftsleckage testen

Eine KI-generierte Strategie ist kein Backtest. Das Modell, die Informationsgrenze, das Entscheidungsprotokoll, der Portfoliostatus und die ausführbare Ausführung müssen alle an der historischen Uhr kontrolliert werden.

DepthFeed··15 min

KI-Vorhersagemarkt-Backtesting bewertet eine LLM-generierte Regel oder Modellentscheidung unter ausschließlicher Verwendung von Informationen, die zu jedem historischen Zeitpunkt verfügbar sind. Ein glaubwürdiger Test friert den Prompt und das Marktuniversum ein, blockiert aufgelöste Ergebnisse und zukünftige Fakten, spielt Orders gegen aufgezeichnete Tiefe ab, bewahrt den Portfoliostatus und berichtet jede Entscheidung, Ablehnung und Ausführung.

Warum KI-Backtesting ein separates Problem ist

Eine deterministische Regel kann Zeile für Zeile überprüft werden. Ein LLM kann seine Argumentation mit dem Prompt, der Modellversion, dem Kontext, den Werkzeugergebnissen und den Sampling-Einstellungen ändern. Es kann auch Fakten kennen, die nach dem simulierten Datum aufgetreten sind, weil seine Trainingsdaten oder ein angeschlossenes Suchwerkzeug über die historische Uhr hinausreichen. Ein normaler Handels-Backtest kontrolliert diese Risiken nicht automatisch.

Vorhersagemärkte machen die Leckage besonders schwerwiegend. Die Marktfrage und die endgültige Auflösung sind nach der Abwicklung öffentlich, sodass ein Modell ein Ereignis vorherzusagen scheint, während es seine Antwort aus späteren Informationen abruft oder ableitet. Der Test muss sowohl die Marktzeitintegrität als auch die Modellzeitintegrität bewahren.

Zwei KI-Backtesting-Workflows

Der derzeit öffentliche Workflow von DepthFeed unterstützt den ersten Pfad: Bitten Sie ein Modell, eine klare Hypothese vorzuschlagen, übersetzen Sie sie in eine voreingestellte oder benutzerdefinierte Regel, frieren Sie die Parameter ein und führen Sie sie durch das Backtest Lab. Dies trennt die Ideengenerierung von der Bewertung und macht die Wiederholung reproduzierbar.

Ein Model-in-the-Loop-Replay erfordert zusätzliche Kontrollen: eine geschlossene Informationsumgebung, sequenziellen Portfoliostatus, dauerhafte Modellaufrufaufzeichnungen und ein punktuelles Band für jeden Zyklus. Beschreiben Sie kein Chat-Transkript über aufgelöste Märkte als diese stärkere Form des Backtests.

WorkflowWas eingefroren wirdBeste Verwendung
KI-generierte RegelPrompt-Ausgabe wird einmal zu expliziter deterministischer LogikTesten, ob eine KI-Hypothese Marktdaten und Ausführung übersteht
Model-in-the-Loop-ReplayModell, Prompt, Werkzeuge und punktueller Kontext laufen bei jeder EntscheidungEinen autonomen Prognostiker oder Portfolio-Agenten bewerten

Bauen Sie die historische Informationsgrenze auf

Die sicherste Implementierung verwendet eine Stichtagsgrenze: Quellzeitstempel kleiner oder gleich der Entscheidungszeit. Jedes Merkmal, jede Zusammenfassung und jede Werkzeugantwort muss diese Grenze erben. Ein einziges unbegrenztes Bequemlichkeitsfeld, wie der heutige Marktstatus oder eine endgültige Ergebnisbezeichnung, kann den gesamten Lauf ungültig machen.

  • Setzen Sie einen Entscheidungszeitstempel und schließen Sie nur Marktzeilen ein, die zu oder vor diesem Zeitpunkt beobachtet wurden.
  • Begrenzen Sie jeden nachlaufenden Rückblick explizit; verwenden Sie niemals eine nächstgelegene Zeile, die aus der Zukunft stammen könnte.
  • Schließen Sie Abwicklungsergebnisse, Endpreise, spätere Schlagzeilen und aktuelle Websuche aus.
  • Zeichnen Sie das genaue Marktuniversum auf, das dem Modell gezeigt wurde, einschließlich der Verträge, die es übersprungen hat.
  • Hashen oder versionieren Sie das Eingabeband, damit dieselbe Entscheidung später rekonstruiert werden kann.
  • Melden Sie fehlende Daten als fehlend, anstatt sie aus einer späteren Beobachtung zu füllen.

Verhindern Sie Antwort- und Prompt-Leckage

Frieren Sie den System-Prompt, Kundenanweisungen, Modellbezeichner, Sampling-Modus, Schema für strukturierte Ausgabe und verfügbare Werkzeuge ein. Entfernen Sie Sprache, die das Ergebnis indirekt preisgibt, einschließlich endgültigem Marktstatus, Abwicklungswortlaut, retrospektiven Artikelzusammenfassungen oder nach der Auflösung erstellten Dateinamen.

Gehen Sie bei historischen Ereignisfragen davon aus, dass das vortrainierte Modellgedächtnis spätere Fakten enthalten kann, selbst wenn das Browsen deaktiviert ist. Verwenden Sie nach Möglichkeit stichtagssichere Fragen, bewerten Sie Leckagekontrollen separat und vergleichen Sie die Leistung in frischeren oder privat zurückgehaltenen Zeiträumen. Eine hohe Punktzahl bei bekannten aufgelösten Ereignissen ist für sich genommen kein Beweis für Prognosefähigkeiten.

Machen Sie das Entscheidungsprotokoll prüfbar

Fordern Sie strukturierte Aktionen anstelle von Freiform-Empfehlungen. Eine nützliche Entscheidung umfasst Marktidentität, Seite, geschätzte Wahrscheinlichkeit, Konfidenz, maximalen Einstiegspreis, angeforderten Nominalwert und eine kurze These. Serverseitige Regeln sollten dann den Vorschlag gemäß Bargeld, Exposure, Konfidenz, Edge und Preislimits akzeptieren, skalieren oder ablehnen.

Speichern Sie Durchläufe und abgelehnte Trades, nicht nur Ausführungen. Wenn der Abschlussbericht nur Gewinner enthält, die das Modell ausgewählt hat, gibt es keinen Nenner für Selektivität, Abdeckung oder Fehleranalyse. Die dauerhafte Aufzeichnung sollte jede Aktion mit ihrer genauen Eingabegrenze und dem resultierenden Portfoliostatus verbinden.

Spielen Sie das Portfolio sequenziell ab

Portfoliozyklen müssen in chronologischer Reihenfolge ablaufen, da eine Entscheidung das Bargeld und das offene Exposure für die nächste ändert. Parallelisieren Sie die Marktentdeckung innerhalb eines Zeitstempels bei Bedarf, aber synthetisieren Sie eine endgültige Portfolioentscheidung gegen ein eingefrorenes Band. Lassen Sie unabhängige Modellaufrufe nicht dasselbe Bargeld ausgeben.

Führen Sie offene Positionen, realisiertes Bargeld und Risikolimits fort. Berichten Sie dann P&L nach Kategorie und Handelsplatz sowie aggregiert. Dies zeigt, ob ein scheinbar intelligentes Portfolio eine konzentrierte Richtungswette ist, die über korrelierte Kontrakte wiederholt wird.

Verwenden Sie ausführbare Ausführungen, nicht den vom Modell angegebenen Preis

Das Modell kann einen Höchstpreis angeben; es sollte nicht seine eigene Ausführung erfinden dürfen. Fügen Sie eine definierte Ausführungsverzögerung hinzu, lokalisieren Sie das erste aufgezeichnete Buch zu oder nach dieser simulierten Zeit und gehen Sie verfügbare Brief- oder Geldkurse nur bis zum Limit durch. Speichern Sie VWAP, ausgeführten Anteil, Beobachtungszeit und das verwendete Buch.

Bewerten Sie das endgültige Portfolio konservativ. Eine Mittelkursbewertung unterstellt Liquidation ohne Überqueren des Spreads oder Verbrauch von Größe. Eine tiefenbewusste ausführbare Liquidation beantwortet besser, was das Portfolio hätte realisieren können; veraltete oder fehlende Bücher sollten eine explizite Fehlerbedingung bleiben.

Ausgearbeiteter Workflow: von einer LLM-Hypothese zu einem Replay

Beginnen Sie mit einem begrenzten Prompt: Bitten Sie das Modell um eine falsifizierbare Polymarket- oder Kalshi-Hypothese, die erforderlichen beobachtbaren Eingaben, eine präzise Einstiegsregel, Positionsgröße, Ausstiegs- oder Abwicklungsverhalten und die Bedingungen, unter denen sie bestehen sollte. Verbieten Sie Gewinnbehauptungen und fordern Sie keine retrospektiven Beispiele an.

Übersetzen Sie die Antwort in eine Backtest Lab-Voreinstellung oder benutzerdefinierte Regel, ohne die Schwellenwerte nach Sichtung der Ergebnisse zu ändern. Wählen Sie den beabsichtigten Handelsplatz und die Marktfamilie, verwenden Sie eine chronologische Stichprobe und vergleichen Sie Mittelkurs, feste Slippage und aufgezeichnete Tiefe. Inspizieren Sie jeden Trade und bewahren Sie einen späteren Holdout auf. Wenn sie überlebt, setzen Sie die eingefrorene Regel im Paper Trading ein und bewerten Sie sie anhand von Ergebnissen, die das Modell bei der Erstellung der Regel nicht kennen konnte.

Metriken, die Prognose vom Handel unterscheiden

Prognosequalität und Handelsleistung sind verwandt, aber nicht identisch. Ein kalibriertes Modell kann verlieren, indem es Preise zahlt, die seine Informationen bereits widerspiegeln. Ein schlecht kalibriertes Modell kann kurzfristig durch Glück oder eine konzentrierte Position Geld verdienen. Berichten Sie beide Ebenen und vermeiden Sie es, die Bewertung auf eine Bestenlisten-Schlagzeile zu reduzieren.

FrageMetrikFehler, den sie aufdeckt
Waren Wahrscheinlichkeiten nützlich?Brier-Score, Log-Loss, KalibrierungZuversichtliche, aber ungenaue Prognosen
Waren Aktionen nach der Ausführung profitabel?Netto-P&L, ROI, ausführbarer VorteilGute Prognosen zu schlechten Preisen gekauft
War das Ergebnis konzentriert?P&L nach Handelsplatz, Kategorie und ZeitEin Ereignis oder Regime, das den Lauf trägt
Wurde das Risiko kontrolliert?Drawdown, Exposure, PositionsanzahlGewinn durch übermäßige Konzentration
War das Modell selektiv?Trades, Durchläufe und AblehnungsratenRosinenpickerei ohne Nenner
War der Lauf reproduzierbar?Prompt-, Modell-, Band- und Buch-HashesEin Ergebnis, das nicht unabhängig wiederholt werden kann

Vergleichen Sie Modelle, ohne die Torpfosten zu verschieben

  • Geben Sie jedem Modell dasselbe eingefrorene Marktband, denselben Werkzeugsatz, dasselbe Ausgabeschema und dieselben Portfoliolimits.
  • Verwenden Sie dieselben Entscheidungszeitstempel, Ausführungslatenz, Ausführungs-Engine und endgültige Bewertungsregel.
  • Trennen Sie Anbieterausfälle, ungültige Ausgaben und Risikoregelablehnungen von Marktverlusten.
  • Erfassen Sie Token- und Modellkosten neben der Leistung; ein marginaler Gewinn rechtfertigt möglicherweise keine viel höheren Inferenzkosten.
  • Wiederholen Sie stochastische Läufe oder verwenden Sie deterministische Einstellungen, wo unterstützt, und berichten Sie die Varianz.
  • Halten Sie Seiten und Behauptungen zu benannten Modellen aktuell, da sich Modellversionen und Verfügbarkeit ändern.

Klassifizieren Sie Fehler, anstatt sie zu verstecken

Diese Ergebnisse bedeuten unterschiedliche Dinge. Eine Anbieter-Zeitüberschreitung als zuversichtlichen Durchlauf zu behandeln, bläht die Selektivität auf; das Weglassen einer nicht ausgeführten Order übertreibt die ausführbare Leistung; und das stille Reparieren fehlerhafter Modellausgaben gibt einem Modell menschliche Hilfe, die andere möglicherweise nicht erhalten. Die Bewertung sollte jede Klasse vor dem Lauf definieren und mechanisch anwenden.

Veröffentlichen Sie den vollständigen Trichter: infrage kommende Märkte, gezeigte Märkte, vorgeschlagene Aktionen, Durchläufe, ungültige Ausgaben, Schutzmechanismus-Ablehnungen, Ausführungsablehnungen, Teilausführungen und abgeschlossene Positionen. Dieser Nenner ermöglicht es, ein vorsichtiges Modell von einem unzuverlässigen zu unterscheiden.

FehlerklasseBeispielWie man sie meldet
InformationsfehlerZukünftige Tatsache, Abwicklungsfeld oder späterer Kurs gelangte in den KontextDen betroffenen Zyklus oder Lauf für ungültig erklären
AnbieterfehlerZeitüberschreitung, Ratenlimit oder nicht verfügbares ModellGetrennt von einem Marktdurchlauf zählen
SchemafehlerUngültige Aktion, fehlende Markt-ID oder nicht parsebare WahrscheinlichkeitSpeichern Sie die Rohantwort und Ablehnung
RisikoablehnungAngeforderte Größe überschritt Bargeld-, Exposure- oder PreislimitsAls Modellvorschlag melden, der von Schutzmechanismen abgelehnt wurde
AusführungsablehnungKein rechtzeitiges Buch, keine Tiefe unter dem Limit oder NullausführungIm Handelsnenner behalten
MarktverlustGültige ausgeführte Entscheidung, die gegen die ausgewählte Seite abgewickelt wurdeNormal in P&L und Prognosebewertung einbeziehen

Die minimale Reproduzierbarkeitsaufzeichnung

Bewahren Sie für jeden Lauf den Modellanbieter und den genauen Modell-Slug, die Prompt-Vorlagen, Werkzeugdefinitionen, das Schema für strukturierte Ausgabe, die Sampling-Konfiguration und die Kundenanweisungen auf. Zeichnen Sie den historischen Start und Ende, das Entscheidungsintervall, den Rückblick, Handelsplätze, Kategorien, Startkapital, Exposure-Limits, Ausführungslatenz und die endgültige Bewertungsmethode auf.

Bewahren Sie für jeden Entscheidungszyklus den Entscheidungszeitstempel, die Bandversion, die Band-Stichtagszeit, die Anzahl der infrage kommenden Märkte, den Eingabe-Hash, das Portfolio vorher und nachher, die Modellnutzung und den Fehlerstatus auf. Speichern Sie für jeden vorgeschlagenen Trade seine These und Wahrscheinlichkeit zusammen mit der beobachteten Marktwahrscheinlichkeit, Konfidenz, Limitpreis, angeforderten Größe, Ablehnungscode und dem für eine etwaige Ausführung verwendeten historischen Buch.

Anbietermodelle können hinter einem stabilen Namen aktualisiert werden, sodass eine exakte Wiederholung später dennoch abweichen kann. Eine dauerhafte Aufzeichnung kann diese Plattformvarianz nicht beseitigen, aber sie kann sie aufdecken. Wo deterministische Seeds oder festgelegte Versionen nicht verfügbar sind, wiederholen Sie denselben Test ausreichend oft, um die Streuung von Lauf zu Lauf zu berichten, anstatt eine günstige Stichprobe zu präsentieren.

  • Modell-Slug, Anbieter, Prompt, Werkzeuge, Schema und Sampling-Einstellungen.
  • Historische Grenze, Marktuniversum, Entscheidungsintervall und Rückblick.
  • Portfoliolimits, Ausführungslatenz, Ausführungs-Engine und endgültige Bewertung.
  • Eingabe- und Buch-Hashes, die mit jeder Entscheidung und Ausführung verknüpft sind.
  • Token-Nutzung, Modellkosten, ungültige Ausgaben und alle Ablehnungsgründe.
  • Varianz bei wiederholten Läufen, wenn das Modell oder der Anbieter stochastisch ist.

Vorwärtstest, bevor Sie eine KI-Leistungsbehauptung aufstellen

Ein historischer KI-Test kann immer noch von Modellgedächtnis, Prompt-Tuning durch Forscher und wiederholtem Experimentieren profitieren. Der sauberste nächste Schritt ist eine gesperrte Vorwärts-Paper-Periode. Frieren Sie den Prompt oder die extrahierte Regel ein, beginnen Sie, nachdem die Konfiguration endgültig ist, bewerten Sie jede Aktion anhand des live angezeigten Buchs und veröffentlichen Sie den vollständigen Nenner.

DepthFeed Paper Trading bietet den verfügbaren Vorwärtspfad für deterministische Regeln und externe Bot-Signale. Es verwendet virtuelles Geld und platziert keine Live-Börsenaufträge. Diese Unterscheidung sollte überall dort sichtbar bleiben, wo ein KI-Workflow beschrieben wird.

Was DepthFeed heute bietet

Heute können Forscher ein KI-Modell verwenden, um eine explizite Strategie zu erstellen oder zu verfeinern, diese eingefrorene Regel im Backtest Lab gegen aufgezeichnete Vorhersagemarkt-Bücher abzuspielen, drei Ausführungsannahmen zu vergleichen, Risiko und einzelne Trades zu inspizieren und kompatible Überlebende zum Live-Paper-Trading zu verschieben. Der Server für historische Daten API und MCP unterstützt auch benutzerdefinierte Agentenforschung außerhalb des Dashboards.

DepthFeed bewirbt derzeit keinen öffentlichen autonomen Model-in-the-Loop-Backtest API oder Live-KI-Handelsausführung. Der engere Workflow ist beabsichtigt und testbar: Das Modell schlägt vor; aufgezeichnete Marktbeweise bewerten; Paper Trading liefert die Vorwärtsaufzeichnung.

Key takeaways

  • 01KI-Ideengenerierung und KI-Model-in-the-Loop-Replay sind unterschiedliche Produkte und erfordern unterschiedliche Nachweise.
  • 02Blockieren Sie Abwicklung, zukünftige Zeilen, aktuelle Suche und spätere Fakten bei jeder historischen Entscheidung.
  • 03Frieren Sie Modell, Prompt, Werkzeuge, Schema, Universum und Portfoliobeschränkungen ein, bevor Sie Ergebnisse vergleichen.
  • 04Speichern Sie Durchläufe, Ablehnungen, Modellaufrufe und Eingabegrenzen sowie profitable Ausführungen.
  • 05Spielen Sie Bargeld und Positionen sequenziell ab und führen Sie dann nach einer definierten Latenz gegen aufgezeichnete Tiefe aus.
  • 06Berichten Sie Kalibrierung, P&L, Risiko, Konzentration, Inferenzkosten und Reproduzierbarkeit getrennt.
  • 07Verwenden Sie eine gesperrte Vorwärts-Paper-Periode, bevor Sie eine KI-Leistungsbehauptung aufstellen.

Eine KI-generierte Strategie ist kein Backtest. Das Modell, die Informationsgrenze, das Entscheidungsprotokoll, der Portfoliostatus und die ausführbare Ausführung müssen alle an der historischen Uhr kontrolliert werden.

Kostenlos starten

Fragen, beantwortet.

Es ist eine historische Bewertung einer KI-generierten Regel oder eines Modellentscheidungsprozesses unter ausschließlicher Verwendung von Informationen, die zu jedem simulierten Zeitpunkt verfügbar sind. Der Test muss Zukunftsleckage kontrollieren, den Portfoliostatus bewahren, gegen historische Marktliquidität ausführen und aus dem tatsächlichen Kontraktergebnis abwickeln.

Beginne, Polymarket & Kalshi auf echter Tiefe zu backtesten.

Kostenlos starten, keine Karte. Upgrade, wenn deine Strategie bereit für das volle Orderbuch ist.

Kostenlos starten