Backtesting de mercados de predicción con IA: prueba estrategias de LLM sin fuga de datos futuros
Una estrategia generada por IA no es un backtest. El modelo, el límite de información, el protocolo de decisión, el estado del portafolio y la ejecución realizable deben controlarse en el reloj histórico.
El backtesting de mercados de predicción con IA evalúa una regla generada por LLM o una decisión del modelo usando solo la información disponible en cada marca de tiempo histórica. Una prueba creíble congela el prompt y el universo de mercados, bloquea los resultados resueltos y los hechos futuros, reproduce las órdenes contra la profundidad registrada, preserva el estado del portafolio e informa cada decisión, rechazo y ejecución.
Por qué el backtesting de IA es un problema aparte
Una regla determinista se puede revisar línea por línea. Un LLM puede cambiar su razonamiento según el prompt, la versión del modelo, el contexto, los resultados de las herramientas y la configuración de muestreo. También puede conocer hechos que ocurrieron después de la fecha simulada porque sus datos de entrenamiento o una herramienta de búsqueda adjunta llegan más allá del reloj histórico. Un backtest de trading normal no controla automáticamente esos riesgos.
Los mercados de predicción hacen que la fuga sea especialmente grave. La pregunta del mercado y la resolución final son públicas después de la liquidación, por lo que un modelo puede parecer pronosticar un evento mientras recuerda o infiere su respuesta a partir de información posterior. La prueba debe preservar tanto la integridad del tiempo de mercado como la integridad del tiempo del modelo.
Dos flujos de trabajo de backtesting de IA
El flujo de trabajo actualmente público de DepthFeed admite la primera ruta: pedir a un modelo que proponga una hipótesis clara, traducirla a una regla predefinida o personalizada, congelar los parámetros y ejecutarla en Backtest Lab. Esto separa la generación de ideas de la evaluación y hace que la reproducción sea repetible.
Una reproducción con modelo en el ciclo requiere controles adicionales: un entorno de información cerrado, estado secuencial del portafolio, registros duraderos de llamadas al modelo y una cinta puntual para cada ciclo. No describas una transcripción de chat sobre mercados resueltos como esta forma más sólida de backtest.
| Flujo de trabajo | Qué se congela | Mejor uso |
|---|---|---|
| Regla generada por IA | La salida del prompt se convierte en lógica determinista explícita una sola vez | Probar si una hipótesis de IA sobrevive a los datos de mercado y a la ejecución |
| Reproducción con el modelo en el ciclo | El modelo, el prompt, las herramientas y el contexto puntual se ejecutan en cada decisión | Evaluar a un pronosticador autónomo o a un agente de portafolio |
Construye el límite de información histórica
La implementación más segura usa un límite "a fecha de": la marca de tiempo de origen menor o igual al momento de decisión. Cada característica, resumen y respuesta de herramienta debe heredar ese límite. Un solo campo de conveniencia sin acotar, como el estado del mercado de hoy o una etiqueta de resultado final, puede invalidar toda la ejecución.
- Establece una marca de tiempo de decisión e incluye solo las filas de mercado observadas en ese momento o antes.
- Acota explícitamente cualquier ventana retrospectiva móvil; nunca uses la fila más cercana que pueda provenir del futuro.
- Excluye los resultados de liquidación, los precios finales, los titulares posteriores y la búsqueda web actual.
- Registra el universo exacto de mercados mostrado al modelo, incluidos los contratos que omitió.
- Calcula el hash o versiona la cinta de entrada para que la misma decisión pueda reconstruirse más adelante.
- Informa los datos faltantes como faltantes en lugar de rellenarlos con una observación posterior.
Evita la fuga de respuestas y de prompts
Congela el prompt del sistema, las instrucciones del cliente, el identificador del modelo, el modo de muestreo, el esquema de salida estructurada y las herramientas disponibles. Elimina el lenguaje que revele el resultado indirectamente, incluido el estado final del mercado, la redacción de liquidación, los resúmenes de artículos retrospectivos o los nombres de archivo creados después de la resolución.
Para preguntas de eventos históricos, asume que la memoria del modelo preentrenado puede contener hechos posteriores incluso cuando la navegación está desactivada. Usa preguntas seguras respecto a la fecha de corte cuando sea posible, evalúa los controles de fuga por separado y compara el rendimiento en periodos más recientes o reservados de forma privada. Un puntaje alto en eventos resueltos bien conocidos no es por sí solo evidencia de habilidad de pronóstico.
Haz que el protocolo de decisión sea auditable
Pide acciones estructuradas en lugar de recomendaciones de texto libre. Una decisión útil incluye la identidad del mercado, el lado, la probabilidad estimada, la confianza, el precio máximo de entrada, el nocional solicitado y una tesis breve. Las reglas del lado del servidor deben aceptar, redimensionar o rechazar la propuesta según los límites de efectivo, exposición, confianza, ventaja y precio.
Almacena los pases y las operaciones rechazadas, no solo las ejecuciones. Si el informe final contiene solo los ganadores que eligió el modelo, no hay denominador para el análisis de selectividad, cobertura o fallos. El registro duradero debe conectar cada acción con su límite de entrada exacto y el estado resultante del portafolio.
Reproduce el portafolio de forma secuencial
Los ciclos del portafolio deben ejecutarse en orden cronológico porque una decisión cambia el efectivo y la exposición abierta disponibles para la siguiente. Paraleliza el descubrimiento de mercados dentro de una marca de tiempo si es necesario, pero sintetiza una decisión final de portafolio contra una sola cinta congelada. No permitas que llamadas independientes al modelo gasten el mismo efectivo.
Traslada las posiciones abiertas, el efectivo realizado y los límites de riesgo hacia adelante. Luego informa las ganancias y pérdidas (P&L) por categoría y mercado, así como en forma agregada. Esto revela si un portafolio aparentemente inteligente es una sola apuesta direccional concentrada repetida en contratos correlacionados.
Usa ejecuciones reales, no el precio cotizado por el modelo
El modelo puede indicar un precio máximo; no se le debe permitir inventar su propia ejecución. Añade un retraso de ejecución definido, localiza el primer libro registrado en o después de ese tiempo simulado y recorre las ofertas o demandas disponibles solo hasta el límite. Almacena VWAP, la fracción ejecutada, el tiempo de observación y el libro utilizado.
Marca el portafolio final de forma conservadora. Una marca de punto medio asume la liquidación sin cruzar el diferencial ni consumir tamaño. Una liquidación ejecutable consciente de la profundidad responde mejor a lo que el portafolio podría haber obtenido; los libros obsoletos o ausentes deben seguir siendo una condición de fallo explícita.
Flujo de trabajo práctico: de una hipótesis de LLM a una reproducción
Comienza con un prompt acotado: pide al modelo una hipótesis falsable de Polymarket o Kalshi, los insumos observables necesarios, una regla de entrada precisa, el tamaño de la posición, el comportamiento de salida o liquidación y las condiciones bajo las cuales debe pasar. Prohíbe las afirmaciones de ganancias y solicita no incluir ejemplos retrospectivos.
Traduce la respuesta a un preset de Backtest Lab o a una regla personalizada sin cambiar sus umbrales después de ver los resultados. Selecciona el mercado y la familia de mercados previstos, usa una muestra cronológica y compara el punto medio, el deslizamiento fijo y la profundidad registrada. Inspecciona cada operación y conserva una muestra de validación posterior. Si sobrevive, implementa la regla congelada en paper trading y evalúala con resultados que el modelo no pudo haber conocido cuando se creó la regla.
Métricas que distinguen el pronóstico del trading
La calidad del pronóstico y el rendimiento del trading están relacionados, pero no son idénticos. Un modelo calibrado puede perder pagando precios que ya reflejan su información. Un modelo mal calibrado puede ganar dinero brevemente por suerte o por una posición concentrada. Informa ambas capas y evita reducir la evaluación a un titular de tabla de posiciones.
| Pregunta | Métrica | Fallo que detecta |
|---|---|---|
| ¿Fueron útiles las probabilidades? | Puntaje de Brier, pérdida logarítmica, calibración | Pronósticos confiados pero inexactos |
| ¿Fueron rentables las acciones después de la ejecución? | P&L neto, ROI, ventaja ejecutable | Buenos pronósticos comprados a malos precios |
| ¿Estuvo concentrado el resultado? | P&L por mercado, categoría y tiempo | Un solo evento o régimen que sostiene la ejecución |
| ¿Estuvo controlado el riesgo? | Drawdown, exposición, número de posiciones | Ganancia creada por una concentración excesiva |
| ¿Fue selectivo el modelo? | Operaciones, pases y tasas de rechazo | Informes seleccionados a conveniencia sin un denominador |
| ¿Fue reproducible la ejecución? | Hashes de prompt, modelo, cinta y libro | Un resultado que no puede reproducirse de forma independiente |
Compara modelos sin cambiar las reglas del juego
- Dale a cada modelo la misma cinta de mercado congelada, el mismo conjunto de herramientas, el mismo esquema de salida y los mismos límites de portafolio.
- Usa las mismas marcas de tiempo de decisión, latencia de ejecución, motor de ejecución y regla de marcación final.
- Separa los fallos del proveedor, la salida no válida y los rechazos por reglas de riesgo de las pérdidas de mercado.
- Registra el costo de tokens y del modelo junto con el rendimiento; una ganancia marginal puede no justificar un costo de inferencia mucho mayor.
- Repite las ejecuciones estocásticas o usa configuraciones deterministas cuando sean compatibles, e informa la varianza.
- Mantén actualizadas las páginas y afirmaciones sobre modelos con nombre, porque las versiones y la disponibilidad de los modelos cambian.
Clasifica los fallos en lugar de ocultarlos
Estos resultados significan cosas diferentes. Tratar un tiempo de espera del proveedor como un pase confiado infla la selectividad; descartar una orden no ejecutada sobrestima el rendimiento ejecutable; y reparar silenciosamente la salida malformada del modelo le da a un modelo ayuda humana que los demás pueden no recibir. La evaluación debe definir cada clase antes de la ejecución y aplicarla de forma mecánica.
Publica el embudo completo: mercados elegibles, mercados mostrados, acciones propuestas, pases, salidas no válidas, rechazos por barandillas, rechazos de ejecución, ejecuciones parciales y posiciones completadas. Ese denominador permite distinguir un modelo cauteloso de uno poco confiable.
| Clase de fallo | Ejemplo | Cómo informarlo |
|---|---|---|
| Fallo de información | Un hecho futuro, un campo de liquidación o una cotización posterior entró en el contexto | Invalida el ciclo o la ejecución afectada |
| Fallo del proveedor | Tiempo de espera agotado, límite de tasa o modelo no disponible | Cuenta por separado de un pase de mercado |
| Fallo de esquema | Acción no válida, ID de mercado faltante o probabilidad no analizable | Almacena la respuesta sin procesar y el rechazo |
| Rechazo por riesgo | El tamaño solicitado superó los límites de efectivo, exposición o precio | Infórmalo como una propuesta del modelo rechazada por las barandillas de protección |
| Rechazo de ejecución | Sin libro oportuno, sin profundidad por debajo del límite o ejecución cero | Mantenlo en el denominador de trading |
| Pérdida de mercado | Decisión válida ejecutada y liquidada contra el lado seleccionado | Inclúyelo normalmente en P&L y en la calificación de pronósticos |
El registro mínimo de reproducibilidad
Para cada ejecución, conserva el proveedor del modelo y el slug exacto del modelo, las plantillas de prompt, las definiciones de herramientas, el esquema de salida estructurada, la configuración de muestreo y las instrucciones del cliente. Registra el inicio y el fin históricos, el intervalo de decisión, la ventana retrospectiva, los mercados, las categorías, el efectivo inicial, los límites de exposición, la latencia de ejecución y el método de marcación final.
Para cada ciclo de decisión, conserva la marca de tiempo de decisión, la versión de la cinta, la hora "a fecha de" de la cinta, el recuento de mercados elegibles, el hash de entrada, el portafolio antes y después, el uso del modelo y el estado de error. Para cada operación propuesta, almacena su tesis y probabilidad junto con la probabilidad de mercado observada, la confianza, el precio límite, el tamaño solicitado, el código de rechazo y el libro histórico utilizado para cualquier ejecución.
Los modelos de los proveedores pueden actualizarse detrás de un nombre estable, por lo que una repetición exacta puede diferir más adelante. Un registro duradero no puede eliminar esa variación de plataforma, pero puede revelarla. Cuando no haya semillas deterministas ni versiones fijadas, repite la misma prueba suficientes veces para informar la dispersión entre ejecuciones en lugar de presentar una muestra favorable.
- Slug del modelo, proveedor, prompt, herramientas, esquema y configuración de muestreo.
- Límite histórico, universo de mercados, intervalo de decisión y ventana retrospectiva.
- Límites del portafolio, latencia de ejecución, motor de ejecución y marcación final.
- Hashes de entrada y de libro vinculados a cada decisión y ejecución.
- Uso de tokens, costo del modelo, salidas no válidas y todos los motivos de rechazo.
- Varianza entre ejecuciones repetidas cuando el modelo o el proveedor es estocástico.
Haz forward testing antes de hacer una afirmación de rendimiento de IA
Una prueba histórica de IA aún puede beneficiarse de la memoria del modelo, el ajuste de prompts por parte del investigador y la experimentación repetida. El siguiente paso más limpio es un periodo forward de paper trading bloqueado. Congela el prompt o la regla extraída, comienza después de que la configuración sea definitiva, valora cada acción según el libro mostrado en vivo y publica el denominador completo.
DepthFeed Paper Trading proporciona la ruta forward disponible para reglas deterministas y señales de bots externos. Usa efectivo virtual y no coloca órdenes en vivo en el exchange. Esa distinción debe permanecer visible en cualquier lugar donde se describa un flujo de trabajo de IA.
Qué ofrece DepthFeed hoy
Hoy, los investigadores pueden usar un modelo de IA para crear o refinar una estrategia explícita, reproducir esa regla congelada en Backtest Lab contra los libros registrados de mercados de predicción, comparar tres supuestos de ejecución, inspeccionar el riesgo y las operaciones individuales, y mover a los sobrevivientes compatibles a paper trading en vivo. Los datos históricos de API y el servidor MCP también admiten investigación personalizada de agentes fuera del panel.
DepthFeed no anuncia actualmente un backtest público autónomo con modelo en el ciclo API ni ejecución de operaciones de IA en vivo. El flujo de trabajo más acotado es intencional y comprobable: el modelo propone; la evidencia de mercado registrada evalúa; el paper trading proporciona el registro forward.
Key takeaways
- 01La generación de ideas con IA y la reproducción con IA en el ciclo son productos diferentes y requieren evidencia diferente.
- 02Bloquea la liquidación, las filas futuras, la búsqueda actual y los hechos posteriores en cada decisión histórica.
- 03Congela el modelo, el prompt, las herramientas, el esquema, el universo y las restricciones del portafolio antes de comparar resultados.
- 04Almacena pases, rechazos, llamadas al modelo y límites de entrada, así como las ejecuciones rentables.
- 05Reproduce el efectivo y las posiciones de forma secuencial y luego ejecuta contra la profundidad registrada después de una latencia definida.
- 06Informa la calibración, el P&L, el riesgo, la concentración, el costo de inferencia y la reproducibilidad por separado.
- 07Usa un periodo forward de paper trading bloqueado antes de hacer cualquier afirmación de rendimiento de IA.
Una estrategia generada por IA no es un backtest. El modelo, el límite de información, el protocolo de decisión, el estado del portafolio y la ejecución realizable deben controlarse en el reloj histórico.
Empieza gratis