DepthFeed/Both venues·AI 백테스팅

AI 예측 시장 백테스팅: 미래 정보 유출 없이 LLM 전략 테스트

AI 생성 전략은 백테스트가 아닙니다. 모델, 정보 경계, 결정 프로토콜, 포트폴리오 상태, 실행 가능한 체결은 모두 과거 시계에서 통제되어야 합니다.

DepthFeed··15 min

AI 예측 시장 백테스팅은 각 과거 타임스탬프에서 사용 가능한 정보만을 사용하여 LLM 생성 규칙 또는 모델 결정을 평가합니다. 신뢰할 수 있는 테스트는 프롬프트와 시장 유니버스를 고정하고, 해결된 결과와 미래 사실을 차단하며, 기록된 깊이에 대해 주문을 재생하고, 포트폴리오 상태를 보존하며, 모든 결정, 거부 및 체결을 보고합니다.

AI 백테스팅이 별개의 문제인 이유

확정적 규칙은 한 줄씩 검토할 수 있습니다. LLM은 프롬프트, 모델 버전, 컨텍스트, 도구 결과 및 샘플링 설정에 따라 추론을 변경할 수 있습니다. 또한 학습 데이터나 연결된 검색 도구가 과거 시계를 넘어서기 때문에 시뮬레이션 날짜 이후에 발생한 사실을 알 수도 있습니다. 일반적인 트레이딩 백테스트는 이러한 위험을 자동으로 통제하지 않습니다.

예측 시장은 정보 유출을 특히 심각하게 만듭니다. 시장 질문과 최종 결과는 정산 후 공개되므로, 모델이 나중 정보를 회상하거나 추론하여 사건을 예측하는 것처럼 보일 수 있습니다. 테스트는 시장 시간 무결성과 모델 시간 무결성을 모두 유지해야 합니다.

두 가지 AI 백테스팅 워크플로

DepthFeed의 현재 공개 워크플로는 첫 번째 경로를 지원합니다. 모델에게 명확한 가설을 제안하도록 요청하고, 이를 사전 설정 또는 사용자 정의 규칙으로 변환하고, 매개변수를 고정하고, 백테스트 랩을 통해 실행합니다. 이는 아이디어 생성과 평가를 분리하고 재생을 반복 가능하게 만듭니다.

모델-인-루프 재생에는 닫힌 정보 환경, 순차적 포트폴리오 상태, 내구성 있는 모델 호출 기록, 각 주기별 시점 테이프 등 추가 통제가 필요합니다. 해결된 시장에 대한 대화 기록을 이러한 강력한 형태의 백테스트로 설명하지 마십시오.

워크플로고정되는 것최적 용도
AI 생성 규칙프롬프트 출력이 한 번 명시적 확정 논리로 변환AI 가설이 시장 데이터와 실행을 견디는지 테스트
모델-인-루프 재생모델, 프롬프트, 도구 및 시점 컨텍스트가 매 결정마다 실행자율 예측자 또는 포트폴리오 에이전트 평가

과거 정보 경계 구축

가장 안전한 구현은 기준 시점 경계를 사용합니다. 소스 타임스탬프가 결정 시간보다 작거나 같아야 합니다. 모든 기능, 요약 및 도구 응답은 해당 경계를 상속해야 합니다. 오늘의 시장 상태나 최종 결과 레이블과 같은 하나의 제한 없는 편의 필드가 전체 실행을 무효화할 수 있습니다.

  • 결정 타임스탬프를 설정하고 해당 시점 또는 그 이전에 관찰된 시장 행만 포함합니다.
  • 후행 룩백을 명시적으로 제한하십시오. 미래에서 올 수 있는 가장 가까운 행을 절대 사용하지 마십시오.
  • 정산 결과, 최종 가격, 이후의 헤드라인 및 현재 웹 검색을 제외합니다.
  • 모델에 표시된 정확한 시장 유니버스를 기록하십시오. 모델이 건너뛴 계약도 포함합니다.
  • 입력 테이프를 해시하거나 버전 관리하여 나중에 동일한 결정을 재구성할 수 있도록 합니다.
  • 누락된 데이터는 나중 관찰에서 채우는 대신 누락으로 보고합니다.

답변 및 프롬프트 유출 방지

시스템 프롬프트, 고객 지시사항, 모델 식별자, 샘플링 모드, 구조화된 출력 스키마 및 사용 가능한 도구를 고정합니다. 최종 시장 상태, 정산 문구, 회고적 기사 요약 또는 해결 후 생성된 파일 이름을 포함하여 결과를 간접적으로 드러내는 언어를 제거합니다.

과거 이벤트 질문의 경우, 브라우징이 비활성화되어 있어도 사전 학습된 모델 메모리에 나중 사실이 포함될 수 있다고 가정합니다. 가능한 경우 컷오프 안전 질문을 사용하고, 유출 통제를 별도로 평가하고, 더 최근이거나 비공개로 보류된 기간에 대한 성능을 비교합니다. 잘 알려진 해결된 이벤트에서 높은 점수는 그 자체로 예측 기술의 증거가 아닙니다.

결정 프로토콜을 감사 가능하게 만들기

자유 형식의 권장 사항보다 구조화된 행동을 요청합니다. 유용한 결정은 시장 식별자, 방향, 추정 확률, 신뢰도, 최대 진입 가격, 요청 명목 금액 및 짧은 논거를 포함합니다. 서버 측 규칙은 현금, 노출, 신뢰도, 에지 및 가격 제한에 따라 제안을 수락, 크기 조정 또는 거부해야 합니다.

체결뿐만 아니라 통과 및 거부된 거래도 저장합니다. 최종 보고서에 모델이 선택한 승자만 포함된 경우, 선택성, 커버리지 또는 실패 분석을 위한 분모가 없습니다. 내구성 있는 기록은 각 행동을 정확한 입력 경계 및 결과 포트폴리오 상태와 연결해야 합니다.

포트폴리오를 순차적으로 재생

하나의 결정이 다음에 사용 가능한 현금 및 오픈 노출을 변경하므로 포트폴리오 주기는 시간 순서대로 실행되어야 합니다. 필요한 경우 타임스탬프 내에서 시장 발견을 병렬화할 수 있지만, 하나의 고정된 테이프에 대해 하나의 최종 포트폴리오 결정을 합성합니다. 독립적인 모델 호출이 동일한 현금을 사용하도록 허용하지 마십시오.

오픈 포지션, 실현 현금 및 위험 한도를 앞으로 이월합니다. 그런 다음 카테고리 및 거래소별로, 그리고 집계하여 손익을 보고합니다. 이는 겉보기에 지능적인 포트폴리오가 상관 계약 전반에 걸쳐 반복되는 하나의 집중된 방향성 베팅인지 드러냅니다.

실행 가능한 체결을 사용하고 모델의 제시 가격을 사용하지 마십시오

모델은 최대 가격을 명시할 수 있지만, 자신의 체결을 만들어내도록 허용해서는 안 됩니다. 정의된 실행 지연을 추가하고, 해당 시뮬레이션 시간 또는 그 이후에 처음 기록된 호가창을 찾아, 사용 가능한 매도/매수 호가를 제한까지 걸어갑니다. VWAP, 체결 비율, 관찰 시간 및 사용된 호가창을 저장합니다.

최종 포트폴리오를 보수적으로 평가합니다. 중간 가격 평가는 스프레드를 넘거나 사이즈를 소비하지 않고 청산된다고 가정합니다. 깊이 인식 실행 가능 청산은 포트폴리오가 실현할 수 있었을 것을 더 잘 알려줍니다. 오래되었거나 부재한 호가창은 명시적인 실패 조건으로 남아야 합니다.

작동 워크플로: LLM 가설에서 재생까지

제한된 프롬프트로 시작하십시오: 모델에게 반증 가능한 Polymarket 또는 Kalshi 가설 하나, 필요한 관측 가능한 입력, 정확한 진입 규칙, 포지션 크기, 청산 또는 정산 행동, 그리고 통과해야 하는 조건을 요청하십시오. 이익 주장을 금지하고 회고적 사례를 요청하지 마십시오.

결과를 본 후 임계값을 변경하지 않고 답변을 백테스트 랩 사전 설정 또는 사용자 정의 규칙으로 변환합니다. 의도된 거래소와 시장 패밀리를 선택하고, 시간 순서 샘플을 사용하고, 중간 가격, 고정 슬리피지 및 기록된 깊이를 비교합니다. 모든 거래를 검사하고 나중에 보류 기간을 보존합니다. 살아남으면 고정된 규칙을 페이퍼 트레이딩에 배포하고 규칙이 생성될 때 모델이 알 수 없었던 결과에 대해 평가합니다.

예측과 트레이딩을 구분하는 지표

예측 품질과 트레이딩 성과는 관련이 있지만 동일하지 않습니다. 잘 보정된 모델도 이미 정보를 반영한 가격을 지불하여 손실을 볼 수 있습니다. 보정이 잘못된 모델은 운이나 하나의 집중된 포지션을 통해 일시적으로 돈을 벌 수 있습니다. 두 계층을 모두 보고하고 평가를 리더보드 헤드라인으로 축소하지 마십시오.

질문지표포착하는 실패
확률이 유용했는가?브라이어 점수, 로그 손실, 캘리브레이션확신하지만 부정확한 예측
실행 후 행동이 수익성이 있었는가?순손익, ROI, 실행 가능한 에지좋은 예측을 나쁜 가격에 매수
결과가 집중되었는가?거래소, 카테고리, 시간별 손익실행을 이끈 하나의 이벤트 또는 체제
위험이 통제되었는가?드로다운, 노출, 포지션 수과도한 집중으로 생성된 이익
모델이 선택적이었는가?거래, 통과 및 거절 비율분모 없는 체리 피킹 보고
실행이 재현 가능했는가?프롬프트, 모델, 테이프 및 호가창 해시독립적으로 재생할 수 없는 결과

목표를 변경하지 않고 모델 비교

  • 모든 모델에 동일한 고정된 시장 테이프, 도구 세트, 출력 스키마 및 포트폴리오 한도를 제공합니다.
  • 동일한 결정 타임스탬프, 실행 지연, 체결 엔진 및 최종 평가 규칙을 사용합니다.
  • 제공자 실패, 유효하지 않은 출력, 위험 규칙 거부를 시장 손실과 분리합니다.
  • 토큰 및 모델 비용을 성과와 함께 기록합니다. 한계 이득이 훨씬 더 높은 추론 비용을 정당화하지 못할 수 있습니다.
  • 확률적 실행을 반복하거나 지원되는 경우 결정적 설정을 사용하고 분산을 보고합니다.
  • 모델 버전 및 가용성이 변경되므로 명명된 모델 페이지와 주장을 최신 상태로 유지합니다.

실패를 숨기지 않고 분류하기

이러한 결과는 서로 다른 의미를 갖습니다. 제공자 타임아웃을 확신적인 통과로 처리하면 선택성이 부풀려집니다. 미체결 주문을 제거하면 실행 가능 성능이 과장됩니다. 그리고 잘못된 형식의 모델 출력을 조용히 수정하면 한 모델이 다른 모델이 받지 못할 인간의 도움을 받게 됩니다. 평가는 실행 전에 각 분류를 정의하고 기계적으로 적용해야 합니다.

전체 퍼널을 게시합니다: 적격 시장, 표시된 시장, 제안된 행동, 통과, 유효하지 않은 출력, 가드레일 거부, 실행 거부, 부분 체결 및 완료된 포지션. 그 분모를 통해 신중한 모델과 신뢰할 수 없는 모델을 구별할 수 있습니다.

실패 분류예시보고 방법
정보 실패미래 사실, 정산 필드 또는 이후 호가가 컨텍스트에 입력됨영향받은 주기 또는 실행을 무효화
제공자 실패타임아웃, 속도 제한 또는 사용 불가능한 모델시장 통과와 별도로 집계
스키마 실패유효하지 않은 행동, 누락된 시장 ID 또는 구문 분석 불가능한 확률원시 응답 및 거절 저장
위험 거부요청된 크기가 현금, 노출 또는 가격 한도를 초과가드레일에 의해 거부된 모델 제안으로 보고
실행 거부적시 호가창 없음, 제한 이하 깊이 없음 또는 체결 제로트레이딩 분모에 유지
시장 손실선택된 방향으로 정산된 유효한 체결 결정손익 및 예측 점수에 정상적으로 포함

최소한의 재현성 기록

모든 실행에 대해 모델 제공자와 정확한 모델 슬러그, 프롬프트 템플릿, 도구 정의, 구조화된 출력 스키마, 샘플링 구성 및 고객 지시사항을 보존합니다. 과거 시작 및 종료, 결정 간격, 룩백, 거래소, 카테고리, 시작 현금, 노출 한도, 실행 지연 및 최종 평가 방법을 기록합니다.

모든 결정 주기에 대해 결정 타임스탬프, 테이프 버전, 테이프 기준 시간, 적격 시장 수, 입력 해시, 사전 및 사후 포트폴리오, 모델 사용량 및 오류 상태를 보존합니다. 모든 제안된 거래에 대해 논거와 확률을 관찰된 시장 확률, 신뢰도, 제한 가격, 요청 크기, 거절 코드 및 모든 체결에 사용된 과거 호가창과 함께 저장합니다.

제공자 모델은 안정적인 이름 뒤에서 업데이트될 수 있으므로 정확한 재실행도 나중에 달라질 수 있습니다. 내구성 있는 기록은 플랫폼 분산을 제거할 수는 없지만 드러낼 수는 있습니다. 결정적 시드 또는 고정된 버전을 사용할 수 없는 경우, 유리한 하나의 샘플을 제시하는 대신 실행 간 분산을 보고할 수 있도록 동일한 테스트를 충분히 반복합니다.

  • 모델 슬러그, 제공자, 프롬프트, 도구, 스키마 및 샘플링 설정.
  • 과거 경계, 시장 유니버스, 결정 간격 및 룩백.
  • 포트폴리오 한도, 실행 지연, 체결 엔진 및 최종 평가.
  • 모든 결정 및 체결에 연결된 입력 및 호가창 해시.
  • 토큰 사용량, 모델 비용, 유효하지 않은 출력 및 모든 거절 이유.
  • 모델 또는 제공자가 확률적일 때 반복 실행 분산.

AI 성능 주장 전에 포워드 테스트 실시

과거 AI 테스트도 모델 메모리, 연구자 프롬프트 튜닝 및 반복 실험의 이점을 누릴 수 있습니다. 가장 깨끗한 다음 단계는 잠긴 포워드 페이퍼 기간입니다. 프롬프트 또는 추출된 규칙을 고정하고, 구성이 최종 확정된 후 시작하며, 실시간 표시 호가창에서 모든 행동의 가격을 책정하고, 전체 분모를 게시합니다.

DepthFeed 페이퍼 트레이딩은 확정적 규칙 및 외부 봇 신호에 대해 사용 가능한 포워드 경로를 제공합니다. 가상 현금을 사용하며 실시간 거래소 주문을 하지 않습니다. 그 구분은 AI 워크플로가 설명되는 모든 곳에서 눈에 띄어야 합니다.

DepthFeed이 오늘 제공하는 것

오늘날 연구자들은 AI 모델을 사용하여 명시적 전략을 만들거나 다듬고, 그 고정된 규칙을 백테스트 랩에서 기록된 예측 시장 호가창에 대해 재생하고, 세 가지 체결 가정을 비교하고, 위험과 개별 거래를 검사하고, 호환되는 생존자를 실시간 페이퍼 트레이딩으로 이동시킬 수 있습니다. 과거 데이터 API 및 MCP 서버는 대시보드 외부에서의 맞춤형 에이전트 연구도 지원합니다.

DepthFeed는 현재 공개 자율 모델-인-루프 백테스트 API 또는 실시간 AI 거래 실행을 광고하지 않습니다. 더 좁은 워크플로는 의도적이며 테스트 가능합니다: 모델이 제안하고, 기록된 시장 증거가 평가하며, 페이퍼 트레이딩이 포워드 기록을 제공합니다.

Key takeaways

  • 01AI 아이디어 생성과 AI 모델-인-루프 재생은 다른 제품이며 다른 증거를 요구합니다.
  • 02모든 과거 결정에서 정산, 미래 행, 현재 검색 및 이후 사실을 차단합니다.
  • 03결과 비교 전에 모델, 프롬프트, 도구, 스키마, 유니버스 및 포트폴리오 제약을 고정합니다.
  • 04수익성 있는 체결뿐만 아니라 통과, 거절, 모델 호출 및 입력 경계를 저장합니다.
  • 05현금과 포지션을 순차적으로 재생한 다음, 정의된 지연 후 기록된 깊이에 대해 실행합니다.
  • 06캘리브레이션, 손익, 위험, 집중, 추론 비용 및 재현성을 별도로 보고합니다.
  • 07AI 성능 주장을 하기 전에 잠긴 포워드 페이퍼 기간을 사용하십시오.

AI 생성 전략은 백테스트가 아닙니다. 모델, 정보 경계, 결정 프로토콜, 포트폴리오 상태, 실행 가능한 체결은 모두 과거 시계에서 통제되어야 합니다.

무료로 시작

궁금한 점, 답해 드립니다.

각 시뮬레이션 시간에 사용 가능한 정보만을 사용하여 AI 생성 규칙 또는 모델 결정 프로세스를 과거 평가하는 것입니다. 이 테스트는 미래 유출을 통제하고, 포트폴리오 상태를 보존하고, 과거 시장 유동성에 대해 체결하고, 실제 계약 결과로 정산해야 합니다.

진짜 호가창 깊이 위에서 Polymarket & Kalshi 백테스트를 시작하세요.

무료로 시작, 카드 불필요. 전략이 전체 호가창을 맞이할 준비가 되면 업그레이드하세요.

무료로 시작