BONDNOTE JOURNAL · 2026.10.04

가격예측과 강화학습 주문전략은 서로 다른 학습문제다

Two Sigma 공식 웨비나는 고빈도 데이터의 가격변동 예측과 강화학습 기반 최적 주문전략을 서로 다른 금융 머신러닝 문제로 제시한다. 전자는 미래 가격을, 후자는 행동이 체결·시장충격·다음 상태를 바꾸는 순차 의사결정을 다룬다.

2 min readRESEARCH NOTE
Source discussed · Two Sigma: 고빈도 가격예측과 강화학습 주문전략은 서로 다른 학습문제다

예측 정확도가 높아도 거래비용과 재고위험을 포함한 최적 집행정책은 아닐 수 있다. 가격모델은 시계열 홀드아웃에서 검증하고, 주문정책은 시장충격을 포함한 시뮬레이션에서 체결·슬리피지·위험을 보상함수로 평가해야 한다. Two Sigma의 실제 전략과 성과는 공개되지 않았다.

국고채선물 방향 신호와 현물·IRS 헤지 주문정책을 분리한다. 집행정책은 체결확률, implementation shortfall, mark-out과 재고 DV01을 목표로 historical replay와 제한적 shadow 실행을 거쳐 승인한다.

Read the full daily briefing →

Show the original briefing text

구분: 퀀트회사 공식 웨비나·딥러닝 및 강화학습
발표일: 2022년 8월 23일
선정 이유: 최신성보다 가격예측과 주문집행의 학습목표를 분리해 설명한 기술적 가치 때문에 선정

핵심 요약

Two Sigma 공식 웨비나는 금융 머신러닝을 고빈도 데이터의 가격변동 예측과 강화학습 기반 최적 주문전략이라는 별개의 문제로 다룬다. 전자는 시장상태에서 미래 가격 움직임을 학습하고, 후자는 행동이 체결·시장충격·다음 상태를 바꾸는 순차 의사결정을 학습한다. 따라서 예측 정확도가 높은 모델이 곧 최적 집행정책이라는 보장은 없으며, 주문전략에는 체결·슬리피지·재고·위험의 보상함수와 반사실 평가가 필요하다는 공개자료 기반 해석이 가능하다. 페이지는 연구기회와 공개 발표를 소개할 뿐 Two Sigma의 실제 전략·데이터·성과를 공개하지 않는다.

실무 시사점

방향모델과 집행모델을 하나의 정확도 지표로 승인하면 신호는 맞지만 비용이 더 큰 전략이 배포될 수 있다. 가격예측은 시계열 홀드아웃으로, 집행정책은 시장충격을 반영한 시뮬레이션과 비용·위험 제약으로 독립 검증해야 한다.

한국 시장 복제 아이디어

국고채선물 방향 신호와 현물·IRS 헤지 주문정책을 분리한다. 예측모델은 수익률·베이시스의 표본외 오차로 평가하고, 집행정책은 체결확률·implementation shortfall·mark-out·재고 DV01을 보상으로 삼아 historical replay와 제한된 shadow 실행에서 검증한다.