집행에서는 강화학습 기반 적응형 지능 라우팅이 여러 거래경로 사이의 탐색과 활용을 균형화한다. 어떤 경로를 선택하지 않으면 그 결과를 볼 수 없고 시장도 계속 변하므로, 단순 과거평균이 아니라 제한된 실험과 업데이트가 필요하다. 실제 보상함수·라우팅 대상·P&L은 공개되지 않았다.
국내 국고채·회사채 주문에서는 체결가격, 응답시간, mark-out, 정보노출과 재고 DV01을 합친 목적함수를 정의한다. 과거 주문으로 반사실 평가를 한 뒤 탐색률과 주문크기를 제한한 shadow·canary 단계에서만 실시간 적응을 허용한다.
편집 전 브리핑 원문 펼치기
구분: 퀀트회사 공식 CIO 기고·강화학습 집행
발표일: 2024년 3월
선정 이유: 최신성보다 실제 연구검증·주문집행 절차를 공개한 기술적 가치 때문에 선정
핵심 요약
Man AHL의 Russell Korgaonkar CIO는 사람이 정한 파라미터 공간에서 AI가 다수의 약한 신호를 찾되, 무작위 잡음에서도 같은 수의 신호가 나오는지와 정보감쇠·표본외 비율을 확인해야 한다고 설명한다. 신호 1만 개 중 10개만 좋아 보이면 데이터마이닝일 수 있지만 다수가 반복되면 조합한 뒤 보지 않은 데이터에서 일반화를 다시 검증한다는 접근이다. 실행에서는 강화학습 기반 적응형 지능 라우팅이 여러 거래경로 사이의 탐색과 활용을 균형 있게 배분하며, 결과를 선택하기 전에는 관측할 수 없고 시장환경도 변한다는 문제를 다룬다. 회사가 실제 전략·보상함수·라우팅 대상·P&L을 공개하지 않았으므로 구체적인 수익효과는 확인되지 않는다.
실무 시사점
공개자료에 기반한 추론으로 수익 연결고리는 경로별 체결확률·비용을 지속적으로 학습해 동일 주문의 시장충격과 기회비용을 줄이는 데 있다. 다만 탐색 주문은 실제 비용을 만들 수 있으므로 오프라인 반사실 평가, 소규모 canary, 참여율 한도와 kill switch가 필요하다.
한국 시장 복제 아이디어
국고채·회사채 주문을 전자플랫폼, 브로커, 딜러 RFQ로 보낼 때 목표를 단순 체결률이 아니라 체결가격, 응답시간, mark-out, 정보노출과 재고 DV01의 합으로 정의한다. 먼저 과거 주문으로 contextual bandit을 오프라인 평가하고, 탐색률과 주문크기를 엄격히 제한한 shadow·canary 단계에서만 실시간 적응을 허용한다.