REFLEX는 이 반복학습이 안정적으로 수렴할지 판단하기 위해 quote 변화에 대한 volume sensitivity, 목적함수의 curvature, spread 축소에 따른 informed-자금 흐름 증가율 세 가지를 결합한 retraining modulus를 제안한다. 모의실험에서는 사전 추정 안정성과 실제 안정성 차이가 8% 이내였고, dealer 경쟁이 2개일 때 불안정성이 1.74배, 3개일 때 3.16배 증가했다. 저자들의 public-data calibration에서는 crisis regime에서 안정성 여유가 IG·HY 모두 평시 대비 약 4배 이상 축소됐다.
편집 전 브리핑 원문 펼치기
구분: 최신 논문 · arXiv / ML·OTC 회사채 Market Making
발표일: 2026년 8월 17일
원문 링크: https://arxiv.org/abs/2608.16155
핵심 요약
OTC 회사채 dealer가 ML로 bid/ask를 결정할 때 생기는 performative feedback을 정면으로 다룬 매우 최신 연구다. quote를 타이트하게 하면 거래량은 늘어나지만 informed flow와 adverse selection도 늘고, dealer는 그렇게 자신이 유인한 체결만으로 모델을 다시 학습한다. 즉 학습 데이터가 외생적으로 주어지는 것이 아니라 내 과거 quoting policy가 다음 training distribution을 만든다.
REFLEX는 이 반복학습이 안정적으로 수렴할지 판단하기 위해 quote 변화에 대한 volume sensitivity, 목적함수의 curvature, spread 축소에 따른 informed-flow 증가율 세 가지를 결합한 retraining modulus를 제안한다. simulation에서는 사전 추정 안정성과 실제 안정성 차이가 8% 이내였고, dealer 경쟁이 2개일 때 불안정성이 1.74배, 3개일 때 3.16배 증가했다. 저자들의 public-data calibration에서는 crisis regime에서 안정성 여유가 IG·HY 모두 평시 대비 약 4배 이상 축소됐다.
실무 시사점
이 논문이 중요한 이유는 모델 평가의 단위를 바꾼다는 데 있다.
기존에는:
OOS accuracy
→ 좋으면 production 배포
였다면 REFLEX 관점에서는:
OOS accuracy
- “이 모델을 배포했을 때 다음 데이터분포가 얼마나 바뀌는가?”
를 동시에 봐야 한다.
예를 들어 ML이 특정 RFQ 고객에게 계속 공격적인 가격을 주면 그 고객의 flow가 dataset에서 과대표집된다. 재학습 모델은 이것을 “시장 전체의 새로운 패턴”으로 오인하고 더 공격적으로 quote할 수 있다. 이게 feedback loop다.
한국 적용: 고객·브로커별 quote engine을 만든다면 다음 KPI를 추가할 가치가 있다.
ΔFill / ΔQuote
ΔAdverse Mark-out / ΔQuote
Retraining Stability
특히 production model을 매일 자동 retrain하기보다 policy shift가 training population을 얼마나 바꿨는지 확인하는 gate를 두는 것이 좋다.
주의: 아직 8페이지짜리 초기 arXiv 프리프린트이며 핵심 결과 상당 부분이 simulation/calibration 기반이다. 수치보다 메커니즘을 가져오는 것이 적절하다.
데스크 적용 우선순위: ★★★★★