이 시각은 금융에 특히 중요하다. trading model은 benchmark 한 번 이기면 끝나는 것이 아니라 regime drift 하에서 계속 calibration과 reliability를 확인해야 하기 때문이다.
IMC가 자세히 리뷰한 논문 중 하나는 Multivariate Distributional Reinforcement Learning Using Sliced Divergences다. 일반 RL이 평균 return을 예측하는 것과 달리 distributional RL은 미래 reward의 전체 분포와 여러 reward dimension 사이 trade-off를 모델링한다.
이 연구는 고차원 분포를 직접 비교하지 않고 여러 1차원 projection으로 나눠 Wasserstein/Cramér 계열 divergence 등을 계산하는 방식을 제시한다. IMC 리뷰는 특히 high-dimensional setting과 outlier robustness를 자세히 다룬다.
편집 전 브리핑 원문 펼치기
구분: IMC 공식 Research/ML 기술 리뷰
공개: ICML 2026 이후, 2026년 공식 게시
채용공고 아님
IMC는 ICML 2026 서울에 quant researcher와 machine-learning engineer 팀을 직접 파견했고, 회사가 실제 연구에 사용하는 학술 생태계를 따라가기 위해 논문들을 선별해 기술적으로 리뷰했다. IMC 공식 리뷰
확인 가능한 사실 ① — “큰 모델”보다 reliability/adaptation 쪽으로 관심이 이동한다
IMC 연구진이 정리한 ICML의 큰 흐름은 foundation-model pretraining 자체보다 adaptation, inference-time computation, evaluation, reliability 쪽으로 무게가 옮겨가고 있다는 것이다.
이 시각은 금융에 특히 중요하다. trading model은 benchmark 한 번 이기면 끝나는 것이 아니라 regime drift 하에서 계속 calibration과 reliability를 확인해야 하기 때문이다.
확인 가능한 사실 ② — Distributional RL을 구체적으로 주목했다
IMC가 자세히 리뷰한 논문 중 하나는 Multivariate Distributional Reinforcement Learning Using Sliced Divergences다. 일반 RL이 평균 return을 예측하는 것과 달리 distributional RL은 미래 reward의 전체 분포와 여러 reward dimension 사이 trade-off를 모델링한다.
이 연구는 고차원 분포를 직접 비교하지 않고 여러 1차원 projection으로 나눠 Wasserstein/Cramér 계열 divergence 등을 계산하는 방식을 제시한다. IMC 리뷰는 특히 high-dimensional setting과 outlier robustness를 자세히 다룬다.
확인 가능한 사실과 추론의 경계
확인 가능한 사실: IMC 연구진이 이 논문과 방법론을 중요 ICML research로 선정해 기술적으로 분석했다.
확인되지 않은 것: IMC가 이 exact distributional-RL algorithm을 production trading에 사용한다는 증거는 없다.
따라서 이를 IMC의 비밀 실행 알고리즘이라고 해석하면 안 된다.
왜 market making에는 흥미로운가
Execution/market-making reward는 사실 scalar 하나가 아니다.
Agent는 동시에:
- spread capture
- inventory risk
- market impact
- fill probability
- tail loss
를 관리해야 한다.
일반적인 reward는:
PnL - λ × Inventory
처럼 모두 합쳐버린다.
하지만 distributional multi-objective RL은:
PnL distribution inventory distribution execution-cost distribution
자체를 모델링할 가능성을 열어준다.
평균 reward가 같아도:
Strategy A: 안정적 +1
Strategy B: 대부분 +3, 가끔 -20
이라면 market maker는 둘을 동일하게 평가하면 안 된다.
한국 시장 복제 아이디어
앞서 HRT 자료에서 만든 PPO execution simulator를 발전시킬 때 reward를 하나로 합치지 말고:
Reward vector
- execution P&L
- fill deficit
- inventory
- market impact
로 저장한다.
처음부터 distributional RL을 production에 넣을 필요는 없다.
먼저 정책별로:
P(P&L < -X)
95% execution cost
inventory tail
fill-shortfall distribution
을 비교하는 Distributional Policy Evaluation부터 도입할 수 있다.
이는 평균 P&L이 비슷한 execution policy 중 tail-safe policy를 고르는 risk gate로 바로 활용할 수 있다.
복제 가치: ★★★★☆