BONDNOTE JOURNAL · 2026.09.09

IMC의 분포형 강화학습 연구 소개

IMC 연구진이 정리한 ICML의 큰 흐름은 foundation-model pretraining 자체보다 adaptation, inference-time computation, evaluation, reliability 쪽으로 무게가 옮겨가고 있다는 것이다.

약 2분RESEARCH NOTE
다룬 자료 · IMC Trading — 현직 연구팀이 ICML에서 무엇을 보고 있는가

이 시각은 금융에 특히 중요하다. trading model은 benchmark 한 번 이기면 끝나는 것이 아니라 regime drift 하에서 계속 calibration과 reliability를 확인해야 하기 때문이다.

IMC가 자세히 리뷰한 논문 중 하나는 Multivariate Distributional Reinforcement Learning Using Sliced Divergences다. 일반 RL이 평균 return을 예측하는 것과 달리 distributional RL은 미래 reward의 전체 분포와 여러 reward dimension 사이 trade-off를 모델링한다.

이 연구는 고차원 분포를 직접 비교하지 않고 여러 1차원 projection으로 나눠 Wasserstein/Cramér 계열 divergence 등을 계산하는 방식을 제시한다. IMC 리뷰는 특히 high-dimensional setting과 outlier robustness를 자세히 다룬다.

이 연구가 소개된 하루의 글 읽기 →

편집 전 브리핑 원문 펼치기

구분: IMC 공식 Research/ML 기술 리뷰
공개: ICML 2026 이후, 2026년 공식 게시
채용공고 아님

IMC는 ICML 2026 서울에 quant researcher와 machine-learning engineer 팀을 직접 파견했고, 회사가 실제 연구에 사용하는 학술 생태계를 따라가기 위해 논문들을 선별해 기술적으로 리뷰했다. IMC 공식 리뷰

확인 가능한 사실 ① — “큰 모델”보다 reliability/adaptation 쪽으로 관심이 이동한다

IMC 연구진이 정리한 ICML의 큰 흐름은 foundation-model pretraining 자체보다 adaptation, inference-time computation, evaluation, reliability 쪽으로 무게가 옮겨가고 있다는 것이다.

이 시각은 금융에 특히 중요하다. trading model은 benchmark 한 번 이기면 끝나는 것이 아니라 regime drift 하에서 계속 calibration과 reliability를 확인해야 하기 때문이다.

확인 가능한 사실 ② — Distributional RL을 구체적으로 주목했다

IMC가 자세히 리뷰한 논문 중 하나는 Multivariate Distributional Reinforcement Learning Using Sliced Divergences다. 일반 RL이 평균 return을 예측하는 것과 달리 distributional RL은 미래 reward의 전체 분포와 여러 reward dimension 사이 trade-off를 모델링한다.

이 연구는 고차원 분포를 직접 비교하지 않고 여러 1차원 projection으로 나눠 Wasserstein/Cramér 계열 divergence 등을 계산하는 방식을 제시한다. IMC 리뷰는 특히 high-dimensional setting과 outlier robustness를 자세히 다룬다.

확인 가능한 사실과 추론의 경계

확인 가능한 사실: IMC 연구진이 이 논문과 방법론을 중요 ICML research로 선정해 기술적으로 분석했다.

확인되지 않은 것: IMC가 이 exact distributional-RL algorithm을 production trading에 사용한다는 증거는 없다.

따라서 이를 IMC의 비밀 실행 알고리즘이라고 해석하면 안 된다.

왜 market making에는 흥미로운가

Execution/market-making reward는 사실 scalar 하나가 아니다.

Agent는 동시에:

  • spread capture
  • inventory risk
  • market impact
  • fill probability
  • tail loss

를 관리해야 한다.

일반적인 reward는:

PnL - λ × Inventory

처럼 모두 합쳐버린다.

하지만 distributional multi-objective RL은:

PnL distribution inventory distribution execution-cost distribution

자체를 모델링할 가능성을 열어준다.

평균 reward가 같아도:

Strategy A: 안정적 +1
Strategy B: 대부분 +3, 가끔 -20

이라면 market maker는 둘을 동일하게 평가하면 안 된다.

한국 시장 복제 아이디어

앞서 HRT 자료에서 만든 PPO execution simulator를 발전시킬 때 reward를 하나로 합치지 말고:

Reward vector

  • execution P&L
  • fill deficit
  • inventory
  • market impact

로 저장한다.

처음부터 distributional RL을 production에 넣을 필요는 없다.

먼저 정책별로:

P(P&L < -X) 95% execution cost inventory tail fill-shortfall distribution

을 비교하는 Distributional Policy Evaluation부터 도입할 수 있다.

이는 평균 P&L이 비슷한 execution policy 중 tail-safe policy를 고르는 risk gate로 바로 활용할 수 있다.

복제 가치: ★★★★☆