BONDNOTE JOURNAL · 2026.09.07

HRT의 기억을 활용한 주문 실행 학습

HRT AI Labs 프로젝트의 목적은 price-수익률 예측 stream을 실제 trading decision으로 합성하는 RL policy를 학습하는 것이다. 장기 신호이 목표 포지션을 결정하고, 단기 return 예측를 이용해 그 목표 포지션으로 언제 얼마나 거래할지를 최적화한다. HRT 공식 기술글

약 2분RESEARCH NOTE
다룬 자료 · HRT AI Labs — SAC가 실패하고 Memory-Augmented PPO까지 간 실제 RL Execution 연구

예를 들어 long target이 있을 때 short-term 신호이 가격하락을 예상하면 즉시 매수하지 않고 기다릴 수 있고, 상승을 예상하면 더 빨리 거래하는 식이다.

HRT는 historical market data를 이용한 market simulator를 먼저 구축해 RL agent가 다양한 trading policy를 대규모로 실험하도록 했다. 그리고 RL 전에 반드시 hand-crafted rule-based policy를 baseline으로 만들었다.

시간이 너무 부족하면 remaining position을 빠르게 체결하며, volatility가 높은 자산일수록 미래에 좋은 execution opportunity가 올 수 있으므로 더 오래 기다릴 수 있도록 설계한다.

이 연구가 소개된 하루의 글 읽기 →

편집 전 브리핑 원문 펼치기

구분: Hudson River Trading 공식 Tech Blog / HRT AI Labs 실제 프로젝트
발표일: 2026년 9월 4일
채용공고 아님 — 실제 프로젝트 작성자가 research process와 실험결과를 공개

오늘 전체 5개 중 가장 추천한다.

확인 가능한 사실 ① — 문제를 어떻게 정의했나

HRT AI Labs 프로젝트의 목적은 price-return prediction stream을 실제 trading decision으로 합성하는 RL policy를 학습하는 것이다. 장기 signal이 목표 포지션을 결정하고, 단기 return forecast를 이용해 그 목표 포지션으로 언제 얼마나 거래할지를 최적화한다. HRT 공식 기술글

예를 들어 long target이 있을 때 short-term signal이 가격하락을 예상하면 즉시 매수하지 않고 기다릴 수 있고, 상승을 예상하면 더 빨리 거래하는 식이다.

이 구분은 굉장히 중요하다.

Long-term alpha → Where do I want my position?

Short-term alpha → When do I trade there?

즉 Alpha Model과 Execution Policy를 분리한다.


확인 가능한 사실 ② — simulator부터 만들었다

HRT는 historical market data를 이용한 market simulator를 먼저 구축해 RL agent가 다양한 trading policy를 대규모로 실험하도록 했다. 그리고 RL 전에 반드시 hand-crafted rule-based policy를 baseline으로 만들었다.

baseline은 대략 다음 식이다.

시장조건이 좋으면:

Remaining Position / Remaining Time

만큼 점진적으로 거래한다.

시간이 너무 부족하면 remaining position을 빠르게 체결하며, volatility가 높은 자산일수록 미래에 좋은 execution opportunity가 올 수 있으므로 더 오래 기다릴 수 있도록 설계한다.

이게 좋은 quant research 방식이다.

딥러닝부터 만들지 않는다. 인간이 이해할 수 있는 baseline부터 만든다.


확인 가능한 사실 ③ — SAC가 생각보다 안 좋았다

HRT는 먼저 off-policy RL인 **Soft Actor-Critic(SAC)**을 실험했다. replay buffer로 과거 experience를 재활용하기 때문에 sample efficiency가 좋다는 장점이 있다.

하지만 실제 실험에서는 state가 조금만 변해도 action이 크게 바뀌는 spiky / non-smooth decision boundary를 학습했다. HRT는 이를 noisy financial simulation의 idiosyncratic pattern을 overfit한 가능성으로 해석했다.

random state initialization도 시도했지만 핵심 문제를 해결하지 못했다.

이건 매우 중요한 실전 교훈이다.

In finance, sample efficiency보다 policy stability가 더 중요할 수 있다.


확인 가능한 사실 ④ — PPO가 SAC를 이겼다

그래서 HRT는 on-policy 방식인 **Proximal Policy Optimization(PPO)**으로 전환했다. PPO는 정책 업데이트마다 fresh sample을 크게 다시 수집하기 때문에 sample efficiency는 떨어지지만, HRT 실험에서는 training stability와 generalization이 좋아졌다.

HRT는 자신의 문제에서 PPO의 안정성이 SAC의 data efficiency보다 가치가 컸다고 명시한다.

확인 가능한 사실 ⑤ — Memory까지 붙였다

표준 PPO는 현재 observation만 보고 행동하기 때문에 partially observable market에는 한계가 있었다. 그래서 HRT는 Memory-Augmented PPO를 만들었다.

최종 OOS 실험에서는:

Human baseline < SAC < PPO < Memory-Augmented PPO

순으로 P&L이 개선됐다고 보고한다. 다만 RL agent가 목표 포지션을 항상 완전히 채우지는 못했고, 특히 PPO가 약간 under-fill되는 문제도 남았다.

공개자료 기반 추론

이 프로젝트가 HRT 전체 production trading stack에 그대로 사용된다고 단정할 수는 없다. HRT AI Labs 공개 프로젝트에서 확인되는 연구결과다.

하지만 연구방법론은 매우 실전적이다.

Forecast → Simulator → Simple baseline
→ SAC
→ failure analysis
→ PPO
→ Memory
→ OOS P&L

즉:

모델 선택 → 결과

가 아니라

실패원인 분석 → architecture 변경

이 핵심이다.

한국 채권시장 복제 아이디어

10선 execution RL 문제를 거의 그대로 만들 수 있다.

Long-term signal → 목표포지션 +500계약

Short-term model → 향후 5/30초 return prediction

State

  • remaining position
  • remaining time
  • short-term alpha
  • order-book imbalance
  • volatility
  • spread
  • inventory

Action → 이번 step에서 거래할 계약 수

Reward → execution price improvement
− market impact
− incomplete-fill penalty

그리고 반드시 비교한다.

  1. TWAP
  2. hand-crafted alpha-aware execution
  3. SAC
  4. PPO
  5. recurrent / memory PPO

특히 HRT 결과를 보면 국내 시장에서도 RL을 쓴다는 것보다 stable decision surface를 만드는 것이 더 중요한 연구목표가 되어야 한다.

복제 가치: ★★★★★+