BONDNOTE JOURNAL · 2026.09.17

시장충격을 넣자 강화학습의 순위가 바뀌었다

공개 강화학습 실험은 거래비용을 단순화하기 쉽다. 하지만 이 연구는 Almgren–Chriss 구조와 제곱근 시장충격을 시뮬레이터에 넣자 알고리즘의 절대 성과뿐 아니라 상대 순위와 회전율까지 달라졌다고 보고한다. 모델이 어떤 행동을 배우는지는 보상함수 못지않게 체결 환경의 모양에 좌우된다는 뜻이다.

약 2분RESEARCH NOTE
다룬 자료 · Realistic Market Impact Modeling for Reinforcement Learning Trading Environments

논문이 보고한 비용 감소 수치는 공개 시뮬레이션 안의 결과다. 실제 시장 성과로 옮겨 말할 수는 없지만, 구현손실·부분체결·충격의 감쇠를 거래별로 기록해야 한다는 설계 원칙은 바로 가져올 수 있다. 국채선물 모델을 비교할 때도 모든 정책이 동일한 주문장 재생 환경과 비용 가정을 통과해야 한다.

국내 적용에서는 장중 유동성 구간과 주문 크기별 충격을 분리하고, TWAP·수동 집행·학습 정책을 같은 기준으로 평가하는 것이 첫 단계다. 평균 수익보다 비용 후 구현손실과 꼬리손실이 운영 여부를 결정해야 한다.

이 연구가 소개된 하루의 글 읽기 →

편집 전 브리핑 원문 펼치기

구분: 연구 논문 · 강화학습 실행 · 시장충격 모형
발표일: 2026년 3월 30일
선정: 최신성보다 실행 시뮬레이션의 기술적 가치 때문에 선정

핵심 요약

이 연구는 많은 공개 강화학습 백테스트가 거래비용을 고정값이나 사실상 0으로 놓아, 현실에서 유지되기 어려운 고회전 정책을 학습시킨다는 문제에서 출발한다. 저자들은 Almgren–Chriss 구조와 제곱근 시장충격 법칙을 반영한 세 가지 Gymnasium 환경을 만들고, 영구적 충격의 감쇠와 거래별 로그를 포함했다. arXiv 원문

A2C·PPO·DDPG·SAC·TD3를 NASDAQ-100 환경에서 비교한 결과, 비용 모형을 바꾸자 절대 성과뿐 아니라 알고리즘의 상대 순위와 회전율도 달라졌다. 논문은 특정 설정에서 일일 비용이 20만달러에서 8천달러로, 회전율이 19%에서 1%로 낮아진 사례를 보고하지만 이는 공개 시뮬레이션 결과이므로 실제 시장 성과로 일반화하면 안 된다. 논문의 실험 요약

실무 시사점

RL 실행 모델의 핵심 라벨은 단순 다음 가격이 아니라 구현손실, 체결률, 재고위험, 영구·일시적 시장충격을 함께 반영한 보상함수다. 비용 모형이 알고리즘 순위까지 바꾼다는 결과는 백테스트 엔진이 모델보다 먼저 검증돼야 한다는 뜻이다.

한국 시장 복제 아이디어

국채선물과 현물의 주문장 재생 환경에 주문 크기별 충격, 부분체결, 호가잔량 회복속도, 장중 유동성 구간을 넣는다. TWAP·수동 집행·PPO 정책을 같은 체결 시뮬레이터에서 비교하고, 평균 P&L보다 비용 후 구현손실과 꼬리손실을 운영 기준으로 삼는다.