BONDNOTE JOURNAL · 2026.08.28

서로 다른 에이전트를 학습시키는 강화학습

이 연구는 투자자가 시장의 구조를 모르는 상태에서 neural-network 기반 reinforcement learning으로 자신의 수요함수를 직접 학습하면 rational-expectations equilibrium에 수렴할 수 있는가를 분석한다. 개별 RL investor가 독립적으로 학습할 때는 equilibrium demand를 회복할 수 있지만, 여러 RL agent가 endogenous price를 통해 연결되면 각자 안정적으로 작동하던 학습규칙도 전체 시스템에서는 불안정해질 수 있다. SSRN 원문

약 2분RESEARCH NOTE
다룬 자료 · Reinforcement Learning and Heterogeneity in Nonlinear Financial Markets

저자 Byung Hwa Lim의 공식 연구 페이지와 SKKU 연구랩 페이지는 해당 논문을 Management Science R&R 단계로 표기하고 있어 단순 미검증 아이디어보다는 한 단계 높은 신뢰도를 가진 working paper로 볼 수 있다. 저자 연구 페이지

이 연구가 소개된 하루의 글 읽기 →

편집 전 브리핑 원문 펼치기

구분: 최신 연구논문 · SSRN / 현재 Management Science Reject & Resubmit
발표일: 2026년 8월 20일
작성일: 2026년 8월 19일

핵심 요약

이 연구는 투자자가 시장의 구조를 모르는 상태에서 neural-network 기반 reinforcement learning으로 자신의 수요함수를 직접 학습하면 rational-expectations equilibrium에 수렴할 수 있는가를 분석한다. 개별 RL investor가 독립적으로 학습할 때는 equilibrium demand를 회복할 수 있지만, 여러 RL agent가 endogenous price를 통해 연결되면 각자 안정적으로 작동하던 학습규칙도 전체 시스템에서는 불안정해질 수 있다. SSRN 원문

저자 Byung Hwa Lim의 공식 연구 페이지와 SKKU 연구랩 페이지는 해당 논문을 Management Science R&R 단계로 표기하고 있어 단순 미검증 아이디어보다는 한 단계 높은 신뢰도를 가진 working paper로 볼 수 있다. 저자 연구 페이지

시장미시구조·리스크관리 시사점

이 논문의 핵심은 “내 모델이 OOS에서 잘 작동한다”와 “여러 모델이 함께 시장에 들어갔을 때 안정적이다”는 전혀 다른 문제라는 점이다.

예를 들어 3개 증권사가 비슷한 RL 또는 ML execution agent를 쓰고 모두

유동성 감소 → 포지션 축소

를 학습한다면, 각 agent의 개별 risk logic은 합리적이어도 동시에 매도하면서 liquidity spiral을 만들 수 있다.

따라서 production AI에는 다음을 별도로 봐야 한다.

single-agent stability
multi-agent interaction risk
action correlation
feedback amplification

한국 시장 복제 아이디어

국채선물·회사채 RFQ simulator에서 우리 모델 하나만 돌리지 말고 경쟁 dealer/agent를 여러 개 넣은 multi-agent simulation을 만들어야 한다. 특히 금통위·입찰·유동성 스트레스 상황에서 여러 agent가 동시에 inventory를 줄일 때 spread와 slippage가 어떻게 폭발하는지 테스트할 가치가 크다.

데스크 적용 우선순위: ★★★★★