BONDNOTE JOURNAL · 2026.08.21

에이전트가 많아지는 시장에 필요한 검증

AI 에이전트가 의사결정에 참여하면 개별 모델뿐 아니라 상호작용도 살펴야 합니다. 시장 균형과 통제 구조, 손실 관리의 관점에서 연구를 읽어봅니다.

약 6분5 RESEARCH NOTES
READING FRAMEWORK / 개념도
연구 질문→모델과 실험→검증과 적용
연구를 읽는 관점을 표현한 개념도이며, 실측 데이터나 성과 차트가 아닙니다.
01 / RESEARCH NOTE

REFLEX가 다루는 시장 균형

다룬 자료 · REFLEX: Reflexive Equilibrium Fixed-point Learning for Endogenous eXchanges

OTC 회사채 dealer가 ML로 bid/ask를 결정할 때 생기는 performative 피드백을 정면으로 다룬 매우 최신 연구다. quote를 타이트하게 하면 거래량은 늘어나지만 informed 자금 흐름와 불리한 정보에 따른 체결 위험도 늘고, dealer는 그렇게 자신이 유인한 체결만으로 모델을 다시 학습한다. 즉 학습 데이터가 외생적으로 주어지는 것이 아니라 내 과거 quoting policy가 다음 training distribution을 만든다.

REFLEX는 이 반복학습이 안정적으로 수렴할지 판단하기 위해 quote 변화에 대한 volume sensitivity, 목적함수의 curvature, spread 축소에 따른 informed-자금 흐름 증가율 세 가지를 결합한 retraining modulus를 제안한다. 모의실험에서는 사전 추정 안정성과 실제 안정성 차이가 8% 이내였고, dealer 경쟁이 2개일 때 불안정성이 1.74배, 3개일 때 3.16배 증가했다. 저자들의 public-data calibration에서는 crisis regime에서 안정성 여유가 IG·HY 모두 평시 대비 약 4배 이상 축소됐다.

02 / RESEARCH NOTE

AI 에이전트의 맥락과 권한을 구분하기

다룬 자료 · Context Is Not Authority: Structured Runtime Governance for Financial Market Agents

이 논문은 금융 AI agent가 정보를 정확하게 이해해도 허가되지 않은 주문·고객 약속·정책 변경을 실행할 수 있다는 별도의 문제를 다룬다. 저자들은 이를 해결하기 위해 SAGE-Fin이라는 authority-handoff 분석 체계를 제시한다. 핵심 아이디어는 LLM이 “무슨 말을 했는가”보다 실제로 어떤 effect를 발생시키려 하는가를 typed object로 변환해, 시장·계좌·정책·대화 상태에 따라 실행권한을 다시 검사하는 것이다.

616개 사례 catalog에서 deterministic specification과 reference implementation이 일치했으며, 일부 response-gate는 실제 디지털자산 플랫폼 production request에도 적용됐다고 저자들은 밝힌다. 다만 해당 production evidence는 보안·기밀 제약 때문에 정량적 성과가 아니라 독립 운영팀의 정성 평가만 공개됐다.

03 / RESEARCH NOTE

장기기억과 최대 손실 연구

다룬 자료 · Drawdown Risk Beyond Brownian Motion: A Monte-Carlo Framework, Non-Gaussian Extensions, and Long Memory

이 연구는 “Sharpe가 X인 전략이면 정상적인 drawdown은 어느 정도인가?”라는 systematic trading의 실무 질문을 다룬다. Gaussian Brownian-motion 가정을 출발점으로 하되 skewness, fat tail, volatility clustering, Sharpe 추정오차와 fractional Brownian motion 기반 장기기억을 차례로 추가한다. 최대낙폭뿐 아니라 최대손실, 마지막 손실시점, 최장 회복기간까지 별도로 계산했는데, 각 위험지표가 비가우시안성에 서로 다르게 반응하므로 하나의 MDD table만으로 리스크를 관리하기 어렵다는 결과다.

특히 persistence가 높은 전략의 큰 drawdown은 단순한 “나쁜 path geometry”보다 square-root-of-time scaling이 깨지면서 분산이 훨씬 빠르게 증가하는 효과에서 상당 부분 나온다고 분석한다. 연구는 재현 가능한 calibration recipe와 lookup table도 제공한다.

04 / RESEARCH NOTE

Point72 Cubist의 AI 신호 연구

다룬 자료 · Point72 / Cubist — Proprietary Data + State-of-the-Art ML → AI-driven Trading Signals

구분: 회사 공식 채용·Systematic Investing 자료 2026년 현재 공개 원문 링크: https://point72.com/cubist/ 관련 공식 ML 역할: Point72 Careers의 Quantitative 연구자 – Machine Learning

Point72의 Cubist는 여러 liquid asset class에서 systematic, computer-driven strategy를 운용하고, 공개 데이터와 정량연구를 투자 thesis로 변환한다고 공식 설명한다. 별도로 Point72의 Internal 초과수익 신호 Capture(IAC) 조직은 현재 공식 ML 연구자 공고에서 proprietary 데이터셋, 최신 기법 machine learning, 대규모 computing power를 이용해 AI-driven trading 신호을 개발한다고 명시하고 있다.

Cubist 내 macro quantitative role도 초과수익 신호 연구, 포트폴리오 구성·optimization, statistical/fundamental/data-driven 신호, cross-sectional·time-series predictive 신호 결합을 요구한다. 즉 공개자료에서 신호 generation과 포트폴리오 구성을 별도 층으로 둔다는 점도 확인할 수 있다.

05 / RESEARCH NOTE

Jane Street의 머신러닝 채용 자료가 보여주는 방향

다룬 자료 · Jane Street — 2027 ML 채용자료에서 드러나는 Fair Value → Algorithm → Simulated Market → Production ML 구조

구분: 회사 공식 2027 ML/Quant 프로그램 자료 2026년 8월 현재 모집 페이지 공개 원문 링크: https://www.janestreet.com/join-jane-street/position/8611307002/ Quant Trading 자료: https://www.janestreet.com/join-jane-street/position/8617344002/

Jane Street 자체는 이전 브리핑에서 소개했지만, 오늘은 새로 공개된 2027 internship 자료에서 보다 구체적인 production architecture가 확인돼 업데이트 항목으로 포함했다.

새 Machine Learning Engineer internship 설명에 따르면 Jane Street의 GPU cluster는 H100·H200·B200 계열 GPU 수천 개로 구성돼 있으며, 금융시장을 새로운 ML 아이디어를 빠르게 피드백받을 수 있는 실험환경으로 설명한다. ML 연구 인턴에게도 petabyte급 데이터와 수십만 CPU core, 수천 GPU에 대한 접근을 제공하며, 실제 systematic trading과 연관된 문제를 다룬다고 명시한다.

그리고 Jane Street식 접근에서 실무적으로 가장 좋은 것은 실제 시장구조를 모사한 simulator다. 모델의 방향예측 성능보다 simulator에서 slippage·fill·queue·inventory까지 포함한 net P&L로 평가하는 게 더 의미 있다.

읽고 나서 남는 질문

이 자료들을 실제 운용에 연결하려면 사용한 시장과 기간, 비교 대상, 거래 비용을 먼저 확인해야 합니다. 아래 원문 링크에서 연구의 범위를 살펴보고, 국내 시장 적용 아이디어는 별도의 검증 과제로 읽어보세요.

편집 전 브리핑 원문 펼치기

채권시장 AI·Quant Intelligence 브리핑 — 2026년 8월 21일

전일의 뉴스 NLP Treasury alpha, BIS BISTRO, MAS AI credit concentration, Two Sigma, XTX/XTY Labs는 제외했다. 오늘은 새로 나온 자료 가운데 ① ML market-maker가 자기 데이터분포를 바꾸면서 발생하는 안정성 문제, ② 금융 AI agent의 주문·정책 실행 권한 통제, ③ 비가우시안·장기기억을 반영한 systematic drawdown 관리를 선정했다. 퀀트사 쪽은 아직 깊게 다루지 않은 Point72/Cubist의 AI-driven alpha capture와, Jane Street에서 새로 확인되는 2027 ML 인프라·fair-value→algorithmic strategy 교육 구조를 본다.

오늘은 특히 1번 REFLEX가 중요하다. 지금까지 브리핑에서 반복해서 본 fair value → quote → fill → retraining 구조에는 숨은 문제가 하나 있는데, 모델이 잘 작동할수록 그 모델이 수집하는 다음 학습 데이터 자체가 달라진다는 것이다.


1. REFLEX: Reflexive Equilibrium Fixed-point Learning for Endogenous eXchanges

구분: 최신 논문 · arXiv / ML·OTC 회사채 Market Making
발표일: 2026년 8월 17일
원문 링크: https://arxiv.org/abs/2608.16155

핵심 요약

OTC 회사채 dealer가 ML로 bid/ask를 결정할 때 생기는 performative feedback을 정면으로 다룬 매우 최신 연구다. quote를 타이트하게 하면 거래량은 늘어나지만 informed flow와 adverse selection도 늘고, dealer는 그렇게 자신이 유인한 체결만으로 모델을 다시 학습한다. 즉 학습 데이터가 외생적으로 주어지는 것이 아니라 내 과거 quoting policy가 다음 training distribution을 만든다.

REFLEX는 이 반복학습이 안정적으로 수렴할지 판단하기 위해 quote 변화에 대한 volume sensitivity, 목적함수의 curvature, spread 축소에 따른 informed-flow 증가율 세 가지를 결합한 retraining modulus를 제안한다. simulation에서는 사전 추정 안정성과 실제 안정성 차이가 8% 이내였고, dealer 경쟁이 2개일 때 불안정성이 1.74배, 3개일 때 3.16배 증가했다. 저자들의 public-data calibration에서는 crisis regime에서 안정성 여유가 IG·HY 모두 평시 대비 약 4배 이상 축소됐다.

실무 시사점

이 논문이 중요한 이유는 모델 평가의 단위를 바꾼다는 데 있다.

기존에는:

OOS accuracy → 좋으면 production 배포

였다면 REFLEX 관점에서는:

OOS accuracy

  • “이 모델을 배포했을 때 다음 데이터분포가 얼마나 바뀌는가?”

를 동시에 봐야 한다.

예를 들어 ML이 특정 RFQ 고객에게 계속 공격적인 가격을 주면 그 고객의 flow가 dataset에서 과대표집된다. 재학습 모델은 이것을 “시장 전체의 새로운 패턴”으로 오인하고 더 공격적으로 quote할 수 있다. 이게 feedback loop다.

한국 적용: 고객·브로커별 quote engine을 만든다면 다음 KPI를 추가할 가치가 있다.

ΔFill / ΔQuote
ΔAdverse Mark-out / ΔQuote
Retraining Stability

특히 production model을 매일 자동 retrain하기보다 policy shift가 training population을 얼마나 바꿨는지 확인하는 gate를 두는 것이 좋다.

주의: 아직 8페이지짜리 초기 arXiv 프리프린트이며 핵심 결과 상당 부분이 simulation/calibration 기반이다. 수치보다 메커니즘을 가져오는 것이 적절하다.

데스크 적용 우선순위: ★★★★★


2. Context Is Not Authority: Structured Runtime Governance for Financial Market Agents

구분: 논문 · arXiv / Agentic AI·Trading Governance
최초 공개: 2026년 8월 10일
최신 개정: 2026년 8월 17일
원문 링크: https://arxiv.org/abs/2608.09025

핵심 요약

이 논문은 금융 AI agent가 정보를 정확하게 이해해도 허가되지 않은 주문·고객 약속·정책 변경을 실행할 수 있다는 별도의 문제를 다룬다. 저자들은 이를 해결하기 위해 SAGE-Fin이라는 authority-handoff framework를 제시한다. 핵심 아이디어는 LLM이 “무슨 말을 했는가”보다 실제로 어떤 effect를 발생시키려 하는가를 typed object로 변환해, 시장·계좌·정책·대화 상태에 따라 실행권한을 다시 검사하는 것이다.

616개 사례 catalog에서 deterministic specification과 reference implementation이 일치했으며, 일부 response-gate는 실제 디지털자산 플랫폼 production request에도 적용됐다고 저자들은 밝힌다. 다만 해당 production evidence는 보안·기밀 제약 때문에 정량적 성과가 아니라 독립 운영팀의 정성 평가만 공개됐다.

실무 시사점

이건 LLM trading agent를 만든다면 매우 현실적인 설계원칙이다.

예를 들어 agent가

“10선 300계약 매도하면 좋겠습니다.”

라고 판단했다고 해서 실제 OMS로 바로 전송해서는 안 된다.

구조를 다음처럼 나누는 게 적절하다.

LLM / Agent → Proposed Action

Deterministic Authority Layer → 종목 허용 여부
→ 주문수량
→ DV01
→ 손실한도
→ 시장상태
→ 승인자
→ 데이터 freshness

Execution Adapter → 실제 주문

그리고 시장상태가 바뀌면 기존 승인을 재사용하지 않는 것이 중요하다. 30초 전에 승인된 주문이라도 금통위 헤드라인이나 갑작스러운 체결로 포지션이 바뀌면 authority를 재검증해야 한다는 것이다.

한국 적용: AI agent에는 DB·백테스트·분석 권한은 넓게 줄 수 있어도 OMS write 권한은 별도 deterministic gateway를 통해서만 주는 구조를 추천한다.

데스크 적용 우선순위: ★★★★★


3. Drawdown Risk Beyond Brownian Motion: A Monte-Carlo Framework, Non-Gaussian Extensions, and Long Memory

구분: 논문 · arXiv / Quant Risk Management
발표일: 2026년 7월 31일
원문 링크: https://arxiv.org/abs/2608.00127

핵심 요약

이 연구는 “Sharpe가 X인 전략이면 정상적인 drawdown은 어느 정도인가?”라는 systematic trading의 실무 질문을 다룬다. Gaussian Brownian-motion 가정을 출발점으로 하되 skewness, fat tail, volatility clustering, Sharpe 추정오차와 fractional Brownian motion 기반 장기기억을 차례로 추가한다. 최대낙폭뿐 아니라 최대손실, 마지막 손실시점, 최장 회복기간까지 별도로 계산했는데, 각 위험지표가 비가우시안성에 서로 다르게 반응하므로 하나의 MDD table만으로 리스크를 관리하기 어렵다는 결과다.

특히 persistence가 높은 전략의 큰 drawdown은 단순한 “나쁜 path geometry”보다 square-root-of-time scaling이 깨지면서 분산이 훨씬 빠르게 증가하는 효과에서 상당 부분 나온다고 분석한다. 연구는 재현 가능한 calibration recipe와 lookup table도 제공한다.

실무 시사점

ML 전략은 보통 OOS Sharpe를 보고

“Sharpe 1.5니까 괜찮다.”

고 생각하기 쉽다.

하지만 두 전략이 Sharpe 1.5라도:

  • 하나는 독립적인 작은 손익이 반복되고
  • 다른 하나는 autocorrelation과 volatility clustering이 강하면

예상 최장 drawdown과 회복기간은 크게 다를 수 있다.

채권 상대가치 전략에서는 특히 중요하다. 10/30 mean reversion이나 basis trade는 작은 이익이 오래 쌓이다 regime break 때 손실이 연속적으로 발생하는 구조일 수 있기 때문이다.

한국 적용: 전략마다 Sharpe뿐 아니라 최소한

MDD distribution
Expected recovery time
Loss clustering
PnL autocorrelation

을 함께 scorecard에 넣는 것이 좋다.

AI 전략의 risk budget 역시 최근 volatility만 annualize해서 정하기보다 long-memory-adjusted risk를 같이 보는 것이 적절하다.

데스크 적용 우선순위: ★★★★☆


Quant Firm Intelligence

4. Point72 / Cubist — Proprietary Data + State-of-the-Art ML → AI-driven Trading Signals

구분: 회사 공식 채용·Systematic Investing 자료
2026년 현재 공개
원문 링크: https://point72.com/cubist/
관련 공식 ML 역할: Point72 Careers의 Quantitative Researcher – Machine Learning

공개적으로 확인된 사실

Point72의 Cubist는 여러 liquid asset class에서 systematic, computer-driven strategy를 운용하고, 공개 데이터와 정량연구를 투자 thesis로 변환한다고 공식 설명한다. 별도로 Point72의 Internal Alpha Capture(IAC) 조직은 현재 공식 ML 연구자 공고에서 proprietary dataset, state-of-the-art machine learning, 대규모 computing power를 이용해 AI-driven trading signal을 개발한다고 명시하고 있다.

Cubist 내 macro quantitative role도 alpha research, portfolio construction·optimization, statistical/fundamental/data-driven signal, cross-sectional·time-series predictive signal 결합을 요구한다. 즉 공개자료에서 signal generation과 portfolio construction을 별도 층으로 둔다는 점도 확인할 수 있다.

수익 메커니즘 — 공개 사실 기반 추론

특정 모델이나 전략은 공개돼 있지 않다.

다만 공개자료를 합치면 수익 구조를 다음처럼 해석할 수 있다.

Proprietary / Public Data → ML Alpha Signals → cross-sectional + time-series forecast → Portfolio Construction → systematic deployment

여기서 중요한 것은 data moat다. 다른 회사도 LightGBM이나 Transformer를 쓸 수 있지만 동일한 proprietary data를 가질 수는 없다.

따라서 AI 경쟁력은

Model edge 보다

Data edge × Model edge × Portfolio translation

의 곱에 가깝다.

한국 채권시장에 복제한다면

우리의 proprietary data는 멀리서 찾을 필요가 없다.

가장 가치가 큰 후보는:

  • 자체 주문·취소 이력
  • 브로커별 quote response
  • 실제 체결 실패
  • 딜러별 포지션 변화
  • 입찰 직전 internal flow
  • hedge sequence와 실제 slippage

다.

공개 K-Bond 데이터만 학습하는 경쟁사와 달리 우리 행동과 결과가 포함된 데이터는 시간이 지나며 차별화될 수 있다.

특히 Cubist식으로 여러 모델을 독립적으로 만들고 마지막에 portfolio optimizer가 DV01·상관·비용을 반영해 결합하는 구조가 유용하다.

복제 난이도: ★★★★☆
복제 가치: ★★★★★


5. Jane Street — 2027 ML 채용자료에서 드러나는 Fair Value → Algorithm → Simulated Market → Production ML 구조

구분: 회사 공식 2027 ML/Quant 프로그램 자료
2026년 8월 현재 모집 페이지 공개
원문 링크: https://www.janestreet.com/join-jane-street/position/8611307002/
Quant Trading 자료: https://www.janestreet.com/join-jane-street/position/8617344002/

업데이트 사항

Jane Street 자체는 이전 브리핑에서 소개했지만, 오늘은 새로 공개된 2027 internship 자료에서 보다 구체적인 production architecture가 확인돼 업데이트 항목으로 포함했다.

공개적으로 확인된 사실

새 Machine Learning Engineer internship 설명에 따르면 Jane Street의 GPU cluster는 H100·H200·B200 계열 GPU 수천 개로 구성돼 있으며, 금융시장을 새로운 ML 아이디어를 빠르게 피드백받을 수 있는 실험환경으로 설명한다. ML 연구 인턴에게도 petabyte급 데이터와 수십만 CPU core, 수천 GPU에 대한 접근을 제공하며, 실제 systematic trading과 연관된 문제를 다룬다고 명시한다.

더 흥미로운 것은 Quantitative Trader 프로그램이다. Jane Street는 algorithmic trading 교육을 시장 데이터에서 tradable fair value를 만들고 → Python으로 전략을 구현한 뒤 → 서로 다른 microstructure를 가진 simulated market에 직접 연결해 최적화하는 end-to-end 과정으로 설명한다. 또한 large real/simulated dataset에 ML을 적용해 모델과 prediction을 만드는 별도 트랙을 운영한다.

수익 메커니즘 — 추론

이 공개자료에서 중요한 구조는 매우 선명하다.

Market Data → Tradable Fair Value → Trading Algorithm → Market-Structure-Specific Optimization → Execution

이고, ML은 그 fair value와 prediction을 개선한다.

특히 “fair value가 맞는가?”와 “그 시장에서 어떻게 거래할 것인가?”를 분리하고 있다는 점이 중요하다.

똑같은 fair-value signal이라도:

  • continuous order book
  • RFQ
  • voice/broker
  • auction

에서는 최적 execution policy가 달라진다.

한국 채권시장에 복제한다면

같은 모델을 바로 K-Bond와 국채선물에 적용하면 안 된다.

예를 들어 동일한 +0.8bp alpha가 있어도:

국채선물 → passive/aggressive order-book policy

현물 K-Bond → 브로커/호가·size/체결 가능성 policy

입찰 → concession·응찰·배정 policy

로 execution layer를 따로 만들어야 한다.

그리고 Jane Street식 접근에서 실무적으로 가장 좋은 것은 실제 시장구조를 모사한 simulator다. 모델의 방향예측 성능보다 simulator에서 slippage·fill·queue·inventory까지 포함한 net P&L로 평가하는 게 더 의미 있다.

복제 난이도: ★★★★★
복제 가치: ★★★★★


오늘의 데스크 결론

오늘 자료의 가장 중요한 변화는 AI 모델이 시장과 독립적인 예측기가 아니라는 점이다.

REFLEX는

Model → Quote → Market Response → New Training Data → Model

이라는 폐루프를 보여준다. 모델이 시장에서 성공할수록 데이터분포가 바뀌고, 잘못 설계하면 자동 retraining이 오히려 자기 자신을 불안정하게 만들 수 있다.

SAGE-Fin은 그 다음 문제를 다룬다. 아무리 좋은 agent라도 판단 권한과 실행 권한을 분리해야 한다.

그리고 Point72/Cubist와 Jane Street의 공개자료를 보면 상위 퀀트는 결국

Unique Data → Multiple Predictions → Fair Value → Portfolio/Risk → Market-specific Execution → Feedback → Retraining

전체 시스템을 산업화하고 있다.

그래서 오늘 기준 채권 AI 시스템에 새로 추가하고 싶은 두 개의 KPI는 **Policy-induced data shift와 Retraining stability**다. 지금까지 많이 본 IC, Sharpe, fill, mark-out에 이 둘까지 붙어야 production ML의 안전성을 제대로 볼 수 있다.

오늘 한 편만 읽는다면: REFLEX
AI agent 실행구조를 만든다면: Context Is Not Authority
글로벌 퀀트 시스템을 벤치마킹한다면: 오늘 업데이트된 Jane Street의 Fair Value → Simulated Market → Market-Specific Algorithm 구조를 가장 추천한다.

오늘의 연구 목차01 · REFLEX가 다루는 시장 균형02 · AI 에이전트의 맥락과 권한을 구분하기03 · 장기기억과 최대 손실 연구04 · Point72 Cubist의 AI 신호 연구05 · Jane Street의 머신러닝 채용 자료가 보여주는 방향읽고 나서 남는 질문