BONDNOTE JOURNAL · 2026.09.02

거래 AI를 평가할 때는 실행 결과를 함께 봐야 한다

주문을 내는 모델은 예측 모델과 다른 제약을 만납니다. 불리한 체결 시점과 시장충격을 고려하는 연구에, 연구 인프라의 역할을 더해 살펴봅니다.

약 6분5 RESEARCH NOTES
READING FRAMEWORK / 개념도
시장 데이터→수익률 예측→검증과 적용
연구를 읽는 관점을 표현한 개념도이며, 실측 데이터나 성과 차트가 아닙니다.
01 / RESEARCH NOTE

RetailAgent와 불리한 거래 시점 문제

다룬 자료 · RetailAgent: Structured Adverse Timing in Self-Conditioned Multimodal LLM Trading Agents

RetailAgent는 LLM에게 익명화된 intraday 가격 history와 제한된 state를 보여주고 매 시점마다 long 또는 flat을 반복적으로 결정하게 만든 실험이다. 연구진은 단순 수익률이 아니라 long exposure 비중을 통제한 뒤 같은 종목의 long 구간과 flat 구간 이후 수익을 비교했는데, 여러 model family·horizon·state에서 지속적인 negative timing이 나타났다고 보고한다. arXiv 원문

더 중요한 결과는 LLM이 이전 판단을 스스로 memory로 작성해 다음 decision에 다시 넣으면 policy persistence가 더 강해지고 adverse timing도 더 심해졌다는 것이다. 저장된 action sequence를 shuffle하면 효과가 크게 약해져, 단순히 종목 자체의 나쁜 성과가 아니라 agent의 반복 행동과 미래 수익 간 정렬이 문제였음을 시사한다.

02 / RESEARCH NOTE

여러 수준의 의사결정을 다루는 시장조성 강화학습

다룬 자료 · Multi-Level Market Making with Reinforcement Learning

이 연구는 market maker가 best bid/ask 한 가격에 quote하는 문제가 아니라, 여러 price level에 서로 다른 size의 limit/market order를 동시에 배분하는 문제를 RL로 푼다. 행동공간을 multivariate logistic-normal distribution으로 모델링하고, variable-length order set을 Deep Sets encoder로 fixed-dimensional representation으로 압축한다. arXiv 원문

Agent의 목적은 trading revenue를 높이면서 inventory를 관리하는 것이며, 연구진은 noise 트레이더뿐 아니라 volume imbalance에 반응하는 tactical 트레이더와 strategic 트레이더가 존재하는 서로 다른 simulated market에서 성능을 검증한다. potential-based reward shaping을 사용해 최적정책 자체를 바꾸지 않으면서 학습속도를 높인다.

03 / RESEARCH NOTE

수동 주문의 시장충격과 최적 실행

다룬 자료 · Optimal Execution with Passive Market Impact

이 논문은 passive limit order를 어디에 놓을지 결정할 때 발생하는 세 가지 핵심 trade-off를 명시적으로 모델링한다. 저자들은 mid에서 멀어질수록 fill probability가 대략 exponential하게 감소하고, 단기 가격변화가 order-자금 흐름 imbalance에 선형적으로 반응한다는 두 empirical regularity에서 passive impact model을 구축한다. arXiv 원문

따라서 트레이더가 quote를 더 aggressive하게 내면 체결확률은 높아지지만 impact와 불리한 정보에 따른 체결 위험이 커지고, 멀리 quote하면 impact는 낮지만 non-execution/opportunity cost가 증가한다. 연구진은 이를 최적 liquidation 문제로 풀고 NASDAQ equities와 public FX 데이터를 통해 model의 기초 가정을 calibration한다.

04 / RESEARCH NOTE

HRT와 CoreWeave의 GPU 활용

다룬 자료 · Hudson River Trading × CoreWeave — Vera Rubin NVL72 기반 차세대 AI Research Platform

HRT는 CoreWeave와 multi-year agreement를 맺고 차세대 AI-driven trading 연구와 model development를 CoreWeave AI cloud 위에서 확장하기로 했다. 플랫폼에는 NVIDIA Vera Rubin NVL72, HGX B200, Spectrum-X Ethernet이 포함되며, CoreWeave는 이를 “multi-billion dollar deal”로 표현한다. CoreWeave 공식 발표

HRT R&D 책임자 Kevin Lee는 “AI platform이 model만큼 중요하다”고 직접 설명했고, 회사는 ML과 large-scale neural-network model, HPC를 quantitative 연구와 trading에 사용한다고 공개했다. 모델 복잡도와 training data volume이 증가하면서 consistent performance, low-latency data movement, operational reliability가 중요한 infrastructure requirement가 되고 있다고 밝힌다.

특히 HRT는 on-prem environment와 CoreWeave 사이에 dedicated high-bandwidth Spectrum-X networking을 사용해 data movement latency를 낮추겠다고 공개했다. 즉 training compute만 cloud로 빌리는 단순 구조가 아니라 on-prem market-data estate와 external GPU compute를 하나의 연구 fabric으로 연결하는 형태에 가깝다.

05 / RESEARCH NOTE

Two Sigma의 연구 운영 체계

다룬 자료 · Two Sigma — AI가 “모델”이 아니라 Quant Research Operating System이 되는 과정

Two Sigma CTO Jeff Wecker는 2026년의 중요한 흐름으로 properly governed agentic AI를 지목하고, Chief AI Innovation Officer Matt Greenwood는 AI가 별도로 배포하는 도구가 아니라 quantitative 연구와 investing의 operating system이 되고 있다고 설명한다. Two Sigma 공식 원문

Two Sigma가 보는 변화는 특히 연구 funnel의 병목 이동이다. LLM 때문에 hypothesis 생성량이 늘면서 기존의 “아이디어 부족”보다 아이디어를 빨리 검증하는 능력이 새로운 bottleneck이 된다고 설명한다. 또한 텍스트와 structured data를 unified representation으로 연결하고, agentic tool을 constraint-aware portfolio copilot 형태로 넣는 방향도 공개적으로 언급한다.

Head of Technique 예측 Jin Choi는 AI agent가 objective를 매우 잘 최적화하기 때문에 오히려 proxy objective를 잘못 설계하면 unintended behavior가 커질 수 있다고 경고하고, human supervision과 monitoring이 필요하다고 강조한다.

읽고 나서 남는 질문

이 자료들을 실제 운용에 연결하려면 사용한 시장과 기간, 비교 대상, 거래 비용을 먼저 확인해야 합니다. 아래 원문 링크에서 연구의 범위를 살펴보고, 국내 시장 적용 아이디어는 별도의 검증 과제로 읽어보세요.

편집 전 브리핑 원문 펼치기

채권시장 AI·Quant Intelligence — 2026년 9월 2일

전일의 FSB AI·레버리지 리스크, Copom LLM, Machine Learning Meets Markowitz, Citadel EQR anomaly framework, Jane Street GPU engineering는 제외했다.

오늘은 최신성 우선으로 8월 28일 LLM trading-agent 연구, 8월 18일 multi-level RL market making, 그리고 7월 30일 passive execution 연구를 골랐다. 퀀트사 쪽은 8월 20일 HRT의 차세대 AI research platform 계약과, 최신성은 낮지만 채용공고보다 훨씬 구체적인 Two Sigma의 AI-as-research-OS 자료를 선정했다.

오늘 핵심은 **AI가 무엇을 예측하느냐보다 AI가 시장에서 반복 행동할 때 어떤 취약성이 생기고, 이를 execution·research system에 어떻게 연결하느냐**다.


1. RetailAgent: Structured Adverse Timing in Self-Conditioned Multimodal LLM Trading Agents

구분: 최신 연구 · arXiv / LLM Agent·시장미시구조
발표일: 2026년 8월 28일

핵심 요약

RetailAgent는 LLM에게 익명화된 intraday 가격 history와 제한된 state를 보여주고 매 시점마다 long 또는 flat을 반복적으로 결정하게 만든 실험이다. 연구진은 단순 수익률이 아니라 long exposure 비중을 통제한 뒤 같은 종목의 long 구간과 flat 구간 이후 수익을 비교했는데, 여러 model family·horizon·state에서 지속적인 negative timing이 나타났다고 보고한다. arXiv 원문

더 중요한 결과는 LLM이 이전 판단을 스스로 memory로 작성해 다음 decision에 다시 넣으면 policy persistence가 더 강해지고 adverse timing도 더 심해졌다는 것이다. 저장된 action sequence를 shuffle하면 효과가 크게 약해져, 단순히 종목 자체의 나쁜 성과가 아니라 agent의 반복 행동과 미래 수익 간 정렬이 문제였음을 시사한다.

채권 트레이딩·리스크관리 시사점

이 연구는 LLM trader의 위험이 hallucination만이 아니라 predictable policy라는 점을 보여준다.

예를 들어 agent가 반복적으로:

가격 급락 → “과매도” → long

가격 상승 → “과열” → flat

같은 구조를 만들면, 개별 판단은 그럴듯해도 다른 시장참가자가 그 행동을 추론할 수 있다.

채권에서는 특히 이런 문제가:

  • 금통위 직후 dip-buying
  • 입찰 tail 이후 mean-reversion
  • 3/10 extreme에서 자동 flattening
  • 급격한 basis 확대 시 자동 convergence trade

같은 반복 규칙에서 발생할 수 있다.

한국 시장 복제 아이디어

LLM/agent의 성과를 단순 P&L만 보지 말고 Action Predictability까지 측정해야 한다.

예를 들어:

P(Action_t | 최근 state) 와

P(Action_t | 최근 state, Agent 자체 과거 action)

의 차이를 측정해 agent의 행동이 얼마나 쉽게 추론되는지 본다.

그리고 agent를 production에 넣을 때는:

LLM proposal → stochastic / optimizer layer
→ risk constraint
→ final action

처럼 LLM output과 실제 주문 사이를 분리하는 것이 좋다.

데스크 적용 우선순위: ★★★★★


2. Multi-Level Market Making with Reinforcement Learning

구분: 최신 연구 · arXiv / Reinforcement Learning·Market Making
발표일: 2026년 8월 18일

핵심 요약

이 연구는 market maker가 best bid/ask 한 가격에 quote하는 문제가 아니라, 여러 price level에 서로 다른 size의 limit/market order를 동시에 배분하는 문제를 RL로 푼다. 행동공간을 multivariate logistic-normal distribution으로 모델링하고, variable-length order set을 Deep Sets encoder로 fixed-dimensional representation으로 압축한다. arXiv 원문

Agent의 목적은 trading revenue를 높이면서 inventory를 관리하는 것이며, 연구진은 noise trader뿐 아니라 volume imbalance에 반응하는 tactical trader와 strategic trader가 존재하는 서로 다른 simulated market에서 성능을 검증한다. potential-based reward shaping을 사용해 최적정책 자체를 바꾸지 않으면서 학습속도를 높인다.

채권 트레이딩 시사점

이 논문이 중요한 이유는 market-making action을 단순화하지 않는다는 것이다.

일반적인 모델은:

fair value = 100 → bid 99.9 / ask 100.1

식으로 끝난다.

하지만 실제 dealer 행동은:

  • 99.90에 20
  • 99.88에 50
  • 99.85에 100
  • 필요 시 marketable hedge 30

처럼 가격과 size를 동시에 여러 level에 배치하는 문제다.

즉 진짜 output은:

Optimal Price

가 아니라

Optimal Order Allocation Surface

에 가깝다.

한국 시장 복제 아이디어

국채선물 top-5 호가를 이용해 먼저 단순한 version을 만들 수 있다.

State

  • depth
  • imbalance
  • recent trade
  • spread
  • inventory
  • short-horizon alpha

Action

  • bid level 1~3 size
  • ask level 1~3 size
  • aggressive hedge size

Reward

  • realized spread
  • mark-out
  • inventory penalty
  • transaction cost

로 정의한다.

특히 inventory와 size decision을 함께 학습하는 것이 핵심이다.

다만 연구 결과는 simulation 기반이므로 production에 바로 옮기기보다 실제 한국 국채선물 event-replay simulator에서 먼저 검증해야 한다.

데스크 적용 우선순위: ★★★★★


3. Optimal Execution with Passive Market Impact

구분: 연구 · arXiv / Execution·Fill Probability·Market Impact
발표일: 2026년 7월 30일
선정 이유: 최신성보다 실제 채권 execution에 직접 옮길 수 있는 기술적 가치 때문에 선정

핵심 요약

이 논문은 passive limit order를 어디에 놓을지 결정할 때 발생하는 세 가지 핵심 trade-off를 명시적으로 모델링한다. 저자들은 mid에서 멀어질수록 fill probability가 대략 exponential하게 감소하고, 단기 가격변화가 order-flow imbalance에 선형적으로 반응한다는 두 empirical regularity에서 passive impact model을 구축한다. arXiv 원문

따라서 trader가 quote를 더 aggressive하게 내면 체결확률은 높아지지만 impact와 adverse selection이 커지고, 멀리 quote하면 impact는 낮지만 non-execution/opportunity cost가 증가한다. 연구진은 이를 최적 liquidation 문제로 풀고 NASDAQ equities와 public FX 데이터를 통해 model의 기초 가정을 calibration한다.

채권 트레이딩·시장미시구조 시사점

이 논문은 execution model을 다음 세 모델로 분해할 수 있음을 보여준다.

Fill model → P(fill | quote distance, state)

Mark-out model → E[future price - fill price | fill]

Opportunity-cost model → E[cost of not filling]

그 다음 최적 quote는 이 세 개를 동시에 비교해서 선택한다.

즉:

“체결확률이 높은 주문”이 좋은 주문이 아니다.

체결 직후 1tick adverse move가 자주 발생한다면 높은 fill은 독성 flow를 받고 있다는 뜻일 수 있다.

한국 시장 복제 아이디어

국채선물/현물 실행 engine을 만들 때 각 주문마다 다음을 저장한다.

  • quote distance
  • queue/depth
  • fill 여부
  • fill까지 걸린 시간
  • 1초/10초/1분 mark-out
  • 미체결 시 이후 best executable price

이 데이터로

Expected Execution Cost = Fill Cost + Adverse Selection + Non-Fill Cost

를 만들 수 있다.

방향성 예측모델이 이미 어느 정도 있는 데스크라면 이 execution layer가 훨씬 빨리 realized P&L을 개선할 가능성이 높다.

데스크 적용 우선순위: ★★★★★


Quant Firm Intelligence

4. Hudson River Trading × CoreWeave — Vera Rubin NVL72 기반 차세대 AI Research Platform

구분: 공식 기술·인프라 발표 / HRT + CoreWeave
발표일: 2026년 8월 20일

확인 가능한 사실

HRT는 CoreWeave와 multi-year agreement를 맺고 차세대 AI-driven trading research와 model development를 CoreWeave AI cloud 위에서 확장하기로 했다. 플랫폼에는 NVIDIA Vera Rubin NVL72, HGX B200, Spectrum-X Ethernet이 포함되며, CoreWeave는 이를 “multi-billion dollar deal”로 표현한다. CoreWeave 공식 발표

HRT R&D 책임자 Kevin Lee는 “AI platform이 model만큼 중요하다”고 직접 설명했고, 회사는 ML과 large-scale neural-network model, HPC를 quantitative research와 trading에 사용한다고 공개했다. 모델 복잡도와 training data volume이 증가하면서 consistent performance, low-latency data movement, operational reliability가 중요한 infrastructure requirement가 되고 있다고 밝힌다.

특히 HRT는 on-prem environment와 CoreWeave 사이에 dedicated high-bandwidth Spectrum-X networking을 사용해 data movement latency를 낮추겠다고 공개했다. 즉 training compute만 cloud로 빌리는 단순 구조가 아니라 on-prem market-data estate와 external GPU compute를 하나의 research fabric으로 연결하는 형태에 가깝다.

공개자료 기반 추론

HRT의 구체적인 alpha model이나 trading rule은 공개되지 않았다.

다만 이번 투자의 경제적 메커니즘은 상당히 명확하다.

Compute ↑ → 더 큰 training dataset
→ 더 복잡한 model
→ 더 많은 parallel experiments
→ research cycle 단축
→ market change에 빠른 adaptation
→ deployable alpha 증가

다.

여기서 중요한 것은 GPU가 아니라 research-optionality다.

기존에는 계산비용 때문에 시도하지 못했던:

  • 더 긴 history
  • 더 많은 instrument
  • multi-market representation
  • ensemble
  • large neural nets
  • 더 많은 hyperparameter/model family

를 동시에 테스트할 수 있게 된다.

한국 시장 복제 아이디어

국내에서는 Vera Rubin cluster보다 먼저 hybrid research architecture 원칙을 가져오는 것이 좋다.

On-prem / fast layer

  • tick DB
  • real-time feature
  • OMS
  • execution
  • low-latency inference

GPU / batch research layer

  • historical training
  • embeddings
  • foundation/time-series models
  • large-scale simulation
  • feature search

두 시스템이 동일한 feature definition과 model registry를 공유하도록 한다.

핵심 KPI는 GPU 수가 아니라:

Idea → OOS Result Time 와 Research → Production Time

이다.

복제 가치: ★★★★★


5. Two Sigma — AI가 “모델”이 아니라 Quant Research Operating System이 되는 과정

구분: 회사 공식 senior researcher/engineer 인터뷰
발표일: 2026년 1월 12일
선정 이유: 최신성보다 기술적 가치 때문에 선정. 채용자료가 아니라 CTO·Chief AI Innovation Officer·Head of AI Core 등 실제 리더들의 공개 기술 관점이다.

확인 가능한 사실

Two Sigma CTO Jeff Wecker는 2026년의 중요한 흐름으로 properly governed agentic AI를 지목하고, Chief AI Innovation Officer Matt Greenwood는 AI가 별도로 배포하는 도구가 아니라 quantitative research와 investing의 operating system이 되고 있다고 설명한다. Two Sigma 공식 원문

Two Sigma가 보는 변화는 특히 research funnel의 병목 이동이다. LLM 때문에 hypothesis 생성량이 늘면서 기존의 “아이디어 부족”보다 아이디어를 빨리 검증하는 능력이 새로운 bottleneck이 된다고 설명한다. 또한 텍스트와 structured data를 unified representation으로 연결하고, agentic tool을 constraint-aware portfolio copilot 형태로 넣는 방향도 공개적으로 언급한다.

Head of Technique Forecasting Jin Choi는 AI agent가 objective를 매우 잘 최적화하기 때문에 오히려 proxy objective를 잘못 설계하면 unintended behavior가 커질 수 있다고 경고하고, human supervision과 monitoring이 필요하다고 강조한다.

공개자료 기반 추론

이 자료에서 Two Sigma의 AI 수익화를 다음처럼 해석할 수 있다.

기존:

연구자 1명 → 가설 3개
→ 검증 3개

AI 이후:

Research Agent → 가설 100개
→ 코드/데이터 준비 자동화

하지만 이 상태에서는 돈을 벌지 못한다.

진짜 병목은:

100 hypotheses → 5 valid hypotheses

를 빠르고 엄격하게 걸러내는 것이다.

즉 AI의 경제적 가치는 단순 idea generation이 아니라:

Hypothesis Generation × Validation Throughput × Research Discipline

으로 결정된다.

한국 시장 복제 아이디어

채권 AI research agent가 하루 30개 전략을 제안하게 된다면 모든 전략에 자동으로 다음 gate를 적용한다.

  1. point-in-time data인가?
  2. economic rationale가 있는가?
  3. training window 밖에서 유지되는가?
  4. event/regime별로 유지되는가?
  5. transaction cost 후 남는가?
  6. 기존 전략과 correlation이 낮은가?
  7. live paper에서 재현되는가?

즉 Agent의 KPI는:

Generated Ideas

가 아니라

Validated Incremental Alpha / Week

로 잡는 것이 좋다.

이 관점은 앞으로 AI agent를 실제 채권 research platform에 붙일 때 상당히 중요하다.

복제 가치: ★★★★★


오늘의 데스크 결론

오늘 세 연구를 연결하면 AI trading에서 굉장히 명확한 순서가 보인다.

RetailAgent는 AI가 시장에서 반복 행동할 경우 policy 자체가 predictable signal이 될 수 있음을 보여준다.
Multi-Level Market Making은 그래서 단순 buy/sell 대신 price×size×inventory 전체 policy를 학습해야 한다는 방향을 보여준다.
Passive Market Impact 연구는 그 policy가 실제 execution 단계에서 fill probability, adverse selection, non-fill cost를 동시에 최적화해야 한다는 점을 보여준다.

HRT와 Two Sigma의 공개자료를 붙이면 탑티어 퀀트사가 AI를 실제 경쟁우위로 만드는 구조는 다음처럼 압축할 수 있다.

Huge / Unique Data
→ AI-assisted Hypothesis Generation
→ Fast Validation Factory
→ Large-scale Model Training
→ Price × Size × Execution Policy
→ Live Market
→ Mark-out / P&L
→ Rapid Feedback

그리고 여기서 앞으로 국내 채권 AI에 특히 중요한 것은 세 가지 모델을 분리해서 만드는 것이다.

① Alpha Model — 어디로 갈 것인가.
② Execution Model — 언제·어디에·얼마를 주문할 것인가.
③ Policy-Risk Model — 내 agent의 행동이 지나치게 반복적·예측 가능해지고 있는가.

오늘 한 편만 읽는다면 Optimal Execution with Passive Market Impact를 추천한다. 채권 데스크에서 바로 사용할 수 있는 fill–markout–opportunity cost 구조가 가장 명확하다. 원문 바로 보기

퀀트사 자료 중 하나만 본다면 HRT × CoreWeave 발표가 오늘 가장 중요하다. “좋은 모델”에서 한 단계 더 나아가 연구자가 시장보다 빠르게 반복실험할 수 있는 infrastructure 자체가 alpha 경쟁력이라는 점을 가장 명시적으로 보여준다. HRT × CoreWeave 공식 발표

오늘의 연구 목차01 · RetailAgent와 불리한 거래 시점 문제02 · 여러 수준의 의사결정을 다루는 시장조성 강화학습03 · 수동 주문의 시장충격과 최적 실행04 · HRT와 CoreWeave의 GPU 활용05 · Two Sigma의 연구 운영 체계읽고 나서 남는 질문