에이전트로 자산가격 연구를 수행하고 검증하기
논문의 가장 중요한 지적은 기존 agentic quant 연구가 대부분 agent가 발견한 factor나 trade만 backtest한다는 점이다. 하지만 agent도 특정 training window에서 우연히 좋은 아이디어를 찾거나, validation gate가 과적합되거나, 심지어 미묘한 look-ahead leakage를 가질 수 있으므로 “연구 시스템 자체”를 여러 과거 시점에서 다시 실행해야 한다고 주장한다.
저자들은 이를 위해 SEADS라는 시스템을 만들고 다섯 기존 방법과 비교하면서 발견된 factor를 단일 Sharpe만으로 평가하지 않고 productivity, performance, novelty를 동시에 측정한다.
캐리 정보를 머신러닝에 담기
으로 분해한 뒤, 이미 수익률곡선가 알려주는 캐리는 구조적으로 계산하고 ML은 residual price return만 예측한다. Tsinghua 원문 PDF
1992~2019년 미국 회사채 데이터를 대상으로 이 hybrid 방식이 total return을 바로 ML에 넣는 방식보다 예측력이 높았다고 보고한다. HY에서 예측력이 특히 높았고, 이는 비선형 credit risk와 유동성 shock에 의해 주로 나타났다.
더 중요한 것은 transaction cost다. 순수 ML long-short 전략은 gross 초과수익 신호가 컸지만 높은 turnover 때문에 수익의 60~80%가 거래비용으로 사라진 반면, 캐리와 ML을 결합한 전략은 turnover가 낮고 net return이 더 안정적이었다.
채권 펀드 운용자의 실력을 구분하기
Ron Kaniel, Markus Pelger, Stijn Van Nieuwerburgh, Luofeng Zhou는 1995~2024년 3,021개 미국 채권펀드를 대상으로 ML을 이용해 향후 outperformer와 underperformer를 사전에 구분할 수 있는지 분석했다. Columbia Business School 연구 페이지
모델은 cross-sectional fund selection과 macro 변수를 이용한 time-series expected abnormal 수익률 예측을 두 단계로 분리한다. 가장 강한 predictor는 fund·fund-family 특성, 특히 과거 risk-adjusted performance였고, 오히려 개별 보유채권의 maturity·수익률·유동성 같은 holdings-level 정보는 manager skill 구분에 큰 도움을 주지 못했다.
예측력은 회사채와 municipal bond fund에서 강하고 Treasury bond fund에서는 약했다고 보고한다.
Optiver와 NVIDIA가 줄이려는 연구 시간
Josh Durham은 과거 대규모 데이터셋 준비 시 수천 CPU core에 작은 data chunk를 분산시키던 작업을, large/unified-memory GPU를 이용해 더 큰 data block 단위로 처리할 수 있다고 설명한다.
IMC의 가설과 실제 환경 피드백
IMC는 공식적으로 quant 연구 workflow를 **“ideas move quickly from hypothesis to execution”**이라고 설명하며, quantitative 연구가 opportunity를 찾고 ML이 discovery를 가속하며 high-performance technology가 아이디어를 실제 시장으로 가져간다고 밝힌다. IMC 공식 연구/Trading 설명
회사 설명에 따르면 연구자들은 adaptive systems, predictive models, 입력 변수를 만들고 reinforcement learning, deep learning, LLM, NLP, optimization을 실제 trading problem에 적용한다.
IMC는 또한 live trading에서 발생한 trade가 다시 pricing·prediction·positioning model의 피드백으로 들어가며 “every trade feeds the models”라고 명시한다.
현재 회사 공식 페이지는 ML/AI가 market-behaviour 예측, 신호 generation, foundation-model training까지 workflow 전반에 사용되고 있다고 설명하며, petabyte 단위 데이터를 처리하고 9개국에 9,000대 이상의 서버를 운영한다고 공개한다. IMC 공식 홈페이지
읽고 나서 남는 질문
이 자료들을 실제 운용에 연결하려면 사용한 시장과 기간, 비교 대상, 거래 비용을 먼저 확인해야 합니다. 아래 원문 링크에서 연구의 범위를 살펴보고, 국내 시장 적용 아이디어는 별도의 검증 과제로 읽어보세요.
편집 전 브리핑 원문 펼치기
채권시장 AI·Quant Intelligence — 2026년 9월 8일
오늘은 전일의 회사채 liquidity segmentation, 중국 회사채 ML, BIS macro-news disagreement, HRT RL execution, Jane Street positional encoding을 전부 제외했다. 9월 7~8일 사이 새로 나온 고품질 fixed-income AI 연구는 제한적이어서, 9월 1일 공개된 agentic quant research 논문 1개 + 아직 다루지 않은 fixed-income ML 연구 2개로 구성했다.
퀀트사 쪽은 채용공고를 완전히 제외했다. 오늘은 Optiver의 Head of Quant Engineering·현직 엔지니어가 직접 밝힌 GPU research→production 구조와, IMC가 공식적으로 공개한 hypothesis→ML→live trading→feedback 구조를 본다.
오늘 핵심은 하나다.
무엇을 ML로 예측할지보다 채권시장 구조를 target에 어떻게 반영하고, 연구 시스템 자체를 어떻게 검증하느냐가 점점 중요해지고 있다.
1. Agentic Empirical Asset Pricing: Methodological Foundations
구분: 최신 AI/Quant Research · LLM Agent + 자동 팩터 연구
발표일: 2026년 9월 1일
핵심 요약
Stanford의 Kay Giesecke 등이 참여한 이 연구는 LLM agent가 가설 생성 → 코드화 → 데이터 실행 → 통계적 검증 → 기억/반복까지 수행하는 새로운 연구 방식을 *Agentic Empirical Asset Pricing(AEAP)*으로 정의한다. arXiv 원문
논문의 가장 중요한 지적은 기존 agentic quant 연구가 대부분 agent가 발견한 factor나 trade만 backtest한다는 점이다. 하지만 agent도 특정 training window에서 우연히 좋은 아이디어를 찾거나, validation gate가 과적합되거나, 심지어 미묘한 look-ahead leakage를 가질 수 있으므로 “연구 시스템 자체”를 여러 과거 시점에서 다시 실행해야 한다고 주장한다.
저자들은 이를 위해 SEADS라는 시스템을 만들고 다섯 기존 방법과 비교하면서 발견된 factor를 단일 Sharpe만으로 평가하지 않고 productivity, performance, novelty를 동시에 측정한다.
채권 AI에서 왜 중요한가
이건 앞으로 채권 research agent를 만들 때 굉장히 중요하다.
예를 들어 AI에게:
“국고채에서 신규 alpha factor를 매일 30개 찾아라.”
라고 시키고 좋은 Sharpe가 나온 factor만 저장하면 거의 확실히 multiple-testing machine이 된다.
더 올바른 검증은:
Historical date (t)
→ 당시 사용 가능했던 데이터만 제공
→ Agent가 처음부터 hypothesis 생성
→ feature 생성
→ backtest
→ 선택
을 여러 (t)에서 다시 실행하는 것이다.
즉:
Backtest the Strategy
가 아니라
Backtest the Researcher
다.
한국 시장 복제 아이디어
Bond Research Agent Evaluation Harness를 만든다.
예를 들어 2019·2020·2021·2022·2023년 말에 agent를 각각 “처음부터” 실행해서 그 시점까지의 정보만 사용하도록 한다.
그리고 신규 factor에 대해:
- OOS IC
- OOS P&L
- 기존 factor와 correlation
- regime stability
- turnover
- transaction cost
- feature novelty
를 gate로 둔다.
특히 novelty가 중요하다.
AI가:
foreign_flow_5d
foreign_flow_6d
foreign_flow_7d
같은 사실상 동일한 factor를 100개 만들어놓고 “100개 신규 alpha”라고 주장하는 것을 막아야 한다.
실무 적용 우선순위: ★★★★★
2. Harness Machine Learning with Carry
구분: Corporate Bond ML · Fixed-income-specific Target Engineering
SSRN 공개: 2026년 1월 28일
선정: 최신성보다 기술적 가치 때문에 선정
핵심 요약
이 연구의 아이디어는 단순하지만 매우 중요하다. 회사채 total return 전체를 ML로 예측하지 않고:
Bond Total Return = Carry + Price Return
으로 분해한 뒤, 이미 yield curve가 알려주는 carry는 구조적으로 계산하고 ML은 residual price return만 예측한다. Tsinghua 원문 PDF
1992~2019년 미국 회사채 데이터를 대상으로 이 hybrid 방식이 total return을 바로 ML에 넣는 방식보다 예측력이 높았다고 보고한다. HY에서 예측력이 특히 높았고, 이는 nonlinear credit risk와 liquidity shock에 의해 주로 나타났다.
더 중요한 것은 transaction cost다. 순수 ML long-short 전략은 gross alpha가 컸지만 높은 turnover 때문에 수익의 60~80%가 거래비용으로 사라진 반면, carry와 ML을 결합한 전략은 turnover가 낮고 net return이 더 안정적이었다.
채권 트레이딩 시사점
이 논문은 채권 ML의 target을 equity처럼 만들면 안 된다는 강한 사례다.
예를 들어:
잘못된 방식
features → next-month bond total return
보다:
Fixed-income aware 방식
Known Carry
+
ML predicted residual price move
가 더 자연스럽다.
왜냐하면 carry는 이미 금리곡선과 bond cash flow에서 상당 부분 결정되어 있기 때문이다.
ML에게 이미 수학적으로 계산 가능한 부분까지 다시 학습시키면 scarce sample capacity를 낭비할 수 있다.
한국 시장 복제 아이디어
국고채에서도:
Expected holding-period return
을
Roll-down + Carry + Forecast Price Change
로 분해한다.
예를 들어 10년 국고채의 1개월 expected P&L을:
① Known component
- carry
- roll-down
② ML component
- 예상 level change
- curve residual
- supply/flow impact
로 나눈다.
그리고 최종 position은:
Carry + ML Alpha − Expected Transaction Cost
로 만든다.
회사채에서도:
현재 spread carry
+
expected spread compression/widening
을 따로 모델링하는 것이 훨씬 해석 가능하다.
실무 적용 우선순위: ★★★★★
3. Detecting Skilled Bond Fund Managers
구분: Bond ML · Manager/Strategy Selection
최종 개정: 2026년 7월 31일
선정: 최신성보다 “무엇을 예측해야 하는가”라는 target-design 가치 때문에 선정
핵심 요약
Ron Kaniel, Markus Pelger, Stijn Van Nieuwerburgh, Luofeng Zhou는 1995~2024년 3,021개 미국 채권펀드를 대상으로 ML을 이용해 향후 outperformer와 underperformer를 사전에 구분할 수 있는지 분석했다. Columbia Business School 연구 페이지
모델은 cross-sectional fund selection과 macro 변수를 이용한 time-series expected abnormal return prediction을 두 단계로 분리한다. 가장 강한 predictor는 fund·fund-family 특성, 특히 과거 risk-adjusted performance였고, 오히려 개별 보유채권의 maturity·yield·liquidity 같은 holdings-level 정보는 manager skill 구분에 큰 도움을 주지 못했다.
예측력은 corporate bond와 municipal bond fund에서 강하고 Treasury bond fund에서는 약했다고 보고한다.
채권 데스크에서의 시사점
흥미로운 포인트는 모델 자체보다 label이다.
일반적으로 quant research는:
“다음 가격을 예측하자.”
부터 출발한다.
하지만 이 연구는:
“누가 반복적으로 좋은 의사결정을 하는가?”
를 예측한다.
우리 데스크에도 같은 사고를 적용할 수 있다.
예를 들어 모델 target을:
next 10Y return
만 만들지 않고:
- 어떤 dealer signal이 좋은가
- 어떤 broker quote가 informative한가
- 어떤 전략이 현재 regime에서 잘 맞는가
- 어떤 연구자의 factor가 live에서 지속되는가
처럼 meta-prediction으로 확장할 수 있다.
한국 시장 복제 아이디어
특히 재미있는 것은 Strategy Allocator다.
여러 모델이 있다면:
- Curve model
- Flow model
- Macro model
- News model
- Microstructure model
각각의 최근 성능·regime별 성능·drawdown·forecast confidence를 입력으로 넣어:
P(strategy i has positive alpha | current state)
를 예측한다.
즉 모델이 금리를 예측하는 것 위에 “어떤 모델을 믿을 것인가?”를 예측하는 second-level model을 둔다.
이는 앞서 다룬 ensemble보다 한 단계 더 적극적인 model-selection problem이다.
실무 적용 우선순위: ★★★★☆
Quant Firm Intelligence
4. Optiver × NVIDIA — “FLOPS가 아니라 Researcher Time을 사는 것”
구분: Optiver 공식 기술대담 · Head of Quant Engineering + 현직 Software Engineer
발표일: 2026년 8월 24일
채용공고 아님
오늘 퀀트사 자료 중 가장 추천한다.
Optiver Global Head of Quant Engineering Scott McKenzie, Software Engineer Josh Durham, NVIDIA Global Head of Capital Markets Strategy Ioana Boier가 실제 trading compute architecture에 대해 대담한 자료다. Optiver 공식 기술글
확인 가능한 사실 ① — GPU의 목표는 FLOPS가 아니다
대담에서 핵심적으로 제시된 문장이:
“It’s not the FLOPS. It’s the researcher time.”
이다.
Optiver가 설명하는 GPU 투자 목적은 단순 neural-network training time 감소가 아니라:
Raw Data → preprocessing → experiment → model → strategy → production
전체 연구 cycle을 줄이는 것이다.
이 관점은 Jump/HRT의 공개자료와도 일관된다.
확인 가능한 사실 ② — CPU 수천 개 → GPU large-memory workflow
Josh Durham은 과거 대규모 dataset 준비 시 수천 CPU core에 작은 data chunk를 분산시키던 작업을, large/unified-memory GPU를 이용해 더 큰 data block 단위로 처리할 수 있다고 설명한다.
이 구조의 장점은 단순 GPU compute가 아니다.
data partitioning / synchronization overhead
를 줄이는 것이다.
즉 ML infrastructure bottleneck이:
Matrix multiplication
이 아니라
Data movement
인 경우가 많다는 뜻이다.
확인 가능한 사실 ③ — Production inference의 사고방식
Optiver 엔지니어는 production에서는 market data가 도착한 뒤 GPU 작업을 launch하는 구조가 아니라:
GPU software와 model weights가 이미 memory에 올라가 있고 다음 market event를 기다려야 한다
고 설명한다.
즉 inference pipeline은:
Market event arrives
→ load model
→ infer
가 아니라:
Model resident
→ market event
→ immediate inference
→ decision
이다.
공개자료 기반 추론
Optiver가 어떤 specific alpha model이나 neural architecture를 이 방식으로 실행하는지는 공개하지 않는다.
하지만 공개된 engineering 목표는 분명하다.
Research P&L Edge ≈
Experiments / Time
× Quality of Experiments
× Time-to-Production
이다.
즉 GPU를 사는 이유를:
“큰 모델을 돌리기 위해서”
라고만 이해하면 부족하다.
실질적으로는 연구자의 대기시간을 줄이는 설비투자다.
한국 채권시장 복제 아이디어
현재 compute optimization에서 KPI를:
GPU utilization
이 아니라 다음으로 바꿀 가치가 있다.
Idea → first backtestData → feature datasetTraining → OOS resultOOS approval → productionValidated experiments / researcher / day
그리고 모든 research job에:
Data loading Feature calculation CPU compute GPU compute I/O Synchronization
시간을 자동 profiling한다.
만약 학습 10분인데 데이터 준비가 2시간이면 H100을 더 사는 건 거의 의미가 없다.
복제 가치: ★★★★★
5. IMC — Hypothesis → Feature → Model → Live Trading → Feedback
구분: IMC Trading 공식 기술·연구 설명
공개일: 공식 페이지 게시일 미표기 · 2026년 현재 공식 공개
채용공고 사용하지 않음
확인 가능한 사실
IMC는 공식적으로 quant research workflow를 **“ideas move quickly from hypothesis to execution”**이라고 설명하며, quantitative research가 opportunity를 찾고 ML이 discovery를 가속하며 high-performance technology가 아이디어를 실제 시장으로 가져간다고 밝힌다. IMC 공식 Research/Trading 설명
회사 설명에 따르면 연구자들은 adaptive systems, predictive models, feature를 만들고 reinforcement learning, deep learning, LLM, NLP, optimization을 실제 trading problem에 적용한다.
IMC는 또한 live trading에서 발생한 trade가 다시 pricing·prediction·positioning model의 feedback으로 들어가며 “every trade feeds the models”라고 명시한다.
현재 회사 공식 페이지는 ML/AI가 market-behaviour forecasting, signal generation, foundation-model training까지 workflow 전반에 사용되고 있다고 설명하며, petabyte 단위 데이터를 처리하고 9개국에 9,000대 이상의 서버를 운영한다고 공개한다. IMC 공식 홈페이지
여기서 가장 중요한 실제 일하는 방식
이 구조는:
Research → Model → Production
으로 끝나지 않는다.
Hypothesis → Feature → Predictive Model → Trading → Live Outcomes → 다시 Research
다.
즉 live trade 자체가 새로운 training/validation data가 된다.
이런 구조에서는 연구자가 단순히:
Validation IC = 0.04
라고 보고 끝내면 안 된다.
production에 들어간 이후:
- expected edge
- actual fill
- realized mark-out
- impact
- realized P&L
- regime
을 연구 시스템으로 다시 가져와야 한다.
공개자료 기반 추론
IMC의 구체적인 foundation-model architecture, target definition, trading horizon은 공개되지 않는다.
따라서 “IMC가 Transformer로 다음 100ms 가격을 예측한다” 같은 주장은 할 수 없다.
확인 가능한 것은 foundation models·deep learning·RL 등 여러 방법을 predictive trading pipeline에 적용하고, live market feedback을 연구로 환원하는 구조까지다.
한국 시장 복제 아이디어
이 구조를 만들려면 Backtest Database보다 Decision Database가 중요하다.
모든 live decision에:
timestamp
model_version
feature_version
predicted_edge
predicted_risk
target_position
actual_order
fill
market_impact
10s markout
1m markout
P&L
을 저장한다.
그리고 연구자가 신규 모델을 만들 때 live history를 그대로 training/evaluation dataset으로 읽을 수 있게 한다.
그래야:
Research → Production → Research
loop가 닫힌다.
복제 가치: ★★★★★
오늘의 데스크 결론
오늘 세 연구를 연결하면 채권 AI의 target engineering에 관한 메시지가 상당히 선명하다.
Harness ML with Carry는:
“수학적으로 이미 아는 carry를 ML에게 다시 배우게 하지 마라.”
Detecting Skilled Bond Fund Managers는:
“가격만 예측하지 말고 누가/어떤 전략이 잘하는지도 예측할 수 있다.”
그리고 최신 AEAP 연구는:
“AI가 전략을 자동으로 찾기 시작하면 전략뿐 아니라 AI 연구자 자체를 backtest해야 한다.”
이 세 가지를 합치면 현재 국내 채권 AI 연구 stack은 이렇게 가는 것이 좋다.
Economic Structure
→ Carry / Roll / Curve
ML Alpha
→ Residual Price / Flow / News / Microstructure
Meta Model
→ 어떤 alpha를 지금 믿을 것인가
Research Agent
→ 새로운 alpha를 자동으로 발견
Agent Evaluation
→ 연구 시스템 자체의 rolling OOS
↓
Portfolio / Execution
↓
Live P&L
↓
Research Feedback
그리고 Optiver와 IMC 공개자료가 보여주는 것은 이 전체 loop의 속도가 경쟁력이 된다는 것이다. Optiver는 compute를 researcher time 문제로 보고 있고, IMC는 live trade가 다시 model research로 돌아오는 feedback loop를 명시적으로 강조한다.
오늘 바로 가져갈 한 가지
현재 국내 채권 AI 플랫폼에 가장 먼저 추가한다면 **Agentic Research Gate**를 추천한다.
AI가 신규 factor를 생성하면 자동으로:
1. Point-in-time check
→ 미래정보 사용 여부
2. Economic-structure check
→ carry처럼 이미 계산 가능한 걸 다시 학습하고 있지는 않은가
3. Incremental-alpha check
→ 기존 factor와 다른 정보인가
4. Regime OOS check
→ 특정 시기에만 맞은 것은 아닌가
5. Cost check
→ 거래비용 후 남는가
6. Rolling re-discovery check
→ 다른 역사적 시점에 agent를 다시 실행해도 좋은 아이디어를 계속 찾는가
를 통과시키는 구조다.
AI agent를 붙이기 시작하면 아이디어 생성은 더 이상 병목이 아니다. 좋은 아이디어와 우연을 구분하는 validation throughput이 병목이 될 가능성이 높다.
오늘 한 편만 읽는다면: Agentic Empirical Asset Pricing. 앞으로 Claude/ChatGPT류 agent를 quant research에 붙일 때 “AI에게 백테스트를 시킨다” 수준에서 벗어나 AI 연구 프로세스 자체를 어떻게 감사하고 OOS 검증할 것인지에 대한 좋은 프레임을 준다. 논문 바로 보기
퀀트사 자료 하나만 본다면: Optiver × NVIDIA 대담을 추천한다. 특히 **“GPU 성능이 아니라 researcher time”**이라는 관점과 CPU/GPU data movement, model residency, production inference까지 현직 Quant Engineering 책임자와 엔지니어가 직접 설명한다는 점에서 현재 채권 AI 인프라를 설계하는 데 실용적이다. Optiver 전체 기술글