FinBERT와 XGBoost로 뉴스 감성 활용하기
이 연구는 GDELT 글로벌 뉴스 피드에서 헤드라인을 모은 뒤 FinBERT로 sentiment를 추출하고, XGBoost로 다음 날 10년 Treasury futures(ZN) 방향을 예측한다. 뉴스 입력 변수는 단순 평균 sentiment뿐 아니라 sentiment dispersion, 기사량, event-impact score, lag/rolling statistics까지 포함한다. arXiv 원문
훈련은 2015년부터 시작해 5-fold expanding-window 방식으로 2017년~2025년 4월을 OOS 평가하고, 각 fold 안에서 hyperparameter tuning을 별도로 수행해 미래 정보 누출을 방지한다. Treasury에서는 logistic-regression baseline이 부진한 반면 저자들의 XGBoost 전략은 비용 반영 후 높은 OOS 성과를 보고하지만, 보고된 ZN Sharpe 4.65는 매우 큰 숫자이므로 독립적 재현 전에는 절대적인 성과수치보다 입력 변수 설계 자체에 무게를 두는 것이 적절하다.
SHAP 분석에서 중요한 점은 평균 sentiment보다 sentiment dispersion과 article impact가 주요 입력 변수로 등장한다는 것이다. 즉 시장은 “뉴스가 긍정적인가”뿐 아니라 시장 narrative가 얼마나 합의돼 있는가/분열돼 있는가에도 반응할 수 있다.
금리곡선을 직접 예측할지 요인으로 나눌지
이 연구는 미국 Treasury zero-coupon curve에 대해 각 tenor를 직접 예측하는 방식과 level/slope/curvature 같은 factor를 예측하는 방식을 같은 macro-information set에서 비교한다. OOS 기간은 2015~2025년이며, macro 입력 변수를 추가했을 때 예측 개선은 모든 곳에서 균일하게 나타나는 것이 아니라 특히 단기만기와 slope 예측에 집중됐다. arXiv 원문
짧은 horizon에서는 direct-수익률 model이 slope 예측에서 상대적으로 강하고, horizon이 길어지면 factor approach가 경쟁력을 얻는다. 더 흥미로운 점은 random-walk가 통계적 loss에서는 강한 benchmark임에도 trading 모의실험에서는 macro-augmented slope model이 더 유용할 수 있었다는 것이다.
전통 금리모형과 랜덤포레스트 결합
이 연구는 금리예측 문제를 단순히 평균 RMSE를 최소화하는 문제가 아니라 미래 distribution이 바뀔 수 있다는 전제하에서 최악의 경우 손실을 제한하는 decision problem으로 재정의한다. 구조는 Factor-Augmented Dynamic Nelson-Siegel + Random Forest + Distributionally Robust 예측 Combination으로 구성된다. arXiv 원문
DNS는 level/slope/curvature를, Random Forest는 macro-financial 변수와 과거 수익률 사이의 비선형 상호작용을 학습한다. 마지막 ensemble 단계에서는 단순 평균 대신 moment uncertainty와 expected-shortfall 관점의 downside risk를 고려해 예측 weight를 결정한다.
저자 결과에서는 짧은 horizon에서 adaptive combination이, 긴 horizon에서는 Random Forest가 상대적으로 강했으며, 다른 sovereign market으로 확장했을 때도 robustness를 보고한다.
XTX Atlas의 대규모 딥러닝 연구
Atlas Wang은 XTX 시스템이 매일 수만 개 financial instrument에 대한 예측를 생성하고, 이를 기반으로 일평균 3000억달러 이상 규모의 거래를 완전 자동화 방식으로 처리한다고 설명한다. 인간 discretionary 트레이더가 개별 거래를 결정하지 않는다는 점도 명시한다.
또 금융시장은 신호-to-noise가 낮고, adversarial하며, regime shift가 빈번하기 때문에 일반적인 ML benchmark보다 훨씬 어려운 deployment environment라고 설명한다.
Citadel의 대체데이터 관점
Citadel Data Strategies Group의 Quantitative 연구자 Solène Chabanier는 팀의 역할을 “복잡한 alternative 데이터셋을 investment professional이 바로 사용할 수 있는 decision-ready insight로 변환하는 것”이라고 직접 설명한다. 위성영상 같은 real-world/real-time 데이터는 투자정보가 될 수 있지만 raw 형태로는 크고 noisy하며 바로 사용하기 어렵기 때문에, 연구자의 핵심 역할은 이를 직관적이고 timely한 신호로 변환하는 것이다. Citadel 공식 인터뷰
이다. Citadel은 이 산출물이 단순 연구 report가 아니라 실제 investment decisions를 inform한다고 명시한다.
이 자료에서 특히 중요한 것은 satellite image 같은 alternative data 자체가 edge가 아니라는 점이다.
읽고 나서 남는 질문
이 자료들을 실제 운용에 연결하려면 사용한 시장과 기간, 비교 대상, 거래 비용을 먼저 확인해야 합니다. 아래 원문 링크에서 연구의 범위를 살펴보고, 국내 시장 적용 아이디어는 별도의 검증 과제로 읽어보세요.
편집 전 브리핑 원문 펼치기
채권시장 AI·Quant Intelligence — 2026년 9월 6일
오늘은 전날의 BoE AI-credit stress, duration-management ML, yield-curve benchmark 비교, Optiver latency/iteration, Man AHL rating-transition ML을 제외했다. 9월 5~6일 새로 공개된 고품질 fixed-income AI 자료가 제한적이어서, 최근 업데이트된 연구 중 아직 다루지 않은 자료를 우선했다.
퀀트사 섹션은 채용공고를 사용하지 않았다. 오늘은 특히 XTX Markets Research Director가 직접 설명한 대규모 deep-learning trading 구조와 Citadel 현직 Quantitative Researcher가 설명한 alternative-data→investment-decision 과정을 골랐다.
1. Interpretable Machine Learning for Macro Alpha: A News Sentiment Case Study
구분: 최신 업데이트 연구 · NLP/ML + U.S. Treasury futures
최신 원고일: 2026년 8월 24일
핵심 요약
이 연구는 GDELT 글로벌 뉴스 피드에서 헤드라인을 모은 뒤 FinBERT로 sentiment를 추출하고, XGBoost로 다음 날 10년 Treasury futures(ZN) 방향을 예측한다. 뉴스 feature는 단순 평균 sentiment뿐 아니라 sentiment dispersion, 기사량, event-impact score, lag/rolling statistics까지 포함한다. arXiv 원문
훈련은 2015년부터 시작해 5-fold expanding-window 방식으로 2017년~2025년 4월을 OOS 평가하고, 각 fold 안에서 hyperparameter tuning을 별도로 수행해 미래 정보 누출을 방지한다. Treasury에서는 logistic-regression baseline이 부진한 반면 저자들의 XGBoost 전략은 비용 반영 후 높은 OOS 성과를 보고하지만, 보고된 ZN Sharpe 4.65는 매우 큰 숫자이므로 독립적 재현 전에는 절대적인 성과수치보다 feature 설계 자체에 무게를 두는 것이 적절하다.
SHAP 분석에서 중요한 점은 평균 sentiment보다 sentiment dispersion과 article impact가 주요 feature로 등장한다는 것이다. 즉 시장은 “뉴스가 긍정적인가”뿐 아니라 시장 narrative가 얼마나 합의돼 있는가/분열돼 있는가에도 반응할 수 있다.
채권 트레이딩 시사점
이 논문에서 가장 가져올 만한 것은 FinBERT 자체가 아니라:
News → multidimensional state
라는 구조다.
예를 들어 금리 뉴스에서:
- 평균 hawkishness
- hawkishness dispersion
- 기사량
- surprise/intensity
- 최근 5일 narrative momentum
을 각각 feature로 만든다.
특히 dispersion이 중요하다. 모든 언론이 같은 방향을 말하는 상황과 의견이 극단적으로 갈리는 상황은 평균 score가 같아도 금리 volatility와 positioning risk가 전혀 다를 수 있다.
한국 시장 복제 아이디어
한국은행·기재부·국내외 경제뉴스를 대상으로:
inflation_sentiment_mean
inflation_sentiment_dispersion
growth_sentiment_mean
policy_hawkishness
policy_hawkishness_dispersion
news_volume_zscore
를 만든다.
그리고 target을 단순 국고 10년 방향 하나로 두지 말고:
- 3선 next-30min return
- 10선 next-30min return
- 3/10 slope
- realized volatility
로 분리한다.
실무 적용 우선순위: ★★★★★
2. Yield Curve Prediction with Machine Learning: Forecasting Approaches and the Role of Macroeconomic Predictors
구분: 금리곡선 ML 연구
공개: 2026년 7월 28일 / arXiv 2608.07536
핵심 요약
이 연구는 미국 Treasury zero-coupon curve에 대해 각 tenor를 직접 예측하는 방식과 level/slope/curvature 같은 factor를 예측하는 방식을 같은 macro-information set에서 비교한다. OOS 기간은 2015~2025년이며, macro feature를 추가했을 때 예측 개선은 모든 곳에서 균일하게 나타나는 것이 아니라 특히 단기만기와 slope forecast에 집중됐다. arXiv 원문
짧은 horizon에서는 direct-yield model이 slope 예측에서 상대적으로 강하고, horizon이 길어지면 factor approach가 경쟁력을 얻는다. 더 흥미로운 점은 random-walk가 통계적 loss에서는 강한 benchmark임에도 trading simulation에서는 macro-augmented slope model이 더 유용할 수 있었다는 것이다.
채권 트레이딩 시사점
이 결과는 target을 이렇게 나눠야 한다는 뜻이다.
Directional duration model → level
Curve-RV model → slope / curvature
둘을 같은 model로 억지로 해결할 필요가 없다.
그리고 macro 정보는 모든 yield prediction에 동일하게 넣는 것보다 curve-specific signal로 쓰는 것이 더 효과적일 가능성이 있다.
예를 들어 CPI surprise가:
- 3Y +6bp
- 10Y +3bp
로 작동한다면, 방향성보다 3/10 flattening이 더 안정적인 target일 수 있다.
한국 시장 복제 아이디어
모델을 최소 세 개로 분리한다.
Level Model
→ parallel DV01
3/10 Slope Model
10/30 Slope Model
그 다음 각 모델에서:
- CPI
- 금통위
- 미국 금리
- USD/KRW
- 외국인 선물
- 국채 발행
feature의 incremental IC를 별도로 본다.
실무 적용 우선순위: ★★★★★
3. Forecasting the U.S. Treasury Yield Curve: A Distributionally Robust Machine Learning Approach
구분: Treasury ML · Robust Optimization + Random Forest + DNS
발표일: 2026년 1월 8일
선정: 최신성보다 기술적 가치 때문에 선정
핵심 요약
이 연구는 금리예측 문제를 단순히 평균 RMSE를 최소화하는 문제가 아니라 미래 distribution이 바뀔 수 있다는 전제하에서 최악의 경우 손실을 제한하는 decision problem으로 재정의한다. 구조는 Factor-Augmented Dynamic Nelson-Siegel + Random Forest + Distributionally Robust Forecast Combination으로 구성된다. arXiv 원문
DNS는 level/slope/curvature를, Random Forest는 macro-financial 변수와 과거 yield 사이의 nonlinear interaction을 학습한다. 마지막 ensemble 단계에서는 단순 평균 대신 moment uncertainty와 expected-shortfall 관점의 downside risk를 고려해 forecast weight를 결정한다.
저자 결과에서는 짧은 horizon에서 adaptive combination이, 긴 horizon에서는 Random Forest가 상대적으로 강했으며, 다른 sovereign market으로 확장했을 때도 robustness를 보고한다.
채권 리스크관리 시사점
실제 데스크에서 모델 선택은:
평균적으로 누가 RMSE가 가장 작은가?
보다
regime가 깨졌을 때 누가 가장 덜 위험한가?
가 더 중요하다.
예를 들어:
| 모델 | Normal | Crisis |
|---|---|---|
| Transformer | 좋음 | 매우 나쁨 |
| DNS | 보통 | 보통 |
| RF | 좋음 | 나쁨 |
이라면 항상 Transformer만 쓰는 대신 state-dependent ensemble이 더 합리적이다.
한국 시장 복제 아이디어
DNS / LightGBM / NN / Macro model을 모두 보유하고:
model prediction
- 최근 OOS error
market regimeforecast disagreement
을 입력으로 최종 ensemble weight를 정한다.
특히 모델 간 forecast dispersion을:
Model Uncertainty Indicator
로 별도 사용하면 좋다.
모델들이 모두 같은 방향이면 size를 늘리고, 크게 갈리면 risk budget을 줄이는 것이다.
실무 적용 우선순위: ★★★★☆
Quant Firm Intelligence
4. XTX Markets Research Director — Algorithmic Trading with Large-Scale Deep Learning
구분: XTX Markets 현직 Research Director 공개 기술강연
강연일: 2026년 3월 9일
자료: Stony Brook University AI Innovation Institute
채용공고 아님
오늘 퀀트사 자료 중 가장 추천한다.
XTX Markets의 Research Director Zhangyang “Atlas” Wang이 대학 AI 세미나에서 XTX의 deep-learning 연구 방향을 직접 설명했다. 주최 측 공식 소개에 따르면 그는 XTX New York의 AI Lab을 이끌며 financial time-series와 market data용 large-scale foundation model을 개발한다. Stony Brook 세미나 원문
확인 가능한 사실 ① — XTX는 price forecast를 대규모 neural system으로 생산한다
Atlas Wang은 XTX 시스템이 매일 수만 개 financial instrument에 대한 forecast를 생성하고, 이를 기반으로 일평균 3000억달러 이상 규모의 거래를 완전 자동화 방식으로 처리한다고 설명한다. 인간 discretionary trader가 개별 거래를 결정하지 않는다는 점도 명시한다.
여기서 중요한 차이는:
AI → research recommendation
정도가 아니라:
AI forecast → automated trading
이라는 것이다.
확인 가능한 사실 ② — 연구 agenda가 명확하다
Atlas는 XTX가 실제로 다루는 기술문제를 다음과 같이 공개했다.
- time-series modeling
- large-scale optimization
- representation learning
- foundation models
- large-scale AI infrastructure
또 금융시장은 signal-to-noise가 낮고, adversarial하며, regime shift가 빈번하기 때문에 일반적인 ML benchmark보다 훨씬 어려운 deployment environment라고 설명한다.
공개자료 기반 추론
XTX의 비밀 모델 architecture나 target horizon은 공개되어 있지 않다.
따라서 “XTX가 특정 Transformer를 쓴다”거나 “몇 초 뒤 가격을 예측한다”고 단정할 수 없다.
다만 공개자료에서 확인되는 구조는 상당히 명확하다.
Massive market data
→ shared representation / foundation model
→ instrument별 forecast
→ pricing / trading decision
→ 자동 execution
→ 새로운 market data
→ retraining
이다.
특히 수만 종목이라는 규모에서는 종목마다 별도 모델을 만드는 것보다 cross-instrument representation sharing의 가치가 매우 크다.
한국 채권시장 복제 아이디어
이 접근을 한국 채권에 그대로 축소하면 재미있는 모델을 만들 수 있다.
개별적으로:
3선 모델
10선 모델
국고3년 모델
국고10년 모델
을 따로 만들지 않고 하나의 Bond Market Encoder를 만든다.
입력:
- 국채선물
- 국고 현물
- IRS
- UST
- FX
- repo
- curve state
→ 공통 latent representation
그 위에:
3선 head
10선 head
3/10 head
fill-probability head
를 붙인다.
즉:
Shared Encoder + Multi-task Heads
구조다.
데이터가 상대적으로 부족한 한국 시장에서는 개별 대형모델보다 이런 cross-asset representation sharing이 더 현실적일 수 있다.
복제 가치: ★★★★★
5. Citadel Data Strategies Group — Alternative Data를 실제 투자결정으로 바꾸는 과정
구분: Citadel 공식 인터뷰 · 현직 Quantitative Researcher Solène Chabanier
발표일: 2026년 3월 17일
채용공고 아님
확인 가능한 사실
Citadel Data Strategies Group의 Quantitative Researcher Solène Chabanier는 팀의 역할을 “복잡한 alternative dataset을 investment professional이 바로 사용할 수 있는 decision-ready insight로 변환하는 것”이라고 직접 설명한다. 위성영상 같은 real-world/real-time 데이터는 투자정보가 될 수 있지만 raw 형태로는 크고 noisy하며 바로 사용하기 어렵기 때문에, 연구자의 핵심 역할은 이를 직관적이고 timely한 signal로 변환하는 것이다. Citadel 공식 인터뷰
즉 Citadel이 설명하는 research flow는:
Alternative Raw Data → cleaning / transformation → economically interpretable output → investment professional → 실제 투자결정
이다. Citadel은 이 산출물이 단순 research report가 아니라 실제 investment decisions를 inform한다고 명시한다.
확인 가능한 사실 — “Data를 갖는 것”보다 transformation이 핵심
이 자료에서 특히 중요한 것은 satellite image 같은 alternative data 자체가 edge가 아니라는 점이다.
같은 raw dataset을 누구나 살 수 있다면:
Raw Data ≠ Alpha
다.
실제 가치가 생기는 것은:
Raw Data → 품질관리 → entity mapping → aggregation → economic feature → forecast
의 중간 단계다.
지난 브리핑에서 Two Sigma가 강조한 feature engineering과 정확히 연결되는 부분이다.
공개자료 기반 추론
Citadel이 이 데이터를 어떤 구체적인 모델이나 전략에 넣는지는 공개하지 않는다.
따라서 “위성영상으로 특정 기업 earnings를 예측한다” 같은 구체적인 전략을 공개자료 이상으로 추정하면 안 된다.
다만 P&L 연결 메커니즘은 합리적으로:
Unique / messy information → 더 빠르거나 정확한 economic state estimate → consensus 대비 정보우위 → portfolio decision 개선
으로 해석할 수 있다.
한국 채권시장 복제 아이디어
채권에서는 굳이 위성사진일 필요가 없다.
오히려 우리 조직만 얻을 수 있는 micro-alternative data가 더 중요하다.
예를 들어:
- 브로커 quote frequency
- 상대별 inquiry 빈도
- 체결 size 변화
- issuer 발행문의 증가
- 회사채 quote dispersion
- dealer inventory proxy
- 장중 민평괴리
- 특정 섹터 뉴스량
을 raw log에서 feature로 만든다.
예:
broker_quote_dispersion_5m
rfq_intensity_zscore
issuer_supply_pressure
counterparty_markout_score
이 데이터는 Bloomberg나 K-Bond에서 모두에게 동일하게 주어지는 가격정보보다 차별화된 proprietary signal이 될 가능성이 높다.
복제 가치: ★★★★★
오늘의 데스크 결론
오늘 세 연구와 두 퀀트사 자료를 연결하면 상당히 일관된 그림이 나온다.
첫 번째 논문은 뉴스 원문 자체보다 sentiment의 평균·분산·intensity 같은 representation이 중요하다는 것을 보여준다. 두 번째 연구는 macro 정보가 특히 curve slope를 예측할 때 가치가 있다고 보여준다. 세 번째 연구는 regime uncertainty가 존재하면 하나의 최고 모델보다 robust ensemble이 필요하다고 제안한다.
그리고 XTX와 Citadel의 공개자료를 붙이면 탑티어 quant의 AI workflow는 결국 다음처럼 압축된다.
Huge / Unique Raw Data
→ Good Representation
→ Shared Model
→ Many Specialized Predictions
→ Decision / Portfolio / Pricing
→ Execution
→ P&L Feedback
특히 오늘 XTX 자료에서 가장 주목할 부분은 foundation model이라는 단어 자체가 아니다.
실질적인 아이디어는:
여러 시장·종목을 하나의 representation-learning problem으로 보고 공통 정보를 공유한다.
는 것이다.
이걸 국내 채권 AI에 적용하면 다음 architecture가 꽤 유망하다.
KTB Market Foundation Encoder
입력:
3선 + 10선 + 국고현물 + IRS + UST + FX + 수급 + 뉴스
↓
공통 latent state
↓
3Y Alpha Head
10Y Alpha Head
3/10 Curve Head
Volatility Head
Fill Probability Head
Mark-out Head
이런 shared encoder + multi-task learning을 단일 예측모델보다 우선 실험해볼 가치가 있다.
오늘 논문 한 편만 읽는다면: Interpretable Machine Learning for Macro Alpha. 결과 Sharpe 숫자는 보수적으로 봐야 하지만, news mean보다 dispersion·intensity·temporal dynamics를 feature로 만드는 방식은 금통위·거시뉴스 NLP에 바로 적용할 수 있다. 논문 바로 보기
오늘 퀀트사 자료 하나만 본다면: XTX Markets Research Director Atlas Wang의 Algorithmic Trading with Large-Scale Deep Learning. 지금까지 공개된 탑티어 market maker 자료 중 time-series modeling, representation learning, foundation models, 대규모 최적화가 어떻게 완전 자동화 trading 문제와 연결되는지를 가장 직접적으로 보여주는 자료 중 하나다. XTX Research Director 강연 소개