BONDNOTE JOURNAL · 2026.09.05

금리 예측의 비교 기준을 다시 보기

이 연구는 약 47년의 미국 Treasury 수익률-curve 데이터를 가지고 ARIMA 계열, naive benchmark, ensemble ML, LightGBM, RNN, 그리고 여러 예측 Transformer를 비교한다. 결과는 의외로 ARIMA와 단순 econometric benchmark가 대부분의 time block에서 복잡한 ML/DL 모델보다 우수했다. arXiv 원문

약 2분RESEARCH NOTE
다룬 자료 · Yield Curve Forecasting using Machine Learning and Econometrics: A Comparative Analysis

ML 모델 중에서는 TimeGPT, LightGBM, RNN이 상대적으로 강했지만, “최신 Transformer를 쓰면 금리예측이 좋아진다”는 단순한 결론은 지지되지 않았다. 연구는 deep-learning input을 stationary transformation으로 할지 raw/non-stationary series로 할지에 따라서도 결과가 달라짐을 분석한다.

이 연구가 소개된 하루의 글 읽기 →

편집 전 브리핑 원문 펼치기

구분: 연구논문 · U.S. Treasury / Transformer·RNN·LGBM
발표일: 2026년 5월 11일
선정: 최신성보다 “복잡한 딥러닝이 항상 이기지 않는다”는 실무적 가치 때문에 선정

핵심 요약

이 연구는 약 47년의 미국 Treasury yield-curve 데이터를 가지고 ARIMA 계열, naive benchmark, ensemble ML, LightGBM, RNN, 그리고 여러 forecasting Transformer를 비교한다. 결과는 의외로 ARIMA와 단순 econometric benchmark가 대부분의 time block에서 복잡한 ML/DL 모델보다 우수했다. arXiv 원문

ML 모델 중에서는 TimeGPT, LightGBM, RNN이 상대적으로 강했지만, “최신 Transformer를 쓰면 금리예측이 좋아진다”는 단순한 결론은 지지되지 않았다. 연구는 deep-learning input을 stationary transformation으로 할지 raw/non-stationary series로 할지에 따라서도 결과가 달라짐을 분석한다.

채권 AI 시사점

오늘 2번 논문과 같이 보면 재미있다.

2번 논문은 hybrid NN이 잘됐지만, 이 논문에서는 전통 모델이 강했다.

차이는 결국:

architecture보다

  • target
  • representation
  • training window
  • regime
  • evaluation objective

가 더 중요하다는 것이다.

따라서 금리 AI 연구에서 반드시 Naive benchmark를 살아 있게 유지해야 한다.

예를 들어 모델 A의 RMSE가 3.41bp이고:

Yesterday Yield = Forecast

의 RMSE가 3.35bp라면 딥러닝 모델은 실패한 것이다.

복잡한 모델이 benchmark보다 0.1bp 낫더라도 turnover와 instability가 커지면 실제 P&L에서는 더 나쁠 수 있다.

한국 시장 복제 아이디어

모든 금리 forecasting experiment에 자동으로 다음 benchmark를 붙이는 것을 추천한다.

  • random walk
  • AR(1)
  • PCA/VAR
  • DNS
  • ridge
  • LightGBM

그 다음에야:

  • RNN/LSTM
  • Transformer
  • time-series foundation model

을 추가한다.

그리고 새로운 모델이 production 후보가 되려면 최소:

OOS P&L > simple benchmark P&L

뿐 아니라

incremental utility / complexity cost > 0

를 통과하게 한다.

이 기준은 AI agent가 자동으로 모델을 수백 개 생성하기 시작할수록 더 중요해진다.

데스크 적용 우선순위: ★★★★☆