ML 모델 중에서는 TimeGPT, LightGBM, RNN이 상대적으로 강했지만, “최신 Transformer를 쓰면 금리예측이 좋아진다”는 단순한 결론은 지지되지 않았다. 연구는 deep-learning input을 stationary transformation으로 할지 raw/non-stationary series로 할지에 따라서도 결과가 달라짐을 분석한다.
편집 전 브리핑 원문 펼치기
구분: 연구논문 · U.S. Treasury / Transformer·RNN·LGBM
발표일: 2026년 5월 11일
선정: 최신성보다 “복잡한 딥러닝이 항상 이기지 않는다”는 실무적 가치 때문에 선정
핵심 요약
이 연구는 약 47년의 미국 Treasury yield-curve 데이터를 가지고 ARIMA 계열, naive benchmark, ensemble ML, LightGBM, RNN, 그리고 여러 forecasting Transformer를 비교한다. 결과는 의외로 ARIMA와 단순 econometric benchmark가 대부분의 time block에서 복잡한 ML/DL 모델보다 우수했다. arXiv 원문
ML 모델 중에서는 TimeGPT, LightGBM, RNN이 상대적으로 강했지만, “최신 Transformer를 쓰면 금리예측이 좋아진다”는 단순한 결론은 지지되지 않았다. 연구는 deep-learning input을 stationary transformation으로 할지 raw/non-stationary series로 할지에 따라서도 결과가 달라짐을 분석한다.
채권 AI 시사점
오늘 2번 논문과 같이 보면 재미있다.
2번 논문은 hybrid NN이 잘됐지만, 이 논문에서는 전통 모델이 강했다.
차이는 결국:
architecture보다
- target
- representation
- training window
- regime
- evaluation objective
가 더 중요하다는 것이다.
따라서 금리 AI 연구에서 반드시 Naive benchmark를 살아 있게 유지해야 한다.
예를 들어 모델 A의 RMSE가 3.41bp이고:
Yesterday Yield = Forecast
의 RMSE가 3.35bp라면 딥러닝 모델은 실패한 것이다.
복잡한 모델이 benchmark보다 0.1bp 낫더라도 turnover와 instability가 커지면 실제 P&L에서는 더 나쁠 수 있다.
한국 시장 복제 아이디어
모든 금리 forecasting experiment에 자동으로 다음 benchmark를 붙이는 것을 추천한다.
- random walk
- AR(1)
- PCA/VAR
- DNS
- ridge
- LightGBM
그 다음에야:
- RNN/LSTM
- Transformer
- time-series foundation model
을 추가한다.
그리고 새로운 모델이 production 후보가 되려면 최소:
OOS P&L > simple benchmark P&L
뿐 아니라
incremental utility / complexity cost > 0
를 통과하게 한다.
이 기준은 AI agent가 자동으로 모델을 수백 개 생성하기 시작할수록 더 중요해진다.
데스크 적용 우선순위: ★★★★☆