이 접근은 데이터의 양과 정보의 양을 구분하게 합니다. 비슷한 정보를 담은 변수가 반복되거나 특정 시기에만 맞는 변수가 섞이면, 입력이 많아도 안정적인 예측에 도움이 되지 않을 수 있습니다. 따라서 변수 중요도와 함께 시기별 안정성, 기존 변수에 더해지는 설명력을 확인해야 합니다.
국내 적용에서는 통화정책·경기·해외금리·환율·수급을 후보군으로 나누고, 각 정보군이 표본 밖 예측에 실제로 보탬이 되는지 비교하는 연구를 생각할 수 있습니다. 중국 시장의 결과가 한국에서도 재현되는지는 별도의 데이터와 검증이 필요합니다.
편집 전 브리핑 원문 펼치기
구분: 국채 Yield Curve ML · Extra Trees / RF / SVR / SHAP
발표일: 2026년 8월 20일
출처: Journal of Innovation & Knowledge
핵심 요약
이 연구는 중국 국채 3개월부터 10년까지 yield curve를 대상으로 31개 macro·market·term-structure feature를 구성하고, SVR·Extra Trees·Random Forest·AdaBoost를 DNS·ARIMA·Random Walk와 비교한다. 결과적으로 Extra Trees가 가장 높은 예측 정확도를 보였고, 특히 1개월을 넘는 horizon에서 전통적 benchmark 대비 우위가 두드러졌다. ScienceDirect 원문
이 논문의 좋은 점은 prediction에서 끝나지 않고 SHAP으로 feature importance와 방향성을 분석한 뒤, 중요한 변수만 다시 추려 모델을 재학습한다는 점이다. 최종적으로 6개월 SHIBOR, USD/CNY, 지급준비율, 주택가격, 고정자산투자, yield 첫 번째 PCA factor 등 6개 변수가 일관되게 중요하게 나타났고, 이들만 사용한 축약모델의 성능이 오히려 개선됐다.
채권 트레이딩 시사점
핵심은:
Feature를 많이 넣는 것과 information을 많이 넣는 것은 다르다.
이다.
31개 변수를 넣은 뒤 SHAP을 이용해 중요한 information set을 다시 압축했을 때 성능이 개선됐다는 것은, fixed income에서 특히:
Macro universe
→ nonlinear model
→ importance/interaction 분석
→ compact state representation
과정이 효과적일 수 있음을 보여준다.
또 중국처럼 정책변수·환율·유동성 요인이 강한 시장에서 tree model이 좋은 성능을 냈다는 점은 한국에도 꽤 직접적이다.
한국 시장 복제 아이디어
국고채 모델에 처음부터 100개 feature를 모두 넣는 대신, 다음 5개 cluster를 만든다.
- 통화정책
- 국내 macro
- global rates
- FX
- flow/liquidity
각 cluster에서 feature를 10~20개 넣어 Extra Trees/LightGBM을 학습한 뒤:
SHAP importance
stability by regimeincremental IC
로 핵심 feature만 남긴다.
예를 들어 최종 모델이:
KOFR/OIS
USD/KRW
UST10Y
외국인 10선 flow
curve PC1
5개로 50개짜리 모델과 비슷하거나 더 좋다면, production에서는 작은 모델이 훨씬 낫다.
실무 적용 우선순위: ★★★★★