AI의 경제적 변화와 장기금리
Isaiah Andrews와 Maryam Farboodi는 2022년 11월~2025년 12월 사이 frontier AI 연구소의 30개 주요 AI 모델 발표일 전후 미국 채권시장의 반응을 조사했다. 최신 개정본에서는 AI 발전에 대한 좋은 뉴스로 평가되는 모델 발표 이후 장기 Treasury와 TIPS 금리가 하락하고, 그 효과가 수주간 지속되는 패턴을 보고한다. 단순 nominal 금리만이 아니라 실질금리에서도 나타나므로 인플레이션 기대 변화만으로 설명하기 어렵다. 저자들은 이를 시장이 AI를 단순한 고성장 충격으로만 해석하지 않으며, 장기 성장·극단적 상태에 대한 믿음을 동시에 수정한다는 증거로 해석한다.
딥러닝으로 포트폴리오를 구성하기
이 연구는 개별 채권의 기대수익을 먼저 예측하고 이후 mean-variance optimization을 수행하는 전통 구조를 우회한다. 대신 딥러닝으로 고차원 특성을 압축해 deep long-short factor를 직접 만들고, benchmark portfolio와 결합해 Sharpe ratio를 최대화하는 포트폴리오를 학습한다. 미국 회사채 적용에서는 채권·주식·옵션에서 얻은 132개 특성을 함께 사용한다. 최신 소개자료에 따르면 deep factor의 표본외 Sharpe는 1을 넘고, market factor와 결합한 deep tangency portfolio는 Sharpe 2를 넘으며 기존 observable·latent factor 조합을 상회한다.
LLM이 과거를 외운 결과를 경계하기
LLM을 과거 금융데이터에 사용해 백테스트할 때 발생하는 매우 심각한 look-ahead contamination 문제를 분석한다. 연구진은 LLM이 knowledge cutoff 이전의 경제지표, 주가, 뉴스와 conference call 정보를 상당 부분 기억하고 있어, 과거 시점 예측에서 높은 정확도가 실제 예측 skill인지 단순 memorization인지 구분할 수 없다고 지적한다. “미래 정보를 쓰지 말라”고 명시적으로 지시해도 문제가 사라지지 않았고, 기업명을 가리는 masking만으로도 모델이 문맥을 통해 해당 기업과 시점을 재구성할 수 있었다. 반면 cutoff 이후 데이터에서는 이런 recall advantage가 급격히 사라졌다.
HRT의 머신러닝 연구를 읽기
HRT는 공식적으로 deep learning이 자사 trading의 핵심이라고 밝히고 있으며, 최신 AI 연구자 설명에서는 ML 모델이 HRT 거래의 “significant fraction”을 구동한다고 명시한다. 모델 개발 범위도 꽤 구체적이다. 데이터 featurization, architecture design, training dynamics뿐 아니라 “how trading decisions are made”까지 ML 연구 범위에 포함된다.
HRT가 밝힌 금융 ML의 난점도 흥미롭다. 시장 데이터는 신호-to-noise가 극도로 낮고, 시장 참가자가 모델 행동에 적응하기 때문에 distribution shift가 지속적으로 발생한다. 게다가 수백만 개의 불규칙한 event를 ultra-low latency로 실시간 처리해야 한다. 이를 위해 현대 GPU를 갖춘 대규모 compute cluster와 공통 기술플랫폼을 사용한다고 설명한다.
즉 모델을 하루 한 번 학습해 방향을 예측하는 것이 아니라 수백만 개 시장 event마다 state를 재평가하는 구조에 가깝다고 추론할 수 있다.
D. E. Shaw의 연구 인프라가 보여주는 것
D. E. Shaw의 현재 Machine Learning 연구자 역할은 financial data에서 대규모 knowledge discovery를 수행하는 고성능 computational architecture를 만드는 것을 목표로 한다. 회사는 ML 모델을 단순 연구용 POC로 끝내지 않고 실제 decision-making과 trading에 직접 measurable impact를 주는 production system으로 배포한다고 명시한다.
기술 스택 역시 PyTorch·JAX뿐 아니라 CUDA, XLA, Triton, PTX와 GPU 저수준 최적화까지 명시돼 있다. 동시에 빠른 deep-learning experiment를 위한 training workflow와 ML infrastructure의 효율성·확장성·신뢰성을 핵심 업무로 둔다.
한 연구자가 1주일에 모델 3개를 실험하는 조직과 100개를 검증할 수 있는 조직이 있다면, 개별 연구자의 능력이 같아도 후자가 더 많은 유효 알파를 찾을 가능성이 높다.
읽고 나서 남는 질문
이 자료들을 실제 운용에 연결하려면 사용한 시장과 기간, 비교 대상, 거래 비용을 먼저 확인해야 합니다. 아래 원문 링크에서 연구의 범위를 살펴보고, 국내 시장 적용 아이디어는 별도의 검증 과제로 읽어보세요.
편집 전 브리핑 원문 펼치기
채권시장 AI·Quant Intelligence 브리핑 — 2026년 8월 11일
오늘 오전까지 신규 공개분을 확인했다. 전일의 Glass Box ML, Bond Similarity Search, BlackRock Macro Decoder, Optiver LLM Trader, IMC Agentic AI는 제외했다. 오늘은 최근 개정된 연구 중 AI 발전 자체가 장기금리에 미치는 영향, 딥러닝을 이용한 회사채 포트폴리오 최적화, LLM 백테스트의 미래정보 누출 문제를 골랐고, 퀀트 회사 쪽에서는 아직 다루지 않은 **Hudson River Trading(HRT)**과 D. E. Shaw의 공식 자료를 선정했다.
1. Do Markets Believe in Transformative AI?
구분: 논문 · NBER Working Paper
최초 발표: 2025년 9월
최근 개정: 2026년 7월 26일
원문: NBER / 최신 SSRN 개정본.
핵심 요약
Isaiah Andrews와 Maryam Farboodi는 2022년 11월~2025년 12월 사이 frontier AI 연구소의 30개 주요 AI 모델 발표일 전후 미국 채권시장의 반응을 조사했다. 최신 개정본에서는 AI 발전에 대한 좋은 뉴스로 평가되는 모델 발표 이후 장기 Treasury와 TIPS 금리가 하락하고, 그 효과가 수주간 지속되는 패턴을 보고한다. 단순 nominal 금리만이 아니라 실질금리에서도 나타나므로 인플레이션 기대 변화만으로 설명하기 어렵다. 저자들은 이를 시장이 AI를 단순한 고성장 충격으로만 해석하지 않으며, 장기 성장·극단적 상태에 대한 믿음을 동시에 수정한다는 증거로 해석한다.
실무 시사점
금리 트레이딩: AI 관련 뉴스는 이제 기술주만의 이벤트가 아니다. GPT급 모델 발표, 컴퓨팅 breakthrough, 규제 변화 같은 이벤트를 장기 실질금리·term premium 이벤트로 분류할 필요가 있다.
다만 “AI 모델 발표 → 금리 하락”을 단순 이벤트 전략으로 복제하면 안 된다. 중요한 것은 AI progress surprise를 추정하는 것이다. 예컨대 benchmark improvement, 추론비용 하락, context length, agent 성능 등을 시장 기대와 비교해 surprise score로 만든 뒤 10년·30년 구간의 반응을 검증하는 편이 낫다.
한국 적용: 미국 장기금리가 국내 10·30년 구간으로 전이되는 만큼, frontier AI 발표 시각을 별도 event calendar로 만들고 UST 10Y/30Y → 원화 10Y/30Y → 외국인 국채선물 수급의 intraday 전파를 측정할 가치가 있다.
데스크 적용 우선순위: ★★★★☆
2. Deep Tangency Portfolio
구분: 논문 · Management Science forthcoming / SSRN
최근 개정: 2026년 6월 28일
원문: SSRN 최신본.
핵심 요약
이 연구는 개별 채권의 기대수익을 먼저 예측하고 이후 mean-variance optimization을 수행하는 전통 구조를 우회한다. 대신 딥러닝으로 고차원 특성을 압축해 deep long-short factor를 직접 만들고, benchmark portfolio와 결합해 Sharpe ratio를 최대화하는 포트폴리오를 학습한다. 미국 회사채 적용에서는 채권·주식·옵션에서 얻은 132개 특성을 함께 사용한다. 최신 소개자료에 따르면 deep factor의 표본외 Sharpe는 1을 넘고, market factor와 결합한 deep tangency portfolio는 Sharpe 2를 넘으며 기존 observable·latent factor 조합을 상회한다.
실무 시사점
이 논문의 핵심은 Prediction Model과 Portfolio Model을 하나로 합친다는 점이다.
일반적인 구조는
특성 → 종목 수익률 예측 → covariance → optimizer
인데, 이 방식은 두 단계의 추정오차가 누적된다. Deep Tangency는 오히려
특성 → portfolio weights → portfolio Sharpe
를 직접 최적화한다.
한국 회사채나 국고 상대가치에서는 훨씬 현실적인 형태로 축소할 수 있다. 예를 들어 3/10·10/30·본드스왑·지표-경과 후보를 입력하고 모델이 개별 가격방향이 아니라 DV01-normalized 포트폴리오 weight를 직접 출력하게 할 수 있다.
다만 논문의 headline Sharpe를 그대로 믿어서는 안 된다. 실제 국내 채권 적용에서는 거래비용, 대차, 호가 size, 미체결과 포지션 한도를 loss function에 반드시 넣어야 한다.
데스크 적용 우선순위: ★★★★★
3. The Memorization Problem: Can We Trust LLMs’ Economic Forecasts?
구분: 논문 · SSRN / AFA 2026 발표 연구
최근 개정: 2026년 4월 2일
원문: SSRN.
핵심 요약
LLM을 과거 금융데이터에 사용해 백테스트할 때 발생하는 매우 심각한 look-ahead contamination 문제를 분석한다. 연구진은 LLM이 knowledge cutoff 이전의 경제지표, 주가, 뉴스와 conference call 정보를 상당 부분 기억하고 있어, 과거 시점 예측에서 높은 정확도가 실제 forecasting skill인지 단순 memorization인지 구분할 수 없다고 지적한다. “미래 정보를 쓰지 말라”고 명시적으로 지시해도 문제가 사라지지 않았고, 기업명을 가리는 masking만으로도 모델이 문맥을 통해 해당 기업과 시점을 재구성할 수 있었다. 반면 cutoff 이후 데이터에서는 이런 recall advantage가 급격히 사라졌다.
실무 시사점
이건 채권 LLM 연구에서 거의 필수 통제사항이다.
예를 들어 현재 모델에게 2022년 레고랜드 이전 뉴스를 보여주고
“향후 회사채 시장이 악화될지 예측해라”
라고 물어 높은 적중률이 나와도, 모델이 이후 사태를 이미 학습했을 가능성을 제거할 수 없다.
따라서 LLM 신호 연구는 최소한 다음 원칙을 따라야 한다. 실제 model cutoff 이후 period만 평가하거나, 특정 시점까지만 학습된 chronologically consistent 모델을 사용해야 한다. 텍스트 parsing·분류에는 범용 LLM을 쓸 수 있지만, 그 LLM의 output 자체를 과거 알파로 검증할 때는 훨씬 엄격해야 한다.
한국 적용: 금통위·국발계·신평보고서·뉴스 NLP 백테스트에서 이 원칙을 적용하지 않으면 알파가 크게 부풀려질 수 있다. 특히 “과거 시점에서 LLM이 무엇을 알 수 있었는가”를 별도 metadata로 관리해야 한다.
데스크 적용 우선순위: ★★★★★
Quant Firm Intelligence
4. Hudson River Trading — Deep Learning이 “상당한 비중의 실제 거래”를 구동한다
구분: 회사 공식 AI/ML 페이지 · HRT AI Labs
발표일: 공식 페이지 게시일 미표기 / 2026년 8월 11일 현재 공개 확인
원문: HRT 공식 Machine Learning 페이지.
공개적으로 확인된 사실
HRT는 공식적으로 deep learning이 자사 trading의 핵심이라고 밝히고 있으며, 최신 AI Researcher 설명에서는 ML 모델이 HRT 거래의 “significant fraction”을 구동한다고 명시한다. 모델 개발 범위도 꽤 구체적이다. 데이터 featurization, architecture design, training dynamics뿐 아니라 “how trading decisions are made”까지 ML 연구 범위에 포함된다.
HRT가 밝힌 금융 ML의 난점도 흥미롭다. 시장 데이터는 signal-to-noise가 극도로 낮고, 시장 참가자가 모델 행동에 적응하기 때문에 distribution shift가 지속적으로 발생한다. 게다가 수백만 개의 불규칙한 event를 ultra-low latency로 실시간 처리해야 한다. 이를 위해 현대 GPU를 갖춘 대규모 compute cluster와 공통 기술플랫폼을 사용한다고 설명한다.
수익 메커니즘 — 공개자료 기반 추론
HRT 공개자료에서 읽히는 구조는 다음과 같다.
Event stream
→ Deep predictive representation
→ short-horizon conditional forecast
→ trading decision
→ low-latency execution
즉 모델을 하루 한 번 학습해 방향을 예측하는 것이 아니라 수백만 개 시장 event마다 state를 재평가하는 구조에 가깝다고 추론할 수 있다.
또 하나 중요한 것은 adversarial adaptation이다. 모델이 수익을 내기 시작하면 다른 참여자와 시장 자체가 그 행동에 적응한다. 따라서 고정 모델의 성능보다 continual research + rapid retraining + deployment가 경쟁력에 더 가깝다.
한국 채권시장에 복제한다면
국고채 자동매매에서도 bar 데이터보다 event-time 데이터가 먼저다.
호가 추가
→ 호가 취소
→ 잔량 변화
→ 선물 체결
→ 현물 체결
→ 외국인 주문흐름
을 각각 하나의 event로 저장하고 모델이 상태를 업데이트하게 만드는 것이다.
특히 “10초 뒤 가격” 하나를 맞히기보다
E[markout | current state, action]
을 추정하면 실제 행동으로 연결하기 훨씬 쉽다.
복제 난이도: ★★★★★
복제 가치: ★★★★★
5. D. E. Shaw — ML 경쟁력의 핵심은 모델보다 ‘고성능 연구 아키텍처’
구분: 회사 공식 Machine Learning Researcher 공개자료
발표일: 게시일 미표기 / 2026년 8월 11일 현재 모집 확인
원문: D. E. Shaw 공식 채용 페이지.
공개적으로 확인된 사실
D. E. Shaw의 현재 Machine Learning Researcher 역할은 financial data에서 대규모 knowledge discovery를 수행하는 고성능 computational architecture를 만드는 것을 목표로 한다. 회사는 ML 모델을 단순 연구용 POC로 끝내지 않고 실제 decision-making과 trading에 직접 measurable impact를 주는 production system으로 배포한다고 명시한다.
기술 스택 역시 PyTorch·JAX뿐 아니라 CUDA, XLA, Triton, PTX와 GPU 저수준 최적화까지 명시돼 있다. 동시에 빠른 deep-learning experiment를 위한 training workflow와 ML infrastructure의 효율성·확장성·신뢰성을 핵심 업무로 둔다.
수익 메커니즘 — 공개자료 기반 추론
여기서 수익원은 특정 신경망 구조를 아는 것이 아니다.
더 유용한 해석은:
Research throughput × model quality × deployment speed
다.
한 연구자가 1주일에 모델 3개를 실험하는 조직과 100개를 검증할 수 있는 조직이 있다면, 개별 연구자의 능력이 같아도 후자가 더 많은 유효 알파를 찾을 가능성이 높다.
D. E. Shaw가 low-level GPU engineering까지 투자하는 이유도 단순 training cost 절감만이 아니라, 같은 시간 안에 더 많은 가설을 실험하는 경제적 가치 때문이라고 해석하는 편이 합리적이다. 다만 어떤 trading strategy에 어떤 모델이 쓰이는지는 공개돼 있지 않다.
한국 채권시장에 복제한다면
GPU 클러스터부터 따라 할 필요는 없다. 먼저 연구 throughput을 측정하는 것이 낫다.
예를 들어 하나의 아이디어에 대해
dataset 생성 → feature 추가 → 학습 → walk-forward → 거래비용 적용 → 리스크 검증 → report
를 완전 자동화하면, 사람이 매번 Python notebook을 만드는 것보다 훨씬 많은 아이디어를 테스트할 수 있다.
결국 중요한 KPI는 “가장 복잡한 모델”이 아니라 주당 유효 실험 수, 재현 가능한 OOS 실험 수, 아이디어→production까지의 시간이 될 수 있다.
복제 난이도: ★★★★☆
복제 가치: ★★★★★
오늘의 데스크 결론
오늘 다섯 자료를 같이 놓으면 세 가지 레이어가 선명해진다.
첫 번째는 Information Layer다. LLM은 훌륭한 텍스트 처리기지만, 과거 데이터를 대상으로 한 백테스트에서는 memorization 때문에 실제 알파처럼 보이는 가짜 성과를 만들 수 있다.
두 번째는 Portfolio Layer다. Deep Tangency 연구는 “종목별 미래수익률을 하나씩 맞혀야 한다”는 생각에서 벗어나, 고차원 정보를 최종 포트폴리오 행동으로 직접 압축할 수 있음을 보여준다.
세 번째가 Production Layer다. HRT와 D. E. Shaw 공개자료를 보면 최고 수준의 퀀트 조직에서 AI 경쟁력은 단순 model architecture보다 event-time 데이터, 대규모 실험, GPU/compute, 빠른 deployment와 실제 trading feedback loop 전체에 걸쳐 있다.
그래서 채권 자동매매 개발에서 우선순위를 한 문장으로 정리하면 **“더 좋은 Transformer를 찾기 전에 더 빠르고 깨끗한 실험-실행-피드백 루프를 만든다”**가 오늘의 결론이다.
오늘 한 편만 읽는다면 Deep Tangency Portfolio, 모델 검증 체계를 만든다면 The Memorization Problem, 글로벌 퀀트의 실제 AI 경쟁력을 본다면 HRT의 Machine Learning at HRT를 가장 추천한다.