BONDNOTE JOURNAL · 2026.08.11

LLM이 과거를 외운 결과를 경계하기

LLM을 과거 금융데이터에 사용해 백테스트할 때 발생하는 매우 심각한 look-ahead contamination 문제를 분석한다. 연구진은 LLM이 knowledge cutoff 이전의 경제지표, 주가, 뉴스와 conference call 정보를 상당 부분 기억하고 있어, 과거 시점 예측에서 높은 정확도가 실제 예측 skill인지 단순 memorization인지 구분할 수 없다고 지적한다. “미래 정보를 쓰지 말라”고 명시적으로 지시해도 문제가 사라지지 않았고, 기업명을 가리는 masking만으로도 모델이 문맥을 통해 해당 기업과 시점을 재구성할 수 있었다. 반면 cutoff 이후 데이터에서는 이런 recall advantage가 급격히 사라졌다.

약 2분RESEARCH NOTE
다룬 자료 · The Memorization Problem: Can We Trust LLMs' Economic Forecasts?

이 연구가 소개된 하루의 글 읽기 →

편집 전 브리핑 원문 펼치기

구분: 논문 · SSRN / AFA 2026 발표 연구
최근 개정: 2026년 4월 2일
원문: SSRN.

핵심 요약

LLM을 과거 금융데이터에 사용해 백테스트할 때 발생하는 매우 심각한 look-ahead contamination 문제를 분석한다. 연구진은 LLM이 knowledge cutoff 이전의 경제지표, 주가, 뉴스와 conference call 정보를 상당 부분 기억하고 있어, 과거 시점 예측에서 높은 정확도가 실제 forecasting skill인지 단순 memorization인지 구분할 수 없다고 지적한다. “미래 정보를 쓰지 말라”고 명시적으로 지시해도 문제가 사라지지 않았고, 기업명을 가리는 masking만으로도 모델이 문맥을 통해 해당 기업과 시점을 재구성할 수 있었다. 반면 cutoff 이후 데이터에서는 이런 recall advantage가 급격히 사라졌다.

실무 시사점

이건 채권 LLM 연구에서 거의 필수 통제사항이다.

예를 들어 현재 모델에게 2022년 레고랜드 이전 뉴스를 보여주고

“향후 회사채 시장이 악화될지 예측해라”

라고 물어 높은 적중률이 나와도, 모델이 이후 사태를 이미 학습했을 가능성을 제거할 수 없다.

따라서 LLM 신호 연구는 최소한 다음 원칙을 따라야 한다. 실제 model cutoff 이후 period만 평가하거나, 특정 시점까지만 학습된 chronologically consistent 모델을 사용해야 한다. 텍스트 parsing·분류에는 범용 LLM을 쓸 수 있지만, 그 LLM의 output 자체를 과거 알파로 검증할 때는 훨씬 엄격해야 한다.

한국 적용: 금통위·국발계·신평보고서·뉴스 NLP 백테스트에서 이 원칙을 적용하지 않으면 알파가 크게 부풀려질 수 있다. 특히 “과거 시점에서 LLM이 무엇을 알 수 있었는가”를 별도 metadata로 관리해야 한다.

데스크 적용 우선순위: ★★★★★