BONDNOTE JOURNAL · 2026.09.20

D. E. Shaw가 보여준 point-in-time 데이터의 기본기

D. E. Shaw와 Quansight Labs의 Versioned HDF5 문서는 과거 시점의 결과에 나중에 알려진 데이터를 섞지 않으려면 데이터 자체의 버전관리가 필수라고 설명한다. point-in-time 데이터는 각 시점에 실제로 알 수 있었던 정보만 재구성한 데이터라는 뜻이다.

약 2분RESEARCH NOTE
다룬 자료 · D. E. Shaw — 시점 데이터 버전관리가 백테스트의 미래정보를 막는다

Versioned HDF5는 큰 배열을 청크로 나눠 해시하고 바뀐 청크만 추가한 뒤 가상 데이터셋으로 전체 상태를 재구성한다. 공식 예시에서는 117KB 배열 5,000개 버전이 별도 파일 기준 약 572MB에서 약 252MB로 줄었다. 이는 라이브러리 성능 사실일 뿐 회사의 알파나 P&L을 보여주는 수치는 아니다.

국내 채권 데이터도 체결·호가·등급·공시를 수신시각 기준의 변경불가 청크로 저장하고 정정은 새 버전으로만 추가한다. 백테스트와 생산모델에 같은 데이터 버전 해시를 붙여야 손익 차이를 당시 상태부터 재생할 수 있다.

이 연구가 소개된 하루의 글 읽기 →

편집 전 브리핑 원문 펼치기

구분: 퀀트회사 공식 기술문서·연구 데이터 인프라
발표일: 2021년(원문에 연도만 표시)
선정 이유: 최신성보다 point-in-time 재현성의 기술적 가치 때문에 선정

핵심 요약

D. E. Shaw와 Quansight Labs의 공식 기술문서는 과거 T1의 결과를 만들 때 이후 T2에 알려진 데이터를 섞지 않으려면 버전 데이터셋을 통한 ‘시간여행’이 정확성과 재현성에 필수라고 설명한다. Versioned HDF5는 큰 배열을 청크로 나누어 해시하고, 바뀐 청크만 추가 저장한 뒤 가상 데이터셋으로 각 시점의 전체 상태를 재구성하는 구조를 쓴다. 공식 예시에서는 117KB 배열의 5,000개 버전을 별도 파일로 저장하면 약 572MB인 경우가 청크 재사용으로 약 252MB가 됐다. 이는 공개된 데이터 라이브러리 설계와 벤치마크 사실이며 D. E. Shaw의 실제 알파, 라벨, 전략별 P&L은 공개되지 않았다.

실무 시사점

채권 연구의 핵심 실패는 가격모델보다 수정 공시·정정 체결·사후 확정 지표를 과거로 되돌려 쓰는 시점 누출에서 자주 생긴다. 코드와 모델만 버전관리해서는 부족하고, 백테스트가 본 원시 데이터 스냅샷과 변환계보를 같은 실험 ID로 고정해야 연구→생산→P&L 차이를 재현할 수 있다.

한국 시장 복제 아이디어

국고채·회사채 체결, 호가, 신평등급, 발행사 공시를 수신시각 기준의 변경불가 청크로 저장하고 정정분은 새 버전으로만 추가한다. 모든 백테스트에 데이터 버전 해시를 의무화하고, 운영 손익이 연구와 달라지면 당시 스냅샷부터 다시 재생한다.