Versioned HDF5는 큰 배열을 청크로 나눠 해시하고 바뀐 청크만 추가한 뒤 가상 데이터셋으로 전체 상태를 재구성한다. 공식 예시에서는 117KB 배열 5,000개 버전이 별도 파일 기준 약 572MB에서 약 252MB로 줄었다. 이는 라이브러리 성능 사실일 뿐 회사의 알파나 P&L을 보여주는 수치는 아니다.
국내 채권 데이터도 체결·호가·등급·공시를 수신시각 기준의 변경불가 청크로 저장하고 정정은 새 버전으로만 추가한다. 백테스트와 생산모델에 같은 데이터 버전 해시를 붙여야 손익 차이를 당시 상태부터 재생할 수 있다.
편집 전 브리핑 원문 펼치기
구분: 퀀트회사 공식 기술문서·연구 데이터 인프라
발표일: 2021년(원문에 연도만 표시)
선정 이유: 최신성보다 point-in-time 재현성의 기술적 가치 때문에 선정
핵심 요약
D. E. Shaw와 Quansight Labs의 공식 기술문서는 과거 T1의 결과를 만들 때 이후 T2에 알려진 데이터를 섞지 않으려면 버전 데이터셋을 통한 ‘시간여행’이 정확성과 재현성에 필수라고 설명한다. Versioned HDF5는 큰 배열을 청크로 나누어 해시하고, 바뀐 청크만 추가 저장한 뒤 가상 데이터셋으로 각 시점의 전체 상태를 재구성하는 구조를 쓴다. 공식 예시에서는 117KB 배열의 5,000개 버전을 별도 파일로 저장하면 약 572MB인 경우가 청크 재사용으로 약 252MB가 됐다. 이는 공개된 데이터 라이브러리 설계와 벤치마크 사실이며 D. E. Shaw의 실제 알파, 라벨, 전략별 P&L은 공개되지 않았다.
실무 시사점
채권 연구의 핵심 실패는 가격모델보다 수정 공시·정정 체결·사후 확정 지표를 과거로 되돌려 쓰는 시점 누출에서 자주 생긴다. 코드와 모델만 버전관리해서는 부족하고, 백테스트가 본 원시 데이터 스냅샷과 변환계보를 같은 실험 ID로 고정해야 연구→생산→P&L 차이를 재현할 수 있다.
한국 시장 복제 아이디어
국고채·회사채 체결, 호가, 신평등급, 발행사 공시를 수신시각 기준의 변경불가 청크로 저장하고 정정분은 새 버전으로만 추가한다. 모든 백테스트에 데이터 버전 해시를 의무화하고, 운영 손익이 연구와 달라지면 당시 스냅샷부터 다시 재생한다.