공개자료는 구체적인 알파나 라벨을 밝히지 않는다. 다만 수익화의 병목이 원천 데이터 구매가 아니라 엔터티 매핑, 시점 정렬, 결측과 수정 이력, 분포 밖 사건의 처리에 있다는 점은 확인할 수 있다. 음수 유가처럼 기존 스키마가 예상하지 못한 값이 나타났을 때 삭제하거나 0으로 바꾸면 가장 중요한 정보를 잃는다.
국내 채권 데이터에도 관측시각과 입수시각을 따로 저장하고, 발행사·그룹·종목·공시를 하나의 entity graph로 연결할 필요가 있다. 이렇게 해야 과거 시점에 실제로 알 수 있었던 정보만으로 백테스트하고, 브로커 문의나 발행정보 같은 내부 데이터를 재현 가능한 입력 변수로 만들 수 있다.
편집 전 브리핑 원문 펼치기
구분: 퀀트회사 공식 팟캐스트 · 현직 대체데이터 책임자
발표일: 2026년 9월 2일
채용공고 아님
확인 가능한 사실
Jane Street에서 10년 넘게 근무했고 현재 대체데이터 팀을 공동으로 이끄는 Eric Mannes는 위성사진·카드 패널·날씨처럼 지저분한 외부 정보를 거래전략이 신뢰할 수 있는 데이터셋으로 바꾸는 과정을 설명한다. 회사 공식 팟캐스트는 더 좋은 ML 모델일수록 세심한 데이터 엔지니어링의 가치가 커진다고 명시한다. Jane Street 공식 에피소드
에피소드는 원유선물이 음수가 됐던 날 어떤 시스템이 깨졌는지, 회사라는 법적·경제적 개체를 데이터에서 어떻게 정의하는지, 과거 리스크 시스템이 거대한 Excel 파일이었던 시기까지 다룬다. 공개자료가 밝히는 것은 데이터 신뢰성의 작업방식이며, 구체적인 알파·라벨·수익률은 공개하지 않는다. 공식 소개
공개자료 기반 추론
수익화 메커니즘은 대체데이터 자체보다 시점 정렬, 엔터티 매핑, 결측·수정 이력, 비정상 체제 처리에서 나온다고 추론할 수 있다. 다만 어떤 시장과 horizon에 이 데이터를 쓰는지는 공개되지 않았으므로 특정 전략으로 단정할 수 없다.
한국 시장 복제 아이디어
발행사·그룹·종목을 하나의 entity graph로 관리하고, 뉴스·공시·발행·브로커 문의의 원시 ID를 동일한 채권 유니버스에 매핑한다. 각 feature에 관측시각과 입수시각을 따로 저장해 point-in-time 오류를 차단하고, 음수 유가처럼 분포 밖 사건이 생겼을 때 값 삭제가 아니라 별도 regime flag를 남긴다.