채권에서도 평시 거래와 정책 발표 직후 거래는 성격이 다릅니다. 학습자료가 평시에 편중되면 평균적인 날의 예측은 괜찮아도 중요한 사건이 발생한 날에는 취약할 수 있습니다. 날짜 단위, 사건 단위, 시장 국면 단위로 표본을 나누어 비교할 이유입니다.
이 자료는 현재 Jane Street의 특정 채권 전략이나 비공개 모델을 설명하는 문서가 아닙니다. 금융 데이터의 학습 실험을 설계할 때 참고할 수 있는 공개 연구 경험으로 읽는 것이 적절합니다.
편집 전 브리핑 원문 펼치기
구분: Jane Street 공식 기술블로그 · ML Research Practice
발표: 2017~2018년 기술 시리즈
선정: 최신성보다 기술적 가치 때문에 선정
채용공고 아님
Jane Street의 공식 ML 아카이브는 자사가 signal-to-noise ratio가 매우 낮지만 데이터 양은 매우 큰 문제를 다룬다고 명시한다. 2018년 Chris Hardin의 글은 대규모 dataset shuffling 문제를 직접 다루며, 2017년 Real world machine learning 시리즈는 trading strategy를 실제 돈을 버는 production model로 만들기 위해 어떤 실험 문제가 생기는지 설명한다. Jane Street ML 공식 아카이브
확인 가능한 사실
Jane Street는 공식적으로 trading에서 ML을 사용할 때 대량 데이터 + 극도로 낮은 SNR이라는 특성을 오래전부터 명시해왔다. 또한 batch size, dataset shuffling, regularization 같은 일반 ML 주제를 단순 benchmark 문제가 아니라 자사의 실제 대규모 학습환경에서 연구해왔다.
다만 공개자료에는 구체적인 현재 trading target이나 실제 특정 alpha model의 architecture는 없다. 따라서 이 자료로 “Jane Street가 특정 neural model을 어떤 시장에서 사용한다”고 말할 수는 없다.
공개자료 기반 추론
저 SNR 환경에서는:
모델 architecture를 복잡하게 만드는 것
보다:
- 데이터 sampling
- train/test temporal separation
- shuffling
- batch construction
- regularization
- massive-scale experimentation
이 더 중요해질 수 있다.
이건 금융 ML에서 매우 현실적이다.
예를 들어 alpha IC가 1~2% 수준이면 작은 leakage나 sampling bias가 실제 signal보다 더 큰 효과를 낼 수 있다.
한국 시장 복제 아이디어
국채 tick-data 모델에서 train loader 설계 자체를 연구대상으로 둬야 한다.
예를 들어 단순 random shuffle 대신:
Day-block sampling Event-balanced sampling Regime-balanced sampling
을 비교한다.
특히 다음 문제가 중요하다.
평시 데이터가 95%, 금통위·CPI·stress가 5%라면 random batch는 거의 항상 평시로 채워진다.
그러면 model은:
평균적인 날에는 잘 맞지만 중요한 날에는 틀리는 모델
이 된다.
따라서 training batch에:
- 평시
- macro event
- liquidity stress
- high vol
을 의도적으로 균형 배분하는 Market Regime Sampler를 만들 가치가 있다.
복제 가치: ★★★★☆