BONDNOTE JOURNAL · 2026.09.21

HRT가 벤치마크 순위보다 재현성을 보는 이유

HRT의 공식 기술 글은 사내 격주 Paper Survey Club에서 논문을 검토한다고 밝히면서 공개 머신러닝 벤치마크의 점수 차이가 평가 프로토콜과 무작위성에 민감하다고 지적한다. 범용 이미지·번역 문제의 개선이 수익률 예측으로 그대로 이전된다고 볼 수 없다는 경계다.

약 2분RESEARCH NOTE
다룬 자료 · Hudson River Trading — 논문 벤치마크보다 거래문제의 재현성을 본다

15개 최적화 알고리즘 연구를 해설한 같은 글은 Adam이 견고한 기본값이며 튜닝과 무작위 시드 차이가 방법 간 차이만큼 클 수 있다고 정리한다. 공개된 사실은 연구 검토 방식과 재현성 원칙이며 HRT의 비공개 거래 라벨이나 P&L은 알 수 없다.

국내 채권 모델은 정확도 대신 체결확률, 체결 후 mark-out, 꼬리손실과 계산지연을 손실함수에 넣는다. 여러 시드와 기간의 신뢰구간, 단순 기준모형을 이기지 못한 결과까지 보존하고 shadow와 소액 canary를 거쳐야 선택편향을 줄일 수 있다.

이 연구가 소개된 하루의 글 읽기 →

편집 전 브리핑 원문 펼치기

구분: 퀀트회사 공식 기술 블로그·머신러닝 연구 검증
발표일: 2022년 5월 16일
선정 이유: 최신성보다 기술적 가치 때문에 선정

핵심 요약

Hudson River Trading(HRT)의 공식 글은 사내에서 격주 Paper Survey Club을 열어 내부·외부 발표자와 논문을 검토한다고 밝히며, 공개 머신러닝 벤치마크의 점 추정치에는 큰 불확실성이 있고 평가 프로토콜 변화만으로 순위가 뒤집힐 수 있다고 지적한다. 이미지·번역 벤치마크의 개선이 수익률 예측과 동일하지 않으며, 최적화 알고리즘의 장점이 표본 밖 거래 문제로 자동 이전된다고 볼 수 없다는 설명이다. 15개 옵티마이저 비교를 해설한 원문은 Adam이 여전히 견고한 기본값이고 튜닝과 무작위 시드의 차이가 방법 간 차이만큼 클 수 있어 재현성과 불확실성 표시가 중요하다고 정리한다. 확인 가능한 사실은 공개된 연구문화와 벤치마크 원칙이며 HRT의 비공개 라벨·전략·P&L은 공개되지 않았다.

실무 시사점

채권용 모델은 범용 정확도보다 체결확률, 체결 후 mark-out, 꼬리손실, 계산지연처럼 실제 의사결정 손실에 맞춰 검증해야 한다. 여러 시드와 기간에서 신뢰구간을 남기고 단순 기준모형을 이기지 못한 결과까지 보존해야 연구→production→P&L 피드백이 선택편향에 오염되지 않는다.

한국 시장 복제 아이디어

국고채 호가·회사채 RFQ 모델마다 사전 등록한 기준모형, 시계열 홀드아웃, 거래비용과 스트레스 구간을 고정한다. 새 모델의 평균 개선뿐 아니라 시드별 분산과 등급·만기·유동성 구간별 실패를 연구카드로 남기고, 실거래 전 shadow와 소액 canary 단계를 거친다.