FIXED INCOME / FIELD NOTES

The trading problem: why market data is a deep learning challenge

주문장 자료는 왜 더 많은 수작업 특징보다 딥러닝 표현학습이 필요한 문제인가?

Optiver가 제시한 목표는 현재 주문장에서 다음 가격방향을 읽는 일이다. 예측기간은 수초에서 수분이고, 입력은 주문 추가·취소·변경·체결의 사건열이다. 최우선 매수·매도만 있는 한 장면에서는 가중평균가격 같은 수작업 특징이 강하다. 같은 장면을 시간순으로 잇거나 여러 가격단계와 상관상품을 함께 보면 어떤 정보를 남기고 버릴지 사람이 일일이 정하기 어려워진다. 딥러닝은 특징추출과 가격예측을 한 모형에서 학습하려는 선택이다.

Level 3 자료에서는 같은 가격과 수량이라도 주문의 큐 위치가 다르면 체결가능성이 달라진다. 한쪽 잔량이 큰 주문 하나인지 작은 주문 여러 개인지도 집계 수량만으로는 보이지 않는다. 종목 사이 관계와 취소 순서까지 결합하면 입력은 공간과 시간을 동시에 갖는다. 다만 회사는 사용한 신경망 구조, 목표라벨, 자산별 성과를 공개하지 않았다. 공개된 내용은 수작업 특징이 막히는 지점과 표현학습을 택한 이유다.

시장자료의 제약은 언어나 영상과 다르다. 신호가 약해 좋은 모형도 52% 정확도일 수 있고 분포는 국면에 따라 바뀐다. 사건 간격도 나노초와 초 사이를 오가며 하루에는 수억 건의 메시지가 생긴다. 100,000개 사건을 보아도 평균 한 분 정도라 더 긴 문맥이 필요하고, 생산 추론에서는 매 나노초가 중요하다. 표본외 정확도만 높이는 구조보다 사건시간, 국면변화, 메모리와 꼬리 지연을 함께 견디는 구조가 실제 연구목표가 된다.

SCOPEOptiver 연구책임자의 공식 문제설명이다. 구체적인 아키텍처·라벨·백테스트·실거래 P&L은 공개되지 않았으므로 딥러닝이 특정 시장에서 수익을 냈다고 읽을 수 없다.

Evidence & verification ↓

Sources & evidence

Original passages appear only when checked against the publication. Earlier briefing records are identified separately.

The trading problem: why market data is a deep learning challenge6 primary · 0 archived +
F1 · PRIMARY RECORD

Optiver의 고빈도 가격예측 기간은 보통 수초에서 수분이다.

ORIGINAL PASSAGE
prediction horizons are typically seconds to minutes
Optiver, opening section, published 2026-10-06, accessed 2026-10-07
F2 · PRIMARY RECORD

가장 세밀한 입력은 개별 주문과 큐 위치를 복원하는 Level 3 사건자료다.

ORIGINAL PASSAGE
Level 3 data
Optiver, From Level 1 to Level 3 market data, accessed 2026-10-07
F3 · PRIMARY RECORD

공식 글은 금융 신호가 약해 좋은 모형도 52% 정확도일 수 있다고 설명한다.

ORIGINAL PASSAGE
accuracy of 52%
Optiver, Why market data is difficult to model, accessed 2026-10-07
F4 · PRIMARY RECORD

일반적인 거래일의 메시지 규모는 수억 건에 이를 수 있다.

ORIGINAL PASSAGE
hundreds of millions of messages
Optiver, Why market data is difficult to model, accessed 2026-10-07
F5 · PRIMARY RECORD

십만 사건의 문맥도 평균 벽시계 시간으로 약 한 분만 덮을 수 있다.

ORIGINAL PASSAGE
100,000 events
Optiver, Why market data is difficult to model, accessed 2026-10-07
F6 · PRIMARY RECORD

생산 추론은 나노초 단위 지연까지 모델 설계를 제약한다.

ORIGINAL PASSAGE
every nanosecond matters
Optiver, Why market data is difficult to model, accessed 2026-10-07
Publication links ↑
Show the original briefing text

구분: 퀀트·마켓메이킹 회사 공식 기술블로그·딥러닝 및 주문장
발표일: 2026년 10월 6일

핵심 요약

Optiver 공식 기술 글은 고빈도 전략의 주된 입력을 거래소의 주문 추가·취소·변경·체결 흐름이라고 밝힌다. 목표는 현재 관측으로 수초에서 수분 뒤 가격을 예측하는 것이며, Level 3에서는 개별 주문의 시각과 큐 위치까지 모델 입력이 된다. 회사는 수작업 특징이 놓치는 시간·종목 간 구조를 딥러닝 표현학습으로 찾되, 신호가 약하고 분포가 바뀌며 사건 간격이 불규칙하다는 조건을 강조한다. 하루 메시지가 수억 건이고 긴 문맥도 벽시계 시간으로는 짧아, 생산 지연과 계산비용이 모델 설계의 일부가 된다.

실무 시사점

공개된 사실은 문제정의와 연구방식이며 특정 아키텍처·라벨·시장별 P&L은 공개되지 않았다. 채권 주문장에서도 단일 스냅샷 정확도보다 시계열 문맥, 큐 변화, 상관상품, 국면변화와 추론 지연을 하나의 검증표에 놓아야 한다.

한국 시장 복제 아이디어

국채선물 Level 3 사건열과 현물·IRS를 공통 시장시각에 맞추고, 다음 사건·5초 중간가격·체결 후 mark-out을 서로 다른 라벨로 둔다. 수작업 특징 기반 GBM과 사건시간 딥러닝을 비교하되 시계열 홀드아웃, 변동성 국면별 성능, 비용 차감, p99 추론지연을 동시에 통과시킨다.