BONDNOTE JOURNAL · 2026.08.29

Jane Street의 운영 엔지니어링

이 자료는 사용자가 요청한 “채용공고 너머의 기술자료”라는 관점에서 상당히 가치가 높다. 약 10년 재직한 Jane Street production engineer Mark Doss가 실제 live trading infrastructure 운영 원칙을 50분 가까이 직접 설명한다. Jane Street 공식 강연 + 전체 Transcript

약 2분RESEARCH NOTE
다룬 자료 · Jane Street — Production Engineering When Trading Billions of Dollars a Day

Jane Street는 live trading system에서 전통적인 SLO 기반 monitoring을 상대적으로 적게 사용한다고 설명한다. 이유는 주문에서 0.01% 실패조차 경제적으로 매우 큰 손실을 만들 수 있기 때문이다. 대신 edge case를 직접 정의하는 event-based alerting 비중이 높다.

Jane Street가 공개한 가장 흥미로운 monitoring 중 하나가 fill-too-good / trade-too-good alert다.

이 연구가 소개된 하루의 글 읽기 →

편집 전 브리핑 원문 펼치기

구분: Jane Street 공식 기술강연 / 현직 Production Engineer
발표: 2026년 공개
선정: 최신성보다 기술적 가치 때문에 선정

이 자료는 사용자가 요청한 “채용공고 너머의 기술자료”라는 관점에서 상당히 가치가 높다. 약 10년 재직한 Jane Street production engineer Mark Doss가 실제 live trading infrastructure 운영 원칙을 50분 가까이 직접 설명한다. Jane Street 공식 강연 + 전체 Transcript

확인 가능한 사실 ①

일반 IT의 99.99% SLA가 trading에서는 충분하지 않다

Jane Street는 live trading system에서 전통적인 SLO 기반 monitoring을 상대적으로 적게 사용한다고 설명한다. 이유는 주문에서 0.01% 실패조차 경제적으로 매우 큰 손실을 만들 수 있기 때문이다. 대신 edge case를 직접 정의하는 event-based alerting 비중이 높다.

즉:

웹서비스:

99.99% request success = excellent

trading:

99.99% correct orders = potentially catastrophic

다.


확인 가능한 사실 ②

“너무 돈을 잘 벌어도” alert가 뜬다

Jane Street가 공개한 가장 흥미로운 monitoring 중 하나가 fill-too-good / trade-too-good alert다.

체결에서 평소보다 지나치게 큰 이익이 발생하면 오히려 시스템이 이상하다고 의심한다. 시장데이터 오류, instrument mapping, order engine, strategy bug, fat-finger 등 여러 종류의 문제를 한꺼번에 잡을 수 있는 orthogonal alert로 사용한다고 설명한다.

또 정상적으로 시장 거래량의 3% 정도를 차지하던 시스템이 갑자기 60%를 차지한다면, technical service가 멀쩡하더라도 시스템 전체의 이해가 틀렸다는 epistemic-health alert를 발생시키는 사고방식을 소개한다.


확인 가능한 사실 ③

Order Engine이 마지막 Risk Firewall

Jane Street에서는 이런 이상체결 alert를 order-engine team까지 전달한다. 이유는 order engine이 거래소로 주문이 나가기 직전의 last line of defense이기 때문이다.

즉 구조가:

Model → Strategy → Position → Order Engine / Safety → Exchange

로 돼 있고,

model이 이상해도 order engine이 독립적으로 주문을 중단할 수 있어야 한다.


공개자료 기반 수익 메커니즘

이건 알파모델 이야기가 아니다.

하지만 자동매매에서 굉장히 중요한 P&L 식이 있다.

Net P&L
= Model Alpha
− Trading Cost
− Operational Loss

대부분 AI 연구자는 첫 번째 항만 개선한다.

Jane Street 자료가 보여주는 것은:

Operational Loss를 거의 0에 가깝게 관리하는 것도 하나의 trading edge다.

좋은 모델이 한 달에 1억원을 벌어도 한 번의 잘못된 order serialization으로 10억원을 잃으면 아무 의미가 없다.


한국 채권 AI에 그대로 적용할 것

AI 자동매매에 다음 네 개를 model 외부에 만들어야 한다.

① Trade-too-good

평균 mark-out 대비 비정상적으로 큰 이익:

→ market data stale?
→ instrument mapping error?
→ P&L calculation bug?

② Trade-too-bad

극단적 adverse-selection 발생 시:

→ strategy halt

③ Position-too-large

모델 신호와 상관없이:

→ hard DV01 limit

④ Volume-share-too-high

평소보다 우리 체결 비중이 급증:

→ 모델 오류 또는 시장구조 변화 의심

즉 ML 외부에 Deterministic Safety Envelope를 둔다.

이건 향후 실제 주문을 보내기 전에 반드시 필요한 계층이다.

복제 가치: ★★★★★