BONDNOTE JOURNAL · 2026.09.17

좋은 모델보다 먼저 필요한 것: 시장충격, 통제, 데이터 기반

오늘의 다섯 자료는 모두 같은 질문을 던진다. 예측 모델이 좋아져도 체결비용을 잘못 가정하거나, 주문 통제가 약하거나, 데이터 이력이 흐리면 실제 수익으로 연결되지 않는다. 반대로 시장충격·제약·원천 데이터·연구 인프라를 먼저 설계하면 작은 모델 개선도 반복 가능한 성과로 바뀔 수 있다.

약 5분5 RESEARCH NOTES
READING FRAMEWORK / 개념도
연구 질문→모델과 실험→검증과 적용
연구를 읽는 관점을 표현한 개념도이며, 실측 데이터나 성과 차트가 아닙니다.
01 / RESEARCH NOTE

시장충격을 넣자 강화학습의 순위가 바뀌었다

다룬 자료 · Realistic Market Impact Modeling for Reinforcement Learning Trading Environments

공개 강화학습 실험은 거래비용을 단순화하기 쉽다. 하지만 이 연구는 Almgren–Chriss 구조와 제곱근 시장충격을 시뮬레이터에 넣자 알고리즘의 절대 성과뿐 아니라 상대 순위와 회전율까지 달라졌다고 보고한다. 모델이 어떤 행동을 배우는지는 보상함수 못지않게 체결 환경의 모양에 좌우된다는 뜻이다.

논문이 보고한 비용 감소 수치는 공개 시뮬레이션 안의 결과다. 실제 시장 성과로 옮겨 말할 수는 없지만, 구현손실·부분체결·충격의 감쇠를 거래별로 기록해야 한다는 설계 원칙은 바로 가져올 수 있다. 국채선물 모델을 비교할 때도 모든 정책이 동일한 주문장 재생 환경과 비용 가정을 통과해야 한다.

국내 적용에서는 장중 유동성 구간과 주문 크기별 충격을 분리하고, TWAP·수동 집행·학습 정책을 같은 기준으로 평가하는 것이 첫 단계다. 평균 수익보다 비용 후 구현손실과 꼬리손실이 운영 여부를 결정해야 한다.

02 / RESEARCH NOTE

수익 모델 밖에 단단한 주문 안전장치를 둔다

다룬 자료 · Safe and Compliant Cross-Market Trade Execution via Constrained RL and Zero-Knowledge Audits

제약 강화학습 연구는 참여율 한도, 가격 밴드, 자전거래 방지를 단순 벌점이 아니라 실행 불가능한 규칙으로 둔다. PPO가 주문을 제안하더라도 action shield가 허용 영역으로 주문을 투영하고, 별도 감사 계층이 규칙 준수를 기록하는 구조다.

이 접근의 실무적 장점은 수익 예측과 통제를 분리한다는 데 있다. 학습 모델이 손실한도를 스스로 내재화하기를 기대하지 않고, 포지션·DV01·주문 빈도·일손실 같은 규칙을 주문 직전에 다시 검사한다. 공개 결과는 시뮬레이션이므로 독립 검증은 제한적이지만 구조 자체는 딜러용 추천 시스템에 잘 맞는다.

한국 채권 시스템에서는 거절되거나 축소된 주문의 이유, 당시 모델 점수, 적용된 한도 버전을 함께 남겨야 한다. 그래야 수익 기회를 놓친 것인지 위험을 막은 것인지 사후에 분해할 수 있고, kill switch도 한 신경망의 판단이 아니라 명시적 운영 규칙으로 관리할 수 있다.

03 / RESEARCH NOTE

AI 채권 공급이 회사채 상대가치를 흔드는 방식

다룬 자료 · AI 설비투자 채권 공급이 흔드는 회사채 상대가치

Reuters 분석은 미국 하이퍼스케일러가 최근 1년간 약 2,200억달러의 채권을 발행하면서 일부 동일 발행사 채권의 상대가치가 기존 규칙과 다르게 움직였다고 설명한다. 비교 가능한 Oracle 채권에서는 더 크고 최근 발행된 종목이 오히려 더 높은 수익률과 스프레드로 거래됐다.

보통 발행잔액이 큰 채권은 유동성이 좋아 더 낮은 스프레드를 기대할 수 있다. 그러나 신규 대형물이 짧은 기간에 몰리면 딜러와 기관의 흡수능력, 섹터 집중 한도, 향후 공급 우려가 유동성 이점을 압도할 수 있다. AI라는 테마가 방향성 전망이 아니라 공급충격과 종목쌍의 가격괴리로 나타난 사례다.

국내에서는 같은 발행사의 신규물과 구물을 묶고, 발행규모·발행 후 경과일·거래량·그룹 전체 공급량을 함께 본다. 타깃을 두 종목의 잔차 스프레드가 5~20영업일에 얼마나 수렴하는지로 두면, 신용등급 방향 예측보다 직접적인 상대가치 실험이 된다.

04 / RESEARCH NOTE

대체데이터의 경쟁력은 정리와 시점 관리에서 나온다

다룬 자료 · Jane Street — 대체데이터를 거래 가능한 행으로 바꾸는 법

Jane Street의 대체데이터 책임자 Eric Mannes는 회사 공식 팟캐스트에서 위성사진, 카드 패널, 날씨 같은 외부 정보를 거래전략이 신뢰할 수 있는 행 데이터로 바꾸는 작업을 설명한다. 더 좋은 ML 모델일수록 데이터 엔지니어링의 가치가 커진다는 표현이 특히 중요하다.

공개자료는 구체적인 알파나 라벨을 밝히지 않는다. 다만 수익화의 병목이 원천 데이터 구매가 아니라 엔터티 매핑, 시점 정렬, 결측과 수정 이력, 분포 밖 사건의 처리에 있다는 점은 확인할 수 있다. 음수 유가처럼 기존 스키마가 예상하지 못한 값이 나타났을 때 삭제하거나 0으로 바꾸면 가장 중요한 정보를 잃는다.

국내 채권 데이터에도 관측시각과 입수시각을 따로 저장하고, 발행사·그룹·종목·공시를 하나의 entity graph로 연결할 필요가 있다. 이렇게 해야 과거 시점에 실제로 알 수 있었던 정보만으로 백테스트하고, 브로커 문의나 발행정보 같은 내부 데이터를 재현 가능한 입력 변수로 만들 수 있다.

05 / RESEARCH NOTE

실시간 데이터와 연구 조회를 한 기반에서 연결한다

다룬 자료 · Jane Street — 실시간 쓰기와 대규모 연구 조회를 함께 버티는 데이터웨어하우스

Jane Street의 Jacob Baskin은 공식 에피소드에서 거래 시스템 속도로 쓰기가 계속 들어오는 동안 연구자의 폭넓은 분석 쿼리를 지원하는 분산 컬럼형 데이터베이스 Superstore를 설명한다. 회사는 이 시스템을 기술 스택의 중심 구성요소라고 소개한다.

공개자료로 내부 지연시간이나 전략별 P&L은 알 수 없다. 다만 대규모 연구 클러스터의 컴퓨트 배분까지 같은 문제로 다룬다는 사실은 연구 생산성이 GPU 수량만이 아니라 데이터 접근과 작업 우선순위에 달려 있음을 보여준다. 실시간 쓰기와 연구용 조회가 분리돼 오래 기다리면 연구→production 피드백이 늦어진다.

우리 환경에서는 호가·체결·주문·포지션을 append-only 이벤트로 저장하고, 같은 입력 변수 정의가 백테스트와 실시간 추론에서 재사용되는지 추적해야 한다. 컴퓨트 큐에는 실험 우선순위, 예상시간, 데이터 버전, GPU 요구량을 남겨 연구자 시간이 어디에서 소모되는지도 함께 측정할 수 있다.

읽고 나서 남는 질문

우리 데스크의 다음 실험에서 모델 점수보다 먼저 확인해야 할 것은 무엇일까. 비용 모형, 주문 제약, 데이터 시점, 실제 체결 결과 가운데 하나라도 추적되지 않는다면 그 빈칸부터 메우는 편이 새 모델을 하나 더 만드는 것보다 가치가 클 수 있다.

편집 전 브리핑 원문 펼치기

채권시장 AI 연구 브리핑

2026년 9월 17일

조사 마감: 2026년 9월 17일 15:01 Asia/Seoul
중복 점검: 기존 게시 이력의 최근 브리핑(9월 11일)까지 제목과 원문 링크를 비교했다. 아래 다섯 자료는 기존 항목과 동일하지 않다.
선정 원칙: 퀀트회사 섹션에는 채용공고를 사용하지 않았고, 회사 공식 팟캐스트의 현직자 설명을 우선했다.

1. Realistic Market Impact Modeling for Reinforcement Learning Trading Environments

구분: 연구 논문 · 강화학습 실행 · 시장충격 모형
발표일: 2026년 3월 30일
선정: 최신성보다 실행 시뮬레이션의 기술적 가치 때문에 선정

핵심 요약

이 연구는 많은 공개 강화학습 백테스트가 거래비용을 고정값이나 사실상 0으로 놓아, 현실에서 유지되기 어려운 고회전 정책을 학습시킨다는 문제에서 출발한다. 저자들은 Almgren–Chriss 구조와 제곱근 시장충격 법칙을 반영한 세 가지 Gymnasium 환경을 만들고, 영구적 충격의 감쇠와 거래별 로그를 포함했다. arXiv 원문

A2C·PPO·DDPG·SAC·TD3를 NASDAQ-100 환경에서 비교한 결과, 비용 모형을 바꾸자 절대 성과뿐 아니라 알고리즘의 상대 순위와 회전율도 달라졌다. 논문은 특정 설정에서 일일 비용이 20만달러에서 8천달러로, 회전율이 19%에서 1%로 낮아진 사례를 보고하지만 이는 공개 시뮬레이션 결과이므로 실제 시장 성과로 일반화하면 안 된다. 논문의 실험 요약

실무 시사점

RL 실행 모델의 핵심 라벨은 단순 다음 가격이 아니라 구현손실, 체결률, 재고위험, 영구·일시적 시장충격을 함께 반영한 보상함수다. 비용 모형이 알고리즘 순위까지 바꾼다는 결과는 백테스트 엔진이 모델보다 먼저 검증돼야 한다는 뜻이다.

한국 시장 복제 아이디어

국채선물과 현물의 주문장 재생 환경에 주문 크기별 충격, 부분체결, 호가잔량 회복속도, 장중 유동성 구간을 넣는다. TWAP·수동 집행·PPO 정책을 같은 체결 시뮬레이터에서 비교하고, 평균 P&L보다 비용 후 구현손실과 꼬리손실을 운영 기준으로 삼는다.

2. Safe and Compliant Cross-Market Trade Execution via Constrained RL and Zero-Knowledge Audits

구분: 연구 논문 · 제약 강화학습 · 실행 통제
발표일: 2025년 10월 6일
선정: 최신성보다 리스크 한도와 감사 가능성을 실행 에이전트에 결합한 기술적 가치 때문에 선정

핵심 요약

이 논문은 주문집행을 제약 마르코프 의사결정과정으로 정의하고, 참여율 한도·가격 밴드·자전거래 방지 같은 규칙을 학습 외부의 실행 제약으로 둔다. 고수준 계획기와 PPO 실행 에이전트 사이에 action shield를 놓아 허용되지 않는 주문을 실행 가능한 영역으로 투영하는 구조다. arXiv 원문

저자들은 ABIDES 기반 다중시장 시뮬레이터에서 TWAP·VWAP과 비교하고, 지연 증가와 부분체결 등 스트레스 상황을 평가했다. 영지식 증명까지 붙인 감사 계층은 흥미롭지만, 공개 프리프린트의 시뮬레이션 결과이며 실제 거래소·브로커 환경에서 독립 검증됐다고 볼 수는 없다. 논문 원문과 한계

실무 시사점

수익 모델과 통제 모델을 한 신경망에 맡기지 않고, 예측→주문 제안→규칙 투영→감사 로그로 분리하면 kill switch와 사후 설명이 쉬워진다. 특히 손실한도나 참여율은 보상함수의 약한 패널티보다 실행 불가능한 hard constraint로 두는 편이 운영상 명확하다.

한국 시장 복제 아이디어

채권 딜러용 추천 시스템의 첫 단계에서 action shield를 독립 모듈로 구현한다. 종목별 순포지션, DV01, 호가단위, 일손실, 주문 빈도, 상대방 한도를 주문 직전에 검사하고, 거절·축소된 이유와 당시 모델 점수까지 immutable decision log로 남긴다.

3. AI 설비투자 채권 공급이 흔드는 회사채 상대가치

구분: 신뢰도 높은 시장 분석 · AI 인프라 부채 · 회사채 상대가치
발표일: 2026년 9월 10일

핵심 요약

Reuters Open Interest 분석은 최근 1년간 미국 하이퍼스케일러의 채권 발행이 약 2,200억달러에 달했다고 집계하고, 거대한 신규 공급이 기존 회사채 상대가치 규칙을 흔드는 사례를 제시한다. Reuters 원문

Oracle의 동일 만기·동일 선순위 채권 쌍에서는 더 크고 최근 발행된 종목이 오히려 19bp 높은 수익률과 22bp 넓은 스프레드로 거래됐고, Alphabet·Meta·Nvidia의 비교 가능한 쌍에서도 신규 대형물이 15~22bp 높은 사례가 관찰됐다. 분석은 이를 동일 위험의 채권은 비슷하게 가격화된다는 규칙보다 공급 흡수 부담이 우위에 선 현상으로 해석한다. 채권별 비교 수치

실무 시사점

신규 발행 프리미엄은 발행사 신용도만으로 설명되지 않으며, 발행 규모·딜러 재고·섹터 집중도·지수 편입 수요가 상대가치 라벨에 들어가야 한다. AI 테마를 방향성 전망으로만 쓰기보다 동일 발행사의 구채권과 신규채권 사이 잔차 스프레드로 보는 편이 더 거래 가능한 문제다.

한국 시장 복제 아이디어

회사채 종목쌍마다 민평 대비 스프레드 차이, 발행잔액, 신규 발행 후 경과일, 동일 그룹 공급량, 거래량을 묶은 matched-bond 패널을 만든다. 타깃은 5~20영업일 동안의 신규물-구물 스프레드 수렴폭으로 두고, 단순 신용등급 모형과 공급·유동성 변수를 추가한 모형의 OOS 성과를 비교한다.

4. Jane Street — 대체데이터를 거래 가능한 행으로 바꾸는 법

구분: 퀀트회사 공식 팟캐스트 · 현직 대체데이터 책임자
발표일: 2026년 9월 2일
채용공고 아님

확인 가능한 사실

Jane Street에서 10년 넘게 근무했고 현재 대체데이터 팀을 공동으로 이끄는 Eric Mannes는 위성사진·카드 패널·날씨처럼 지저분한 외부 정보를 거래전략이 신뢰할 수 있는 데이터셋으로 바꾸는 과정을 설명한다. 회사 공식 팟캐스트는 더 좋은 ML 모델일수록 세심한 데이터 엔지니어링의 가치가 커진다고 명시한다. Jane Street 공식 에피소드

에피소드는 원유선물이 음수가 됐던 날 어떤 시스템이 깨졌는지, 회사라는 법적·경제적 개체를 데이터에서 어떻게 정의하는지, 과거 리스크 시스템이 거대한 Excel 파일이었던 시기까지 다룬다. 공개자료가 밝히는 것은 데이터 신뢰성의 작업방식이며, 구체적인 알파·라벨·수익률은 공개하지 않는다. 공식 소개

공개자료 기반 추론

수익화 메커니즘은 대체데이터 자체보다 시점 정렬, 엔터티 매핑, 결측·수정 이력, 비정상 체제 처리에서 나온다고 추론할 수 있다. 다만 어떤 시장과 horizon에 이 데이터를 쓰는지는 공개되지 않았으므로 특정 전략으로 단정할 수 없다.

한국 시장 복제 아이디어

발행사·그룹·종목을 하나의 entity graph로 관리하고, 뉴스·공시·발행·브로커 문의의 원시 ID를 동일한 채권 유니버스에 매핑한다. 각 feature에 관측시각과 입수시각을 따로 저장해 point-in-time 오류를 차단하고, 음수 유가처럼 분포 밖 사건이 생겼을 때 값 삭제가 아니라 별도 regime flag를 남긴다.

5. Jane Street — 실시간 쓰기와 대규모 연구 조회를 함께 버티는 데이터웨어하우스

구분: 퀀트회사 공식 팟캐스트 · 연구 인프라 · 분산 데이터베이스
발표일: 2026년 6월 24일
채용공고 아님

확인 가능한 사실

Jane Street의 데이터베이스 인프라 엔지니어 Jacob Baskin은 거래 시스템 속도로 쓰기가 계속 들어오는 동안 폭넓은 분석 쿼리를 지원하기 위해 Superstore라는 분산 컬럼형 데이터베이스를 구축했다고 설명한다. 이 시스템은 현재 회사 기술 스택의 중심 구성요소라고 공식 소개돼 있다. Jane Street 공식 에피소드

공식 소개는 첫 설계 문서가 8자리 달러 규모의 하드웨어 구매로 이어졌고, 이후 Baskin이 대규모 연구 클러스터 Hive의 컴퓨팅 자원 배분 방식까지 연구하고 있다고 밝힌다. 이는 Jane Street가 모델뿐 아니라 데이터 쓰기·조회와 연구 컴퓨트 배분을 하나의 연구 생산성 문제로 본다는 사실을 보여주지만, 구체적인 거래모델과 P&L 기여도는 공개되지 않았다. 공식 에피소드 목록

공개자료 기반 추론

연구→production→P&L 피드백을 줄이려면 야간 배치만 빠른 저장소보다 장중 데이터가 들어오는 즉시 동일 스키마로 연구자가 조회할 수 있는 구조가 중요하다. 다만 공개자료만으로 Superstore의 내부 지연시간이나 종목별 사용 방식을 알 수는 없다.

한국 시장 복제 아이디어

호가·체결·포지션·주문결과를 append-only 이벤트로 저장하고, 연구용 컬럼 저장소에는 point-in-time snapshot을 제공한다. 컴퓨트 자원은 사용자별 선착순이 아니라 실험 우선순위·예상시간·GPU 요구량을 기록한 큐로 배분하고, 성공한 실험이 같은 feature 정의로 실시간 추론까지 이어지는지 추적한다.

오늘의 데스크 결론

오늘의 공통점은 모델의 정확도보다 모델이 믿을 수 있는 환경을 먼저 만드는 것이다. 현실적인 시장충격과 hard constraint가 없는 RL은 종이 위 성과에 그칠 수 있고, AI 설비투자발 대규모 채권 공급은 기존 상대가치 규칙 자체를 흔들 수 있다. Jane Street의 공개자료도 edge가 신경망 한 개가 아니라 신뢰 가능한 행 데이터와 연구자가 즉시 조회할 수 있는 인프라에서 시작된다는 점을 보여준다.

한국 채권 AI의 우선순위는 체결 시뮬레이터 → action shield → point-in-time 데이터웨어하우스 → 모델 순서가 적절하다. 모델 판단마다 입력 데이터 버전, 비용 가정, 제약 통과 여부, 실제 체결과 사후 mark-out을 연결하면 연구 결과가 운영 가능한 P&L로 바뀌는 구간을 측정할 수 있다.

오늘의 연구 목차01 · 시장충격을 넣자 강화학습의 순위가 바뀌었다02 · 수익 모델 밖에 단단한 주문 안전장치를 둔다03 · AI 채권 공급이 회사채 상대가치를 흔드는 방식04 · 대체데이터의 경쟁력은 정리와 시점 관리에서 나온다05 · 실시간 데이터와 연구 조회를 한 기반에서 연결한다읽고 나서 남는 질문