BONDNOTE JOURNAL · 2026.09.21

예측보다 먼저 고정할 것: 데이터, 감독, 복구, 피드백

오늘의 다섯 자료는 더 복잡한 AI를 고르는 문제보다 무엇을 고정하고 어디서 멈출지를 먼저 묻는다. OFR의 공개 벤치마크는 데이터 정제와 평가규칙을 고정해야 모델 차이를 볼 수 있음을 보여주고, BIS와 FSI는 검증의 범위를 신용·사업모델·사이버 복구까지 넓힌다. HRT와 Optiver의 공개자료는 이 원칙이 연구 재현성과 빠른 생산 피드백으로 어떻게 이어지는지 보여준다.

약 6분5 RESEARCH NOTES
READING FRAMEWORK / 개념도
연구 질문→모델과 실험→검증과 적용
연구를 읽는 관점을 표현한 개념도이며, 실측 데이터나 성과 차트가 아닙니다.
01 / RESEARCH NOTE

모델 경쟁 전에 데이터를 고정한다

다룬 자료 · OFR — 금융예측의 승부는 모델보다 고정된 데이터에서 시작한다

OFR의 공개 금융예측 벤치마크는 주식, 회사채, 미 국채, 외환, 원자재, CDS와 옵션뿐 아니라 다섯 종류의 베이시스 스프레드와 은행·중개기관 지표를 자산별 표준 정제로 묶었다. 모델을 비교하기 전에 입력 데이터와 정제 절차를 고정해야 순위가 모델 능력에서 온 것인지 데이터 선택에서 온 것인지 알 수 있다는 문제의식이다.

같은 데이터에서 약 12개 단변량 방법을 비교하자 수익률은 거의 예측되지 않았지만 하이브리드·머신러닝 모델은 베이시스와 은행 지표에서 추가 예측력을 보였다는 OFR의 결과는 표적 선택의 중요성을 보여준다. 구조적 조달·중개 제약이 남는 변수가 채권 데스크의 더 현실적인 출발점일 수 있다.

국내에서는 국고채 현물·선물 베이시스, IRS, 레포와 회사채 유동성 지표를 point-in-time, 즉 그 시점에 실제로 알 수 있었던 정보만 담는 패널로 만든다. 같은 롤링 구간과 비용 가정에서 단순모형과 AI를 비교하고 위기구간 오차와 순위 신뢰구간도 함께 남긴다.

02 / RESEARCH NOTE

AI 감독을 차주와 사업모델까지 넓힌다

다룬 자료 · BIS — AI 감독은 모델 검증에서 차주·사업모델 회복력으로 넓어진다

BIS의 9월 18일 연설은 은행의 AI 활용이 사기탐지·신용평가·준법·고객서비스와 위험관리로 넓어졌다고 설명한다. 기존 모델위험 지침은 비교적 투명한 통계모형을 전제로 했으므로 설명이 제한적인 대형언어모델과 고도 AI에는 검증과 독립검토의 재설계가 필요하다.

감독의 초점도 모형 내부에만 머물 수 없다. AI가 취약점 발견과 악용 사이의 시간을 줄이는 동시에 산업구조를 흔들면 은행은 운영회복력과 AI 충격을 받는 차주의 신용, 자신의 사업모델을 함께 봐야 한다는 것이 연설의 제안이다.

한국 시장에서는 AI 대체위험이 큰 차주군의 현금흐름·담보·차환 충격과 공통 모델 제공자 장애를 하나의 시나리오에 넣는다. 설명 점수만 보는 대신 예외승인, 수동개입과 업무 복구 실패를 은행채·회사채 스트레스 결과에 연결한다.

03 / RESEARCH NOTE

공격 속도가 빨라질수록 복구 통제가 중요하다

다룬 자료 · FSI — 프런티어 AI 시대의 희소자원은 사고 대응시간이다

FSI의 프런티어 AI 사이버 보고서는 AI가 취약점 탐색과 다단계 공격을 자동화해 방어자의 대응 창을 줄일 수 있다고 본다. 클라우드·소프트웨어·프런티어 모델 제공자에 대한 집중은 여러 금융회사가 동시에 같은 장애를 겪게 할 수 있다.

대응은 전혀 새로운 규제체계를 만드는 것보다 기존 거버넌스, 패치, 사고대응과 복구를 가속하는 데 있다. 보고서가 제안한 보완책은 AI 활동 목록과 로그, 도구·데이터 접근 제한, 고영향 행동의 사람 승인, 신뢰할 수 있는 중지·회수 통제다.

국고채 전자호가와 회사채 RFQ에서는 모델과 독립된 kill switch, 즉 주문경로를 즉시 차단하는 장치가 필요하다. 공통 클라우드와 모델 API가 함께 끊기는 훈련으로 수동호가 전환, 미확인 주문 취소와 DV01 한도 복구시간을 측정한다.

04 / RESEARCH NOTE

HRT가 벤치마크 순위보다 재현성을 보는 이유

다룬 자료 · Hudson River Trading — 논문 벤치마크보다 거래문제의 재현성을 본다

HRT의 공식 기술 글은 사내 격주 Paper Survey Club에서 논문을 검토한다고 밝히면서 공개 머신러닝 벤치마크의 점수 차이가 평가 프로토콜과 무작위성에 민감하다고 지적한다. 범용 이미지·번역 문제의 개선이 수익률 예측으로 그대로 이전된다고 볼 수 없다는 경계다.

15개 최적화 알고리즘 연구를 해설한 같은 글은 Adam이 견고한 기본값이며 튜닝과 무작위 시드 차이가 방법 간 차이만큼 클 수 있다고 정리한다. 공개된 사실은 연구 검토 방식과 재현성 원칙이며 HRT의 비공개 거래 라벨이나 P&L은 알 수 없다.

국내 채권 모델은 정확도 대신 체결확률, 체결 후 mark-out, 꼬리손실과 계산지연을 손실함수에 넣는다. 여러 시드와 기간의 신뢰구간, 단순 기준모형을 이기지 못한 결과까지 보존하고 shadow와 소액 canary를 거쳐야 선택편향을 줄일 수 있다.

05 / RESEARCH NOTE

Optiver식 피드백 고리를 국내 채권시장에 옮긴다

다룬 자료 · Optiver — 가격·리스크·집행의 피드백을 수백만 번 돌린다

Optiver 공식 사이트는 연구자가 딥러닝, 대형언어모델, 통계모형과 강화학습을 시장·대체데이터에 적용하고, 트레이더가 주문흐름·변동성·위험과 시장구조를 가격·익스포저 결정으로 바꾼다고 설명한다. 연구·트레이딩·엔지니어링을 하나의 성과 피드백 고리로 묶는 구조다.

회사가 공개한 규모는 하루 1,000만 건 이상 거래, 페타바이트급 데이터, 100개 이상 거래소와 채권을 포함한 100만 개 이상 상품이다. 공식 설명에 따르면 이 규모에서는 1% 개선도 수백만 건의 결정에서 빠르게 측정되지만, 구체적인 모델·라벨·시장별 P&L은 공개되지 않았고 회사 수치의 독립 검증도 제한적이다.

공개자료에 기반한 실무적 추론은 수익화의 핵심이 단일 예측보다 짧은 피드백 주기라는 것이다. 국고채·IRS·레포의 시장 이벤트와 주문·체결·포지션을 공통 ID로 연결하고, 변경은 shadow에서 canary로 단계적으로 확대하되 가격·수량·DV01·일손실 한도는 모델 밖에서 강제한다.

읽고 나서 남는 질문

국내 채권시장에 필요한 공통 기반은 화려한 단일 모델이 아니다. 수신시각 기준 데이터, 사전 등록한 손실함수와 홀드아웃, 권한이 제한된 배포, 독립 kill switch, 실거래 결과를 같은 ID로 되돌리는 구조다. 이 다섯 요소를 갖추면 새로운 AI를 더 빨리 시험하면서도 잘못된 개선을 더 빨리 멈출 수 있다.

편집 전 브리핑 원문 펼치기

채권시장 AI 연구 브리핑

2026년 9월 21일

조사 마감: 2026년 9월 21일 06:36 (Asia/Seoul)
원문 열람일: 2026년 9월 21일
중복 점검: 기존 50개 브리핑과 2026년 9월 20일 게시물을 대조했다. 전날의 BIS AI 투자금융, 뉴욕 연은, OECD, D. E. Shaw, G-Research 자료와 겹치지 않는 원문을 선정했다. 4번은 최신성보다 거래 연구의 재현성이라는 기술적 가치 때문에 선정했으며, 5번의 발표일은 공식 페이지에서 확인되지 않아 열람일과 구분했다.

1. OFR — 금융예측의 승부는 모델보다 고정된 데이터에서 시작한다

구분: 금융당국 Working Paper·시계열 예측 및 채권 데이터
발표일: 2026년 8월 25일

핵심 요약

미국 금융연구국(OFR)의 공개 벤치마크는 주식, 회사채, 미 국채, 외환, 원자재, CDS, 옵션, 다섯 종류의 베이시스 스프레드와 은행·중개기관 지표를 자산별 표준 정제 절차로 묶었다. 외생변수를 쓰지 않는 약 12개 단변량 예측법을 같은 데이터에서 비교하자 수익률은 모델군과 무관하게 거의 예측되지 않았지만, 하이브리드·머신러닝 모델은 베이시스 스프레드와 은행 지표에서 추가 예측력을 보였다. OFR가 강조한 결론은 모델 순위처럼 보이는 차이가 실제로는 데이터 정제 선택과 모델 능력을 뒤섞을 수 있으므로 입력 데이터를 고정해야 한다는 것이다. 논문은 공개 벤치마크 결과이며 특정 채권 전략의 거래비용 차감 수익을 입증한 것은 아니다.

실무 시사점

채권 데스크는 방향성 수익률 하나보다 현물·선물·스왑 베이시스, 레포 조달, 딜러 중개지표처럼 구조적 제약이 남는 표적에서 예측모형을 비교하는 편이 낫다. 동일한 point-in-time 데이터, 시계열 분할, 거래비용과 위기구간을 고정하지 않으면 새 모델의 개선이 정제 규칙이나 표본선택에서 왔는지 구분할 수 없다.

한국 시장 복제 아이디어

국고채 현물·선물 베이시스, IRS 스프레드, 레포금리, 회사채 유동성 지표를 수신시각 기준 패널로 만들고 단순 AR·상태공간·트리·신경망을 같은 롤링 구간에서 비교한다. 방향 정확도뿐 아니라 비용 차감 손익, 스트레스 구간 오차, 모델 간 순위 신뢰구간을 함께 공개한다.

2. BIS — AI 감독은 모델 검증에서 차주·사업모델 회복력으로 넓어진다

구분: 국제기구 연설·은행감독 및 신용위험
발표일: 2026년 9월 18일

핵심 요약

BIS 금융안정연구소 의장 연설은 은행이 사기탐지, 신용평가, 준법, 고객서비스와 위험관리에 AI를 쓰고 감독당국도 데이터 분석과 자원배분에 활용한다고 설명한다. 기존 모델위험 지침은 비교적 투명한 통계모형을 전제로 했기 때문에 설명이 제한적인 대형언어모델과 고도 AI에는 검증·독립검토 체계를 다시 설계해야 한다고 본다. 동시에 AI가 취약점 발견부터 악용까지의 시간을 줄이는 만큼 운영회복력뿐 아니라 AI로 산업구조가 흔들릴 차주의 신용과 은행 사업모델을 전향적으로 평가해야 한다는 감독 과제를 제시한다. 단순 자본가산보다 전략검토, 시나리오 분석, 지평선 탐색과 부문 간 정보공유 같은 정성적 수단이 더 적합할 수 있다는 정책 견해다.

실무 시사점

채권 신용모형의 위험은 모형 자체의 설명가능성에 그치지 않는다. AI 충격으로 현금흐름과 담보가치가 함께 바뀌는 산업, 공통 클라우드·모델 제공자 장애, 승인되지 않은 모델 변경을 하나의 신용·운영 시나리오로 연결해야 한다.

한국 시장 복제 아이디어

은행채와 회사채 스트레스에 AI 대체위험이 큰 차주군의 매출·고용·차환 충격을 추가하고, 공통 외부모델 장애 시 신용심사와 호가업무의 복구시간을 측정한다. 모델 버전 변경은 독립 승인과 사후 성능검토를 거치고, 감독 대시보드에는 설명 점수보다 예외승인·수동개입·복구 실패를 우선 표시한다.

3. FSI — 프런티어 AI 시대의 희소자원은 사고 대응시간이다

구분: 국제기구 보고서·사이버 및 거래 운영리스크
발표일: 2026년 9월 9일

핵심 요약

FSI Occasional Paper No. 28는 프런티어 AI가 취약점 탐색, 공격 개발과 다단계 실행을 자동화해 금융회사의 탐지·대응 창을 압축할 수 있다고 분석한다. 금융기관이 소수 클라우드·소프트웨어·프런티어 모델 제공자에 의존하면서 기술 집중과 서비스 접근중단 위험도 커진다는 보고서의 진단이다. 해법은 별도의 전면적 AI 사이버 규제를 새로 만드는 것보다 기존 거버넌스, 패치, 사고대응과 복구를 가속하는 데 있으며, AI 활동 목록·로그, 도구와 데이터 접근 제한, 고영향 행동의 사람 승인, 신뢰할 수 있는 중지·회수 통제를 보완하라고 제안한다. 이는 위협·정책 분석이며 특정 거래시스템 침해사고나 손실을 보고한 것은 아니다.

실무 시사점

가격·주문·위험 엔진이 같은 모델 또는 클라우드에 연결되면 작은 침해가 잘못된 호가와 포지션 확대를 동시에 만들 수 있다. 모델 신뢰도와 별도로 주문경로를 끊는 kill switch, 최소권한, 변경불가 로그, 대체 가격원과 복구목표를 사전에 시험해야 한다.

한국 시장 복제 아이디어

국고채 전자호가와 회사채 RFQ의 AI 에이전트별 도구·데이터·주문 권한을 목록화하고, 신규 종목·대량주문·한도변경은 사람 승인을 요구한다. 공통 클라우드와 모델 API가 동시에 끊기는 훈련에서 수동호가 전환시간, 미확인 주문 취소율, DV01 한도 복구시간을 측정한다.

4. Hudson River Trading — 논문 벤치마크보다 거래문제의 재현성을 본다

구분: 퀀트회사 공식 기술 블로그·머신러닝 연구 검증
발표일: 2022년 5월 16일
선정 이유: 최신성보다 기술적 가치 때문에 선정

핵심 요약

Hudson River Trading(HRT)의 공식 글은 사내에서 격주 Paper Survey Club을 열어 내부·외부 발표자와 논문을 검토한다고 밝히며, 공개 머신러닝 벤치마크의 점 추정치에는 큰 불확실성이 있고 평가 프로토콜 변화만으로 순위가 뒤집힐 수 있다고 지적한다. 이미지·번역 벤치마크의 개선이 수익률 예측과 동일하지 않으며, 최적화 알고리즘의 장점이 표본 밖 거래 문제로 자동 이전된다고 볼 수 없다는 설명이다. 15개 옵티마이저 비교를 해설한 원문은 Adam이 여전히 견고한 기본값이고 튜닝과 무작위 시드의 차이가 방법 간 차이만큼 클 수 있어 재현성과 불확실성 표시가 중요하다고 정리한다. 확인 가능한 사실은 공개된 연구문화와 벤치마크 원칙이며 HRT의 비공개 라벨·전략·P&L은 공개되지 않았다.

실무 시사점

채권용 모델은 범용 정확도보다 체결확률, 체결 후 mark-out, 꼬리손실, 계산지연처럼 실제 의사결정 손실에 맞춰 검증해야 한다. 여러 시드와 기간에서 신뢰구간을 남기고 단순 기준모형을 이기지 못한 결과까지 보존해야 연구→production→P&L 피드백이 선택편향에 오염되지 않는다.

한국 시장 복제 아이디어

국고채 호가·회사채 RFQ 모델마다 사전 등록한 기준모형, 시계열 홀드아웃, 거래비용과 스트레스 구간을 고정한다. 새 모델의 평균 개선뿐 아니라 시드별 분산과 등급·만기·유동성 구간별 실패를 연구카드로 남기고, 실거래 전 shadow와 소액 canary 단계를 거친다.

5. Optiver — 가격·리스크·집행의 피드백을 수백만 번 돌린다

구분: 퀀트·마켓메이킹 회사 공식 기술 설명·연구 생산화
발표일: 미확인 (2026년 9월 21일 열람)

핵심 요약

Optiver 공식 사이트는 연구자가 딥러닝, 대형언어모델, 통계모형과 강화학습을 시장·대체데이터에 적용하고 빠른 실험 인프라를 사용한다고 설명한다. 트레이더는 주문흐름, 변동성, 위험과 동적인 시장구조를 해석해 신호를 가격과 익스포저 결정으로 전환하며, 연구·트레이딩·엔지니어링이 하나의 성과 피드백 고리로 연결된다는 회사의 공개 설명이다. 회사가 제시한 운영 규모는 하루 1,000만 건 이상 거래, 하루 페타바이트급 데이터, 100개 이상 거래소와 채권을 포함한 100만 개 이상 상품이며, 이 규모에서는 1% 개선도 수백만 건의 실시간 결정에서 빠르게 측정된다고 밝힌다. 이 수치는 회사가 공개한 설명으로 독립 검증은 제한적이며, 구체적인 모델·라벨·시장별 손익은 공개되지 않았다.

실무 시사점

공개자료에 기반한 추론으로는 수익화의 핵심이 단일 예측모형보다 연구가 가격·위험·집행 변경으로 배포되고 실거래 피드백이 다시 연구로 돌아오는 짧은 주기에 있다. 그러나 규모 자체가 우위를 보장하지 않으므로 실험군과 대조군, 위험한도, 롤백 조건을 분리해야 개선과 시장국면 효과를 구분할 수 있다.

한국 시장 복제 아이디어

국고채 현물·선물·IRS·레포의 시장 이벤트와 주문·체결·포지션을 공통 ID로 연결하고 신호별 예상가치와 실제 mark-out을 같은 날 돌려준다. 변경은 shadow→제한된 canary→확대 순서로 배포하며 가격·수량·DV01·일손실 한도와 독립 kill switch를 모델 밖에 둔다.

오늘의 연구 목차01 · 모델 경쟁 전에 데이터를 고정한다02 · AI 감독을 차주와 사업모델까지 넓힌다03 · 공격 속도가 빨라질수록 복구 통제가 중요하다04 · HRT가 벤치마크 순위보다 재현성을 보는 이유05 · Optiver식 피드백 고리를 국내 채권시장에 옮긴다읽고 나서 남는 질문