BONDNOTE JOURNAL · 2026.08.30

LLM을 금융 업무에 쓸 때, 역할을 구체적으로 나누기

LLM은 강화학습을 돕거나 감독 업무를 지원할 수 있습니다. 거래 관계의 정보와 대규모 데이터 운영 사례를 더해, 각 도구가 맡을 수 있는 역할을 살펴봅니다.

약 7분5 RESEARCH NOTES
READING FRAMEWORK / 개념도
연구 질문→모델과 실험→검증과 적용
연구를 읽는 관점을 표현한 개념도이며, 실측 데이터나 성과 차트가 아닙니다.
01 / RESEARCH NOTE

LLM과 강화학습을 결합한 연구를 읽기

다룬 자료 · A Survey on LLM-Enhanced Reinforcement Learning in Financial Markets

금융 의사결정에서 LLM과 reinforcement learning을 결합하는 연구를 체계적으로 분류한 최신 오픈액세스 리뷰가 8월 28일 공개됐다. 기존 연구가 흩어져 있어 LLM이 단순 텍스트 encoder인지, RL agent의 reasoning/planning module인지, reward 또는 environment 생성에 관여하는지를 비교하기 어려웠다는 문제에서 출발한다. Springer 원문

핵심 흐름은 LLM이 단순히 “뉴스 sentiment를 숫자로 만드는 모델”에서 벗어나 상태 해석, 전략 생성, memory, tool use, action planning을 담당하고, RL이 실제 행동정책을 최적화하는 방향으로 가고 있다는 점이다. 하지만 금융시장은 non-stationary하고 reward가 희소하며 거래비용·market impact가 있기 때문에, 일반적인 게임·로보틱스 RL보다 검증 난도가 훨씬 높다는 점도 강조한다.

02 / RESEARCH NOTE

BIS의 금융감독 업무와 LLM

다룬 자료 · BIS Bulletin 134 — Supervisory Screening with Large Language Models: Finding Divergences

BIS는 LLM을 이용해 금융상품 prospectus와 자본규제를 자동 비교하고 잠재적인 불일치를 ranking하는 procedure를 개발했다. 유럽 G-SIB의 Additional Tier 1(AT1) 채권 prospectus에 적용했고, Credit Suisse와 Yes Bank의 익명화 문서를 대상으로 검증했을 때 이후 실제 AT1 손실흡수 분쟁에서 중요해진 rule–prospectus divergence를 찾아냈다. BIS Bulletin 134 원문

특히 중요한 점은 LLM을 “최종 법적 판정기”로 쓰지 않는다는 것이다. 모델은 문서 수천 페이지에서 사람이 검토할 후보를 우선순위화하는 screening engine으로 사용되며, supervisory judgment는 인간에게 남긴다.

03 / RESEARCH NOTE

정보를 가진 고객과 딜러의 관계

다룬 자료 · Informed Trading and the Dynamics of Client–Dealer Connections in Corporate Bond Markets

Bank of England와 BIS 연구진은 counterparty identity가 공개된 regulatory corporate-bond transaction data를 이용해 고객–dealer 관계와 정보거래를 분석했다. 결과적으로 sophisticated client는 하나의 dealer에 주문을 몰기보다 여러 dealer에 주문을 분산시킬 때 더 좋은 성과를 냈고, 이 효과는 informationally sensitive client, HY bond, COVID 같은 정보집약적 기간에서 더 강했다. Oxford Academic 원문

또 국채와 회사채를 동시에 거래하는 고객을 식별했을 때 dealer relationship 효과는 회사채에서 더 크고 오래 지속됐다. 즉 OTC 회사채에서는 단순 가격 외에 누가 누구와 거래하는가라는 network state 자체가 정보다.

04 / RESEARCH NOTE

HRT의 대규모 데이터와 딥러닝

다룬 자료 · Hudson River Trading — 20TB/일 Market Data + Deep Learning + Microsecond Engineering

HRT는 최근 공식 LinkedIn 기술 업데이트에서 하루 약 20TB의 streaming market data를 처리한다고 공개했다. 동시에 trading infrastructure에서는 microsecond 단위 latency가 중요하기 때문에 throughput과 latency를 동시에 맞춰야 하며, 이 과정에서 C++가 핵심 역할을 한다고 Software Engineering Lead Eric Lubin이 설명한다. HRT 공식 LinkedIn 기술 업데이트

HRT AI Labs 공식 페이지에서는 deep learning이 이미 HRT trading의 significant fraction을 drive하고 있다고 명시한다. 시장 데이터는 신호-to-noise가 매우 낮고, adversarial participant가 모델 행동에 적응하며, distribution shift가 빈번한 동시에 millions of bursty, irregularly spaced events를 실시간 처리해야 한다고 설명한다. HRT Machine Learning 공식 페이지

HAIL 연구자 Marc가 공개한 설명도 실무적으로 흥미롭다. 거래소는 깔끔한 (X,Y) supervised 데이터셋을 주지 않고 오직 event stream만 보내기 때문에 무엇을 target으로 정의할지 자체가 연구문제이며, future buy price·sell price·mid·classification 등 target 정의부터 시작해야 한다고 설명한다. HRT의 ML 문제정의 설명

05 / RESEARCH NOTE

D. E. Shaw의 연산 자원과 운영 관찰

다룬 자료 · D. E. Shaw Group — Millions of Compute Jobs를 어떻게 관측하고 Alpha Factory의 병목을 찾는가

D. E. Shaw Group 내부 compute grid에서는 매월 수백만 개의 workload가 실행되며 연구자·engineer·quant 팀이 짧은 experiment부터 장기간 service까지 같은 HPC infrastructure를 이용한다. 회사는 각 task별 requested compute와 실제 consumed compute를 개별 task ID 수준에서 추적한다. ClickHouse × D. E. Shaw 기술 case study 원문

D. E. Shaw SRE Mike Vasiliou가 참여한 benchmark에서는 동일 hardware/data 조건에서 ClickHouse가 단일 노드 기준 약 3.5 million samples/sec, 비교대상은 약 480,000 samples/sec를 처리했다. 실제 production cluster는 평균 약 530k records/sec, peak 100만 건 이상을 ingest하며, 여러 해에 걸친 약 68TB compressed metrics data를 보유한다. 원문 — Scaling the metrics platform

이 자료의 진위는 ClickHouse의 일방적 광고만으로 보는 것보다 신뢰도가 높다. D. E. Shaw 현직자 Prerna Rai와 Jazmin Medina도 해당 사례를 직접 공유하며 자사 compute grid와 운영 의사결정에 ClickHouse를 사용한다고 확인했다.

읽고 나서 남는 질문

이 자료들을 실제 운용에 연결하려면 사용한 시장과 기간, 비교 대상, 거래 비용을 먼저 확인해야 합니다. 아래 원문 링크에서 연구의 범위를 살펴보고, 국내 시장 적용 아이디어는 별도의 검증 과제로 읽어보세요.

편집 전 브리핑 원문 펼치기

채권시장 AI·Quant Intelligence — 2026년 8월 30일

전일의 M3 시장 시뮬레이터, corporate-bond information risk, AI productivity/장기금리, Optiver×NVIDIA, Jane Street production engineering은 제외했다.

오늘은 최근 48시간 안에 나온 LLM+RL 금융 리뷰, 8월 26일 BIS의 LLM supervisory screening, 그리고 회사채 RFQ에서 바로 모델링 가능한 client–dealer informed-flow 연구를 골랐다. 퀀트사 쪽은 새 공개 기술자료를 우선해 HRT의 초저지연 데이터/ML production 구조와, 채용공고 수준을 훨씬 넘어 실제 내부 compute 운영수치를 공개한 D. E. Shaw의 observability stack을 본다.

오늘의 키워드는 **AI Agent → Information Extraction → Microstructure → Compute/Production Reliability**다.


1. A Survey on LLM-Enhanced Reinforcement Learning in Financial Markets

구분: 동료평가 리뷰 · Discover Artificial Intelligence / LLM + RL
발표일: 2026년 8월 28일

핵심 요약

금융 의사결정에서 LLM과 reinforcement learning을 결합하는 연구를 체계적으로 분류한 최신 오픈액세스 리뷰가 8월 28일 공개됐다. 기존 연구가 흩어져 있어 LLM이 단순 텍스트 encoder인지, RL agent의 reasoning/planning module인지, reward 또는 environment 생성에 관여하는지를 비교하기 어려웠다는 문제에서 출발한다. Springer 원문

핵심 흐름은 LLM이 단순히 “뉴스 sentiment를 숫자로 만드는 모델”에서 벗어나 상태 해석, 전략 생성, memory, tool use, action planning을 담당하고, RL이 실제 행동정책을 최적화하는 방향으로 가고 있다는 점이다. 하지만 금융시장은 non-stationary하고 reward가 희소하며 거래비용·market impact가 있기 때문에, 일반적인 게임·로보틱스 RL보다 검증 난도가 훨씬 높다는 점도 강조한다.

채권 트레이딩 시사점

채권 agent를 만들 때 다음 두 역할을 분리하는 것이 중요하다.

LLM

  • 금통위 문장 해석
  • 입찰·발행계획 구조화
  • 뉴스/event state 추출
  • 전략 후보 생성

RL / Optimizer

  • Long/Short 여부
  • size
  • hedge timing
  • execution sequence

즉 LLM에게 곧바로

“10선을 몇 계약 팔까?”

를 묻는 것보다,

Unstructured information → Structured State

까지만 맡기고 실제 포지션 결정은 수치적 reward와 hard risk constraint가 있는 별도 decision layer가 맡는 구조가 낫다.

한국 시장 복제 아이디어

예를 들어 금통위일에:

통방문 + 기자회견 + 전망치 → LLM
→ hawkishness / growth revision / inflation revision / uncertainty

그 다음:

LLM state + 3선/10선 LOB + position + DV01 → policy model
→ 3-10 flattener 30% risk budget

식으로 구성한다.

우선순위: ★★★★★


2. BIS Bulletin 134 — Supervisory Screening with Large Language Models: Finding Divergences

구분: 국제기구 · BIS Bulletin 134 / 금융문서 LLM
발표일: 2026년 8월 26일

핵심 요약

BIS는 LLM을 이용해 금융상품 prospectus와 자본규제를 자동 비교하고 잠재적인 불일치를 ranking하는 procedure를 개발했다. 유럽 G-SIB의 Additional Tier 1(AT1) 채권 prospectus에 적용했고, Credit Suisse와 Yes Bank의 익명화 문서를 대상으로 검증했을 때 이후 실제 AT1 손실흡수 분쟁에서 중요해진 rule–prospectus divergence를 찾아냈다. BIS Bulletin 134 원문

특히 중요한 점은 LLM을 “최종 법적 판정기”로 쓰지 않는다는 것이다. 모델은 문서 수천 페이지에서 사람이 검토할 후보를 우선순위화하는 screening engine으로 사용되며, supervisory judgment는 인간에게 남긴다.

채권·크레딧 실무 시사점

이 구조는 회사채 분석에 거의 그대로 복제할 수 있다.

예를 들어:

발행계획서 vs 기존 사채 계약 vs 신평보고서 vs 사업보고서

를 LLM이 비교해:

  • 보증조건 변화
  • 조기상환 조건
  • change-of-control
  • cross-default
  • 담보순위
  • call structure
  • 재무 covenant

같은 변경점만 ranking하게 만들 수 있다.

특히 크레딧에서는 “문서를 잘 요약하는 것”보다 이전 문서와 무엇이 달라졌는가가 돈이 된다.

한국 시장 복제 아이디어

회사채 발행조건 V_t 와 V_{t-1}

을 LLM diff engine으로 비교해:

“이번 발행에서 투자자에게 불리하게 변한 조항 Top 5”

를 자동 생성하게 한다.

신평 3사의 신규 보고서도 전월 보고서와 비교해 risk-language delta만 추출하면 analyst가 읽어야 할 문서량을 크게 줄일 수 있다.

이건 생성형 AI가 채권 데스크에서 바로 생산성으로 연결될 가능성이 높은 use case다.

우선순위: ★★★★★


3. Informed Trading and the Dynamics of Client–Dealer Connections in Corporate Bond Markets

구분: 동료평가 논문 · Review of Asset Pricing Studies / 회사채 시장미시구조
현재 확정본 업데이트: 2026년 8월 8일 typeset/corrected
게재: Volume 16, Issue 3, September 2026

AI 논문은 아니다. 오늘은 최신성보다 ‘dealer AI가 무엇을 예측해야 하는가’라는 기술적 가치 때문에 선정했다.

핵심 요약

Bank of England와 BIS 연구진은 counterparty identity가 공개된 regulatory corporate-bond transaction data를 이용해 고객–dealer 관계와 정보거래를 분석했다. 결과적으로 sophisticated client는 하나의 dealer에 주문을 몰기보다 여러 dealer에 주문을 분산시킬 때 더 좋은 성과를 냈고, 이 효과는 informationally sensitive client, HY bond, COVID 같은 정보집약적 기간에서 더 강했다. Oxford Academic 원문

또 국채와 회사채를 동시에 거래하는 고객을 식별했을 때 dealer relationship 효과는 회사채에서 더 크고 오래 지속됐다. 즉 OTC 회사채에서는 단순 가격 외에 누가 누구와 거래하는가라는 network state 자체가 정보다.

채권 AI 시사점

이 연구는 RFQ 모델에 중요한 feature를 하나 추가한다.

기존:

bond

  • size
  • quote distance
  • market state

보다

client identity

  • client–dealer relationship state
  • recent dealer dispersion

을 같이 봐야 한다.

예를 들어 고객이 평소 특정 dealer 한 곳과만 거래하다 갑자기 동시에 6곳에 RFQ를 던지면 그것 자체가 information urgency / price discovery intensity의 signal일 수 있다.

따라서 다음을 모델링할 가치가 있다.

P(informed flow | client, dealer network, size, state)

그리고 이를:

Fill Probability 뿐 아니라 Expected Post-Trade Mark-out

에 넣는다.

한국 시장 복제 아이디어

브로커 또는 counterparty가 식별 가능한 내부 데이터를 기준으로:

  • 평소 거래 상대 수
  • 최근 RFQ 상대 확대 여부
  • 평균 quote dispersion
  • size 변화
  • 이후 1분/10분 mark-out

을 feature로 만든다.

그러면 **“누가 샀다”보다 “평소와 다른 방식으로 liquidity를 찾고 있는가”**를 포착할 수 있다.

우선순위: ★★★★★


Quant Firm Intelligence

4. Hudson River Trading — 20TB/일 Market Data + Deep Learning + Microsecond Engineering

구분: HRT 공식 최신 기술자료 + 공식 HRT AI Labs 자료
최신 기술 업데이트: 2026년 8월 말

HRT는 이전 브리핑에서 deep learning 활용 자체를 다룬 적이 있다. 오늘 다시 넣은 이유는 이번에 새로 공개된 production-scale data/latency 수치가 AI 모델을 실제 시장에 넣는 engineering constraint를 상당히 구체적으로 보여주기 때문이다.

확인 가능한 사실

HRT는 최근 공식 LinkedIn 기술 업데이트에서 하루 약 20TB의 streaming market data를 처리한다고 공개했다. 동시에 trading infrastructure에서는 microsecond 단위 latency가 중요하기 때문에 throughput과 latency를 동시에 맞춰야 하며, 이 과정에서 C++가 핵심 역할을 한다고 Software Engineering Lead Eric Lubin이 설명한다. HRT 공식 LinkedIn 기술 업데이트

HRT AI Labs 공식 페이지에서는 deep learning이 이미 HRT trading의 significant fraction을 drive하고 있다고 명시한다. 시장 데이터는 signal-to-noise가 매우 낮고, adversarial participant가 모델 행동에 적응하며, distribution shift가 빈번한 동시에 millions of bursty, irregularly spaced events를 실시간 처리해야 한다고 설명한다. HRT Machine Learning 공식 페이지

HAIL 연구자 Marc가 공개한 설명도 실무적으로 흥미롭다. 거래소는 깔끔한 (X,Y) supervised dataset을 주지 않고 오직 event stream만 보내기 때문에 무엇을 target으로 정의할지 자체가 연구문제이며, future buy price·sell price·mid·classification 등 target 정의부터 시작해야 한다고 설명한다. HRT의 ML 문제정의 설명

공개자료 기반 추론

HRT에서 중요한 edge는:

Deep Model 하나가 아니라,

Raw exchange event → label/target engineering → large-scale training → ultra-low-latency inference → execution → new event data

전체 loop다.

특히 financial ML에서는 target definition이 모델 architecture만큼 중요하다.

예를 들어 국채선물에서:

다음 mid-price

를 예측하는 모델이 좋다고 해서 반드시 돈이 되는 것은 아니다.

오히려:

30초 후 executable bid 30초 후 executable ask our expected mark-out conditional on fill

이 실제 거래목적에 더 좋은 target일 수 있다.

한국 채권시장 복제 아이디어

처음부터 Transformer architecture보다 target factory를 만들어야 한다.

하나의 시장 상태에 대해 동시에:

  • 1s future mid
  • 5s future mid
  • 30s VWAP
  • passive fill probability
  • post-fill mark-out
  • realized spread

를 label로 저장한다.

그 다음 어느 target이 실제 P&L과 가장 강하게 연결되는지 실험한다.

즉:

모델 선택 전에 Target Selection을 연구한다.

이게 오늘 HRT 자료에서 가장 중요한 포인트다.

복제 가치: ★★★★★


5. D. E. Shaw Group — Millions of Compute Jobs를 어떻게 관측하고 Alpha Factory의 병목을 찾는가

구분: D. E. Shaw 현직 SRE 인터뷰 기반 기술 case study / ClickHouse
발표일: 2026년 5월 15일
선정 사유: 최신성보다 기술적 가치 때문에 선정. 채용공고가 아니라 실제 production infrastructure 수치가 공개된 드문 자료다.

확인 가능한 사실

D. E. Shaw Group 내부 compute grid에서는 매월 수백만 개의 workload가 실행되며 researcher·engineer·quant 팀이 짧은 experiment부터 장기간 service까지 같은 HPC infrastructure를 이용한다. 회사는 각 task별 requested compute와 실제 consumed compute를 개별 task ID 수준에서 추적한다. ClickHouse × D. E. Shaw 기술 case study 원문

D. E. Shaw SRE Mike Vasiliou가 참여한 benchmark에서는 동일 hardware/data 조건에서 ClickHouse가 단일 노드 기준 약 3.5 million samples/sec, 비교대상은 약 480,000 samples/sec를 처리했다. 실제 production cluster는 평균 약 530k records/sec, peak 100만 건 이상을 ingest하며, 여러 해에 걸친 약 68TB compressed metrics data를 보유한다. 원문 — Scaling the metrics platform

이 자료의 진위는 ClickHouse의 일방적 광고만으로 보는 것보다 신뢰도가 높다. D. E. Shaw 현직자 Prerna Rai와 Jazmin Medina도 해당 사례를 직접 공유하며 자사 compute grid와 운영 의사결정에 ClickHouse를 사용한다고 확인했다.

왜 이게 Quant Alpha와 관련 있나

표면적으로는 observability 이야기다.

하지만 실질적인 경제학은:

수백만 Research Job → 어떤 experiment가 GPU/CPU를 얼마나 사용했는지 추적 → idle / over-request / bottleneck 탐지 → compute 재배분 → 더 많은 연구 experiment → 알파 발견속도 증가

다.

즉 compute를 많이 보유하는 것만으로 끝나지 않는다.

“누가 얼마를 요청했고 실제로 얼마를 썼고 어느 workload가 병목인가?”

를 알 수 있어야 compute가 alpha factory가 된다.

공개자료 기반 추론

이걸 트레이딩 조직의 P&L로 옮기면:

Compute Utilization → Research Throughput → Valid Hypotheses Tested → Deployable Strategies → P&L

이다.

지난 브리핑의 Optiver가 researcher time을 강조했다면 D. E. Shaw 사례는 그 한 단계 아래인:

Researcher time을 줄이려면 infrastructure bottleneck 자체를 데이터로 측정해야 한다.

는 것을 보여준다.

한국 채권시장 복제 아이디어

대규모 HPC가 없어도 다음부터 기록하면 된다.

각 backtest마다:

researcher strategy_id dataset training time CPU/GPU hours memory data-read time feature-compute time OOS result

를 저장한다.

그러면 예를 들어:

모델 training은 5분인데 tick data loading이 42분

이라는 사실이 드러난다.

이 경우 GPU를 더 사는 것이 아니라 데이터 pipeline을 고치는 게 research velocity를 훨씬 많이 높인다.

따라서 채권 AI 연구플랫폼에 추가할 KPI는:

Useful Experiments / Compute Hour 와 Idea → Result Latency

다.

복제 가치: ★★★★★


오늘의 데스크 결론

오늘 다섯 자료에서 꽤 중요한 공통점이 보인다.

AI가 발전할수록 경쟁력의 중심이 단순히 **“더 큰 모델”**에서 멀어지고 있다.

첫 번째 최신 리뷰는 LLM이 information/reasoning layer, RL이 decision layer로 분화되는 방향을 보여준다. BIS는 실제 금융문서에서 LLM을 판단자보다 divergence-screening engine으로 사용하는 것이 현실적인 production use case임을 보여준다. 회사채 시장미시구조 연구는 AI가 학습해야 할 정보가 가격뿐 아니라 client–dealer network와 informed flow에도 있음을 보여준다.

그리고 HRT와 D. E. Shaw 자료를 붙이면 top-tier quant의 실제 AI stack은 다음처럼 읽힌다.

Huge Event Data
→ Correct Target Definition
→ Deep Learning
→ Fast Research Infrastructure
→ Low-Latency Production
→ Execution
→ P&L / Mark-out
→ New Data

여기서 오늘 국내 채권 AI에 바로 추가한다면 두 가지가 가장 가치 있어 보인다.

① Target Factory
같은 market state에서 future mid, executable price, fill, mark-out 등 여러 label을 동시에 만든다.

② Research Observability
모델뿐 아니라 연구과정 자체를 데이터화한다. 어떤 단계에서 시간이 소비되고 어떤 experiment가 실제 production P&L을 개선했는지 추적한다.

오늘 한 편만 읽는다면 BIS Bulletin 134를 추천한다. LLM을 “채권 트레이더 대신 판단하는 AI”로 쓰기보다 수천 페이지 문서에서 사람이 놓칠 divergence를 찾아주는 시스템으로 쓰는 접근이 현재 단계에서는 훨씬 현실적이다. BIS Bulletin 134 바로 보기

퀀트 production 관점에서 하나만 본다면 D. E. Shaw × ClickHouse case study를 추천한다. 실제 탑티어 퀀트 조직이 “compute를 많이 쓴다” 수준을 넘어 수백만 research workload의 자원소비까지 측정해 research factory를 운영하는 방식을 볼 수 있기 때문이다. D. E. Shaw 기술 case study 바로 보기

오늘의 연구 목차01 · LLM과 강화학습을 결합한 연구를 읽기02 · BIS의 금융감독 업무와 LLM03 · 정보를 가진 고객과 딜러의 관계04 · HRT의 대규모 데이터와 딥러닝05 · D. E. Shaw의 연산 자원과 운영 관찰읽고 나서 남는 질문