BONDNOTE JOURNAL · 2026.09.10

Optiver의 LLM 거래 실험에서 드러난 한계

LLM이 거래 개념을 설명할 수 있다는 사실은 연속적인 거래 판단도 잘한다는 뜻일까요? Optiver의 공개 실험은 이 차이를 살펴볼 수 있는 사례입니다.

약 2분RESEARCH NOTE
다룬 자료 · Optiver — LLM을 실제 trading simulation에 넣어보니 어디서 깨졌는가

원 브리핑에 따르면 모델은 적정가치와 기댓값 같은 기본 개념을 비교적 잘 다뤘지만, 새로운 정보가 들어온 뒤 판단을 일관되게 갱신하는 데 어려움을 보였습니다. 여러 단계 뒤의 결과를 고려하는 판단도 제약으로 소개됐습니다.

따라서 실무 도구를 평가할 때는 정답형 문제뿐 아니라 반복되는 의사결정, 위험 한도 준수, 정보 변화에 대한 대응도 시험해야 합니다. 이 실험의 결과를 모든 모델이나 실제 운용의 성과로 일반화하지 않는 것이 좋습니다.

이 연구가 소개된 하루의 글 읽기 →

편집 전 브리핑 원문 펼치기

구분: Optiver Applied AI 공식 실험 · 현직 trader Quintin Brown
발표일: 2026년 4월 27일
선정: 최신성보다 실제 LLM trading 실험 결과라는 기술적 가치 때문에 선정
채용공고 아님

오늘 퀀트사 자료 중에서는 이 자료를 가장 추천한다.

확인 가능한 사실 ① — LLM에게 trader 시험을 실제로 시켰다

Optiver Applied AI 팀의 trader Quintin Brown은 최신 LLM에 신입 trader 시험뿐 아니라 입사 6개월 수준의 mock trading assessment까지 시켰다. 이론 문제와 함께 실제 Optiver training에 쓰이는 market-making simulation에서도 테스트했다. Optiver 공식 실험

LLM은 fair value 계산, market-maker의 역할, adverse-selection 개념 등 기본 trading reasoning에서는 꽤 좋은 성능을 보였고, 일부 기초 영역에서는 intern 수준과 경쟁할 정도였다고 Optiver는 평가한다.

확인 가능한 사실 ② — 약점은 “sequential updating”

가장 반복적으로 나타난 실패는:

  • fair value를 일관되게 업데이트하지 못함
  • 한 번 행동한 뒤 새로운 정보를 제대로 반영하지 못함
  • 1~2단계 이상의 미래 reasoning이 약함

이었다.

즉 LLM이:

Information A → fair value 수정
→ trade

까지는 잘하지만,

Information B 추가 → 과거 trade와 새로운 information을 종합
→ 다시 belief 업데이트

하는 과정에서 자주 무너졌다.

이건 실제 trading agent에서 매우 중요한 failure mode다.

확인 가능한 사실 ③ — EV를 알지만 EV-maximizing action은 잘 못한다

모델들은 expected value 개념 자체는 잘 이해했지만 실제 simulation에서는 지나치게 보수적으로 행동했다.

Optiver는 모델이:

  • 최적 size보다 작게 거래하거나
  • positive-EV opportunity보다 hedge를 우선하거나

해서 알고 있는 EV를 행동으로 정확히 전환하지 못하는 문제를 관찰했다.

또 adverse selection을 올바르게 식별하고도 informed counterparty와 negative-EV level에서 거래하는 모순된 action을 보이기도 했다.

확인 가능한 사실 ④ — 다른 시장참가자의 반응을 제대로 simulation하지 못한다

LLM은 participant를:

  • informed trader
  • position-driven trader
  • liquidity provider

등으로 분류하는 데는 괜찮았지만, 자신의 행동에 따라 상대가 다음에 어떻게 반응할지를 동적으로 추론하는 능력이 약했다. Optiver는 이를 game-theoretic/adversarial reasoning의 한계로 본다.

공개자료 기반 추론

이 결과를 보면 현 단계에서 LLM을:

직접 bond trader로 production 배치

하는 것보다,

Research copilot / scenario analyst / simulator critic

으로 쓰는 것이 훨씬 현실적이다.

LLM은:

  • 문제 framing
  • 계산
  • 규칙 이해

에는 강하지만,

  • stateful belief updating
  • strict EV optimization
  • adversarial sequential decision

에는 아직 별도의 시스템적 보완이 필요하다.

한국 채권시장 복제 아이디어

이 자료를 그대로 활용해서 Bond Trader Agent Benchmark를 만들 수 있다.

예를 들어 시나리오:

09:58 10선 fair value = 116.25

10:00 CPI surprise

→ fair value 업데이트

10:00:05 외국인 매도 3,000계약

→ 다시 업데이트

10:00:20 UST reversal

→ 다시 업데이트

각 단계에서 agent에게:

  1. fair value
  2. position
  3. order size
  4. confidence
  5. expected P&L

을 출력시킨다.

평가 metric은 단순 정답률보다:

Belief consistency Sequential adaptation EV optimality Risk limit compliance

로 잡아야 한다.

LLM trader 평가 benchmark로 상당히 재미있다.

복제 가치: ★★★★★