Optiver Applied AI 팀은 최신 LLM들에게 실제 intern 트레이더 시험과 약 6개월 경력 트레이더용 mock assessment를 수행시켰다. LLM은 기본 계산·trading theory뿐 아니라 simulated 시장조성 환경에서 적정가치 계산, 불리한 정보에 따른 체결 위험 식별, bid/ask spread와 risk management의 개념까지 상당히 잘 수행했다.
하지만 문제가 생긴 곳은 sequential decision-making이었다. Optiver는 모델이 새로운 정보가 들어왔는데도 적정가치를 반복적으로 갱신하지 않거나, 자기 거래 이후 추가 정보가 등장했을 때 belief update를 제대로 하지 못하고, 한두 단계 이후의 시장 참가자 반응을 예상하는 데 어려움을 보였다고 설명한다.
더 흥미로운 것은 EV 문제다. LLM은 기댓값를 개념적으로 이해했지만 실제 상황에서는 positive-EV trade임에도 너무 적게 거래하거나 과도하게 hedge해 경제적으로 최적 수준보다 보수적인 행동을 보였다. informed counterparty를 제대로 식별하고도 negative-EV 가격에 거래하는 경우도 관찰됐다.
편집 전 브리핑 원문 펼치기
구분: Optiver 공식 AI Engineering 블로그
발표일: 2026년 4월 27일
원문: Where AI trading models work — and where they still fall short
공개적으로 확인된 사실
Optiver Applied AI 팀은 최신 LLM들에게 실제 intern trader 시험과 약 6개월 경력 트레이더용 mock assessment를 수행시켰다. LLM은 기본 계산·trading theory뿐 아니라 simulated market-making 환경에서 fair value 계산, adverse selection 식별, bid/ask spread와 risk management의 개념까지 상당히 잘 수행했다.
하지만 문제가 생긴 곳은 sequential decision-making이었다. Optiver는 모델이 새로운 정보가 들어왔는데도 fair value를 반복적으로 갱신하지 않거나, 자기 거래 이후 추가 정보가 등장했을 때 belief update를 제대로 하지 못하고, 한두 단계 이후의 시장 참가자 반응을 예상하는 데 어려움을 보였다고 설명한다.
더 흥미로운 것은 EV 문제다. LLM은 expected value를 개념적으로 이해했지만 실제 상황에서는 positive-EV trade임에도 너무 적게 거래하거나 과도하게 hedge해 경제적으로 최적 수준보다 보수적인 행동을 보였다. informed counterparty를 제대로 식별하고도 negative-EV 가격에 거래하는 경우도 관찰됐다.
수익 메커니즘에 대한 추론
이 자료가 보여주는 것은 현재 LLM을 바로 Trading Policy로 쓰기 어려운 이유다.
문제는 지능 부족보다 구조다.
트레이딩은
State_t
→ Fair Value_t
→ Action_t
→ Market Reaction
→ State_t+1
→ Fair Value_t+1
을 계속 반복해야 한다.
한 번 좋은 답을 생성하는 LLM benchmark와 완전히 다른 문제다.
따라서 지금 현실적인 아키텍처는:
LLM: 이벤트 해석·가설·설명
ML: fair value / alpha / fill / markout
Optimizer: position sizing
Rule Engine: risk limits
Trader: 최종 판단
이라고 보는 편이 맞다.
한국 채권시장에 복제한다면
특히 금통위·입찰처럼 정보가 연속적으로 들어오는 날에 적용할 수 있다.
예:
09:50 외국인 10선 매도
→ fair value 갱신
10:00 입찰 결과
→ 다시 갱신
10:05 PD flow
→ 다시 갱신
10:10 미국 선물 변화
→ 다시 갱신
즉 “오늘 방향 알려줘” agent보다, state를 계속 업데이트하는 trading agent가 필요하다.
복제 가치: ★★★★★