더 중요한 결과는 LLM이 이전 판단을 스스로 memory로 작성해 다음 decision에 다시 넣으면 policy persistence가 더 강해지고 adverse timing도 더 심해졌다는 것이다. 저장된 action sequence를 shuffle하면 효과가 크게 약해져, 단순히 종목 자체의 나쁜 성과가 아니라 agent의 반복 행동과 미래 수익 간 정렬이 문제였음을 시사한다.
편집 전 브리핑 원문 펼치기
구분: 최신 연구 · arXiv / LLM Agent·시장미시구조
발표일: 2026년 8월 28일
핵심 요약
RetailAgent는 LLM에게 익명화된 intraday 가격 history와 제한된 state를 보여주고 매 시점마다 long 또는 flat을 반복적으로 결정하게 만든 실험이다. 연구진은 단순 수익률이 아니라 long exposure 비중을 통제한 뒤 같은 종목의 long 구간과 flat 구간 이후 수익을 비교했는데, 여러 model family·horizon·state에서 지속적인 negative timing이 나타났다고 보고한다. arXiv 원문
더 중요한 결과는 LLM이 이전 판단을 스스로 memory로 작성해 다음 decision에 다시 넣으면 policy persistence가 더 강해지고 adverse timing도 더 심해졌다는 것이다. 저장된 action sequence를 shuffle하면 효과가 크게 약해져, 단순히 종목 자체의 나쁜 성과가 아니라 agent의 반복 행동과 미래 수익 간 정렬이 문제였음을 시사한다.
채권 트레이딩·리스크관리 시사점
이 연구는 LLM trader의 위험이 hallucination만이 아니라 predictable policy라는 점을 보여준다.
예를 들어 agent가 반복적으로:
가격 급락
→ “과매도”
→ long
가격 상승
→ “과열”
→ flat
같은 구조를 만들면, 개별 판단은 그럴듯해도 다른 시장참가자가 그 행동을 추론할 수 있다.
채권에서는 특히 이런 문제가:
- 금통위 직후 dip-buying
- 입찰 tail 이후 mean-reversion
- 3/10 extreme에서 자동 flattening
- 급격한 basis 확대 시 자동 convergence trade
같은 반복 규칙에서 발생할 수 있다.
한국 시장 복제 아이디어
LLM/agent의 성과를 단순 P&L만 보지 말고 Action Predictability까지 측정해야 한다.
예를 들어:
P(Action_t | 최근 state)
와
P(Action_t | 최근 state, Agent 자체 과거 action)
의 차이를 측정해 agent의 행동이 얼마나 쉽게 추론되는지 본다.
그리고 agent를 production에 넣을 때는:
LLM proposal
→ stochastic / optimizer layer
→ risk constraint
→ final action
처럼 LLM output과 실제 주문 사이를 분리하는 것이 좋다.
데스크 적용 우선순위: ★★★★★