BONDNOTE JOURNAL · 2026.08.02

금융 연구 에이전트를 평가하는 실험 환경

일반적인 딥리서치 에이전트를 금융 리서치에 맞게 특화한 프레임워크다. 시점별로 실제 이용 가능했던 자료만 검색하도록 point-in-time 검색 환경을 구축해 미래정보 누출을 방지하고, 금융 실무자가 설계한 워크플로·도구·평가 기준을 에이전트에 결합했다.

약 2분RESEARCH NOTE
다룬 자료 · FinanceHarness: Autonomous Financial Deep Research Framework

함께 제안된 FinanceGym은 투자 논제 중심의 금융 리서치 문제 400개와 사전·사후 평가 기준으로 구성된다. 전문가 검증 데이터의 통과율은 82%였지만, 평가 대상 선도 LLM과 에이전트는 모두 40% 미만을 기록했다. 동일한 오픈웨이트 기반모델에 FinanceHarness를 적용했을 때 종합 점수가 25.3%에서 32.4%로 개선됐다.

이 연구가 소개된 하루의 글 읽기 →

편집 전 브리핑 원문 펼치기

구분: 논문·Google Cloud AI Research/UCLA 프리프린트
발표일: 2026년 7월 30일
원문: arXiv 논문 PDF

핵심 요약

일반적인 딥리서치 에이전트를 금융 리서치에 맞게 특화한 프레임워크다. 시점별로 실제 이용 가능했던 자료만 검색하도록 point-in-time 검색 환경을 구축해 미래정보 누출을 방지하고, 금융 실무자가 설계한 워크플로·도구·평가 기준을 에이전트에 결합했다.

함께 제안된 FinanceGym은 투자 논제 중심의 금융 리서치 문제 400개와 사전·사후 평가 기준으로 구성된다. 전문가 검증 데이터의 통과율은 82%였지만, 평가 대상 선도 LLM과 에이전트는 모두 40% 미만을 기록했다. 동일한 오픈웨이트 기반모델에 FinanceHarness를 적용했을 때 종합 점수가 25.3%에서 32.4%로 개선됐다.

실무 시사점

  • 트레이딩: 채권 리서치 에이전트에는 단순 웹검색보다 금통위→국발계→입찰→커브→수급→포지션처럼 데스크의 판단 순서를 워크플로로 내장해야 한다.
  • 데이터 관리: 기사와 보고서를 현재 시점 기준으로만 조회해야 한다. 수정된 경제지표나 사후 확정 데이터를 과거 백테스트에 사용하면 알파가 과장된다.
  • 모델 검증: 리서치 보고서의 문장 품질보다 출처 정확성, 날짜 정합성, 반대 근거 수집 여부와 이후 시장 반응을 평가해야 한다.
  • 적용 아이디어: 매일 생성하는 AI 브리핑을 논문 발견 → 근거 검증 → 채권시장 번역 → 트레이딩 아이디어 → 사후평가 데이터셋으로 축적하면 자체 FinanceGym을 만들 수 있다.

데스크 적용 우선순위: ★★★★★