Inflation attitudes of large language models
LLM은 사람에게 설문하지 않고도 인플레이션 기대를 대신 측정할 수 있을까?
연구진은 GPT가 과거 물가급등의 결과를 이미 알고 답하는 문제부터 막았다. 사용한 모형의 학습지식은 2021년 9월에 끝났고, 영국 물가가 크게 오른 시기는 그 뒤다. 여기에 실제 인플레이션 설문의 인구통계 특성과 당시 식품·에너지·나머지 품목의 가격상승률을 프롬프트로 넣었다. 모형이 외운 정답을 꺼내기보다 새 가격정보로 기대를 형성하게 만든 준실험 설계다.
설정 조정과 시험도 시간순으로 갈랐다. 2022년 4분기인 11월의 2111명 응답으로 temperature를 정했고, 2023년 1분기인 2월의 4472명 응답은 별도 시험에 사용했다. 집계 분포와 소득·주거·계층별 차이 일부는 실제 설문과 가까웠다. 그러나 같은 개인의 응답을 맞히는 관계는 약했고, 사람 설문과 공식 통계 가운데 어느 쪽을 더 잘 따라야 하는지도 과제에 따라 달라졌다.
구성품목을 따로 움직인 민감도 실험에서는 식품·외식 가격에 대한 반응이 소비바스켓 비중으로 계산한 반응의 4.01배였다. 사람도 자주 사는 식품가격을 크게 받아들이지만, GPT의 반응은 일부 범위에서 꺾여 일관된 소비자물가 모형으로 보기 어려웠다. 한 해 뒤 기대는 실제 물가와 사람 응답이 내려간 뒤에도 높은 수준에 머물렀다. 단기 집계값의 유사성이 장기 금리전망의 타당성을 보장하지 않는다.
SCOPE단일 세대의 GPT-3.5 Turbo와 영국의 두 설문 시점을 이용한 준실험이다. 사람의 의사결정이나 채권수익률을 예측한 연구가 아니며, 새 LLM과 한국 표본으로의 일반화는 다시 검증해야 한다.
Evidence & verification ↓시장스트레스 경보는 높은 예측정확도와 이해 가능한 이유를 동시에 줄 수 있을까?
시장기능이 흔들리는 날을 직접 라벨링하면 심한 사건이 너무 적다. 연구진은 유로·엔을 바로 거래한 가격과 달러를 거쳐 계산한 가격의 차이를 대신 썼다. 정상시장에서는 차익거래로 빠르게 사라져야 할 괴리가 길게 남으면 거래 마찰이 커졌다고 볼 수 있다. 모형은 백 개가 넘는 일별 지표를 받아 60영업일 뒤 한 달 평균 괴리를 예측했다.
순환신경망 안에는 변수별 가중치를 매일 새로 배분하는 층이 있다. 금리·변동성·다른 통화의 가격괴리 가운데 그날 예측에 중요한 입력이 무엇인지 드러내는 장치다. 3.5년의 표본외 시험에서 가중치는 2023년 3월 은행불안 전후의 유동성·통화 관련 변수로 이동했다. 이 목록을 LLM의 뉴스검색 주제로 넘기면 막연한 전체 뉴스 요약보다 당시 위험과 가까운 근거를 찾을 수 있다.
경보를 좋게 해석하려면 불편한 결과도 같이 봐야 한다. 순환신경망의 표본외 예측손실은 자기회귀 기준모형보다 일관되게 높았다. 다만 미래 괴리와의 방향 관계는 유의해 정확한 크기보다 위험의 움직임을 알리는 지표로 평가됐다. LLM 사례도 시점이 맞는 제한된 뉴스실험이다. 예측모형, 변수선택, 원문확인 단계를 분리해야 설명이 사후 이야기가 되는 것을 막을 수 있다.
SCOPE유로·엔의 한 가지 삼각차익 괴리를 목표로 한 연구다. 순환신경망이 단순 기준모형보다 점예측 RMSE를 낮추지 못했고, LLM 설명 사례도 자동매매나 실시간 손익을 검증한 결과가 아니다.
Evidence & verification ↓국채 입찰 전후의 금리반전은 딜러의 재고부담이 실제 거래로 나타난 결과인가?
입찰 concession은 새 물량을 받아야 하는 딜러가 미리 가격을 낮추는 현상으로 설명돼 왔다. 이 논문은 1991~2024년의 장중 미 국채 거래를 입찰 전후 여섯 시간 창으로 맞췄다. 수익률은 입찰을 향해 올라갔다가 결과 발표 뒤 되돌아왔고, 만기별 전체 압력은 0.7~1.2bp였다. 고용지표와 연방공개시장위원회 발표일에는 같은 순매도·순매수 대칭이 나타나지 않아 예정된 공급충격과 뉴스충격을 구분했다.
가격만 보면 딜러의 제약이 어떤 경로로 전달됐는지 알기 어렵다. 연구진은 입찰 전 순매도와 발표 뒤 순매수를 따로 재고조정의 흔적으로 보았다. 각각의 주문흐름이 한 표준편차 커질 때 수익률 압력은 0.76bp와 1.05bp 늘었다. 종목별 가격충격과 주문규모를 결합한 분해에서도 거래로 설명되는 부분이 대부분을 차지했다. 공개된 공급정보도 실제 주문이 시장심도를 소진하면서 가격으로 전달된다는 결과다.
딜러 재무여건과 투자자 수요만 넣은 회귀식에 주문흐름을 추가하면 조정 설명력은 4.7%에서 19.8%로 높아졌다. 최근 2015~2024년에는 펀드와 해외투자자의 입찰 참여가 가격압력을 줄이는 역할도 했다. 발행잔액이 빠르게 늘었는데도 압력이 추세적으로 커지지 않은 배경이다. 특정 입찰의 방향을 자동으로 예측한 연구는 아니지만, 공급·재고·실제 체결을 같은 사건표에서 보아야 한다는 근거는 분명하다.
SCOPE미국 국채 입찰의 장중 사건연구와 회귀분해다. 주문흐름의 역할을 강하게 보여주지만 한국의 낙찰제도·투자자구성에 그대로 적용할 수 없고, 제시된 관계를 개별 입찰의 무위험 거래전략으로 해석해서도 안 된다.
Evidence & verification ↓주문장 자료는 왜 더 많은 수작업 특징보다 딥러닝 표현학습이 필요한 문제인가?
Optiver가 제시한 목표는 현재 주문장에서 다음 가격방향을 읽는 일이다. 예측기간은 수초에서 수분이고, 입력은 주문 추가·취소·변경·체결의 사건열이다. 최우선 매수·매도만 있는 한 장면에서는 가중평균가격 같은 수작업 특징이 강하다. 같은 장면을 시간순으로 잇거나 여러 가격단계와 상관상품을 함께 보면 어떤 정보를 남기고 버릴지 사람이 일일이 정하기 어려워진다. 딥러닝은 특징추출과 가격예측을 한 모형에서 학습하려는 선택이다.
Level 3 자료에서는 같은 가격과 수량이라도 주문의 큐 위치가 다르면 체결가능성이 달라진다. 한쪽 잔량이 큰 주문 하나인지 작은 주문 여러 개인지도 집계 수량만으로는 보이지 않는다. 종목 사이 관계와 취소 순서까지 결합하면 입력은 공간과 시간을 동시에 갖는다. 다만 회사는 사용한 신경망 구조, 목표라벨, 자산별 성과를 공개하지 않았다. 공개된 내용은 수작업 특징이 막히는 지점과 표현학습을 택한 이유다.
시장자료의 제약은 언어나 영상과 다르다. 신호가 약해 좋은 모형도 52% 정확도일 수 있고 분포는 국면에 따라 바뀐다. 사건 간격도 나노초와 초 사이를 오가며 하루에는 수억 건의 메시지가 생긴다. 100,000개 사건을 보아도 평균 한 분 정도라 더 긴 문맥이 필요하고, 생산 추론에서는 매 나노초가 중요하다. 표본외 정확도만 높이는 구조보다 사건시간, 국면변화, 메모리와 꼬리 지연을 함께 견디는 구조가 실제 연구목표가 된다.
SCOPEOptiver 연구책임자의 공식 문제설명이다. 구체적인 아키텍처·라벨·백테스트·실거래 P&L은 공개되지 않았으므로 딥러닝이 특정 시장에서 수익을 냈다고 읽을 수 없다.
Evidence & verification ↓Mitigating memorization in LLMs
과거사건 예측에서 LLM이 정보를 읽은 것과 결과를 외운 것을 어떻게 구분할까?
과거 경기를 맞히는 LLM은 당시 기사에서 승자를 추론했을 수도 있고 사전학습 문서에서 결과를 외웠을 수도 있다. 연구팀은 크리켓 경기 프리뷰를 지식 마감 전후로 나눠 기준모형 대비 추가 예측력, 마감 전후 성능차, 마감 전 과신을 함께 봤다. 기간 앞쪽은 남자 국제경기가 많고 뒤쪽은 구성이 더 다양해 단순 성능차가 자료분포 변화에서 올 가능성도 확인했다. 시점분할만으로 기억오염 문제가 자동 해결되지는 않는다.
divergence decoding은 2015년 이전과 2026년 이전까지 학습한 작은 보조모형의 logits 차이를 큰 모형 출력에 더한다. 두 보조모형 사이 기간의 지식을 추론시점에 줄이려는 방식이다. 크리켓 실험에서는 마감일 이전 성능을 낮추면서 이후 성능을 해치지 않았다. 과거 정답을 덜 꺼내면서 새 경기의 예측력은 보존했다는 간접증거다. 그러나 조정된 모형을 다시 큰 모형에 증류한 결과는 원모형과 추론시점 조정보다 일관되게 나빴다.
자연어 오토인코더로 내부표현을 문장처럼 읽는 실험도 했다. 팀 이름 언급비율은 최종 예측과 0.93 정도로 함께 움직였지만 마감 전후 차이를 구분하지 못해 기억 탐지지표가 되지 못했다. 대신 합성 추론자료에서는 뒤쪽의 불필요한 층을 찾아 제거하면서 학습속도가 1.5배 빨라졌다. 연구는 완성된 기억 제거기를 만들지 못한 탐색적 프로젝트로 끝났다. 금융예측에 옮길 때도 실패 결과와 데이터구성 변화를 함께 남겨야 한다.
SCOPE금융자료가 아닌 크리켓 프리뷰를 사용한 인턴 연구이며 결과도 탐색적이다. 공개 글은 Jane Street의 생산 거래모형이나 P&L을 설명하지 않고, 제안한 방법이 모든 LLM과 금융시점 분할에 일반화된다고 확인하지 않았다.
Evidence & verification ↓LLM 설문은 집계값을 닮고도 장기 기대에서 흔들렸고, 시장경보 신경망은 위험 변수를 찾으면서도 단순 모형의 예측오차를 넘지 못했다. 국채 입찰에서는 실제 주문흐름이 가격압력의 전달경로를 드러냈다. 한국 데스크의 다음 실험은 더 큰 모델보다 시점고정 데이터, 명시적인 기준모형, 주문·체결·지연을 잇는 평가표에서 시작하는 편이 낫다.
Sources & evidence
Original passages appear only when checked against the publication. Earlier briefing records are identified separately.
Inflation attitudes of large language models5 primary · 0 archived +
설정 조정 표본은 2022년 4분기 11월의 설문 응답자 2,111명이다.
ORIGINAL PASSAGE2022 Q4 (November 2022; 2111 participants)Bank of England Staff Working Paper No. 1,190, §3.3, printed p. 9, accessed 2026-10-07별도 시험 표본은 2023년 1분기 2월의 설문 응답자 4,472명이다.
ORIGINAL PASSAGE2023 Q1 (February 2023; 4472 participants)Bank of England Staff Working Paper No. 1,190, §3.3, printed p. 9, accessed 2026-10-07주요 LLM의 지식 마감은 이후 영국 물가급등 전인 2021년 9월이다.
ORIGINAL PASSAGESeptember 2021Bank of England Staff Working Paper No. 1,190, abstract and §3.3, printed pp. 1 and 9, accessed 2026-10-07식품·외식 물가에 대한 GPT 반응기울기를 소비바스켓 비중으로 나눈 값은 4.01이다.
ORIGINAL PASSAGEratio 4.01Bank of England Staff Working Paper No. 1,190, Table 7, printed p. 33, accessed 2026-10-071년을 넘는 기대에서 GPT 응답은 사람 설문과 실제 물가의 하락을 따라가지 않고 높은 수준을 유지했다.
ORIGINAL PASSAGEroughly constant and elevatedBank of England Staff Working Paper No. 1,190, §4.2, printed p. 20, accessed 2026-10-07Harnessing artificial intelligence for monitoring financial markets5 primary · 0 archived +
모형은 현재 정보로 60영업일 뒤에 시작하는 시장기능 구간을 예측한다.
ORIGINAL PASSAGE60 business days aheadBIS Working Paper No. 1291, abstract and §4.1, printed pp. 2 and 10, accessed 2026-10-07입력은 금리·변동성·주식·통화시장 등을 아우르는 백 개가 넘는 일별 시장지표다.
ORIGINAL PASSAGEover one hundred daily market indicatorsBIS Working Paper No. 1291, publication focus and §3–4, printed pp. 3 and 10–12, accessed 2026-10-07엄격한 표본외 시험기간은 2021~2024년을 포함하는 약 3.5년이다.
ORIGINAL PASSAGEout-of-sample testing covering 3.5 yearsBIS Working Paper No. 1291, introduction, printed p. 3, accessed 2026-10-07RMSE 기준 순환신경망의 표본외 손실은 자기회귀 모형보다 작지 않았다.
ORIGINAL PASSAGEforecast losses are systematically higherBIS Working Paper No. 1291, §5.2 and Table 3, printed pp. 15–16, accessed 2026-10-07동적 변수 가중치는 2023년 3월 은행불안과 관련된 시장변수로 이동했다.
ORIGINAL PASSAGEMarch 2023BIS Working Paper No. 1291, §5.3, printed p. 17, accessed 2026-10-07Intraday Price Pressure and Order Flow Around U.S. Treasury Auctions6 primary · 0 archived +
장중 표본은 1991년부터 2024년까지의 미 국채 입찰을 포함한다.
ORIGINAL PASSAGE1991–2024New York Fed Staff Report No. 1188, conclusion, printed p. 40, accessed 2026-10-07입찰 전후 여섯 시간 창에서 만기별 수익률 압력은 0.7~1.2bp다.
ORIGINAL PASSAGE0.7 to 1.2 basis pointsNew York Fed Staff Report No. 1188, overview of intraday estimates, printed p. 5, accessed 2026-10-07입찰 전 순매도가 1표준편차 늘면 수익률 압력은 0.76bp 커진다.
ORIGINAL PASSAGE0.76 bpsNew York Fed Staff Report No. 1188, §5.3 and Table 7, printed p. 36, accessed 2026-10-07발표 뒤 순매수가 1표준편차 늘면 수익률 압력은 1.05bp 커진다.
ORIGINAL PASSAGE1.05 bpsNew York Fed Staff Report No. 1188, §5.3 and Table 7, printed p. 36, accessed 2026-10-07주문흐름을 포함하면 통합 회귀식의 조정 설명력은 4.7%에서 19.8%로 높아진다.
ORIGINAL PASSAGEfrom 4.7% to 19.8%New York Fed Staff Report No. 1188, §5.4 and Table 8, printed p. 37, accessed 2026-10-072015~2024년에는 비딜러 투자자 참여가 입찰 가격압력을 유의하게 줄였다.
ORIGINAL PASSAGE2015–2024New York Fed Staff Report No. 1188, §5.4, printed p. 38, accessed 2026-10-07The trading problem: why market data is a deep learning challenge6 primary · 0 archived +
Optiver의 고빈도 가격예측 기간은 보통 수초에서 수분이다.
ORIGINAL PASSAGEprediction horizons are typically seconds to minutesOptiver, opening section, published 2026-10-06, accessed 2026-10-07가장 세밀한 입력은 개별 주문과 큐 위치를 복원하는 Level 3 사건자료다.
ORIGINAL PASSAGELevel 3 dataOptiver, From Level 1 to Level 3 market data, accessed 2026-10-07공식 글은 금융 신호가 약해 좋은 모형도 52% 정확도일 수 있다고 설명한다.
ORIGINAL PASSAGEaccuracy of 52%Optiver, Why market data is difficult to model, accessed 2026-10-07일반적인 거래일의 메시지 규모는 수억 건에 이를 수 있다.
ORIGINAL PASSAGEhundreds of millions of messagesOptiver, Why market data is difficult to model, accessed 2026-10-07십만 사건의 문맥도 평균 벽시계 시간으로 약 한 분만 덮을 수 있다.
ORIGINAL PASSAGE100,000 eventsOptiver, Why market data is difficult to model, accessed 2026-10-07생산 추론은 나노초 단위 지연까지 모델 설계를 제약한다.
ORIGINAL PASSAGEevery nanosecond mattersOptiver, Why market data is difficult to model, accessed 2026-10-07Mitigating memorization in LLMs6 primary · 0 archived +
divergence decoding은 서로 다른 지식기간을 가진 보조모형을 사용한다.
ORIGINAL PASSAGEpre-2015 and pre-2026Jane Street, Divergence decoding, published 2026-09-30, accessed 2026-10-07크리켓 실험의 추론시점 조정은 마감 뒤 표본 성능을 떨어뜨리지 않았다.
ORIGINAL PASSAGEwithout harming post-cutoff performanceJane Street, Divergence decoding, accessed 2026-10-07조정 모형을 증류한 결과는 원모형과 추론시점 조정보다 일관되게 낮았다.
ORIGINAL PASSAGEconsistently underperformed bothJane Street, Distillation, accessed 2026-10-07오토인코더가 읽은 팀 언급비율과 최종 예측의 상관은 약 0.93이었다.
ORIGINAL PASSAGEcorr ~0.93Jane Street, Natural language autoencoder, accessed 2026-10-07합성 추론자료에서 불필요한 마지막 층을 제거하자 학습이 1.5배 빨라졌다.
ORIGINAL PASSAGEsped up training by 1.5xJane Street, Sequence effects, accessed 2026-10-07공식 결론은 이 프로젝트의 결과를 완성된 제거기가 아닌 탐색적 연구로 규정한다.
ORIGINAL PASSAGEexploratoryJane Street, Conclusions, accessed 2026-10-07Show the original briefing text
채권시장 AI 연구 브리핑
2026년 10월 7일
조사 마감: 2026년 10월 7일 06:44 (Asia/Seoul)
원문 열람일: 2026년 10월 7일
중복 점검: 기존 63개 브리핑·315개 연구와 원문 URL 422건을 대조했다. 전날 BIS 국채시장 분포예측, ECB AI 시장구조·뉴스감성, Jane Street 시장자료 생성, G-Research Arrow 자료는 제외했다. 1~3번은 중앙은행·국제기구의 원문 연구이고 4~5번은 채용공고가 아닌 퀀트·마켓메이킹 회사의 공식 기술자료다. 회사가 공개하지 않은 전략·라벨·보유기간·P&L은 추론하지 않았다.
1. Inflation attitudes of large language models
구분: 중앙은행 연구·LLM 및 인플레이션 기대
발표일: 2026년 6월 19일
핵심 요약
영란은행 Staff Working Paper No. 1,190은 학습지식이 2021년 9월에 끝난 GPT-3.5 Turbo에 2022년 말과 2023년 초의 물가정보와 가상 응답자 특성을 주고 실제 인플레이션 설문과 비교했다. 2,111명 표본으로 temperature를 조정하고 4,472명 표본을 별도 시험에 썼다. 집계 응답과 소득·주거·계층별 패턴 일부는 사람 설문과 비슷했지만 개인별 일치는 약했고, 식품가격에는 소비바스켓 비중보다 훨씬 민감했다. 1년 뒤 기대는 실제 물가가 둔화된 뒤에도 높은 수준에 머물러 LLM을 기대자료의 대체재로 바로 쓸 수 없었다.
실무 시사점
금리 방향을 묻는 LLM 평가에서 과거 사건의 정답을 기억한 성능과 당시 정보로 형성한 기대를 분리해야 한다. 집계 평균이 맞더라도 응답자별·국면별 반응함수와 장기 전망이 안정적인지는 별도 검증이 필요하다.
한국 시장 복제 아이디어
지식 마감일 이전의 금통위·물가자료만 허용한 시점고정 프롬프트를 만들고, 이후 소비자동향조사의 기대인플레이션과 비교한다. 전체 평균뿐 아니라 연령·소득·주거형태별 오차, 식품·에너지 충격 민감도, 1년 기대의 방향 적중률을 기준으로 한국어 LLM과 단순 시계열 모형을 함께 시험한다.
2. Harnessing artificial intelligence for monitoring financial markets
구분: 국제기구 연구·AI 시장스트레스 감시
발표일: 2025년 9월 24일
선정 사유: 최신성보다 예측·설명·뉴스검색을 분리한 기술적 가치 때문에 선정
핵심 요약
BIS Working Paper No. 1291은 유로·엔 직접거래와 달러 경유거래의 삼각차익 괴리를 시장기능 저하의 목표변수로 삼았다. 순환신경망은 백 개가 넘는 일별 시장지표에서 변수를 매일 다시 가중해 60영업일 뒤 한 달 평균 괴리를 예측한다. 2021~2024년 표본외 구간에서 변수 가중치는 2023년 3월 은행불안 같은 국면을 포착했지만, 점예측 RMSE는 단순 자기회귀 모형보다 조금 높았다. 따라서 이 모형의 강점은 숫자 하나를 더 정확히 맞히기보다 위험 방향과 관련 변수를 찾아 LLM 뉴스검색의 범위를 좁히는 데 있다.
실무 시사점
조기경보 모형은 예측오차와 사건 탐지력을 분리해 평가해야 한다. 동적 중요도가 커진 변수만 시점이 맞는 뉴스에 연결하면 LLM이 전체 뉴스에서 임의의 설명을 고르는 위험을 줄일 수 있지만, 사람이 원문과 시간표를 확인해야 한다.
한국 시장 복제 아이디어
원화 IRS·FX스왑·국채선물 베이시스·레포·회사채 호가폭을 입력으로 쓰고, 20거래일 뒤 시장기능 지수와 스트레스 임계 초과를 함께 예측한다. 자기회귀·무작위숲·순환신경망을 비교하고 RMSE, 경보 선행일수, 오경보율, 중요변수 기반 뉴스근거의 정확도를 따로 측정한다.
3. Intraday Price Pressure and Order Flow Around U.S. Treasury Auctions
구분: 중앙은행 연구·국채 입찰 및 시장미시구조
발표일: 2026년 3월, 2026년 7월 개정
핵심 요약
뉴욕 연은 Staff Report No. 1188은 1991~2024년 미 국채 장중자료에서 입찰 전 수익률이 오르고 발표 뒤 되돌아오는 경로를 측정했다. 만기별 6시간 창의 수익률 압력은 0.7~1.2bp였다. 입찰 전 순매도와 발표 뒤 순매수의 1표준편차 증가는 각각 0.76bp와 1.05bp의 압력과 연관됐고, 주문흐름을 회귀식에 넣자 조정 설명력은 4.7%에서 19.8%로 높아졌다. 최근에는 비딜러가 공급을 더 흡수하면서 발행 증가에도 가격압력이 커지지 않았다.
실무 시사점
입찰 concession을 발행액이나 딜러 재무지표만으로 추정하면 실제 재고조정 경로를 놓친다. 입찰 전후 순매수·순매도, 종목별 가격충격, 비딜러 낙찰비중을 함께 봐야 공급충격이 가격으로 전달되는 시점을 구분할 수 있다.
한국 시장 복제 아이디어
국고채 입찰일에 지표·비지표 현물과 국채선물의 1분 수익률·순매수·호가깊이를 맞춘다. 동일 요일·만기의 비입찰일을 대조군으로 두고, 낙찰 전 매도와 뒤 매수가 수익률 반전을 설명하는 정도를 회귀식과 이벤트별 표본외 예측으로 비교한다.
4. The trading problem: why market data is a deep learning challenge
구분: 퀀트·마켓메이킹 회사 공식 기술블로그·딥러닝 및 주문장
발표일: 2026년 10월 6일
핵심 요약
Optiver 공식 기술 글은 고빈도 전략의 주된 입력을 거래소의 주문 추가·취소·변경·체결 흐름이라고 밝힌다. 목표는 현재 관측으로 수초에서 수분 뒤 가격을 예측하는 것이며, Level 3에서는 개별 주문의 시각과 큐 위치까지 모델 입력이 된다. 회사는 수작업 특징이 놓치는 시간·종목 간 구조를 딥러닝 표현학습으로 찾되, 신호가 약하고 분포가 바뀌며 사건 간격이 불규칙하다는 조건을 강조한다. 하루 메시지가 수억 건이고 긴 문맥도 벽시계 시간으로는 짧아, 생산 지연과 계산비용이 모델 설계의 일부가 된다.
실무 시사점
공개된 사실은 문제정의와 연구방식이며 특정 아키텍처·라벨·시장별 P&L은 공개되지 않았다. 채권 주문장에서도 단일 스냅샷 정확도보다 시계열 문맥, 큐 변화, 상관상품, 국면변화와 추론 지연을 하나의 검증표에 놓아야 한다.
한국 시장 복제 아이디어
국채선물 Level 3 사건열과 현물·IRS를 공통 시장시각에 맞추고, 다음 사건·5초 중간가격·체결 후 mark-out을 서로 다른 라벨로 둔다. 수작업 특징 기반 GBM과 사건시간 딥러닝을 비교하되 시계열 홀드아웃, 변동성 국면별 성능, 비용 차감, p99 추론지연을 동시에 통과시킨다.
5. Mitigating memorization in LLMs
구분: 퀀트회사 공식 ML 연구블로그·시점검증 및 LLM
발표일: 2026년 9월 30일
핵심 요약
Jane Street 공식 ML 연구 글은 과거 경기예측에서 모델이 당시 정보로 추론했는지 사전학습 때 결과를 외웠는지를 분리하려 했다. 크리켓 경기 프리뷰를 지식 마감일 전후로 나누고 예측력·전후 격차·과신을 점검했으며, 기간 사이 경기구성 변화도 따로 확인했다. 서로 다른 시점까지 학습한 보조모형의 logits 차이로 큰 모형을 조정하는 divergence decoding은 마감일 이전 성능을 낮추면서 이후 성능을 해치지 않았다. 다만 증류는 실패했고 자연어 오토인코더 진단도 완전한 기억 제거기를 만들지 못해, 공개 결과는 탐색적 연구로 남았다.
실무 시사점
역사적 금리·신용사건을 LLM에 물어 높은 적중률을 얻어도 지식 마감이 사건 뒤라면 백테스트가 아니다. 데이터 시점, 모델 체크포인트, 프롬프트와 검색자료의 공개시각을 고정하고 마감 전후의 성능 차이를 정식 지표로 남겨야 한다.
한국 시장 복제 아이디어
금통위 결정·등급변경·입찰결과를 발표 전 문서만으로 예측하는 벤치마크를 만든다. 마감일 전후 적중률과 확률보정, 단순 기준모형 대비 추가가치, 문서구성 변화 영향을 측정하고, divergence decoding·문서 재서술·검색차단을 각각 적용해 미래정보 오염 감소와 진짜 표본외 성능을 분리한다.