연구진은 GPT가 과거 물가급등의 결과를 이미 알고 답하는 문제부터 막았다. 사용한 모형의 학습지식은 2021년 9월에 끝났고, 영국 물가가 크게 오른 시기는 그 뒤다. 여기에 실제 인플레이션 설문의 인구통계 특성과 당시 식품·에너지·나머지 품목의 가격상승률을 프롬프트로 넣었다. 모형이 외운 정답을 꺼내기보다 새 가격정보로 기대를 형성하게 만든 준실험 설계다.
설정 조정과 시험도 시간순으로 갈랐다. 2022년 4분기인 11월의 2111명 응답으로 temperature를 정했고, 2023년 1분기인 2월의 4472명 응답은 별도 시험에 사용했다. 집계 분포와 소득·주거·계층별 차이 일부는 실제 설문과 가까웠다. 그러나 같은 개인의 응답을 맞히는 관계는 약했고, 사람 설문과 공식 통계 가운데 어느 쪽을 더 잘 따라야 하는지도 과제에 따라 달라졌다.
구성품목을 따로 움직인 민감도 실험에서는 식품·외식 가격에 대한 반응이 소비바스켓 비중으로 계산한 반응의 4.01배였다. 사람도 자주 사는 식품가격을 크게 받아들이지만, GPT의 반응은 일부 범위에서 꺾여 일관된 소비자물가 모형으로 보기 어려웠다. 한 해 뒤 기대는 실제 물가와 사람 응답이 내려간 뒤에도 높은 수준에 머물렀다. 단기 집계값의 유사성이 장기 금리전망의 타당성을 보장하지 않는다.
SCOPE단일 세대의 GPT-3.5 Turbo와 영국의 두 설문 시점을 이용한 준실험이다. 사람의 의사결정이나 채권수익률을 예측한 연구가 아니며, 새 LLM과 한국 표본으로의 일반화는 다시 검증해야 한다.
Evidence & verification ↓Sources & evidence
Original passages appear only when checked against the publication. Earlier briefing records are identified separately.
Inflation attitudes of large language models5 primary · 0 archived +
설정 조정 표본은 2022년 4분기 11월의 설문 응답자 2,111명이다.
ORIGINAL PASSAGE2022 Q4 (November 2022; 2111 participants)Bank of England Staff Working Paper No. 1,190, §3.3, printed p. 9, accessed 2026-10-07별도 시험 표본은 2023년 1분기 2월의 설문 응답자 4,472명이다.
ORIGINAL PASSAGE2023 Q1 (February 2023; 4472 participants)Bank of England Staff Working Paper No. 1,190, §3.3, printed p. 9, accessed 2026-10-07주요 LLM의 지식 마감은 이후 영국 물가급등 전인 2021년 9월이다.
ORIGINAL PASSAGESeptember 2021Bank of England Staff Working Paper No. 1,190, abstract and §3.3, printed pp. 1 and 9, accessed 2026-10-07식품·외식 물가에 대한 GPT 반응기울기를 소비바스켓 비중으로 나눈 값은 4.01이다.
ORIGINAL PASSAGEratio 4.01Bank of England Staff Working Paper No. 1,190, Table 7, printed p. 33, accessed 2026-10-071년을 넘는 기대에서 GPT 응답은 사람 설문과 실제 물가의 하락을 따라가지 않고 높은 수준을 유지했다.
ORIGINAL PASSAGEroughly constant and elevatedBank of England Staff Working Paper No. 1,190, §4.2, printed p. 20, accessed 2026-10-07Show the original briefing text
구분: 중앙은행 연구·LLM 및 인플레이션 기대
발표일: 2026년 6월 19일
핵심 요약
영란은행 Staff Working Paper No. 1,190은 학습지식이 2021년 9월에 끝난 GPT-3.5 Turbo에 2022년 말과 2023년 초의 물가정보와 가상 응답자 특성을 주고 실제 인플레이션 설문과 비교했다. 2,111명 표본으로 temperature를 조정하고 4,472명 표본을 별도 시험에 썼다. 집계 응답과 소득·주거·계층별 패턴 일부는 사람 설문과 비슷했지만 개인별 일치는 약했고, 식품가격에는 소비바스켓 비중보다 훨씬 민감했다. 1년 뒤 기대는 실제 물가가 둔화된 뒤에도 높은 수준에 머물러 LLM을 기대자료의 대체재로 바로 쓸 수 없었다.
실무 시사점
금리 방향을 묻는 LLM 평가에서 과거 사건의 정답을 기억한 성능과 당시 정보로 형성한 기대를 분리해야 한다. 집계 평균이 맞더라도 응답자별·국면별 반응함수와 장기 전망이 안정적인지는 별도 검증이 필요하다.
한국 시장 복제 아이디어
지식 마감일 이전의 금통위·물가자료만 허용한 시점고정 프롬프트를 만들고, 이후 소비자동향조사의 기대인플레이션과 비교한다. 전체 평균뿐 아니라 연령·소득·주거형태별 오차, 식품·에너지 충격 민감도, 1년 기대의 방향 적중률을 기준으로 한국어 LLM과 단순 시계열 모형을 함께 시험한다.