FIXED INCOME / FIELD NOTES

Measuring sentiment news with transformer-based language models

뉴스의 분위기를 읽는 모델이 사람의 판단과 얼마나 가까운가?

물가가 낮아진다는 문장과 성장이 낮아진다는 문장은 같은 단어를 써도 경제적 어조가 다르다. 연구는 긍정·부정 단어를 세는 사전 방식과 문맥을 읽는 금융 언어모형 FinBERT를 비교한다. 표본은 2025년 Factiva 영문 금융뉴스 143,755건이며 300단어를 넘는 기사만 포함했다. 긴 기사는 문장별로 분류한 뒤 기사와 날짜의 지수로 합쳤다.

기사에 중립 문장이 많으면 긍정·부정 문장의 차이를 전체 문장 수로 나눈 점수는 작아진다. 중립을 빼고 감성이 있는 문장만 비교하면 같은 기사도 더 강하게 긍정 또는 부정으로 표시된다. 그래서 연구는 집계법을 바꾸며 결과를 비교하고, 별도로 588건에 대한 사람들의 독립 평점을 기준으로 삼았다. 그 평점은 투자에 좋은 뉴스인지보다 표현의 어조와 감정을 평가한다.

학습에는 먼저 나온 기사를 쓰고 시험에는 나중 기사를 남겼으며 모형 선택도 시간순 교차검증으로 했다. 표본외 macro-F1은 최고 문맥 기반 지수에서 0.638, 사전 방식에서 0.162였다. 이 점수는 긍정·중립·부정 각각에서 잘 찾았는지와 잘못 찍었는지를 결합해 같은 비중으로 평균한 값이다. 전체 기사의 적중률이나 수익률과 혼동하면 안 된다.

분류 차이에는 문맥뿐 아니라 지수의 크기도 작용한다. 논문은 동일한 ±0.33 경계를 쓰는데 사전 점수는 영 근처에 몰려 거의 모두 중립으로 분류됐다. 임계값을 각 방식에 맞춰 보정한 모든 비교에서도 같은 격차가 난다는 뜻은 아니다. 별도의 임베딩 회귀는 Random Forest에서 R² 0.688을 기록했다. 이것 역시 사람의 감성평점을 얼마나 설명했는지의 결과로, 실제 금리나 스프레드가 뒤따라 움직였다는 증거는 아니다.

SCOPE한 해의 영문 금융기사와 사람 라벨 하위표본을 이용한 감성 측정 연구다. 표본외 분류 비교는 공통 임계값을 사용한다. 평가자는 경제적 투자가치보다 표현의 어조를 판단했으므로 한국어 정책문서나 채권손익으로의 효과는 검증되지 않았다.

Evidence & verification ↓

Sources & evidence

Original passages appear only when checked against the publication. Earlier briefing records are identified separately.

Measuring sentiment news with transformer-based language models11 primary · 0 archived +
F1 · PRIMARY RECORD

뉴스 모집단은 2025년 1월부터 12월까지 Factiva의 영문 금융 기사다.

ORIGINAL PASSAGE
2025
ECB WP No.3283, §3.1, printed p.9; September 2026 edition; accessed 2026-10-06
F2 · PRIMARY RECORD

전처리 후 전체 뉴스 표본은 143,755건이다.

ORIGINAL PASSAGE
143,755 articles
ECB WP No.3283, §3.1, printed p.9; September 2026 edition; accessed 2026-10-06
F3 · PRIMARY RECORD

사람이 평가한 검증 표본은 기사 588건이다. 복수 평가자의 독립 평점을 기사별로 합쳐 감성 기준으로 사용한다.

ORIGINAL PASSAGE
588 articles
ECB WP No.3283, §6.2, printed p.22; labeling procedure §5, printed pp.18–20; September 2026 edition; accessed 2026-10-06
F4 · PRIMARY RECORD

FinBERT는 긴 기사를 문장별로 나눠 긍정·중립·부정을 추정하고 문장 분류를 기사·일별 지수로 집계한다. 중립 문장과 기사 길이의 처리에 따라 지수의 범위와 극단값이 달라진다.

ORIGINAL PASSAGE
sentence-level approach
ECB WP No.3283, §3.2, printed pp.9–10; Appendix A, printed pp.34–38; September 2026 edition; accessed 2026-10-06
F5 · PRIMARY RECORD

기사를 시간순으로 나눈 학습·시험 구간과 시간순 교차검증을 사용한다. 모형 선택에서 미래 기사로 과거 평가를 돕는 문제를 줄이는 설계다.

ORIGINAL PASSAGE
chronologically
ECB WP No.3283, §6.3, printed pp.25–26, temporal split and footnote9; September 2026 edition; accessed 2026-10-06
F6 · PRIMARY RECORD

표본외 분류에서 index_pos_neg의 macro-F1은 0.638이다. macro-F1은 긍정·중립·부정 각각의 정밀도와 재현율을 결합한 점수를 같은 비중으로 평균하며 적중률과 다르다.

ORIGINAL PASSAGE
index_pos_neg 0.627 0.630 0.638
ECB WP No.3283, Table7, printed p.27; columns Accuracy / Balanced Accuracy / Macro-F1; metric definition printed p.23; September 2026 edition; accessed 2026-10-06
F7 · PRIMARY RECORD

같은 표본외 분류에서 사전 기반 index_shapiro의 macro-F1은 0.162이다. 사전 지수는 대부분 중립으로 분류돼 감성 극단을 구별하지 못한다.

ORIGINAL PASSAGE
index_shapiro 0.322 0.333 0.162
ECB WP No.3283, Table7, printed p.27, same columns; classification behavior printed p.24; September 2026 edition; accessed 2026-10-06
F8 · PRIMARY RECORD

임베딩을 입력으로 한 Random Forest 회귀의 표본외 R²는 0.688이다. 설명하는 대상은 사람의 감성평점 변화이며 자산수익률이 아니다.

ORIGINAL PASSAGE
0.688
ECB WP No.3283, §6.3, printed p.28; Table8, printed p.29, Random Forest row and R² column; September 2026 edition; accessed 2026-10-06
F9 · PRIMARY RECORD

연속 감성점수를 긍정·중립·부정으로 바꿀 때 지수들에 동일한 ±0.33 경계를 적용한다. 사전 지수의 점수 범위가 좁다는 점을 분류 비교와 함께 읽어야 한다.

ORIGINAL PASSAGE
±0.33
ECB WP No.3283, §6.2 footnote8 and Table5 note, printed pp.22–23; distributions Table2, printed p.12; September 2026 edition; accessed 2026-10-06
F10 · PRIMARY RECORD

사람 평가자는 기사의 경제적 내용보다 표현의 어조와 감정에 점수를 매기도록 안내받았다. 시장반응이나 거래성과를 목표로 한 검증이 아니다.

ORIGINAL PASSAGE
tone and emotional content
ECB WP No.3283, §5, printed p.19, annotation instructions; future economic applications §7, printed p.31; September 2026 edition; accessed 2026-10-06
F11 · PRIMARY RECORD

전체 뉴스 표본은 본문이 비어 있지 않고 300단어를 초과한 영문 금융 기사만 포함한다.

ORIGINAL PASSAGE
300 words
ECB WP No.3283, §3.1, printed p.9, inclusion filters; September 2026 edition; accessed 2026-10-06
Publication links ↑
Show the original briefing text

구분: 중앙은행 연구·금융 NLP 및 시계열 검증
발표일: 2026년 9월 17일

핵심 요약

ECB Working Paper No. 3283은 2025년 영문 금융뉴스 143,755건을 모으고 588건을 사람이 판정해 transformer 감성지수를 비교했음. FinBERT의 문장별 예측을 문서 수준으로 합쳤고, 시간순 분할과 3겹 시계열 교차검증으로 미래정보 누출을 막았음. 최고 transformer 지수의 macro-F1은 0.638로 어휘사전 기반 지수의 0.162보다 높았음. 회귀형 문장 임베딩은 사람 라벨 예측에서 표본외 R² 0.688을 기록했지만 채권수익률이나 P&L을 예측한 실험은 아님.

실무 시사점

뉴스 모델은 문서 수보다 라벨 설계와 시간분할에서 먼저 갈림. 감성 정확도가 높아도 금리·스프레드 반응 라벨과 연결되지 않으면 거래가치는 확인되지 않으므로 텍스트 평가와 시장반응 평가를 분리해야 함.

한국 시장 복제 아이디어

금통위·기재부·등급공시를 정책방향·불확실성·신용사건으로 사람이 이중 라벨링함. 문장 집계 FinBERT, 한국어 장문 encoder, 단순 사전을 같은 시간순 홀드아웃에서 비교하고 다음 날 금리방향·변동성·회사채 스프레드는 별도 과제로 검증해봄.