BONDNOTE JOURNAL · 2026.09.04

Two Sigma의 투자 정보 가공

Two Sigma에서는 연구자들이 silo별로 각자 입력 변수를 소유하기보다 공유 입력 변수 library와 공통 연구 platform을 사용한다고 Ben이 설명한다.

약 2분RESEARCH NOTE
다룬 자료 · Two Sigma — Ben Wellington이 직접 설명한 “Feature Engineering에서 Alpha가 만들어지는 방식”

이 연구가 소개된 하루의 글 읽기 →

편집 전 브리핑 원문 펼치기

구분: 현직 Head of Complex Feature Engines 인터뷰 + 회사 공식 정리
팟캐스트: 2026년 7월 6일
Two Sigma 공식 공개: 2026년 8월 11일

오늘 퀀트사 자료 중 가장 추천한다.

Two Sigma의 Head of Complex Feature Engines Ben Wellington이 Flirting with Models에서 약 56분 동안 feature engineering, ML, AI, p-hacking, forecast horizon, shared research platform을 직접 설명했다. Two Sigma도 이후 이를 공식 사이트에 상세히 정리했다. Two Sigma 공식 정리 전체 팟캐스트·챕터

확인 가능한 사실 ① — Feature는 “column”이 아니다

Ben은 feature를 단순 데이터 column이 아니라:

“facts about the world worth noting”

으로 정의한다.

예를 들어:

  • 최근 일주일 가격변화
  • 뉴스 보도량
  • analyst upgrade
  • press release timing

모두 feature가 될 수 있다.

하지만 핵심은 데이터를 보유하는 것 자체가 아니라 어떤 질문으로 그것을 변환하느냐다.

그는 raw data가 commoditize될수록 quant edge가:

Data 에서 What you do with the data

즉 feature engineering 쪽으로 이동한다고 설명한다.

확인 가능한 사실 ② — 가장 중요한 목표는 “Orthogonal Prediction”

Ben은 alpha modeler의 업무를 아주 명확하게 표현한다.

매일 orthogonal하고 novel한 prediction을 찾는 것이다.

기존 signal과 correlation이 높은 feature는 쉽게 찾을 수 있지만 경제적 가치는 낮다.

실제로 팟캐스트에서는:

  • feature collinearity
  • orthogonality
  • forecast horizon
  • feature lifecycle
  • market efficiency

를 별도 주제로 깊게 다룬다.

이 관점에서 feature 평가식은 단순:

IC(feature, return)

보다:

Incremental IC conditional on existing features

가 더 중요하다.

확인 가능한 사실 ③ — Shared Feature Library

Two Sigma에서는 연구자들이 silo별로 각자 feature를 소유하기보다 공유 feature library와 공통 research platform을 사용한다고 Ben이 설명한다.

즉 한 팀이 발견한 feature가 다른 모델과 전략에도 재사용된다.

이 구조에서는:

Research 1개 → feature library
→ 모델 20개에서 재사용

이 가능하다.

확인 가능한 사실 ④ — LLM과 Feature Engineering

Ben은 LLM이 과거 NLP와 다른 중요한 변화를 만들었다고 본다.

기존:

Language → Numbers

였다면 이제는:

Numbers / tables / structured information → Language

까지 가능해졌기 때문에 **“anything can be language”**에 가까운 연구공간이 열린다고 설명한다.

다만 AI가 모두에게 동일한 아이디어를 제안하면 오히려 연구결과가 homogenize될 수 있다. 그는 AI를:

연구자의 originality를 증폭하는 도구

로 써야 한다고 강조한다.

공개자료 기반 수익 메커니즘

Two Sigma의 구조는 이렇게 해석할 수 있다.

Raw Data → Human/AI feature hypothesis
→ orthogonality test
→ forecast model
→ shared feature library
→ 여러 portfolio에 재사용
→ P&L

즉 edge의 핵심 중 하나는:

Feature Quality × Reuse × Orthogonality

다.

한국 채권시장 복제 아이디어

우리도 Bond Feature Store를 단순 DB table이 아니라 연구자산 library로 만들 필요가 있다.

예:

foreign_10y_futures_flow_zscore auction_tail_20d_percentile 10_30_curve_residual orderbook_cancel_imbalance broker_fill_ratio MPC_hawkishness_delta

각 feature에 자동으로:

  • 설명
  • 경제적 hypothesis
  • target horizon
  • IC
  • regime별 IC
  • 기존 feature와 correlation
  • production usage
  • decay

를 기록한다.

그리고 신규 feature 승인기준을:

높은 단독 IC

가 아니라

기존 feature set에 없는 incremental information

으로 바꾼다.

이건 바로 구현할 가치가 있다.

복제 가치: ★★★★★