편집 전 브리핑 원문 펼치기
구분: 현직 Head of Complex Feature Engines 인터뷰 + 회사 공식 정리
팟캐스트: 2026년 7월 6일
Two Sigma 공식 공개: 2026년 8월 11일
오늘 퀀트사 자료 중 가장 추천한다.
Two Sigma의 Head of Complex Feature Engines Ben Wellington이 Flirting with Models에서 약 56분 동안 feature engineering, ML, AI, p-hacking, forecast horizon, shared research platform을 직접 설명했다. Two Sigma도 이후 이를 공식 사이트에 상세히 정리했다. Two Sigma 공식 정리 전체 팟캐스트·챕터
확인 가능한 사실 ① — Feature는 “column”이 아니다
Ben은 feature를 단순 데이터 column이 아니라:
“facts about the world worth noting”
으로 정의한다.
예를 들어:
- 최근 일주일 가격변화
- 뉴스 보도량
- analyst upgrade
- press release timing
모두 feature가 될 수 있다.
하지만 핵심은 데이터를 보유하는 것 자체가 아니라 어떤 질문으로 그것을 변환하느냐다.
그는 raw data가 commoditize될수록 quant edge가:
Data
에서
What you do with the data
즉 feature engineering 쪽으로 이동한다고 설명한다.
확인 가능한 사실 ② — 가장 중요한 목표는 “Orthogonal Prediction”
Ben은 alpha modeler의 업무를 아주 명확하게 표현한다.
매일 orthogonal하고 novel한 prediction을 찾는 것이다.
기존 signal과 correlation이 높은 feature는 쉽게 찾을 수 있지만 경제적 가치는 낮다.
실제로 팟캐스트에서는:
- feature collinearity
- orthogonality
- forecast horizon
- feature lifecycle
- market efficiency
를 별도 주제로 깊게 다룬다.
이 관점에서 feature 평가식은 단순:
IC(feature, return)
보다:
Incremental IC conditional on existing features
가 더 중요하다.
확인 가능한 사실 ③ — Shared Feature Library
Two Sigma에서는 연구자들이 silo별로 각자 feature를 소유하기보다 공유 feature library와 공통 research platform을 사용한다고 Ben이 설명한다.
즉 한 팀이 발견한 feature가 다른 모델과 전략에도 재사용된다.
이 구조에서는:
Research 1개
→ feature library
→ 모델 20개에서 재사용
이 가능하다.
확인 가능한 사실 ④ — LLM과 Feature Engineering
Ben은 LLM이 과거 NLP와 다른 중요한 변화를 만들었다고 본다.
기존:
Language → Numbers
였다면 이제는:
Numbers / tables / structured information → Language
까지 가능해졌기 때문에 **“anything can be language”**에 가까운 연구공간이 열린다고 설명한다.
다만 AI가 모두에게 동일한 아이디어를 제안하면 오히려 연구결과가 homogenize될 수 있다. 그는 AI를:
연구자의 originality를 증폭하는 도구
로 써야 한다고 강조한다.
공개자료 기반 수익 메커니즘
Two Sigma의 구조는 이렇게 해석할 수 있다.
Raw Data
→ Human/AI feature hypothesis
→ orthogonality test
→ forecast model
→ shared feature library
→ 여러 portfolio에 재사용
→ P&L
즉 edge의 핵심 중 하나는:
Feature Quality × Reuse × Orthogonality
다.
한국 채권시장 복제 아이디어
우리도 Bond Feature Store를 단순 DB table이 아니라 연구자산 library로 만들 필요가 있다.
예:
foreign_10y_futures_flow_zscore
auction_tail_20d_percentile
10_30_curve_residual
orderbook_cancel_imbalance
broker_fill_ratio
MPC_hawkishness_delta
각 feature에 자동으로:
- 설명
- 경제적 hypothesis
- target horizon
- IC
- regime별 IC
- 기존 feature와 correlation
- production usage
- decay
를 기록한다.
그리고 신규 feature 승인기준을:
높은 단독 IC
가 아니라
기존 feature set에 없는 incremental information
으로 바꾼다.
이건 바로 구현할 가치가 있다.
복제 가치: ★★★★★