Citadel은 단순 statistical-distance 기반 anomaly detector만으로는 충분하지 않다고 명시한다. 동일한 이상값도 데이터셋의 사용목적과 주변정보에 따라 의미가 달라지므로, 업무 맥락와 downstream 연구 usage까지 반영해야 한다고 설명한다.
편집 전 브리핑 원문 펼치기
구분: Citadel 공식 EQR 기술·프로젝트 공개자료
발표일: 2026년 8월 4일
확인 가능한 사실
Citadel의 Equity Quantitative Research(EQR) 팀은 최근 실제 프로젝트 하나를 공개했다. 프로젝트의 목표는 다양한 데이터셋의 이상값을 찾아 그 값이 오류인지, noise인지, 아니면 오히려 가치 있는 signal인지 분류하고 각 경우마다 exclude/down-weight/keep을 추천하는 framework를 만드는 것이다. Citadel 공식 원문
Citadel은 단순 statistical-distance 기반 anomaly detector만으로는 충분하지 않다고 명시한다. 동일한 이상값도 dataset의 사용목적과 주변정보에 따라 의미가 달라지므로, business context와 downstream research usage까지 반영해야 한다고 설명한다.
또 모델을 만든 뒤 끝나는 것이 아니라 researchers/developers가 실제로 사용하면서 feedback을 주고 다시 모델을 수정하는 model→internal product→user feedback loop를 운영한다.
공개자료 기반 추론
이 자료가 보여주는 경제적 구조는:
Better Data Quality
→ false signal 감소
→ corrupted feature로 인한 모델 오판 감소
→ research quality ↑
→ portfolio decision 개선
이다.
더 중요한 점은 이상치가 항상 나쁜 것이 아니라는 것이다.
금융데이터에서는:
Outlier = Error
가 아니라
Outlier ∈ {Bad Data, Noise, Regime Shift, Alpha}
다.
이 분류를 잘못하면 진짜 시장 스트레스를 데이터 오류로 지우거나, 반대로 broken tick을 alpha로 학습하게 된다.
한국 채권시장 복제 아이디어
K-Bond·국채선물·브로커 quote에 Data Quality Engine을 별도 모델로 만들 가치가 크다.
예를 들어 수익률이 갑자기 8bp 튀었을 때:
- stale quote인가?
- 잘못된 종목 mapping인가?
- 소액 이상체결인가?
- 진짜 block trade인가?
- 시장 전체 regime shift인가?
를 분류한다.
그리고 feature store에는 raw 값을 바로 덮어쓰지 말고:
raw_value
cleaned_value
anomaly_type
confidence
action
을 모두 저장한다.
이렇게 해야 나중에 **“우리가 알파를 지워버렸는가?”**까지 감사할 수 있다.
복제 가치: ★★★★★