BONDNOTE JOURNAL · 2026.10.03

컬럼형 저장이 수천 개 특징의 연구비용을 줄인다

G-연구의 Apache Parquet 기술 글은 대량 금융데이터의 저장형식이 조회성능과 인프라 비용에 직접 영향을 준다고 설명한다. row group은 병렬처리, column chunk는 필요한 열만 읽는 단위이고 page는 압축·인코딩의 최소 단위다.

2 min readRESEARCH NOTE
Source discussed · G-Research: 컬럼형 저장이 수천 개 특징의 연구비용을 줄인다

컬럼 가지치기는 수백·수천 개 특징 가운데 필요한 것만 읽고, 조건 푸시다운은 파일 통계를 이용해 무관한 구간을 건너뛴다. 반복 범주에는 dictionary와 run-length 인코딩이 유리하고, 압축 방식은 CPU 사용과 I/O 절감의 절충을 만든다. 특정 알파나 P&L은 공개되지 않았다.

국고채·회사채 체결과 RFQ는 거래일·상품군별 row group으로 저장하되 수신시각·유효시각·스키마·파일 해시를 보존한다. 빠른 조회가 미래정보 누출을 빠르게 반복하지 않도록, 특징 생성 시점과 수정 전후 스냅샷을 자동시험에 포함한다.

Read the full daily briefing →

Show the original briefing text

구분: 퀀트회사 공식 기술 블로그·금융 데이터 인프라
발표일: 2026년 9월 21일

핵심 요약

G-Research의 Apache Parquet 기술 글은 대량 금융데이터를 매일 처리할 때 저장구조가 인프라 비용과 조회성능에 직접 영향을 준다고 설명한다. Parquet은 row group을 병렬처리 단위로, column chunk를 필요한 열만 읽는 단위로, page를 압축·인코딩 단위로 사용한다. 컬럼 가지치기와 조건 푸시다운은 수백·수천 개 특징 가운데 일부만 읽는 퀀트 연구의 I/O를 줄이고, dictionary·run-length·delta 인코딩과 압축 방식은 CPU와 저장비용의 절충을 결정한다. 이는 공개된 데이터 인프라 설명이며 실제 알파·모델·P&L 개선폭은 공개하지 않았다.

실무 시사점

공개자료에 기반한 추론으로 연구→생산 속도는 모델 학습시간만이 아니라 시점 데이터 검색과 특징 선택 비용에서 결정된다. 다만 row group 통계가 미래정보를 포함하거나 스키마 변경이 조용히 반영되면 빠른 조회가 잘못된 백테스트를 더 빨리 만들 수 있다.

한국 시장 복제 아이디어

국고채·회사채 체결, 민평, 공시와 RFQ를 거래일·상품군 기준 row group으로 저장하고 자주 쓰는 특징은 함께 읽히도록 배치한다. 수신시각과 유효시각, 스키마·파일 해시를 보존하고 열 가지치기·조건 푸시다운 전후의 조회시간·비용·재현성을 측정한다.