채권 틱 자료를 읽어 특징을 계산하고 모델에 넣는 동안, 실제 계산보다 도구 사이의 자료 변환에 시간이 들 수 있다. G-Research는 저장 파일에서 분산 분석, 데이터프레임 처리, 모델 학습, 시각화로 이어지는 경로를 예로 든다. 각 도구가 서로 다른 형식을 쓰면 데이터를 바이트로 바꾸고 다시 풀어야 한다. Arrow의 출발점은 이 도구들이 계산 중에 쓰는 메모리 규격을 맞추는 것이다.
Arrow는 같은 열의 값을 연속으로 배치한다. 호환되는 도구가 같은 실행 과정 안에 있으면 큰 자료를 새로 복사하는 대신 메모리 위치를 가리키는 정보로 넘길 수 있다. 서로 다른 실행 과정 사이에서는 메모리에 연결한 파일을 활용한다. 여러 서버에 나뉜 자료는 Arrow Flight가 각 자료 조각의 위치를 알려 주고 동시에 받아 오게 한다. 같은 과정의 메모리 공유와 서버 사이 전송은 구분해서 이해해야 한다.
이 구조가 저장 형식까지 대체하는 것은 아니다. Parquet은 압축과 부호화로 파일 크기를 줄이는 데, Arrow는 계산하기 쉬운 메모리 배치에 맞춰져 있다. 따라서 Parquet으로 보관한 자료를 Arrow로 읽어 처리하고 결과를 다시 저장하는 조합이 자연스럽다. 글은 이런 연결 방식을 설명하며, 특정 거래 모델의 예측력이나 수익 개선을 검증하지는 않는다. 어떤 경로에서 이득이 생기는지는 기존 도구의 호환성과 실제 변환 비용을 재서 판단해야 한다.
SCOPE데이터 인프라의 공개 설명이다. 글에 소개된 일반 성능 수치를 해당 회사의 거래 시스템 성과로 해석할 수 없고, 모든 도구 사이에서 복사가 없어지는 것도 아니다.
Evidence & verification ↓Sources & evidence
Original passages appear only when checked against the publication. Earlier briefing records are identified separately.
Apache Arrow: Accelerating in-memory analytics through zero-copy data sharing5 primary · 0 archived +
공식 글은 여러 분석·학습 도구를 잇는 과정의 직렬화와 역직렬화 비용을 다룬다.
ORIGINAL PASSAGEserialisation and deserialisationG-Research (5 October 2026), The serialisation bottleneck killing performance, accessed 2026-10-06Arrow 호환 도구는 공통 열 중심 메모리 규격을 사용하며 같은 과정 안에서 메모리 위치 정보를 공유한다.
ORIGINAL PASSAGEpass pointers to memory regionsG-Research, Hardware-conscious design and Zero-copy data sharing, accessed 2026-10-06Flight는 분산 자료의 조각별 접속 위치를 알려 주고 동시에 받아 오는 구조다.
ORIGINAL PASSAGEone per partitionG-Research, Arrow Flight: Massively parallel data transport, accessed 2026-10-06Parquet은 저장 밀도, Arrow는 계산 속도를 목표로 하므로 함께 사용하는 기술이다.
ORIGINAL PASSAGEstorage densityG-Research, The Arrow-Parquet symbiosis, accessed 2026-10-06프로세스 사이 공유에는 메모리에 연결한 파일을 활용한다.
ORIGINAL PASSAGEmemory-mapped filesG-Research, Zero-copy data sharing, accessed 2026-10-06Show the original briefing text
구분: 퀀트회사 공식 기술자료·데이터 파이프라인 및 HPC
발표일: 2026년 10월 5일
핵심 요약
G-Research 공식 기술 글은 Parquet에서 Spark·Polars·PyTorch·시각화로 이어지는 분석 파이프라인의 직렬화·역직렬화 비용을 다뤘음. Arrow는 공통 열지향 메모리 규격과 C 인터페이스를 써 시스템이 데이터를 다시 복사하기보다 메모리 영역을 공유하게 함. Parquet은 저장밀도, Arrow는 계산속도에 맞춰 함께 쓰는 구조이며 Arrow Flight는 분산 파티션 전송을 병렬화함. 이는 데이터 엔지니어링 공개자료이고 실제 알파·거래배포·P&L은 공개하지 않았음.
실무 시사점
모델 학습시간만 재면 연구→생산 경계의 복사비용을 놓침. 원천 체결부터 특징·학습·온라인 추론까지 복사 바이트·직렬화 CPU·메모리 최고점·p99 지연을 공통 계보에 남겨야 함.
한국 시장 복제 아이디어
국고채 틱·RFQ·민평·포지션 파이프라인 한 구간을 Arrow C 인터페이스로 바꿈. 같은 스냅샷과 모델에서 기존 변환경로와 처리량·CPU·메모리·p99를 비교하고 결과 해시가 같을 때만 생산경로로 확대해봄.