FIXED INCOME / FIELD NOTES

A 24x Speedup for Reinforcement Learning with RLlib + Ray

강화학습 연구에서 GPU를 늘려도 왜 실험이 빨라지지 않을 수 있는가?

강화학습은 정책이 환경에 행동을 보내고 관측과 보상을 되돌려 받는 과정을 반복한다. 금융자료는 신호대잡음비가 낮아 많은 표본이 필요하지만 환경 시뮬레이터는 CPU에서 천천히 움직일 수 있다. Two Sigma 사례의 기존 실험은 24 CPU로 7~10시간이 걸렸고, 표본 생성은 전체 시간의 약 90%를 차지했다. GPU를 키워도 느린 환경은 빨라지지 않았다.

기존 벡터환경은 여러 환경의 한 step이 모두 끝나야 다음 계산으로 넘어갔다. 일부 reset이나 step이 오래 걸리면 나머지 작업자가 기다리는 lock-step 문제가 생긴다. RLlib은 여러 rollout을 묶어 끝나는 단위부터 수집하는 방식으로 기다림을 줄였다. 같은 이천만 표본 실험의 벽시계 시간은 7~10시간에서 1.5~2.5시간으로 줄었다.

추가로 Ray를 이용해 범용 CPU 머신 여러 대에 rollout 작업자를 분산하자 시간은 약 20분까지 내려갔다. 발표는 RLlib 전환의 약 4배와 클러스터 확장의 약 6배를 합쳐 약 24배라고 요약한다. 그러나 이는 특정 환경과 병목에 대한 속도결과다. 정책의 거래수익, 표본외 안정성, 시뮬레이터 현실성은 별도 검증해야 하며 계산량을 늘린 것과 더 좋은 전략을 얻은 것은 동일하지 않다.

SCOPE2021년의 한 금융 강화학습 실험과 계산환경에 관한 기술발표다. 24배는 두 단계의 벽시계 속도향상을 합친 값이며, 실거래 배포나 손익개선을 보여주는 결과가 아니다.

Evidence & verification ↓

Sources & evidence

Original passages appear only when checked against the publication. Earlier briefing records are identified separately.

A 24x Speedup for Reinforcement Learning with RLlib + Ray7 primary · 0 archived +
F1 · PRIMARY RECORD

기존 금융 강화학습 실험은 24 CPU에서 7~10시간이 걸렸다.

ORIGINAL PASSAGE
7-10 Hrs
Two Sigma, A 24x Speedup for Reinforcement Learning with RLlib + Ray, slide 9, accessed 2026-10-08
F2 · PRIMARY RECORD

전체 시간의 약 90%는 환경 표본 생성에 쓰였다.

ORIGINAL PASSAGE
~90% generating samples
Two Sigma, A 24x Speedup for Reinforcement Learning with RLlib + Ray, slide 9, accessed 2026-10-08
F3 · PRIMARY RECORD

RLlib 전환으로 같은 2천만 표본 실험은 1.5~2.5시간이 걸렸다.

ORIGINAL PASSAGE
7-10 Hrs -> 1.5-2.5 Hrs ~4x
Two Sigma, A 24x Speedup for Reinforcement Learning with RLlib + Ray, slide 13, accessed 2026-10-08
F4 · PRIMARY RECORD

Ray 클러스터를 더하면 실험시간은 약 20분까지 줄었다.

ORIGINAL PASSAGE
RLlib + Ray ~20 min
Two Sigma, A 24x Speedup for Reinforcement Learning with RLlib + Ray, slide 19, accessed 2026-10-08
F5 · PRIMARY RECORD

발표는 두 단계의 속도향상을 합쳐 약 24배로 요약했다.

ORIGINAL PASSAGE
Together ~24x
Two Sigma, A 24x Speedup for Reinforcement Learning with RLlib + Ray, slide 22, accessed 2026-10-08
F6 · PRIMARY RECORD

기존 실험은 24 CPU에서 실행됐다.

ORIGINAL PASSAGE
24 CPUs
Two Sigma, A 24x Speedup for Reinforcement Learning with RLlib + Ray, slide 9, accessed 2026-10-08
F7 · PRIMARY RECORD

Ray 클러스터 확장은 RLlib 단독 대비 약 6배의 추가 속도향상을 냈다.

ORIGINAL PASSAGE
~6x speedup
Two Sigma, A 24x Speedup for Reinforcement Learning with RLlib + Ray, slide 19, accessed 2026-10-08
Publication links ↑
Show the original briefing text

구분: 퀀트회사 공식 기술발표·강화학습 및 분산컴퓨팅
발표일: 2021년 8월 12일
선정 사유: 최신성보다 금융 강화학습의 실제 계산 병목과 분산화 효과를 수치로 공개한 기술적 가치 때문에 선정

핵심 요약

Two Sigma 공식 발표는 저신호 금융자료를 쓰는 강화학습 실험에서 GPU보다 시뮬레이터 표본생성이 병목이 된 사례를 공개했다. 공식 슬라이드에 따르면 기존 24 CPU 실험은 7~10시간이 걸렸고 약 90%가 표본생성에 쓰였다. RLlib의 배치 rollout으로 1.5~2.5시간, Ray 클러스터로 약 20분까지 줄어 합산 약 24배의 속도향상을 얻었다. 이는 한 실험의 학습시간 결과이며 거래수익 개선을 입증한 자료는 아니다.

실무 시사점

강화학습 연구비용은 모델 크기보다 환경의 사건처리 속도와 동기화 방식에서 결정될 수 있다. GPU 사용률만 보지 말고 시뮬레이터 step·reset·추론·학습 시간을 분해해야 실험회전과 검증범위를 늘릴 수 있다.

한국 시장 복제 아이디어

국채 집행 시뮬레이터에서 동일한 정책·표본수·무작위 시드를 고정하고 단일머신 벡터환경, 배치 rollout, Ray 클러스터를 비교한다. 벽시계 학습시간, 초당 환경 step, 비용, 정책수익 분산과 재현률을 함께 측정해 속도향상이 품질 저하나 미래정보 누출에서 나오지 않았는지 확인한다.