기타 Hacker News · 2026-09-18

수학과 Rust로 또 RAM 100TB 아껴버린 클라우드플레어 근황

핵심 요약
  • 클라우드플레어가 내부 라우팅 시스템의 메모리 낭비를 잡기 위해 분산 해싱 알고리즘을 최적화했습니다.
  • 수학적 통계 분석을 통해 서버 간 불균형 문제를 개선하고 Rust 기반 로직을 손질해 전 세계에서 100TB 이상의 RAM을 회수했습니다.
  • 지난달 DNS 팀의 100TB 절감에 이은 연속적인 대규모 인프라 자원 최적화 성과입니다.
요약 글로벌 클라우드 및 CDN 인프라 기업 클라우드플레어(Cloudflare)가 수학적 통계 분석과 Rust 코드 개선을 통해 전 세계 서버에서 무려 100TB 이상의 RAM을 추가로 절감했다고 밝혔습니다. 지난달 DNS 팀이 100TB의 메모리를 확보한 데 이어 또 한 번 대규모 최적화에 성공한 것입니다. 전 세계에 걸쳐 수천 대의 서버와 수백만 개의 CPU 코어를 운용하는 대규모 인프라 환경에서는 단 1%의 개선도 엄청난 자원 회수로 이어집니다. 이번 최적화의 시작은 사내 성능 관리 팀의 엔지니어가 핑고라 백엔드 라우터(Pingora Backend Router, PBR)에서 오픈소스 분산 해싱 라이브러리인 'pingora-ketama'의 메모리 사용량이 지나치게 높다는 티켓을 등록하면서 출발했습니다. 클라우드플레어는 데이터 센터당 파일 복사본을 하나만 유지하고 요청을 적절한 서버로 균등하게 라우팅하기 위해 '안정 해시(Consistent Hashing)' 알고리즘을 사용합니다. 하지만 서버와 작업의 해시 값을 단순 정렬해 담당 영역을 할당할 경우, 해시의 무작위성 때문에 특정 서버가 비정상적으로 넓은 범위를 맡게 되는 불균형 문제가 발생합니다. 실제로 서버 100대를 기준으로 통계적 기댓값과 표준편차를 계산해 변동 계수(Coefficient of Variation)를 분석한 결과 약 99%에 달했습니다. 이는 동일한 환경에서도 어떤 서버는 평균치의 두 배에 달하는 과부하에 시달리고, 어떤 서버는 거의 유휴 상태로 방치될 수 있음을 수학적으로 보여줍니다. 클라우드플레어 엔지니어링 팀은 이러한 해시 분산 통계 구조를 재설계하고 Rust 구현체를 손질해 전 세계 서버 인프라에서 100TB가 넘는 RAM 공간을 되찾는 성과를 냈습니다.
Sponsored · 광고