핵심 요약
- 유명 벡터 DB turbopuffer가 기존의 벡터 기본 인덱스 중심 설계를 폐기하고 신규 스토리지 엔진 'v3'를 도입한다고 밝혔습니다.
- Cursor, Notion 등 고객사의 요구로 텍스트 검색 및 필터링 기능이 늘어나면서 기존 벡터 중심 구조가 스토리지 및 쓰기 병목을 유발했기 때문입니다.
- 앞으로는 벡터 인덱스를 여러 보조 인덱스 중 하나로 격하시키며 범용 검색 데이터베이스로 전환할 계획입니다.
요약 서버리스 벡터 데이터베이스로 출발해 Cursor와 Notion 등을 초기 고객사로 확보했던 turbopuffer가 스토리지 아키텍처를 전면 개편하는 'turbopuffer v3' 개발 계획을 발표했습니다.
v1 시절의 turbopuffer는 문서가 단순히 ID와 벡터 하나로만 구성된 순수 벡터 데이터베이스였습니다. 오브젝트 스토리지 환경에 최적화하기 위해 계층형 클러스터링 인덱스(SPANN에서 시작해 SPFresh로 전환) 방식을 채택했고, 모든 데이터는 클러스터 ID와 로컬 ID가 결합된 ANN 주소를 기본 키(Primary Index)로 삼아 저장되었습니다.
그러나 v2로 넘어가며 속성 필터링과 BM25 기반 전문 검색(Full-text search), 정규식 검색, 퍼지 매칭 등 다양한 검색 쿼리 수요가 급증했습니다. 이에 따라 벡터 주소를 역인덱스로 참조하는 방식으로 기능을 확장해왔지만, 모든 인덱스와 데이터가 여전히 벡터 기본 인덱스에 종속되어 있는 구조적 한계에 부딪혔습니다. 이로 인해 단일 인덱스에서 1,000억 개 이상의 벡터를 처리할 만큼 벡터 검색 자체는 강력했으나, 비벡터 쿼리 처리 시 스토리지 및 쓰기 증폭(write/storage amplification), 벡터화 연산의 한계 같은 병목이 발생했습니다.
이에 turbopuffer 측은 기존의 벡터 중심 설계를 과감히 탈피하고, ANN 벡터 인덱스를 '여러 보조 인덱스(Secondary Index) 중 하나'로 격하시키며 범용 검색 데이터베이스를 지향하는 신규 스토리지 엔진 v3로 전환하겠다고 선언했습니다.
Sponsored · 광고