핵심 요약
- 레디스 창시자 살바토레 산필리포가 거대 LLM을 로컬 머신에서 구동하는 C 언어 기반 추론 엔진 'ds4'를 공개했습니다.
- 비대칭 2비트 양자화와 SSD 기반 KV 캐시 저장을 통해 DeepSeek V4 및 Qwen 계열 모델을 고용량 Mac이나 CUDA 환경에서 효율적으로 돌릴 수 있습니다.
- 대화형 CLI뿐 아니라 OpenAI 호환 로컬 API 서버와 코딩 에이전트 인터페이스를 일체형으로 제공합니다.
요약 오픈소스 데이터베이스 레디스(Redis)의 창시자로 유명한 살바토레 산필리포(antirez)가 대형 LLM을 로컬 환경에서 직접 구동할 수 있는 새로운 C 기반 추론 엔진 'DwarfStar 4(ds4)'를 공개했습니다.
기존 대규모 전문가 혼합(MoE) 모델인 DeepSeek V4 및 V4.1 Flash(2,840억 파라미터 규모), GLM 5.x, Qwen3.8 등 프론티어급 오픈 가중치 모델들은 거대한 크기 때문에 보통 원격 서버 호스팅에 의존해 왔습니다. 하지만 ds4는 비대칭 2비트 양자화(Asymmetric 2-bit quantization) 기술을 적용해, 라우팅되는 전문가 레이어는 압축하면서도 핵심적인 공통 경로는 정밀도를 유지하는 방식으로 고용량 메모리를 갖춘 개인용 및 워크스테이션 머신에서 모델이 작동하도록 설계되었습니다.
또한 KV 캐시를 SSD에 저장하고 프롬프트 해시를 통해 세션을 복원하는 아키텍처를 도입해 매번 긴 프롬프트를 다시 프리필(prefill)할 필요가 없도록 만들었습니다. 구동 인터페이스는 대화형 CLI(./ds4), OpenAI 및 Anthropic 호환 로컬 API 서버(./ds4-server), 그리고 코딩용 네이티브 에이전트(./ds4-agent)의 세 가지 형태로 제공되어 기존 개발 환경이나 코드 에디터와 쉽게 연동할 수 있습니다.
지원 하드웨어 플랫폼은 Apple Silicon(Metal), NVIDIA(CUDA/DGX Spark), AMD Strix Halo(ROCm) 등이며, 메모리 용량에 따라 단계별 실행을 지원합니다. 공개된 벤치마크에 따르면 M5 Max 128GB 환경에서 DeepSeek V4 Flash q2 모델 기준 초당 30~40 토큰 안팎의 생성 속도와 790 토큰 수준의 프리필 속도를 보여주며 고사양 개인 장비에서도 거대 모델의 로컬 구동이 현실화되고 있음을 보여줍니다.
Sponsored · 광고