기타 Hacker News · 2일 전

일반 게이밍 PC에서 125B 초대형 AI를 초당 100토큰으로 돌리는 오픈소스 등장

핵심 요약
  • 서버급 초대형 AI 모델인 Qwen3.8-Flash-Next(125B)를 일반 게이밍 PC에서 로컬로 구동할 수 있는 오픈소스 엔진 'Strata'가 공개되었습니다.
  • RTX 5070이나 RX 9070 XT 등 일반 그래픽카드(12GB VRAM 이상)와 시스템 RAM을 활용해 초당 최대 90~100토큰 이상의 실시간 속도를 달성했습니다.
  • 외부 서버 연결 없이 로컬에서 완전 구동되며 원클릭 배치 파일 및 AI 코딩 도구를 통한 원스톱 자동 설치를 지원합니다.
요약 원래 대형 서버에서나 겨우 돌리던 1,250억 개(125B) 매개변수 규모의 거대 AI 모델을 일반 가정용 게이밍 PC에서 로컬로 빠르게 구동할 수 있는 오픈소스 프로젝트 'Strata'가 공개되어 개발자와 AI 커뮤니티에서 큰 주목을 받고 있습니다. Strata는 Qwen3.8-Flash-Next 모델을 일반 PC 환경에서 최적화하여 실행하도록 돕는 추론 엔진입니다. 외부 서버로 데이터를 전혀 전송하지 않고 모든 작업이 로컬 컴퓨터 내에서 처리되며, 텍스트 대화뿐 아니라 코딩 에이전트 연동, 이미지 인식(Vision), OpenAI 및 Anthropic 호환 로컬 API 지원까지 갖추고 있습니다. 제작진이 공개한 벤치마크 결과에 따르면, RTX 5070(12GB VRAM) 및 라이젠 5 7600, 64GB RAM 환경에서 Q2_0 양자화 모델 기준 초당 94토큰(94 tokens/s)의 답변 생성 속도를 기록했습니다. 또한 AMD RX 9070 XT(16GB VRAM) 환경에서도 초당 60토큰 수준의 빠른 속도를 보여주었으며, VRAM이 24GB인 RTX 3090 같은 그래픽카드에서는 초당 100~140토큰까지 나올 것으로 예상됩니다. 프롬프트를 읽는 속도 역시 수천 토큰 수준으로 매우 빠릅니다. 최소 요구 사양은 12GB 이상의 VRAM을 갖춘 엔비디아(RTX 20/30/40/50 시리즈) 또는 AMD 라데온 그래픽카드와 32GB 이상의 시스템 RAM(권장 64GB), 약 80GB의 여유 저장 공간(SSD 권장)입니다. 설치 과정도 원클릭 수준으로 간소화되어, 윈도우에서는 배치 파일(START-HERE.bat)을 실행하거나 Cursor, Claude Code 같은 AI 코딩 어시스턴트에 프롬프트를 넘겨 자동으로 사양을 확인하고 설치를 진행할 수 있습니다. 처음 모델을 로드할 때 시스템 RAM에 약 35~55GB를 적재하느라 1~3분간 PC가 멈추거나 느려질 수 있지만, 이후 로컬 웹 브라우저(127.0.0.1:8080)를 통해 바로 사용할 수 있습니다.
Sponsored · 광고