기타 Hacker News · 21시간 전

27B AI 모델을 5.9GB로 9배 압축했는데 성능은 98% 유지한다는 신규 모델

핵심 요약
  • PrismML이 Qwen3.8 27B 기반의 삼진 가중치를 적용해 모델 크기를 5.9GB로 압축한 'Bonsai 2 27B'를 발표했습니다.
  • 원본 정밀도 대비 크기는 9배 이상 작아졌지만 주요 벤치마크 종합 성능의 98.2%를 보존해 거의 손실 없는 압축을 구현했습니다.
  • RTX 5090에서 초당 143토큰 속도를 내며 로컬 PC 환경에서도 코딩 에이전트 및 컴퓨터 조작 워크플로를 원활하게 구동할 수 있습니다.
요약 PrismML이 Qwen3.8 27B를 기반으로 성능 손실을 대폭 줄인 삼진(Ternary) 가중치 기반 경량화 언어 모델 'Ternary Bonsai 2 27B'를 공개했습니다. Bonsai 2 27B는 {-1, 0, +1}의 3진 가중치에 FP16 그룹 단위 스케일링을 적용해 가중치당 유효 비트 수를 1.76비트 수준으로 낮췄습니다. 이를 통해 전체 모델 크기를 5.9GB까지 압축해 원본 정밀도 모델 대비 크기를 9배 이상 줄이면서도, 종합 벤치마크에서는 원본 대비 98.2%에 달하는 성능을 유지합니다. 또한 26만 2천(262K) 토큰의 컨텍스트 윈도우와 텍스트 및 이미지 멀티모달 입력을 지원하며 오픈소스 Apache 2.0 라이선스로 배포됩니다. 벤치마크 평가 결과에 따르면, Bonsai 2 27B는 추론, 코딩, 비전, 도구 호출 전반에서 83.9점을 기록했습니다. 특히 코딩 에이전트 루프나 도구 호출, 스크린샷 및 문서 분석처럼 작은 오류가 누적되기 쉬운 장기 과제 영역에서 성능 저하를 최소화한 것이 특징입니다. 구동 속도 및 전력 효율 면에서도 RTX 5090 기준 초당 최대 143토큰, M5 Max 기준 초당 46.8토큰의 처리량을 기록했습니다. 또한 RTX 4090 환경에서 토큰당 0.714mWh의 전력을 소모해 원본 정밀도로 구동되는 8B급 모델보다 약 40% 더 높은 에너지 효율을 보였습니다. 개발사 측은 이번 릴리즈를 통해 성능 유지율 격차를 기존 95%에서 98% 이상으로 좁힘으로써 로컬 기기에서도 클라우드 의존도를 낮춘 본격적인 코딩 에이전트 및 컴퓨터 조작 워크플로가 가능해졌다고 강조했습니다.
Sponsored · 광고