기타 Hacker News · 2026-09-29

몇천 원짜리 칩 7개 엮어서 LLM 돌리는 용자 등장 (ESP32 클러스터)

핵심 요약
  • 초저가 마이크로컨트롤러 ESP32-S3 7대를 고속 SPI 데이지 체인으로 연결해 0.4B~0.5B 규모의 LLM을 분산 구동하는 프로젝트가 공개되었습니다.
  • 1대의 마스터 노드가 토크나이저와 임베딩을, 나머지 6개 노드가 1.58비트(BitNet) 삼진 양자화 기반의 트랜스포머 레이어를 4개씩 나눠서 파이프라인 방식으로 연산합니다.
  • PC용 가중치 양자화/가지치기 파이썬 도구와 펌웨어 소스코드가 깃허브에 MIT 라이선스로 오픈되었습니다.
요약 초소형·초저가 마이크로컨트롤러인 ESP32-S3 여러 대를 엮어 거대언어모델(LLM)을 구동하는 오픈소스 프로젝트 'ESP32s3-LLM-Cluster'가 깃허브에 공개되어 개발자 커뮤니티에서 화제를 모았습니다. 이 프로젝트는 총 7대의 ESP32-S3 보드를 데이지 체인 방식의 고속 SPI(고속 시리얼 통신)로 연결하여 약 0.4B~0.5B 규모의 소형 LLM을 분산 추론(Pipeline Inference)하도록 설계되었습니다. 전체 구조에서 1대의 보드가 마스터 노드 역할을 맡고 나머지 6대가 연산 노드로 동작합니다. 마스터 노드는 사용자 입력을 받아 BPE 토크나이저를 실행하고 INT4 형식의 토큰 임베딩(Flash 메모리 내 약 14MB 크기) 처리를 담당합니다. 마스터 노드에서 생성된 은닉 상태 벡터(FP32)는 SPI 통신을 통해 첫 번째 연산 노드로 전송되며, 각 연산 노드는 트랜스포머 블록을 4개씩 분담해 총 24개 레이어(0~23 레이어)를 순차적으로 계산합니다. 연산 노드에서는 RMSNorm과 함께 1.58비트(BitNet 삼진 양자화) 어텐션 및 MLP 연산을 어셈블리로 최적화된 연산 코드로 수행하고, KV 캐시는 PSRAM에 보관합니다. 마지막 6번째 노드까지 계산을 마치면 데이터는 다시 마스터 노드로 전송되어 최종 정규화(Final RMS Norm)와 LM 헤드를 거쳐 다음 토큰을 출력하게 됩니다. 개발자는 PC 환경에서 어휘를 32K로 가지치기하고 BitNet QAT(양자화 인식 훈련) 미세조정 및 가중치를 패킹할 수 있는 파이썬 도구 일체도 함께 공개했습니다. 고성능 GPU 없이도 개당 수천 원 수준의 초저가 임베디드 칩을 엮어 최신 양자화 기술로 LLM 파이프라인을 구현했다는 점에서 기술적 흥미를 끌고 있습니다.
Sponsored · 광고