기타 Hacker News · 4시간 전

"내가 쓸 칩은 내가 만든다"… AI가 직접 설계한 오픈소스 AI 가속기 등장

핵심 요약
  • AI가 스스로 추론용 반도체 가속기(RTL, ISA, 컴파일러, 시뮬레이터 등)를 직접 설계하는 오픈소스 프로젝트 'openTPU'가 공개되었습니다.
  • 실제 Kintex-7 FPGA 카드에서 Qwen, Gemma 등 10개 최신 모델을 구동했으며, 하드웨어 연산 결과가 시뮬레이터와 비트 단위로 일치했습니다.
  • DRAM 피크 대역폭의 최대 94%를 활용하는 등 실질적인 성능과 최적화를 증명해 큰 주목을 받고 있습니다.
요약 인공지능(AI)이 자신을 구동할 하드웨어 가속기까지 직접 설계하는 오픈소스 프로젝트 'openTPU'가 공개되어 개발자 커뮤니티에서 화제를 모으고 있습니다. 이 프로젝트는 "AI 에이전트가 하드웨어 설계에 어디까지 도달할 수 있는가", 그리고 "자신들의 추론(Inference)을 직접 돌릴 칩을 AI가 스스로 설계할 수 있는가"라는 근본적인 질문에서 출발했습니다. 놀랍게도 결과물은 단순한 개념 증명에 그치지 않고, SystemVerilog 기반의 하드웨어 설계(RTL)부터 명령어 집합(ISA), 비트 단위로 일치하는 시뮬레이터, 커널 언어 및 컴파일러, 실제 PCIe 보드를 제어하는 호스트 소프트웨어까지 단일 모노레포에 모두 담아냈습니다. 실제 검증 테스트는 Xilinx Kintex-7 FPGA 칩(xc7k480t)과 DDR3 채널이 탑재된 Inspur PCIe 카드에서 진행되었습니다. 테스트 결과 LFM2.5, Qwen3, Qwen3.5, Phi-4-mini, SmolLM3, Gemma 4 등 실제 가중치를 가진 최신 오픈소스 AI 모델 10종이 정상적으로 구동되었습니다. 특히 FPGA 실물 하드웨어에서 추출된 토큰 결과값은 시뮬레이터의 계산 결과와 비트 단위로 완벽하게 일치했습니다. 성능 수치에서도 인상적인 결과를 보였습니다. 133.33MHz 클럭과 LiteDRAM 컨트롤러를 탑재한 비트스트림 이미지 환경에서, 모델 디코딩 시 DDR3 메모리 대역폭 피크치의 82%에서 최대 94%까지 극한으로 활용하는 효율을 기록했습니다. 4비트 양자화 모델 기준 LFM2.5는 초당 80토큰 이상, Qwen3-0.6B는 초당 30토큰 이상의 처리 속도를 보여주며 실질적인 추론 연산 능력을 입증했습니다. 파이썬의 행렬 곱셈부터 하드웨어 배선 레벨까지 AI 가속기의 전체 동작 원리를 한눈에 볼 수 있도록 구성되어 있어, AI가 설계하는 반도체 하드웨어의 가능성을 보여주는 흥미로운 이정표로 평가받고 있습니다.
Sponsored · 광고