핵심 요약
- 기존 딥러닝 프레임워크 없이 러스트 언어로 바닥부터 직접 구현한 비(非)트랜스포머 언어 모델 'PSSA'가 공개되었습니다.
- 순환 상태 공간(SSM)과 기억 뱅크 구조를 채택해 동일 파라미터 대비 학습이 빠르고 동일 CPU에서 텍스트 생성이 약 12배 빠릅니다.
- 시퀀스 길이에 따른 연산 비용이 선형적으로 증가하며, 토큰 단위의 독특한 가중치 업데이트 구현을 위해 러스트로 직접 작성되었습니다.
요약 트랜스포머 아키텍처가 지배하는 언어 모델 생태계에서, 파이토치(PyTorch)나 텐서플로(TensorFlow) 같은 기존 딥러닝 프레임워크를 전혀 쓰지 않고 러스트(Rust) 언어로 바닥부터 직접 구현한 비(非)트랜스포머 기반 경량 언어 모델 'PSSA(Plastic State-Space Architecture)'가 공개되어 개발자 커뮤니티의 관심을 모으고 있습니다.
PSSA는 순환 상태 공간(Recurrent State-Space) 계층을 통해 텍스트를 한 번에 한 토큰씩 읽고, 일화적 기억 뱅크(episodic memory bank)를 유지하며, 실행되는 도중 가중치의 일부를 스스로 다시 작성하는 '가소성(plastic)' 구조를 채택했습니다. 개발자에 따르면 동일한 파라미터 수와 코퍼스 기준으로 트랜스포머보다 학습 속도가 빠르며, 동일 CPU 환경에서 텍스트 생성 속도가 약 12배가량 빠릅니다.
트랜스포머는 컨텍스트 내 모든 토큰 쌍의 관계를 계산하기 때문에 시퀀스 길이에 따라 비용이 제곱(O(N^2))으로 증가하고 매 단계마다 전체 컨텍스트를 다시 읽어야 합니다. 반면 PSSA는 고정된 크기의 상태를 유지하며 왼쪽에서 오른쪽으로 한 번만 통과하고, 컨텍스트를 다시 읽는 대신 메모리 뱅크를 참조하므로 시퀀스 길이에 따른 비용이 선형적으로만 증가합니다.
구현 언어로 러스트를 선택한 이유에 대해 개발자는 단순한 실행 속도 때문이 아니라고 밝혔습니다. 토큰 단위의 가중치 업데이트, 순전파 중 메모리 뱅크 기록 등을 기존 자동 미분(Autograd) 프레임워크 내에서 구현하려면 끊임없이 프레임워크와 충돌해야 했기에 선형대수를 직접 코딩하는 편이 훨씬 직관적이었다는 설명입니다. 모델은 S4나 Mamba 계열과 유사한 선택적 대각 SSM 순환 구조에 푸앵카레 공(Poincare ball) 기반 쌍곡선 공간에서 4개 슬롯으로 제한된 메모리 읽기, 불응기 카운터와 능형 회귀를 결합한 메모리 쓰기 경로 등을 접목했습니다.
Sponsored · 광고