핵심 요약
- 역전파(Backprop) 없이 토큰별 활성화 값의 섭동을 이용해 트랜스포머 언어 모델을 사전학습하는 0차 최적화 기법 'Dust'가 발표되었습니다.
- 기존 가중치 기반 진화 전략보다 1000~10000배가량 효율적이며, 대규모 연산 환경에서는 역전파의 성능을 근접하게 모사하거나 일부 능가하기도 했습니다.
- 모델 크기가 커질수록 효율이 떨어지는 기존 0차 기법의 한계를 깨고 대규모 모델에서도 강력한 확장 가능성을 보였습니다.
요약 딥러닝의 근간이자 사실상 유일한 표준 학습 알고리즘으로 여겨지던 역전파(Backpropagation) 없이 트랜스포머 모델을 사전학습(Pretraining)하는 연구가 공개되어 해외 개발자 커뮤니티에서 주목받고 있습니다. 연구진이 공개한 'Dust'는 0차 최적화(Zeroth-Order Optimization) 기법으로, 미분 가능성이나 해석적 기울기에 의존하지 않는 새로운 학습 방식을 제안합니다.
기존의 진화 전략(ES) 방식은 가중치(Weight)를 직접 흔들어 개체군을 평가해야 했기 때문에 계산 비용이 극심했지만, Dust는 활성화 값(Activation)을 토큰 단위로 독립적으로 섭동(노드 섭동)시키는 방식을 도입했습니다. 이를 통해 단 한 번의 순전파(Forward Pass)만으로 모든 토큰을 병렬적으로 평가하는 가상 개체군 개념을 구현하여 기존 첨단 ES 기법(EGGROLL) 대비 $10^3$~$10^4$배 이상의 높은 효율성을 달성했습니다.
특히 주목할 점은 0차 방식은 모델이 커질수록 확장이 불가능하다는 통념을 깬 결과입니다. 실험 결과 더 큰 모델(243M 파라미터)이 120배 작은 모델보다 개체군 효율이 더 우수했으며, 개체군 규모가 커질수록 역전파의 기울기 추정치와 매우 유사해지거나 특정 설정에서는 오히려 역전파를 능가하는 성능을 보였습니다. 연구진은 막대한 연산 자원이 주어지는 환경에서는 복잡한 유도 편향(Inductive Bias)보다 무차별 탐색(Brute-force) 기반의 일반 알고리즘이 결국 승리한다는 '쓰라린 교훈(Bitter Lesson)'을 언급하며, 역전파를 대체할 수 있는 새로운 가능성을 제시하고 있습니다.
Sponsored · 광고