Dust, 역전파 없이 트랜스포머 사전학습하는 방법 제시
Dust 연구진이 토큰별 내부 활성값에 잡음을 넣고 손실 변화를 이용해 학습하는 방법을 제시했다. FineWeb 실험에서 많은 탐색 표본을 사용하자 일부 조건에서 역전파보다 낮은 손실을 기록했다. 다만 연산량이 크게 늘어나며, 연구진도 현재 역전파를 대체할 만큼 효율적인 방법은 아니라고 설명했다.
각 토큰의 선형층 출력에 독립적인 가우시안 잡음을 추가하고, 손실 감소량으로 가중한 잡음의 평균을 이용해 학습 신호를 추정한다.
주요 비교 실험은 FineWeb의 10만~2000만 토큰과 업데이트당 64~1만6000개 탐색 표본을 사용했으며, 조건마다 세 개의 시드로 수행했다.
10만·100만 토큰 조건에서는 충분한 표본을 사용한 Dust의 손실이 역전파보다 낮았다. 2000만 토큰 조건에서 역전파를 밑도는 극한 손실값은 실측이 아닌 외삽이다.
EGGROLL 대비 1000~1만 배 효율적이라는 수치도 연구진의 외삽에 근거한다.
외부 프로그램을 학습 과정에 포함하는 신경망 등은 향후 과제로 남겼으며 이번 연구에서 학습하지 않았다.
토큰마다 별도 탐색 표본을 구성해 한 번의 순전파로 병렬 평가하므로, 가중치 사본마다 실행해야 하는 기존 진화 전략의 비용을 줄인다.
원문
- Dust: Pretraining Transformers Without Backpropagationqlabs.sh · 원문 2026-10-06