**Dust - 역전파 없이 트랜스포머 사전학습하기**

- Dust는 모델 내부의 계산값에 작은 무작위 변화를 주고, 예측 오류가 줄어드는 방향을 찾아 역전파 없이 트랜스포머를 처음부터 학습하는 방법임  
- 모델 가중치를 여러 벌 복제하는 대신 토큰마다 서로 다른 변화를 시험해, 한 번의 순전파에서 수천 개의 탐색 후보를 병렬로 평가함  
- 탐색 후보를 늘릴수록 역전파로 학습한 모델에 가까운 성능을 보였으며, 10만·100만 토큰 학습 실험에서는 일부 설정에서 더 낮은 예측 오류를 기록함  
- 모델이 커지면 탐색이 어려워진다는 통념과 달리, 2억 4,300만 파라미터 모델이 약 12…

[https://news.hada.io/topic?id=34868](https://news.hada.io/topic?id=34868)