ToaSt: ViT를 더 가볍고 더 정확하게 만드는 분리형 압축 (ICML2026)
· 약 6분
success
ToaSt 논문이 AI 분야 최고 권위 학회 중 하나인 ICML 2026에 채택되었습니다.
Vision Transformer(ViT)는 분류, 검출, 분할, 멀티모달 백본까지 폭넓게 쓰이지만, 높은 계산량 때문에 실제 배포 단계에서 병목이 자주 발생합니다. 이번 글에서는 ICML 2026에 채택된 ToaSt 논문의 문제의식, 방법론, 실험 결과를 논문 구조에 맞춰 자세히 정리합니다.
ToaSt의 핵심은 아래 한 줄로 요약할 수 있습니다.
- MHSA와 FFN을 분리해 각각 다른 전략으로 압축하고, 레이어 간 전파 문제를 피하면서 정확도-효율 균형을 동시에 개선한다.
1. 문제 배경: ViT는 어디서 느려지는가?
ViT 계산량은 크게 두 축에서 발생합니다.
- Attention: 토큰 수 (N)에 대해 대략 (O(N^2))
- FFN: 채널 차원 (D) 중심의 큰 연산량
논문에서 인용한 분석에 따르면 표준 ViT에서 FFN이 전체 FLOPs의 약 61%, Attention이 약 19%를 차지합니다. 즉 attention만 줄여서는 전체 효율을 충분히 끌어올리기 어렵고, FFN 중복을 직접 다뤄야 합니다.

Figure 1. ToaSt는 MHSA와 FFN을 분리 압축해 레이어 간 전파 문제를 줄인다.
2. 기존 접근의 한계: 왜 새로운 설계가 필요했나?
논문은 기존 ViT 경량화 방법을 크게 세 그룹으로 정리합니다.
2.1 Structured Weight Pruning
- 장점: 채널/헤드/블록 단위로 잘라서 일반 GPU에서도 가속 가능
- 한계: 정확도 회복을 위한 재학습 비용이 큼
- 실제 문제: ViT 계열은 원래 학습도 길어(수백 epoch), pruning 후 긴 fine-tuning이 실무에서 부담
2.2 Token Compression / Token Merging
- 장점: (N)을 줄여 attention의 (O(N^2)) 비용을 직접 줄임
- 한계 1: FFN의 (D^2) 지배 항을 직접 줄이지 못함
- 한계 2: 한 레이어의 token 선택이 이후 레이어로 전파되어 전역 의존성이 생김
2.3 Joint / Hybrid Methods
- 장점: 여러 축을 동시에 최적화해 큰 가속 잠재력
- 한계: 최적화 공간이 복잡하고 설정 민감도가 높음
- 일부 방식은 하드웨어/커널 의존성이 커 범용 배포가 어렵기도 함
ToaSt는 이 지점에서 "한 번에 다 최적화"가 아니라 "모듈별로 분리해 단순하고 안정적으로 압축"하는 철학을 택합니다.
3. ToaSt 방법론: Layer-Independent Compression
ToaSt는 Transformer block의 입출력 인터페이스 ((N \times D))를 유지한 채, 블록 내부만 줄입니다. 이렇게 하면 앞 레이어의 압축 결정이 뒤 레이어로 강하게 전파되는 문제를 줄일 수 있습니다.
