후보 모델 선정
https://cafe.daum.net/SmartRobot/RoVa/2722
VAD
장면 표현: Vectorized (bev 위에 vector 형태 map/agent)
Task 연결 방식: BEV Encoder -> map/agent Query -> planning
학습 단계: 단일 단계
VAD는 회귀(regression)방식이다.
MLP 기반 Decoder head가 실수 좌표값을 직접 출력하는 회귀 방식이다.
출력 텐서의 shape 자체가 좌표로 되어있다.
마지막 차원이 항상 2(x,y)로 끝난다.
언어 모델처럼 vocabulary size만큼의 차원을 갖고 softmax를 취하는 구조가 아니라,
좌표값 자체가 텐서의 원소로 직접 들어가있다.
논문 내 학습 방식
NVIDIA RTX 3090 8대, 60 epoch, AdamW, CosineAnnealing 스케쥴러 사용
별도의 perception-only pretrain 단계가 없고 처음부터 detection+map+motion+planning을 동시 학습한다.
1. Full Fine-tuning
Transfer FT (LR 10배 축소)
UniAD에서 새 데이터로 파인튜닝한 연구는 학습률을 10배 낮추기만 하고 나머지 하이퍼파라미터는 그대로 유지했다.
또한 기존 20~60epoch 학습 돌리던 걸 6~20epoch으로 낮춰서 학습하는 방식이다.
Full Fine-tuning이 필요한 경우는 카메라 개수나 FOV가 nuScenes와 근본적으로 다를 때,
클래스 정의 자체가 다를 때, 목표 도메인이 사전학습 도메인과 시각적으로 다를 때 사용해야 한다.
현재 상황에서는 Detection head가 10->3 class / Map head 3->1 class로 output shape 자체가 달라서
이 부분은 가중치 로드가 불가능하고 랜덤 초기화 후 처음부터 학습해야 한다.
2. Partial / PEFT (Parameter-Efficient Fine-Tuning)
(1) Partial Layer Fine-tuning은 센서 설정 변화에 가장 민감한 레이어를 선택적으로 업데이트하는 것으로,
backbone과 neck은 학습시키고 encoder와 head는 얼려서 공간적 특징을 적응시키는 방식이라고 한다.
3D object detection의 경우에서도 encoder는 입력 레벨 특성(포인트 분포/강도 패턴)에 영향받고
head는 출력 레벨 특성(객체 크기/라벨 포맷)에 영향받는 반면,
backbone과 neck은 공간 특징을 추출하는 역할이라 시점과 센서 배치에 민감하다.
따라서 nuScenes와 ETRI는 카메라 배치가 다른 센서 설정 변화이므로,
image backbone + BEV/feature neck은 학습, detection/map head는 상대적으로 안정적(얼리거나 낮은 LR)
조합으로 부분 파인튜닝이 가능할 것 같다.
(2) Frozen Backbone + 경량 Adapter
https://pmc.ncbi.nlm.nih.gov/articles/PMC12526605/
새로운 도시나 새로운 센서 설정에 빠르게 배포하기 위해
경량 어댑터, LoRA 모듈, frozen-backbone 파인튜닝 같은 파라미터 효율적 전이 기법을 사용한다고 한다.
차량 특성을 조건으로 장면 특징을 재구성하는 cross-attention만 학습 가능하게 둔다
backbone 전체를 재학습하지 않고 "차량이 바뀌었다"는 조건 정보를 주입하는 모듈만 학습하는 형식이다.
현재 모델에서는 backbone을 학습해야 센서 조건이 바뀐 걸 적용 가능하기 때문에 바로 사용하기는 힘들 것 같다.
(3) LoRA / Adapter - Transformer에 직접 삽입
LoRA는 원래 projection 가중치를 고정하고 low rank 추가해서 attn의 특정 linear projection에 삽입한 뒤
low rank만 학습하는 방식인데, VAD/SparseDrive의 BEV·attention 인코더에 그대로 적용 가능하다.
LoRA는 완전 파인튜닝보다 이전에 학습한 지식을 훨씬 덜 잃기 때문에
nuScenes에서 배운 일반 주행 지식을 유지하면서 ETRI에 적응하는 데 유리할 것 같다.