Mở dần mức fine-tuning thay vì mở hết ngay

Mở dần mức fine-tuning thay vì mở hết ngay A workflow diagram generated by Archify. 01 / Mức fine-tuning EX / Rủi ro khi mở quá tay Thử mức rẻ trước Mở dần khi chưa đạt Chốt và đo lần cuối Bắt đầu · pretrained + dataset mới · Mức fine-tuning › Thử mức rẻ trước Bắt đầu pretrained + dataset mới Feature extraction · chỉ train head · Mức fine-tuning › Thử mức rẻ trước · rẻ nhất Feature extraction chỉ train head rẻ nhất Partial fine-tuning · mở thêm vài layer cuối · Mức fine-tuning › Mở dần khi chưa đạt · trung gian Partial fine-tuning mở thêm vài layer cuối trung gian Full fine-tuning · mọi layer có gradient · Mức fine-tuning › Mở dần khi chưa đạt · đắt nhất Full fine-tuning mọi layer có gradient đắt nhất Đạt yêu cầu · chốt best checkpoint · Mức fine-tuning › Chốt và đo lần cuối Đạt yêu cầu chốt best checkpoint Chạy test một lần · con số cuối cùng · Mức fine-tuning › Chốt và đo lần cuối · không tune nữa Chạy test một lần con số cuối cùng không tune nữa Overfitting · validation loss đi lên · Rủi ro khi mở quá tay › Mở dần khi chưa đạt Overfitting validation loss đi lên chưa đạt vẫn chưa đạt đạt mục tiêu đã chốt cấu hình freeze lại bớt layer dataset quá nhỏ Legend Agent logic Context / trace Cloud service External system

Vì sao tăng dần

  • • Mỗi mức mở thêm đều tốn memory và tăng nguy cơ overfit
  • • Mức rẻ nhất đã đủ tốt thì không có lý do đi tiếp
  • • Đi từ dưới lên cho biết mức nào thực sự tạo ra cải thiện

Khi nào full fine-tuning là đúng

  • • Task khác đáng kể so với dữ liệu pretraining
  • • Dataset đủ lớn để không overfit ngay
  • • Có đủ GPU memory và cần tối đa hoá chất lượng

Hai lối thoát khi mở quá tay

  • • Overfitting: freeze lại bớt layer, thêm weight decay, dừng sớm
  • • Hết VRAM: giảm micro batch rồi bù bằng gradient accumulation
  • • Mixed precision giảm activation memory mà không đổi kiến trúc