Chia dữ liệu và những đường rò rỉ

Chia dữ liệu và những đường rò rỉ A workflow diagram generated by Archify. 01 / Chuẩn bị dữ liệu 02 / Vai trò từng split EX / Rò rỉ dữ liệu Trước khi chia Chia Sau khi chia Dataset thô · văn bản + nhãn · Chuẩn bị dữ liệu › Trước khi chia Dataset thô văn bản + nhãn Khử trùng lặp · theo nội dung và theo nhóm · Chuẩn bị dữ liệu › Trước khi chia · làm trước khi chia Khử trùng lặp theo nội dung và theo nhóm làm trước khi chia Chia split · train / validation / test · Chuẩn bị dữ liệu › Chia Chia split train / validation / test Train · forward → backward → update · Vai trò từng split › Chia · được học Train forward → backward → update được học Validation · chọn checkpoint và LR · Vai trò từng split › Sau khi chia · chỉ đo, không học Validation chọn checkpoint và LR chỉ đo, không học Test · chạy một lần cuối cùng · Vai trò từng split › Sau khi chia · giữ tính khách quan Test chạy một lần cuối cùng giữ tính khách quan Fit trên toàn bộ · scaler, vocab, thống kê · Rò rỉ dữ liệu › Trước khi chia Fit trên toàn bộ scaler, vocab, thống kê Sample trùng · cùng câu ở hai split · Rò rỉ dữ liệu › Chia Sample trùng cùng câu ở hai split Nhìn test khi tuning · test thành validation thứ hai · Rò rỉ dữ liệu › Sau khi chia Nhìn test khi tuning test thành validation thứ hai phần model được học đánh giá sau mỗi epoch sau khi chốt hyperparameter preprocessing fit trước khi chia bỏ qua bước khử trùng lặp tune theo test score Legend Agent logic Policy Tool action Context / trace Cloud service External system

Ba vai trò không thay thế nhau

  • • Train là dữ liệu duy nhất được phép cập nhật weights
  • • Validation trả lời model có generalize không
  • • Test chỉ có giá trị khi chưa từng ảnh hưởng tới quyết định nào

Năm dạng rò rỉ hay gặp

  • • Sample trùng nhau giữa các split
  • • Cùng một user hoặc tài liệu nằm ở cả train và test
  • • Preprocessing fit bằng toàn bộ dataset rồi mới chia
  • • Feature tạo từ thống kê của target
  • • Augmentation sinh biến thể gần giống rồi chia sang split khác

Vì sao đây là vấn đề của model

  • • Rò rỉ làm validation score cao giả tạo
  • • Mọi quyết định hyperparameter sau đó đều dựa trên số sai
  • • Chất lượng split là một phần của chất lượng model