Đánh giá tokenizer: một con số không đủ để kết luận

Đánh giá tokenizer: một con số không đủ để kết luận A data-flow diagram generated by Archify. 01 / Workload đại diện 02 / Đo cái gì 03 / Đọc ra quyết định Văn bản thật của bạn · news · chat · code · URL · 01 / Workload đại diện · không chỉ vài câu mẫu Văn bản thật của bạn news · chat · code · URL không chỉ vài câu mẫu Cặp song ngữ · cùng nội dung, hai ngôn ngữ · 01 / Workload đại diện Cặp song ngữ cùng nội dung, hai ngôn ngữ Bytes / token · đo mức nén · 02 / Đo cái gì Bytes / token đo mức nén Fertility · tokens / word · 02 / Đo cái gì Fertility tokens / word Cross-lingual parity · tỉ lệ token giữa hai bên · 02 / Đo cái gì Cross-lingual parity tỉ lệ token giữa hai bên Context và chi phí · token nhiều thì đắt · 03 / Đọc ra quyết định Context và chi phí token nhiều thì đắt Điểm downstream · chỉ đo được cùng model · 03 / Đọc ra quyết định · trọng tài cuối cùng Điểm downstream chỉ đo được cùng model trọng tài cuối cùng Công bằng ngôn ngữ · ai đang bị thu thuế token · 03 / Đọc ra quyết định Công bằng ngôn ngữ ai đang bị thu thuế token văn bản có tách từ song ngữ nén cao vụn nhiều chênh lệch Legend primary data data store data flow

Không metric nào một mình mô tả được chất lượng

  • • Nén tốt nhất không tự động là tokenizer tốt nhất
  • • Fertility cần một word segmentation tham chiếu đáng tin
  • • Token trông đẹp về ngôn ngữ học cũng không phải mục tiêu duy nhất

Đo trên đúng loại văn bản mình sẽ chạy

  • • Tokenizer tốt trên news có thể vỡ vụn trên log và tên sản phẩm
  • • Code, số, URL và định danh có pattern rất khác văn xuôi
  • • Văn bản mạng xã hội có typo và teencode là một workload riêng

Bộ tối thiểu nên chạy trước khi chốt

  • • Tokens mỗi câu, bytes mỗi token, tỉ lệ từ phổ biến bị cắt nhỏ
  • • Tên riêng, từ ghép, viết tắt, văn bản có dấu và không dấu
  • • Cả hai dạng Unicode, và các đoạn code-switch Việt ↔ Anh