Token tax: cùng một nội dung, hai hoá đơn khác nhau

Token tax: cùng một nội dung, hai hoá đơn khác nhau A data-flow diagram generated by Archify. 01 / Cùng một nội dung 02 / Tokenizer đã thấy gì 03 / Số token thật ra 04 / Hệ quả phải trả Cùng một đoạn văn · khoảng 1.000 từ thông tin · 01 / Cùng một nội dung · chưa tokenize Cùng một đoạn văn khoảng 1.000 từ thông tin chưa tokenize High-resource · xuất hiện dày trong corpus · 02 / Tokenizer đã thấy gì High-resource xuất hiện dày trong corpus Low-resource · xuất hiện thưa trong corpus · 02 / Tokenizer đã thấy gì Low-resource xuất hiện thưa trong corpus Ít token · fertility thấp · 03 / Số token thật ra Ít token fertility thấp Nhiều token · fertility cao · 03 / Số token thật ra Nhiều token fertility cao Còn nhiều context · ít bước decode, rẻ hơn · 04 / Hệ quả phải trả Còn nhiều context ít bước decode, rẻ hơn Hết context sớm · nhiều bước decode, đắt hơn · 04 / Hệ quả phải trả Hết context sớm nhiều bước decode, đắt hơn cùng chữ cùng chữ nén tốt cắt vụn n nhỏ n lớn Legend primary data policy / PII data store data flow

Context window đo bằng token, không phải bằng từ

  • • Một đoạn 1.000 từ có thể thành 1.200 hoặc 2.500 token
  • • Tỉ lệ đó phụ thuộc tokenizer, ngôn ngữ, domain và loại văn bản
  • • "128k token" không có nghĩa là khoảng 128k từ

Sequence dài kéo theo ba thứ cùng lúc

  • • Attention pairwise chuẩn có độ phức tạp bậc hai theo n
  • • Mỗi token sinh ra là một bước decode, nên latency tăng theo
  • • Dịch vụ tính tiền theo token thì chi phí tăng trực tiếp

Đây không phải thiên vị có chủ đích

  • • Vocabulary học theo tần suất nên phản ánh phân phối corpus
  • • Ngôn ngữ ít xuất hiện nhận được ít token dài hữu ích hơn
  • • Encode được mọi ngôn ngữ không đồng nghĩa công bằng với mọi ngôn ngữ