Ba lớp để debug một hệ thống LLM

Ba lớp để debug một hệ thống LLM A workflow diagram generated by Archify. 01 / Lớp 1 · Representation 02 / Lớp 2 · Neural computation 03 / Lớp 3 · Inference system Phân loại Kiểm tra trong lớp Sửa và đo lại Tokenizer · decode lại input_ids · Lớp 1 · Representation › Kiểm tra trong lớp Tokenizer decode lại input_ids Padding + mask · 1 thật / 0 pad · Lớp 1 · Representation › Kiểm tra trong lớp Padding + mask 1 thật / 0 pad Triệu chứng · sai / chậm / OOM · Lớp 2 · Neural computation › Phân loại Triệu chứng sai / chậm / OOM Thuộc lớp nào? · hỏi trước khi sửa · Lớp 2 · Neural computation › Phân loại · đừng đổi model vội Thuộc lớp nào? hỏi trước khi sửa đừng đổi model vội Task head · đúng AutoModelFor? · Lớp 2 · Neural computation › Kiểm tra trong lớp Task head đúng AutoModelFor? Logits + nhãn · shape và id2label · Lớp 2 · Neural computation › Kiểm tra trong lớp Logits + nhãn shape và id2label Sửa đúng tầng · một thay đổi mỗi lần · Lớp 2 · Neural computation › Sửa và đo lại Sửa đúng tầng một thay đổi mỗi lần Đo lại · cùng input và batch · Lớp 2 · Neural computation › Sửa và đo lại Đo lại cùng input và batch Bộ nhớ · dtype, KV cache · Lớp 3 · Inference system › Kiểm tra trong lớp Bộ nhớ dtype, KV cache Batching + kernel · TTFT, tokens/s · Lớp 3 · Inference system › Kiểm tra trong lớp Batching + kernel TTFT, tokens/s output vô nghĩa chậm hoặc hết VRAM đổi batch, đổi kết quả đo hai pha riêng sửa tiền xử lý sửa cấu hình serving nhãn hoặc shape sai đọc đúng output sửa head Legend User UI Agent logic Policy Tool action Context / trace Cloud service External system

Lớp 1 — Representation

  • • Human text → Tokenizer → Token IDs
  • • Special token, padding, attention mask
  • • Kết thúc ở tensor mà model nhận được

Lớp 2 — Neural computation

  • • Embedding → Transformer layers
  • • Contextual hidden states → task head hoặc LM head
  • • Kết thúc ở logits, chưa phải xác suất

Lớp 3 — Inference system

  • • Batching, scheduling, quản lý KV cache
  • • Sampling, streaming, tối ưu bộ nhớ
  • • Kết thúc ở phần cứng CPU / GPU