$ ls ./blog/series

Chuỗi bài viết đọc theo thứ tự

Mỗi chuỗi là một chủ đề được kể từ đầu đến cuối. Trang này ghi nhớ phần bạn đã đọc, để lần sau quay lại là đi tiếp được ngay.

./series/cach-hoat-dong-cua-llm/đang viết

Cách hoạt động của LLM

Chuỗi bài đi từ kiến trúc Transformer đến các lớp hệ thống dựng bên trên nó. Mỗi phần đứng riêng được, nhưng đọc tuần tự thì thấy rõ vì sao từng khái niệm lại xuất hiện đúng ở chỗ đó.

bắt đầu từ phần 1 ->
tiến độ của bạn
0/ 4 phần đã đăng
total4 phần · ~153 phút
nextphần 1 — Transformer từ A đến Z: Hiểu nền tảng của LLM
  1. phần 12026-09-0245 phút
    Transformer từ A đến Z: Hiểu nền tảng của LLM

    Một mental model có hệ thống về Transformer: từ token và chi phí token tiếng Việt, qua Attention, residual, FFN và RoPE, tới ba họ kiến trúc, MoE và toàn bộ đường đi của inference.

  2. phần 22026-09-0534 phút
    Sử dụng Transformers: từ pipeline() đến triển khai LLM tối ưu

    pipeline() chỉ là một lớp abstraction mỏng. Bài này mở nó ra: tokenizer, model head, logits, padding và attention mask, rồi đi tiếp đến device, dtype, KV cache, continuous batching, quantization và cách chọn giữa TGI, vLLM và llama.cpp.

  3. phần 32026-09-0536 phút
    Fine-tuning một pretrained model: từ dữ liệu thô đến training loop

    Hai bài đầu nói về một model đã biết sẵn. Bài này nói về cách thay đổi những gì nó biết: split và rò rỉ dữ liệu, padding và chi phí thật của một tensor, cross-entropy, backpropagation, AdamW, learning-rate schedule, và cách đọc learning curve để phân biệt overfitting với underfitting.

  4. phần 42026-09-0538 phút
    Tokenization trong LLM: từ văn bản con người đọc được đến những con số model xử lý được

    Ba bài trước đều bắt đầu từ chỗ văn bản đã thành số. Bài này quay lại bước đó: normalization, pre-tokenization, subword segmentation, vocabulary và special token - lớp giao diện rời rạc quyết định context window, chi phí, và cả việc một ngôn ngữ có bị đánh thuế token hay không.