Bản đồ triển khai: TGI, vLLM và llama.cpp

Bản đồ triển khai: TGI, vLLM và llama.cpp An architecture diagram generated by Archify. Application · chat / RAG / agent · Architecture component Application chat / RAG / agent OpenAI-compat API · /v1/chat · Architecture component · thay backend dễ OpenAI-compat API /v1/chat thay backend dễ TGI · HF serving stack · Production GPU serving · streaming + metrics TGI HF serving stack streaming + metrics vLLM · throughput cao · Production GPU serving · nhiều user vLLM throughput cao nhiều user llama.cpp · GGUF quantized · Local inference · CPU-first, offline llama.cpp GGUF quantized CPU-first, offline KV cache · PagedAttention · Production GPU serving · ít phân mảnh KV cache PagedAttention ít phân mảnh FlashAttention · kernel theo block · Production GPU serving · ít đọc ghi HBM FlashAttention kernel theo block ít đọc ghi HBM Datacenter GPU · A100 / H100 · Production GPU serving Datacenter GPU A100 / H100 Máy cá nhân · CPU + GPU rời · Local inference · offload layer Máy cá nhân CPU + GPU rời offload layer một chuẩn API HF-centric throughput offline batching kernel tối ưu chiếm VRAM ít đọc HBM Q4_K_M Production GPU serving Local inference Legend Frontend Backend Database Cloud External

Chọn runtime theo nhu cầu

  • • Nhiều user đồng thời, cần throughput: vLLM
  • • Serving trong hệ sinh thái Hugging Face: TGI
  • • Laptop, Mac, CPU server, model quantized: llama.cpp

Quantization đổi chất lượng lấy bộ nhớ

  • • Model 8B ở FP32 cần khoảng 32 GB chỉ riêng weights
  • • FP16 còn khoảng 16 GB, 4-bit còn khoảng 4 GB
  • • Bit thấp hơn không phải lúc nào cũng tốt hơn

Điều khiển generation

  • • Temperature nắn độ sắc của phân phối trước khi sample
  • • Top-k giữ k ứng viên, top-p giữ tập đạt ngưỡng xác suất
  • • Repetition, frequency, presence penalty chống lặp