$ whoami

Trương Đức Dũng - AI Engineer. Tôi đưa mô hình rời khỏi notebook và chạy thật trong production.

Tôi tập trung vào các hệ thống LLM có thể vận hành thật: RAG trên dữ liệu nội bộ, fine-tune mô hình tiếng Việt, hạ tầng suy luận và các lớp đánh giá chất lượng trước khi đưa vào sản phẩm. Tôi viết lại những gì học được ở mục blog bên dưới.

xem dự án ->đọc blog

$ ls ./work --selected

04
2026

Trợ lý tra cứu tài liệu nội bộ

Hỏi đáp trên 180.000 trang quy trình và hợp đồng của một ngân hàng, có trích dẫn nguồn và phân quyền theo phòng ban.

-> giảm 62% thời gian tra cứu thủ công
ragpgvectorvllmfastapi
2025

Pipeline fine-tune mô hình tiếng Việt

Quy trình khép kín từ thu thập, làm sạch, huấn luyện LoRA đến đánh giá tự động, chạy lại bằng một lệnh.

-> chu kỳ thử nghiệm: 9 ngày -> 14 giờ
loraraywandbairflow
2025

Chấm điểm rủi ro giao dịch thời gian thực

Mô hình gradient boosting phục vụ dưới 40ms p99, kèm giám sát trôi dữ liệu và rollback tự động.

-> 1,4 triệu lượt suy luận mỗi ngày
xgboostkafkatritongrafana
2024

eval-kit - thư viện đánh giá mã nguồn mở

Bộ công cụ nhỏ để viết test cho đầu ra LLM giống như viết unit test, dùng nội bộ trước khi mở mã.

-> 1.900 sao github, 40 người đóng góp
pythonosspytest

$ cat experience.log

2023 - nay
AI Engineer
Công ty sản phẩm fintech, Hà Nội

Dẫn dắt nhóm 4 người xây nền tảng LLM nội bộ và các ứng dụng chạy trên đó.

2021 - 2023
Machine Learning Engineer
Startup thương mại điện tử

Hệ thống gợi ý sản phẩm và dự báo tồn kho cho 2 triệu người dùng hoạt động hàng tháng.

2019 - 2021
Data Scientist
Công ty tư vấn dữ liệu

Mô hình dự báo nhu cầu và phân khúc khách hàng cho khách ngành bán lẻ, logistics.

$ cat stack.toml

[models]
pytorchtransformerslora/qlorarageval & benchmarkdistillation
[infra]
vllmtritonkubernetesrayairflowawsterraform
[languages]
pythongosqlduckdbpostgres/pgvectorweights & biases
./gen-ai/llm-fundamentals/cách hoạt động của llm3 bài
2026-09-05

Fine-tuning một pretrained model: từ dữ liệu thô đến training loop

Hai bài đầu nói về một model đã biết sẵn. Bài này nói về cách thay đổi những gì nó biết: split và rò rỉ dữ liệu, padding và chi phí thật của một tensor, cross-entropy, backpropagation, AdamW, learning-rate schedule, và cách đọc learning curve để phân biệt overfitting với underfitting.

#fine-tuning
36 phút
2026-09-05

Sử dụng Transformers: từ pipeline() đến triển khai LLM tối ưu

pipeline() chỉ là một lớp abstraction mỏng. Bài này mở nó ra: tokenizer, model head, logits, padding và attention mask, rồi đi tiếp đến device, dtype, KV cache, continuous batching, quantization và cách chọn giữa TGI, vLLM và llama.cpp.

#transformers
34 phút
2026-09-05

Tokenization trong LLM: từ văn bản con người đọc được đến những con số model xử lý được

Ba bài trước đều bắt đầu từ chỗ văn bản đã thành số. Bài này quay lại bước đó: normalization, pre-tokenization, subword segmentation, vocabulary và special token - lớp giao diện rời rạc quyết định context window, chi phí, và cả việc một ngôn ngữ có bị đánh thuế token hay không.

#tokenization
38 phút
./gen-ai/gen ai & ứng dụng1 bài
2026-08-20

RAG không cứu được dữ liệu bẩn

Ba tháng debug một hệ thống hỏi đáp nội bộ, và 80% công sức hoá ra nằm ở khâu chuẩn hoá tài liệu.

#rag
12 phút
~/contact.sh

Bạn có bài toán AI cần đưa vào vận hành?

Tôi nhận tư vấn kiến trúc, dựng prototype và đồng hành đến khi hệ thống chạy thật. Viết vài dòng về bối cảnh, tôi trả lời trong 48 giờ.

đặt lịch 20 phút
mail truongducdung.98@gmail.com
tz   GMT+7
rep  < 48h