Luồng request
Đi thẳng từ trên xuống, mỗi lớp chỉ biết lớp kế tiếp.
Một cụm inference LLM tự vận hành trên node GPU của chính bạn: vLLM phục vụ model, LiteLLM làm gateway, Portainer CE làm control plane, Netdata làm lớp giám sát — gói gọn trong ba stack Docker.
Sáu lớp theo luồng request, cộng một lớp vận hành cắt ngang. Bấm vào sơ đồ để mở bản đầy đủ.
Đi thẳng từ trên xuống, mỗi lớp chỉ biết lớp kế tiếp.
Chạy vuông góc với luồng request, từ cột phải cắt vào lớp serving.
Ranh giới rõ cho phép thay từng phần mà không đụng phần còn lại.
Sơ đồ vẽ bằng core shape của draw.io nên mở được ở mọi máy, không cần bật thêm shape library. File nguồn .drawio nằm trong diagrams/.
Chín thành phần, mỗi cái giải đúng một việc. Bấm thẻ để mở tài liệu chính thức.
vLLM expose metrics định dạng Prometheus tại /metrics; collector go.d/prometheus của Netdata đọc thẳng, không cần dựng thêm Prometheus.
Những chỗ tốn thời gian nhất khi dựng thật — ghi lại để bạn không phải trả giá lần nữa.
Đủ mười gạch đầu dòng này thì bạn đang vận hành một hệ thống, chứ không phải trông một con server.
Đủ nghiêm túc cho một đến vài node GPU. Vượt ngưỡng đó thì các giả định bắt đầu gãy.
Toàn bộ case study nằm trong một repo phẳng: hướng dẫn triển khai, sơ đồ nguồn draw.io, và trang landing này.