
500.000 GPU chạy vLLM: Chiến thắng của hạ tầng mở hay chỉ là câu chuyện dòng tiền?
Crypto Briefing, một ấn phẩm blockchain, vừa đưa ra một tuyên bố khiến giới đầu tư AI lẫn tiền số chú ý: vLLM, framework suy luận mã nguồn mở, đang vận hành trên 500.000 GPU. Con số này nhanh chóng được chia sẻ như một bằng chứng rằng open model đã đánh bại các API đóng. Nhưng khi tôi mở bản phân tích gốc, tôi không tìm thấy bất kỳ số liệu kỹ thuật nào đi kèm: không throughput, không latency, không độ trễ, không cấu hình phần cứng. Chỉ có con số làm sáng bừng cả bài viết. Tôi đã làm phân tích dữ liệu suốt 15 năm, và một trong những bài học đầu tiên tôi học được trong đợt ICO năm 2017 là: con số càng tròn trịa, câu hỏi càng phải sắc bén. 500.000 GPU là số GPU đang bật, hay số GPU từng được cài đặt, hay số GPU mà đội ngũ marketing ước lượng? Mỗi định nghĩa dẫn đến một câu chuyện khác.
vLLM không phải là một mô hình ngôn ngữ. Đó là một cỗ máy phục vụ suy luận, được phát triển bởi UC Berkeley và Anyscale. Điểm nổi bật là PagedAttention, một kỹ thuật quản lý bộ nhớ đệm cho KV Cache trong quá trình sinh token. Thay vì lưu trữ liên tục và dễ vỡ, bộ nhớ được chia thành các trang nhỏ, giúp tăng số lượng yêu cầu xử lý đồng thời và tiết kiệm VRAM. Điều này giống như việc một ngân hàng chia nhỏ các khoản vay để quản lý rủi ro thanh khoản tốt hơn. Nhưng PagedAttention không thay đổi kiến trúc Transformer, không thay đổi trọng số mô hình, và không tự nó sinh ra tri thức. Nó chỉ làm cho việc chạy mô hình rẻ hơn, nhanh hơn. Khi Crypto Briefing dùng con số GPU để nói về sự trỗi dậy của "open model", họ đã gộp hai tầng khác nhau: tầng công cụ và tầng mô hình. Trong tài chính, chúng tôi gọi đó là nhầm lẫn giữa công ty môi giới với tài sản cơ sở. Trong blockchain, nó giống như việc ai đó khoe khoang số lượng node trên mạng lưới để chứng minh token đó có giá trị — trong khi node chỉ là hạ tầng, còn giá trị nằm ở ứng dụng và dòng tiền.
Hãy thử làm một phép toán thô. Nếu 500.000 GPU là NVIDIA H100, với giá khoảng 25.000 đến 30.000 USD mỗi chiếc, tổng giá trị phần cứng tương đương 12,5 đến 15 tỷ USD. Đây là một con số khổng lồ, nhưng nó không thuộc về vLLM. vLLM chỉ là phần mềm chạy trên đó. Giống như Solana có thể chạy trên hàng nghìn validator, nhưng Solana không sở hữu những validator đó. Sự nhầm lẫn này tạo ra một dạng "TVL của GPU". Trong thời kỳ DeFi Summer 2020, tôi từng tính toán lợi suất thực tế của các pool thanh khoản và nhận ra rằng lợi suất quảng cáo 20% chỉ còn 3% sau khi trừ trượt giá và rủi ro tạm thời mất vốn. Những con số công bố thường rất đẹp, nhưng điều kiện để đạt được con số đó lại không bao giờ được nói rõ. Tương tự, nếu 500.000 GPU bao gồm cả môi trường phát triển, thử nghiệm, CI/CD và các tác vụ nhỏ lẻ, thì con số "production adoption" sẽ nhỏ hơn nhiều. Một đồng nghiệp từng nói với tôi rằng mọi framework đều có thể đạt 500.000 GPU nếu bạn cho phép đếm cả các lần cài đặt thử nghiệm. Dòng tiền đi trước, câu chuyện đi sau: các nhà đầu tư không nhìn vào benchmark, họ nhìn vào câu chuyện tăng trưởng để quyết định xuống tiền.
Nhưng không thể phủ nhận vLLM đang chiếm một vị trí đặc biệt. Khả năng tương thích với API OpenAI, hỗ trợ nhiều kiến trúc mô hình, tích hợp sâu với LangChain, LlamaIndex và Ray đã biến nó thành lựa chọn mặc định cho các đội ngũ muốn tự triển khai suy luận. Các nhà cung cấp đám mây như AWS, Azure, Google Cloud đều có hướng dẫn chạy vLLM. Điều này xuất phát từ lợi ích chiến lược: họ muốn tạo ra một tầng trung gian độc lập với NVIDIA. Nếu vLLM trở thành tiêu chuẩn thực tế, sức mạnh thương lượng của các công ty đám mây đối với nhà sản xuất chip sẽ tăng lên. Trong giới crypto, chiến lược này giống như việc các sàn DEX orderbook cố gắng giành thanh khoản từ các sàn tập trung. Tôi đã nhiều lần phân tích cơ chế hoạt động của chúng và nhận ra một nghịch lý: market maker không bao giờ để lộ lệnh on-chain, vì độ trễ và tính minh bạch sẽ khiến họ bị front-run. Vì vậy, dù DEX có ưu việt về mặt phi tập trung, thanh khoản vẫn nằm ở CEX. vLLM cũng có thể rơi vào tình trạng tương tự: được ca ngợi về tính mở, nhưng các ứng dụng thương mại quan trọng nhất có thể vẫn chạy trên các giải pháp đóng được tối ưu riêng. NVIDIA TensorRT-LLM là một đối thủ mạnh, và SGLang cũng đang lớn lên từng ngày. Cuộc chơi chưa kết thúc.
Điểm phản trực giác là ở chỗ: sự thành công của vLLM gần như không chứng minh được open model giỏi hơn closed model. Nó chỉ chứng minh rằng tầng triển khai đang mở ra. Một mô hình đóng kém chất lượng cũng có thể được phục vụ bởi một framework mã nguồn mở; một mô hình mở xuất sắc cũng có thể bị bóp nghẹt bởi một lớp suy luận kém. Tuyên bố "open model thắng thế" là sự trượt nghĩa. Trong giới blockchain, chúng ta thấy điều này ở những Layer 2 từng công bố TVL khổng lồ nhờ chương trình khuyến khích, nhưng khi ngừng phát thưởng, TVL bốc hơi. Tôi gọi đó là hiệu ứng "phí rẻ là tiến bộ": khi chi phí vận hành giảm, người ta dễ nhầm lẫn giữa sự rẻ đi và sự tốt hơn. vLLM giúp giảm chi phí suy luận, tạo điều kiện cho các ứng dụng AI xuất hiện nhiều hơn, nhưng không tự động cải thiện chất lượng mô hình. Một mô hình kém được phục vụ bởi vLLM vẫn là mô hình kém; nó chỉ kém với chi phí thấp hơn. Khi on-chain im lặng, sự thật bắt đầu hiện hình. Khi một bài viết chỉ đưa ra một con số duy nhất và không có số liệu kiểm chứng, tôi bắt đầu tìm hiểu xem ai hưởng lợi từ câu chuyện đó. Ấn phẩm Crypto Briefing viết cho đối tượng nhà đầu tư tiền số, không phải kỹ sư hệ thống. Việc họ nhấn mạnh 500.000 GPU có thể là tín hiệu cho thấy vốn đang dịch chuyển vào câu chuyện GPU DePIN.
Chu kỳ không chết, chỉ thay đổi hình hài. Năm 2021, chúng ta mua NFT vì sợ bỏ lỡ văn hóa và sự giàu có; năm 2025, chúng ta mua những câu chuyện về GPU và hạ tầng AI để không bị bỏ lại phía sau. vLLM có thể là một trong những nền móng quan trọng của kỷ nguyên tính toán mở, nhưng một nền móng thì không thể thay thế cho toàn bộ tòa nhà. Trước khi tin vào con số 500.000 GPU, hãy tìm hiểu định nghĩa của nó, nguồn dữ liệu của nó, lợi ích của người công bố. Nếu bạn không trả lời được ba câu hỏi đó, bạn không đầu tư, bạn đang nghe một câu chuyện hay. Giống như tôi đã nói trong các báo cáo nội bộ: hãy để dữ liệu dẫn đường, không phải những con số biết nhảy múa.