
Infinity: 1500 triệu USD cho giấc mơ 'giết' CUDA, nhưng con số biết nói
Hoàng Thế
Một con số thật còn hơn cả ngàn tin đồn. Infinity vừa gọi vốn 15 triệu USD, định giá 100 triệu, với tuyên bố sẽ thay thế CUDA bằng AI tự động viết kernel. Ấn tượng? Hãy nhìn vào sự thật: team 26 người, một khách hàng duy nhất (D-Matrix), và zero benchmark công khai. Đây không phải bài PR, tôi sẽ mổ xẻ dữ liệu để xem liệu 'AI compiler' này có thực sự đáng giá hay chỉ là một con chip giấy khác.
Context: Infinity xây dựng một AI agent có tên Ignition, tự động viết code kernel cho GPU, SRAM, mobile chip, thậm chí systolic array. Họ không bán license, mà lấy phí dựa trên hiệu suất tăng thêm. Founder Jeremy Nixon từ Google Brain, team có background AutoML. Nghe có vẻ hợp lý, nhưng 26 người so với đội CUDA của NVIDIA (vài nghìn engineer) là một cuộc chiến không tưởng. 15 triệu USD đủ nuôi team 18-24 tháng, nhưng để xây dựng hệ sinh thái cạnh tranh với cuDNN, TensorRT, Triton? Cần thêm 10x số tiền đó.
Core: Phân tích kỹ thuật. Ignition dùng reinforcement learning hoặc evolutionary search để sinh ra kernel tối ưu cho từng hardware. Giống AutoTVM, nhưng generalize hơn. Vấn đề: AI compiler đã tồn tại hàng thập kỷ (MLIR, LLVM, XLA), chưa cái nào thay thế được CUDA. Lý do? CUDA không chỉ là compiler, mà là ecosystem: hàng ngàn thư viện tối ưu từng operator, hàng triệu developer quen thuộc, và 20 năm tuning. Một kernel do AI sinh ra có thể nhanh hơn CUDA trong 1-2 trường hợp, nhưng không thể cover được toàn bộ model từ Transformer đến Mamba. Thử nghiệm thực tế? Không có. Dữ liệu on-chain? Không. Chỉ có lời hứa.
Contrarian: Đừng nhầm lẫn tương quan với nhân quả. Infinity có vốn từ cựu nhân viên OpenAI/Anthropic – đó là tín hiệu mạng lưới, không phải tín hiệu kỹ thuật. Tôi từng thấy hàng chục startup 'CUDA killer' thất bại vì thiếu adoption. 80% ICO năm 2017 cũng có đội ngũ 'danh giá' nhưng không có sản phẩm thực. Infinity hôm nay giống họ: PR đẹp, data rỗng. Điểm mù lớn nhất: họ bỏ qua chi phí train Ignition agent. Mỗi lần sinh kernel mới, cần chạy hàng trăm GPU giờ. Nếu khách hàng đông, chi phí này sẽ ăn vào margin của họ. Mô hình 'pay-per-performance' nghe hay, nhưng khó đo lường công bằng – ai định nghĩa 'hiệu suất tăng'? Cùng một kernel, chạy trên GPU A vs GPU B cho kết quả khác nhau. Ai kiểm toán?
Takeaway: Tuần tới, hãy watchlist MLPerf Inference v4.0. Nếu Infinity không submit kết quả hoặc chỉ đạt top 10, đó là tín hiệu cảnh báo. Nếu họ công bố hợp tác với AMD, Intel hay AWS? Lúc đó mới đáng xem. Còn bây giờ, 100 triệu USD valuation là một canh bạc dựa trên niềm tin, không phải dữ liệu. Một con số thật còn hơn cả ngàn tin đồn – và con số duy nhất tôi thấy là 26 người chống lại 30.000 engineer của NVIDIA. Bạn có đặt cược không? Tôi không.