Hook
Tháng 6/2025, một bài phỏng vấn của nhà sáng lập Moonshine (Moon's Dark Side) – công ty AI đứng sau chatbot Kimi – bất ngờ gây sốt trong giới công nghệ. Ông so sánh quản lý con người với huấn luyện mô hình ngôn ngữ: “Sử dụng Reinforcement Learning (RL) làm chủ đạo, Supervised Fine-Tuning (SFT) chỉ là phụ trợ.”
Tôi lập tức nhận ra: phát biểu này không chỉ dành cho ngành AI. Nó là một tín hiệu vĩ mô – một lời cảnh báo cho toàn bộ hệ sinh thái blockchain, nơi mà các DAO, giao thức DeFi và thậm chí cả cơ chế đồng thuận đang vật lộn với chính xác cùng một vấn đề: thiết kế hệ thống phần thưởng và kiểm soát hành vi.
Context
Hãy nhìn lại bản đồ thanh khoản toàn cầu. Sau chu kỳ tăng trưởng 2023-2024, dòng vốn đang co lại. Lãi suất thực vẫn ở mức cao, stablecoin bị siết chặt bởi quy định, và các giao thức Lending/Staking đối mặt với cuộc khủng hoảng về “incentive alignment” – sự liên kết động cơ giữa nhà phát triển, nhà đầu tư và người dùng.
Trong bối cảnh đó, một tuyên bố đến từ lĩnh vực AI – vốn được coi là “công nghệ nền tảng” của thập kỷ – lại mang sức nặng đặc biệt. Nó đặt ra câu hỏi: Nếu ngay cả một startup AI hàng đầu cũng chọn RL (tự do khám phá) thay vì SFT (chỉ thị cứng nhắc), thì các giao thức blockchain có nên tiếp tục áp đặt các quy tắc cố định như hợp đồng thông minh bất biến, hay chuyển sang mô hình linh hoạt hơn?
Tôi, với tư cách là một nhà nghiên cứu CBDC tại Dubai và từng phân tích sâu các chu kỳ thanh khoản của crypto (từ ICO 2017, DeFi Summer 2020, NFT Boom 2021, đến sự sụp đổ Terra 2022), thấy rõ sự tương đồng. Cả AI và blockchain đều đang đối mặt với cùng một bài toán: Thiết kế phần thưởng.
Core Insight
Phần 1: RL vs SFT – Bản chất kỹ thuật và sự áp dụng vào quản trị phi tập trung
Trong huấn luyện AI, Supervised Fine-Tuning (SFT) là quá trình dùng dữ liệu gắn nhãn để “dạy” mô hình câu trả lời chính xác. Nó giống như một CEO ra lệnh trực tiếp: “Hãy làm A, không được làm B.” Reinforcement Learning (RL) thì khác: mô hình tự tương tác với môi trường, nhận phần thưởng (reward) khi đạt mục tiêu, và tự khám phá cách tối ưu.
Áp vào blockchain, hãy nghĩ đến cơ chế đồng thuận Proof-of-Work (PoW). PoW thuần túy là RL: các thợ đào tự do chọn nonce, cạnh tranh, và được thưởng khi tìm được hash hợp lệ. Ngược lại, Proof-of-Stake (PoS) hiện đại với slashing conditions và các validator bị phạt nếu vi phạm quy tắc – đó là SFT: bạn phải tuân thủ một bộ quy tắc cứng, nếu không sẽ mất tiền.
Nhưng điều thú vị là hầu hết các giao thức DeFi hiện nay đều áp dụng mô hình lai: các smart contract cung cấp khuôn khổ SFT (ví dụ: quy tắc thanh lý trên Aave), nhưng người dùng lại có tự do RL trong việc chọn chiến lược yield farming. Vấn đề nằm ở chỗ: khung SFT thường không được thiết kế dựa trên dữ liệu thị trường thực, mà dựa trên các giả định phi thực tế của đội ngũ phát triển.
Tôi nhớ năm 2020, khi phân tích Compound Farm với 50 ETH, tôi đã xây dựng mô hình thanh khoản động và nhận ra: lãi suất 200% APY từ yield farming không phải là tín hiệu của thị trường, mà là kết quả của các tham số SFT tùy tiện. Khi tôi tranh luận trên diễn đàn rằng đây là bong bóng, tôi bị phản đối dữ dội. Ba tháng sau, sự sụp đổ của YAM và SushiSwap chứng minh tôi đúng.
Phần 2: Tại sao “RL-first” lại nguy hiểm cho DAO?
Nhà sáng lập Moonshine nói đúng: nếu chỉ dùng RL, nhân viên sẽ “gaming the system” – tìm cách hack phần thưởng. Tương tự, trong DAO, nếu chỉ dùng cơ chế bỏ phiếu tự do (RL) mà không có các ràng buộc văn hóa (constitutional AI), các cuộc tấn công quản trị (governance attack) sẽ xảy ra thường xuyên hơn. Thực tế, năm 2022, tôi đã chứng kiến cảnh cộng đồng Terra bỏ phiếu nâng cấp thuật toán neo (một dạng RL) mà không có lớp bảo vệ SFT nào – và kết quả là sự sụp đổ hoàn toàn.

Nhưng quan trọng hơn: “RL-first” trong quản trị phi tập trung là một ảo tưởng. Bởi vì trong AI, phần thưởng được định nghĩa rõ ràng bởi nhà phát triển. Trong blockchain, “phần thưởng” là giá token – vốn chịu ảnh hưởng của hàng nghìn yếu tố bên ngoài. Bạn không thể thiết kế một reward function cho các validator nếu giá token phụ thuộc vào quyết định của Fed. Đó là lý do tại sao mô hình “lãi suất thả nổi” của Aave và Compound luôn lệch lạc so với cung-cầu thực tế.
Phần 3: Khi nào SFT là không thể thiếu?
Trong quản lý nhân sự, SFT là cần thiết cho các quy tắc an toàn (safety alignment). Trong blockchain, nó tương đương với các smart contract chống re-entrancy, các cơ chế khóa tạm thời (time-lock), và các quy tắc tuân thủ pháp lý. Không có SFT, mọi RL đều dẫn đến hỗn loạn. Nhưng vấn đề là: các blockchain hiện tại quá cứng nhắc – họ áp đặt SFT cho mọi thứ, kể cả những lĩnh vực đáng lẽ nên để RL tự do.
Hãy nhìn vào Bitcoin ETF spot. Sau khi được phê duyệt, Bitcoin trở thành con rối của Phố Wall – một dạng SFT hoàn hảo, nơi các quỹ đầu tư “chỉ thị” cho dòng vốn. Tầm nhìn “peer-to-peer electronic cash” của Satoshi đã chết, thay vào đó là một tài sản macro bị điều khiển bởi lãi suất và thanh khoản. Nếu Bitcoin là một mô hình RL – nơi các nút tự do xác thực và khai thác – thì ETF là một lớp SFT bóp nghẹt tính phi tập trung.
Contrarian Angle
Ngược lại với quan điểm số đông, tôi cho rằng: “RL-first” sẽ không bao giờ hoạt động trong quản trị phi tập trung quy mô lớn. Ngay cả trong AI, RL chỉ thành công khi có một reward function ổn định và một môi trường mô phỏng. Trong thế giới thực của blockchain, môi trường luôn thay đổi, reward function bị thao túng, và không có một “huấn luyện viên” trung tâm để điều chỉnh.
Các nhà đầu tư thường lạc quan về các DAO “tự trị” – họ nghĩ mô hình này giống như một agent RL khám phá thị trường. Nhưng thực tế: hầu hết các DAO thành công đều có một đội ngũ core developers (SFT layer) kiểm soát chặt chẽ. Uniswap có team Uniswap Labs; MakerDAO có đội ngũ phát triển cốt lõi. Decentralization chỉ là một lớp mỏng trên bề mặt.
Câu chuyện của tôi với Telegram ICO năm 2017 là một minh chứng. Khi đó, Telegram huy động 1,7 tỷ USD với lời hứa về một blockchain TON hoàn toàn phi tập trung (RL). Tôi dùng mô hình kỹ thuật tài chính phân tích tokenomics và phát hiện: nguồn cung GRAM không tương thích với thanh khoản thực tế. Dự án quá lạc quan. Kết quả? Telegram bị SEC kiện và phải đóng cửa dự án. Họ đã thất bại vì không có một lớp SFT (quy tắc pháp lý và compliance) vững chắc ngay từ đầu.
Takeaway
Vậy, bài học cho chúng ta là gì? Trong chu kỳ thị trường giảm hiện tại, khi dòng vốn khô cạn và các giao thức đang chảy máu LP, đã đến lúc ngừng mơ về “RL utopia” và quay lại với những nguyên tắc cơ bản: SFT (quy tắc, compliance, kiểm toán) là nền tảng cho sự sống còn, trong khi RL (đổi mới, thử nghiệm) là gia vị.
Tôi đã nhìn thấy điều này trong nghiên cứu CBDC tại Dubai: các ngân hàng trung ương không bao giờ giao toàn bộ quyền kiểm soát cho thị trường (RL). Họ duy trì một lớp SFT mạnh mẽ – và chỉ cho phép thử nghiệm trong sandbox. Đó cũng là cách mà các giao thức blockchain nên vận hành: hãy giữ các smart contract cốt lõi (SFT) thật vững, và chỉ để RL hoạt động ở lớp ứng dụng ngoại vi.
Nếu không, chúng ta sẽ lặp lại sai lầm của Terra, của ICO 2017, và của vô số dự án đã chết vì tin tưởng rằng “tự do là trên hết”. Nhưng như nhà sáng lập Moonshine đã thừa nhận: hoàn toàn RL sẽ dẫn đến hệ thống bị game. Câu hỏi còn lại là: Bạn có muốn bị game bởi chính những người tham gia của mình không?