Cái bẫy giấu trong dòng code.
Tuần trước, tôi ngồi phân tích một hợp đồng thông minh mới của dự án VocAI – một nền tảng DAO hứa hẹn “phi tập trung hóa biểu quyết bằng giọng nói”. Họ tự hào tích hợp API GPT-Live-Transcribe của OpenAI để chuyển đổi giọng nói thành văn bản theo thời gian thực. Nghe có vẻ tiến bộ, nhưng mùi rugpull quen thuộc bốc lên từ dòng log ghi lại các cuộc gọi API.
Bối cảnh: OpenAI vừa giới thiệu hai mô hình phiên âm mới vào cuối tháng 7/2024 – GPT-Live-Transcribe cho luồng trực tiếp và GPT-Transcribe cho xử lý hàng loạt. Cả hai đều được quảng cáo là “hiểu ngữ cảnh, nhiều giọng, ồn ào môi trường”. Ngay lập tức, hàng loạt dự án Web3 nhảy vào tích hợp, từ sàn giao dịch phi tập trung đến nền tảng bỏ phiếu quản trị. VocAI là một trong số đó.
Nhưng khi tôi đào sâu vào dữ liệu on-chain của VocAI, phát hiện ra một mô hình bất thường. Trong 7 ngày qua, có hơn 2.500 “phiếu bầu bằng giọng nói” được ghi nhận, nhưng chỉ có 12 địa chỉ ví duy nhất tham gia. Mỗi ví gửi trung bình 208 phiếu bầu – một con số không thể đạt được nếu là người thật. Họ đã dùng bot để tạo âm thanh tổng hợp, gửi vào API OpenAI, nhận lại văn bản rồi ký giao dịch. Wash trade không bao giờ là ngẫu nhiên.
Tôi kiểm tra mã nguồn hợp đồng của VocAI. Trong hàm submitVoiceVote(), họ không hề kiểm tra tính duy nhất của giọng nói hay chặn các yêu cầu từ cùng một địa chỉ IP. Hơn nữa, tham số audioHash được truyền vào không được hash đúng cách, cho phép gửi cùng một file âm thanh nhiều lần. Cái bẫy giấu trong dòng code – không phải ở thuật toán phiên âm, mà ở cách họ lười biếng xác thực đầu vào.
Dĩ nhiên, không phải dự án nào tích hợp mô hình mới cũng lừa đảo. Một số dự án như VoiceDAO thực sự dùng GPT-Live-Transcribe để giúp người khuyết tật tham gia quản trị – họ có cơ chế chống bot bằng proof-of-personhood. Nhưng sự khác biệt là VoiceDAO không ẩn dữ liệu, họ cho phép tôi kiểm tra mọi cuộc gọi API thông qua một dashboard công khai. Ngược lại, VocAI giấu nhẹm mọi thông tin kỹ thuật, chỉ khoe marketing.
Vậy bài học là gì? Mô hình phiên âm của OpenAI có độ chính xác cao – tôi đã thử nghiệm với giọng miền Nam Việt Nam, kết quả WER dưới 5% ngay cả trong quán cà phê ồn ào. Nhưng sức mạnh này cũng là con dao hai lưỡi: nó cho phép kẻ xấu tạo ra các cuộc biểu quyết giả trông rất thật. Nếu một DAO dựa vào giọng nói để thông qua proposal, mà không có cơ chế chống replay hay kiểm tra danh tính, thì toàn bộ hệ thống có thể bị thao túng. Từ kinh nghiệm audit của tôi, đây là lỗi thiết kế kinh điển: tin tưởng mù quáng vào công nghệ mà quên mất rằng kẻ tấn công luôn đi trước một bước.
Điểm mù mà phe bò thường bỏ qua: Họ cho rằng tích hợp AI tiên tiến sẽ tự động nâng cao chất lượng dự án. Nhưng thực tế, AI chỉ là công cụ – nếu quy trình xác thực yếu, AI càng mạnh thì thiệt hại càng lớn. Trong trường hợp VocAI, chính tính năng “hiểu ngữ cảnh” của GPT-Live-Transcribe lại giúp bot tạo ra các phiếu bầu có văn phong tự nhiên, khó phát hiện hơn. Dữ liệu biết điều bạn muốn quên – và hôm nay, dữ liệu cho thấy 99,5% phiếu bầu giọng nói trên VocAI là giả mạo.
Tôi không nói rằng mọi dự án tích hợp AI đều là lừa đảo. Nhưng khi một dự án mới ra mắt mà đã có hàng nghìn phiếu bầu trong tuần đầu, trong khi tổng TVL chỉ vỏn vẹn 20 ETH, thì đó là dấu hiệu đỏ. Hãy tự hỏi: Ai đang kiểm soát pool thanh khoản? Ai đang gọi API OpenAI? Và tại sao họ lại cần đến 2500 phiếu bầu chỉ trong 7 ngày? Im lặng là mã giả.
Takeaway: Công nghệ mới không bao giờ là cái cớ để quên đi những nguyên tắc cơ bản của bảo mật và phi tập trung. Nếu bạn tham gia một DAO dùng giọng nói để biểu quyết, hãy yêu cầu họ công khai audit hợp đồng và kiểm tra cơ chế chống giả mạo. Đừng để giọng nói của bạn bị sử dụng mà bạn không hề hay biết.