Sniped. Một tin đồn vừa lan ra từ giới blockchain: Claude Opus 5, mô hình AI mới của Anthropic, vượt qua cả 'flagship' Fable 5 ở hầu hết các benchmark, nhưng giá chỉ bằng một nửa. Nghe có vẻ như một giấc mơ, nhưng mình, một Data Detective sống ở Abu Dhabi, luôn có thói quen kiểm tra on-chain trước khi tin vào bất kỳ câu chuyện nào. Và đây, không có on-chain data, chỉ có một mớ từ ngữ rỗng tuếch từ một nguồn blockchain/Web3. Điều này làm mình nghi ngờ ngay lập tức.

Trước hết, bối cảnh cần được làm rõ. Mình từng phân tích dữ liệu của 47 ICO vào năm 2017, phát hiện 3 dự án có >60% token tập trung vào 5 ví, dẫn đến cảnh báo rug pull sớm. Kinh nghiệm đó dạy mình rằng: trong thế giới crypto và Web3, mọi thông tin đều có thể là một 'wash trade', và floor price thường là ảo. Đây là cái gọi là 'thám tử dữ liệu' – để dữ liệu tự kể câu chuyện, không phải cảm xúc. Nhưng ở đây, dữ liệu về Claude Opus 5 không có gì cả: không benchmark, không con số cụ thể, không so sánh nào khác ngoài một vài câu mơ hồ.
Floor price ảo, wash trade thật. Trong phân tích của mình, mình thấy rằng bài báo chỉ sử dụng các mô tả mơ hồ như 'vượt qua hầu hết' và 'chi phí chỉ bằng một nửa', nhưng không đưa ra bất kỳ tên benchmark cụ thể nào. Điều này giống hệt như một dự án NFT tuyên bố floor price cao nhưng không có volume giao dịch thực tế. Mình đã từng xây dựng dashboard trên Dune Analytics để theo dõi wash trading của CryptoPunks và Bored Ape Yacht Club, phát hiện 35% volume đến từ giao dịch giữa các ví có liên quan. Ở đây, không có ví nào để kiểm tra, chỉ có một lời hứa hẹn không thể kiểm chứng.

Core: Dữ liệu kể một câu chuyện khác. Dựa trên kinh nghiệm của mình với bot arbitrage trong DeFi Summer năm 2020, mình biết rằng một tuyên bố mạnh mẽ như 'hiệu suất cao hơn, giá rẻ hơn một nửa' cần có bằng chứng kỹ thuật cứng. Nhưng bài báo này không cung cấp gì cả: không kiến trúc mô hình (Transformer, SSM, hybrid?), không kích thước tham số, không chi tiết về dữ liệu huấn luyện. Khi mình xây dựng mô hình Random Forest dự đoán đáy thị trường năm 2022, mình đã phải có ít nhất 20 trang giải thích chi tiết từng biến số. Ở đây, mọi thứ đều trống rỗng.
Hơn nữa, bài báo không giải thích tại sao giá lại rẻ hơn một nửa. Nếu đúng như vậy, điều này sẽ yêu cầu một bước đột phá lớn trong kỹ thuật tối ưu hóa suy luận (quantization, speculative sampling, continuous batching), vượt xa những gì GPT-4o hay Claude 3 Opus đang làm. Điều này cực kỳ bất thường. Mình đã từng phân tích dữ liệu ETF inflow và ảnh hưởng đến Layer 2, phát hiện mỗi 1 tỷ đô la inflow vào ETF tương ứng với 15% tăng TVL trên L2, nhưng cần có dữ liệu thời gian thực để xác nhận. Ở đây, không có dữ liệu nào để xác nhận cả.

Contrarian: Mọi người có thể nghĩ đây là một bước tiến lớn, nhưng mình thấy nó giống một trò chơi định nghĩa hơn. Có thể 'Fable 5' không phải là một mô hình đã phát hành, mà chỉ là một mã nội bộ. Hoặc, bài báo đang cố gắng tạo ra 'FUD' hoặc 'pump' cho một dự án token nào đó. Mình đã từng thấy điều này: vào năm 2017, khi ICO boom, nhiều dự án tuyên bố công nghệ vượt trội nhưng thực chất chỉ là một smart contract cơ bản. Sự khác biệt giữa tương quan và nhân quả rất quan trọng: chỉ vì bài báo nói 'vượt trội' không có nghĩa là nó thực sự vượt trội.
Mình đã viết paper về on-chain metrics và mô hình dự đoán thị trường, nhưng bị reject vì quá technical. Bài báo này thì ngược lại: nó không kỹ thuật tí nào. Đây là một điểm mù lớn: nếu một tuyên bố quá tốt đến nỗi không thể tin được, thì thường là nó không đúng. Mình đã thấy điều này trong wash trading của NFT: floor price ảo vì người bán tạo ra giao dịch giả. Ở đây, không có floor price nào cả, chỉ có một lời hứa hẹn.
Takeaway: Tuần tới, mình sẽ theo dõi ba tín hiệu: (1) Liệu Anthropic có đưa ra thông báo chính thức nào không, (2) Có ai trên LMSYS Chatbot Arena thấy mô hình này không, và (3) Có bất kỳ dự án Web3 nào liên quan đến token không. Nếu không có, mình có thể kết luận rằng đây là 'wash trade' của ngành AI. Floor price ảo, wash trade thật – câu chuyện cũ, mánh mới, mùi cũ.