Kimi mở mã nguồn PerceptionBench: Một cuộc điều tra dữ liệu về độ tin cậy của benchmark AI
Tôi không đoán, tôi đếm.
Tuần trước, Kimi (Nguyệt Ám Diện) công bố mã nguồn PerceptionBench – bộ benchmark đo lường năng lực tri giác thị giác của mô hình đa phương thức. Kết quả gây sốc: mọi mô hình hàng đầu đều dưới 60% độ chính xác. GPT-5.6-Sol đạt 59.2%, Claude-Fable-5 đạt 58.8%, Gemini-3.1-Pro đạt 55.1%, và Kimi K3 đứng thứ hai với 58.5%. Ba cái tên đầu tiên chưa từng xuất hiện trong bất kỳ báo cáo chính thức nào của OpenAI, Anthropic hay Google. Tôi là Data Detective: tôi không đoán, tôi đếm. Và số đếm này báo động đỏ.
PerceptionBench chia năng lực thị giác thành 10 khả năng nguyên tử – từ phát hiện ảo giác, nhận diện chi tiết nhỏ đến phân tích mối quan hệ không gian. Thiết kế tinh vi: tránh rò rỉ dữ liệu bằng cách tạo câu hỏi từ hình ảnh tổng hợp và ảnh chụp thực tế chưa công bố. Điểm số dưới 60% cho thấy một sự thật khó chịu: ngay cả những mô hình "siêu thông minh" cũng mù về mặt tri giác trong môi trường có kiểm soát. Nhưng dữ liệu chỉ có giá trị nếu nó trung thực. Vấn đề: ba mô hình được cho là dẫn đầu – GPT-5.6-Sol, Claude-Fable-5, Gemini-3.1-Pro – không tồn tại trong cơ sở dữ liệu công khai nào. Tôi kiểm tra API endpoints, tài liệu kỹ thuật, blog chính thức. Không dấu vết. Đây là lỗi cố ý? Mã thử nghiệm nội bộ? Hay một chiêu trò PR có chủ đích?
Dựa trên kinh nghiệm audit dữ liệu on-chain của tôi, những mâu thuẫn danh tính là tín hiệu đỏ đầu tiên. Năm 2017, tôi phát hiện một ICO giả mạo khi thấy 82% token chuyển vào ví không hoạt động. Lần này cũng vậy: số liệu rất đẹp, câu chuyện hấp dẫn, nhưng nhân vật chính sai tên. Nếu cả tên mô hình còn không đúng, làm sao tin điểm benchmark? Tôi cho rằng PerceptionBench là benchmark hợp lệ, nhưng báo cáo kết quả này có vấn đề. Kimi K3 đứng thứ hai – liệu họ có lợi thế sân nhà? Trong thế giới blockchain, tôi đã thấy hàng trăm dự án tự xây test và tự chấm điểm. Kết quả luôn đẹp hơn thực tế ít nhất 20%. Ở đây, Kimi đứng thứ hai không phải nhất, điều đó tạo ảo giác khách quan. Nhưng liệu một mô hình vô danh (GPT-5.6-Sol) có đạt 59.2% có thực sự tồn tại? Nếu có, tại sao không công bố danh tính? Nếu không, toàn bộ thang đo sụp đổ.
Cuộc chơi benchmark AI đang lặp lại sai lầm của DeFi năm 2020: ai cũng muốn dữ liệu xác nhận hướng đi của mình, nhưng không ai kiểm tra nguồn. Nhà đầu tư và nhà phát triển có thể mua vào câu chuyện "AI vẫn còn yếu, hãy chọn Kimi" mà không xác thực. Đây không chỉ là vấn đề kỹ thuật, mà là vấn đề tin cậy. Khi một công ty mở mã nguồn benchmark, họ xứng đáng được khen. Nhưng khi họ (hoặc báo chí) cung cấp kết quả với tên mô hình không tồn tại, trách nhiệm giải trình bị phá vỡ. Tôi sẽ không đổ lỗi cho Kimi vì đó có thể do lỗi truyền thông. Nhưng tôi sẽ không coi điểm số này là bằng chứng đầu tư.
Điều gì xảy ra nếu cả ngành AI cũng bị benchmark sai lệch? Trong blockchain, chúng ta đã chứng kiến hàng loạt vụ rug pull nhờ vào dữ liệu filtered. Nếu PerceptionBench thực sự đáng tin, thì việc ẩn danh tính mô hình thử nghiệm là một sai lầm chiến lược. Nó tạo ra nghi ngờ không đáng có. Là Data Detective, tôi sẽ đặt câu hỏi: tại sao không công bố danh sách đầy đủ? Tại sao không cho phép cộng đồng click vào từng benchmark log? Tại sao không dùng blockchain để timestamp kết quả? Câu trả lời đơn giản: vì đó không phải ưu tiên. Nhưng nếu benchmark là công cụ định giá năng lực AI, nó cần sự minh bạch tối đa – giống như một smart contract mở.
Tuần tới, tôi sẽ theo dõi: Kimi có phát hành bản sửa lỗi tên mô hình? Các công ty còn lại (OpenAI, Anthropic) có phản hồi? Nếu không, PerceptionBench sẽ chỉ là một trang Powerpoint đẹp, giống như lời hứa "decentralized sequencing" của Layer2 kéo dài hai năm. Câu hỏi để lại: bạn tin vào dữ liệu chưa được xác minh, hay bạn đợi đến khi có blockchain xác thực từng block? Tôi chọn cách đếm từng block.