AI agent trượt cổng hội nghị AI: Bài học sống còn cho các dự án crypto đang bán giấc mơ "nhà khoa học tự trị"
Trong khi phần lớn thị trường vẫn đang mải mê kể câu chuyện "AI agent sẽ thay thế con người", một nghiên cứu đa tổ chức vừa đưa ra kết quả khiến nhiều quỹ đầu tư phải dừng lại. Các tác nhân AI tiên tiến nhất hiện nay – những hệ thống được quảng cáo là có khả năng "làm khoa học từ đầu đến cuối" – đã thất bại tại cổng tuyển chọn của các hội nghị AI hàng đầu. Chúng làm tốt phần việc mang tính cơ học: viết mã, tóm tắt tài liệu, thực thi thí nghiệm. Nhưng khi cần tạo ra một kết quả đủ mới lạ, đủ đóng góp về mặt lý thuyết để lọt qua vòng phản biện của các nhà khoa học kỳ cựu, chúng gần như đứng yên.
Đây không phải một câu chuyện bi quan về AI. Đây là một tín hiệu dữ liệu mà các nhà đầu tư crypto – những người đang đổ tiền vào hàng loạt dự án "AI scientist tự trị" – cần đọc kỹ trước khi tiếp tục rót vốn. Câu chuyện này bắt đầu từ một bài phân tích trên một nền tảng Web3, nói về một thí nghiệm đánh giá năng lực của các AI agent trong nhiệm vụ nghiên cứu khoa học trọn gói. Nhiều nhóm nghiên cứu độc lập đã cùng tham gia, đưa ra các bài toán từ xây dựng giả thuyết, thiết kế thí nghiệm, viết mã, đến phân tích dữ liệu và hoàn thiện một bài báo khoa học. Tiêu chuẩn đánh giá không phải là một tạp chí thường, mà là các hội nghị AI hàng đầu như NeurIPS, ICML hay ICLR. Đây là những nơi mà ngay cả các nhà nghiên cứu con người có kinh nghiệm cũng phải cạnh tranh khốc liệt.
Sự thật khó chịu là: năng lực cơ học không phải là năng lực sáng tạo. Nghiên cứu đa tổ chức nói trên không nêu tên cụ thể các mô hình, nhưng kết quả của nó trùng khớp với một thực tế mà bất kỳ ai làm kỹ thuật trong ngành AI lâu năm đều nhận ra. Các mô hình ngôn ngữ lớn hiện nay hoạt động như những cỗ máy "biến đổi mẫu" cực kỳ tinh vi. Chúng học từ hàng trăm tỷ tham số, ghi nhớ các phân bố dữ liệu, và tái tổ hợp chúng theo cách có vẻ hợp lý. Nhưng khi đối mặt với một bài toán nằm ngoài phân bố – một giả thuyết khoa học chưa từng xuất hiện, một cách tiếp cận chưa từng được mô tả – chúng không có gì để "biến đổi". Chúng bắt chước sự sáng tạo, nhưng không tạo ra.
Các hội nghị AI hàng đầu có tỷ lệ chấp nhận bài thường dưới 25%. Ngay cả con người – những nghiên cứu sinh tiến sĩ có nhiều năm kinh nghiệm – cũng phải vật lộn để vượt qua. Nhưng điều đáng nói ở đây không phải là việc AI agent bị từ chối. Điều đáng nói là việc các hệ thống này được thiết kế cho mục tiêu "end-to-end research", tức là tự động hóa toàn bộ quy trình nghiên cứu, nhưng lại không thể hoàn thành phần khó nhất của quy trình đó. Nếu một AI không thể vượt qua rào cản của một hội nghị AI, thì cơ chế nào đảm bảo nó có thể tự mình phát hiện lỗ hổng smart contract mới? Tự mình tạo ra một chiến lược DeFi đột phá? Hay tự mình viết ra một báo cáo phân tích đáng tin cậy?
Trong những năm gần đây, tôi đã chứng kiến không ít dự án crypto quảng cáo các "AI agent" có khả năng tự động kiểm tra hợp đồng thông minh, tự động phát hiện rug pull, hay tự động đưa ra quyết định đầu tư. Nhìn từ bên ngoài, những sản phẩm này rất ấn tượng – chúng quét hàng nghìn dòng mã trong vài phút, đưa ra cảnh báo về các lỗ hổng đã biết, và tạo ra các báo cáo dày đặc biểu đồ. Nhưng nếu nhìn sâu vào kiến trúc, hầu hết chúng chỉ đang làm tốt phần "cơ học" của quy trình: tìm kiếm các pattern đã có trong dữ liệu huấn luyện. Còn với những lỗ hổng chưa từng xuất hiện – những lỗ hổng nằm ngoài mọi pattern đã biết – các AI agent này gần như bị mù.
Tôi đã từng dành nhiều năm săn tin và kiểm tra các hợp đồng thông minh, và tôi nhận ra sự khác biệt giữa một công cụ rà soát tự động và một chuyên gia an ninh thực thụ. Công cụ tự động có thể giúp tôi tiết kiệm 30% thời gian cho việc tìm kiếm các lỗi cú pháp, các dấu hiệu bất thường trong luồng dữ liệu. Nhưng chính tôi – con người – mới là người phát hiện ra những lỗi logic tinh vi, nơi một dòng code có vẻ vô hại lại có thể biến thành lỗ hổng rút tiền khi kết hợp với một hàm khác. AI không thể làm điều đó, vì điều đó đòi hỏi một dạng "phán đoán khoa học" vượt xa khả năng dự đoán token tiếp theo. Tôi từng xây dựng một bot sử dụng mô hình ngôn ngữ lớn để quét tin tức blockchain. Bot rất giỏi trong việc tóm tắt và phát hiện các sự kiện đã được định nghĩa trước. Nhưng khi tôi yêu cầu nó dự đoán tác động thị trường của một sự kiện chưa từng có tiền lệ, nó trả về những câu trả lời mang tính "hợp lý trung bình" – tức là vô dụng. Không có một tham số nào trong mô hình cho phép nó "nhảy" ra khỏi phân bố dữ liệu.
Vậy những kết quả thất bại này có ý nghĩa gì với các nhà đầu tư trong thị trường giảm? Theo cách nhìn của tôi, nó đóng vai trò như một "chất xúc tác để phân loại". Nó giúp chúng ta phân biệt giữa hai loại dự án: loại thứ nhất là những dự án xây dựng công cụ hỗ trợ con người – đúng như tinh thần "research copilot" – và loại thứ hai là những dự án bán giấc mơ về một AI hoàn toàn tự trị. Trong giai đoạn thị trường đi xuống, các dự án loại hai sẽ là nơi chảy máu nhiều nhất, bởi vì câu chuyện của chúng được xây trên một nền tảng không vững chắc. Việc AI agent không thể vượt qua cổng hội nghị AI không có nghĩa là AI agent vô dụng. Nó chỉ có nghĩa là chúng ta đang đặt sai câu hỏi. Câu hỏi đúng không phải là "AI có thể thay thế nhà khoa học không?", mà là "AI có thể giúp nhà khoa học làm việc hiệu quả hơn gấp bao nhiêu lần?". Nếu một AI agent có thể tự động hóa 80% khối lượng công việc cơ học – thu thập dữ liệu, viết mã, chạy thí nghiệm, định dạng bài báo – thì ngay cả khi nó không tạo ra một khám phá mới nào, giá trị của nó vẫn là rất lớn.
Điều nguy hiểm nhất mà tôi nhìn thấy ở đây không phải là việc AI quá yếu, mà là việc thị trường có thể rơi vào một cái bẫy nhận thức: coi sự bất lực của AI như một sự đảm bảo an toàn. Nhiều nhà đầu tư có thể nghĩ rằng "nếu AI chưa thể tự tạo ra khoa học, thì nó cũng không thể tạo ra những bài phân tích giả mạo có sức thuyết phục". Đây là một sai lầm nghiêm trọng. Ngay cả khi AI không thể tạo ra một khám phá mới, nó vẫn có thể tạo ra hàng nghìn bài báo "có vẻ hợp lý" – với đầy đủ biểu đồ, số liệu, và trích dẫn – để phục vụ cho các chiến dịch truyền thông của các dự án rác. Trong một thị trường giảm, nơi thanh khoản khan hiếm và tâm lý nhà đầu tư dễ bị tổn thương, đây chính là mảnh đất màu mỡ cho "các nhà máy sản xuất nghiên cứu tự động" trục lợi. Hãy nghĩ về điều này: một AI agent thất bại trong việc tạo ra một bài báo khoa học đủ tốt để được NeurIPS chấp nhận, nhưng lại hoàn toàn có thể tạo ra một bài phân tích kỹ thuật dài 2.000 từ, với các thuật ngữ chuyên ngành, biểu đồ giá và các dự đoán tương lai, để đăng trên các nền tảng truyền thông phi tập trung. Đối với một nhà đầu tư không có nền tảng kỹ thuật vững chắc, bài phân tích đó trông giống hệt một sản phẩm của chuyên gia.
Càng theo đuổi tốc độ, thị trường càng dễ đánh mất thứ quan trọng nhất – tính xác thực của thông tin. Và trong thị trường giảm, thứ duy nhất còn giá trị chính là sự xác thực. Vậy nên, thay vì rót tiền vào các dự án hứa hẹn "AI tự động làm mọi thứ", hãy tìm kiếm những đội ngũ đang xây dựng hạ tầng đánh giá – các bộ tiêu chuẩn để kiểm chứng chất lượng nghiên cứu của AI, một dạng "credit score" cho các mô hình. Hãy quan sát những dự án tích hợp AI vào quy trình làm việc của con người một cách khiêm tốn. Trong thị trường giảm, sự khiêm tốn trong thiết kế chính là một chỉ báo sống còn. Người ta không mua cổ phiếu của cái cuốc vì nghĩ rằng cái cuốc sẽ tìm thấy vàng. Họ mua cổ phiếu của cái cuốc vì có rất nhiều người đang đổ xô đi tìm vàng. Câu hỏi còn lại là: ai đang bán cuốc, và ai đang giả vờ là nhà địa chất?