Somalisan

Framework điều phối AI agent: bề mặt tấn công bị bỏ quên, bằng chứng từ SADF tại DEF CON 34

Phan Mỹ Học tập

Trong bảy ngày qua, thị trường crypto đi ngang. Bitcoin bị kẹt trong một biên độ hẹp, altcoin tích lũy, và các trader bắt đầu mất kiên nhẫn. Tôi không quan tâm lắm đến biểu đồ giá trong lúc này; tôi đang theo dõi một tín hiệu khác, phát ra từ một báo cáo vừa trình bày tại DEF CON 34 AI Village. Tín hiệu đó không đến từ thị trường, mà từ một nghiên cứu có tên SADF: "The Orchestration Framework Is the Attack Surface". Kết quả chính của nghiên cứu này đơn giản đến mức gây sốc: một agent AI dùng model Claude Sonnet, khi được điều phối bởi framework SmolAgents, hoàn thành các cuộc tấn công ở tỷ lệ 31,1%. Cũng agent đó, cùng model đó, nhưng gọi API trực tiếp, chỉ hoàn thành 15,5%. Chênh lệch 2,6 lần. Không phải model khác nhau. Không phải dữ liệu huấn luyện khác nhau. Chỉ khác lớp phần mềm nằm giữa model và công cụ. Một framework không phải là một lớp trừu tượng. Nó là một bề mặt tấn công.

Với người ngoài ngành, AI agent nghe có vẻ như một con chatbot biết gõ lệnh. Nhưng trong bối cảnh blockchain, một agent có thể là một cỗ máy được giao nắm giữ private key, ký giao dịch, tương tác với hàng trăm smart contract, đọc dữ liệu từ oracle, thậm chí phối hợp với các agent khác để thực hiện chiến lược arbitrage phức tạp. Điều gì ngăn một agent làm điều sai trái? Không chỉ model, mà là lớp framework đứng giữa model và thế giới bên ngoài. Đó là nơi quyết định agent được phép gọi tool nào, bộ nhớ lưu giữ điều gì, và thông tin từ agent này có lan sang agent khác hay không. Hầu hết các đội ngũ Web3 mà tôi gặp đều tự hào nói rằng họ dùng model mạnh nhất, có hệ thống kiểm tra jailbreak. Nhưng họ không thể trả lời một câu hỏi đơn giản: nếu agent của bạn bị ép gọi một tool không nằm trong danh sách cho phép, framework của bạn có chặn được không? Câu trả lời thường là sự im lặng.

Nghiên cứu SADF được thiết kế để phá vỡ sự im lặng đó. Nhóm nghiên cứu, đứng đầu là Julie Brunias, đã xây dựng một thí nghiệm có đối chứng: cố định model Claude Sonnet làm bộ não; dùng môi trường mô phỏng SimulatedToolEnvironment, trong đó các công cụ giả lập—gửi email, ghi file, truy vấn database—được dựng sẵn. Không có hệ thống thật nào bị tổn hại, không có thông tin xác thực nào bị lộ. Nhóm đã sử dụng 32 payload tấn công, tạo ra 5.119 dòng đánh giá, và đo chỉ số ACR (Attack Completion Rate)—tức tỷ lệ tấn công hoàn thành mục tiêu, một thước đo khắt khe hơn nhiều so với việc chỉ đo "model có trả lời sai hay không". Kết quả được công bố công khai, và nó đáng để từng người xây dựng agent trên blockchain đọc kỹ.

Bảng số liệu trông như thế này: Direct API (Claude Sonnet) có ACR 15,5%. CrewAI—một framework theo mô hình phân tách nhiệm vụ—đạt 11,9%, thấp hơn cả API trực tiếp. LangChain, framework phổ biến nhất hiện nay, đạt 18,1%. AutoGen, nền tảng đa tác tử của Microsoft, đạt 20,0%. Và SmolAgents, framework tối giản được cộng đồng ưa chuộng vì dễ dùng, đạt 31,1%. Điều đầu tiên tôi nhìn thấy không phải là thứ hạng, mà là cấu trúc. CrewAI thấp hơn Direct API—điều đó có nghĩa là framework này không chỉ làm đúng nhiệm vụ điều phối mà còn vô tình đóng vai trò như một lớp chặn. Nó cô lập các tác vụ, ngăn thông tin từ tác vụ này tràn sang tác vụ khác, và do đó hạn chế kẻ tấn công khai thác các bước trung gian.

Ngược lại, SmolAgents không chỉ mở rộng bề mặt tấn công mà còn có hai điểm yếu mang tính hệ thống: RAG Poisoning xuất hiện ở 20% số ca thử nghiệm và Context Boundary Violation lên tới 64%. Nói một cách thực dụng: kẻ tấn công có thể đầu độc nguồn dữ liệu mà agent truy xuất—ví dụ, chèn một đoạn văn bản độc hại vào một trang web mà agent đọc để ra quyết định—và agent sẽ tin rằng đó là dữ liệu hợp lệ. Sau đó, kẻ tấn công có thể khiến agent hành động vượt qua ranh giới ngữ cảnh: thay vì chỉ đọc dữ liệu, agent có thể bị lừa thực thi một hành động không được phép. Trong một hệ thống blockchain, điều đó có nghĩa là agent có thể bị lừa ký một giao dịch chuyển tài sản, gọi một hàm nguy hiểm trong smart contract, hoặc thay đổi tham số của một giao thức thanh khoản.

Điều làm SADF khác biệt so với các nghiên cứu bảo mật AI trước đây nằm ở chỗ nhóm nghiên cứu đã tự sửa sai chính mình. Khi phân tích dữ liệu, họ phát hiện ra rằng phương pháp chấm điểm truyền thống—dùng so khớp chuỗi con đơn giản để xác định agent có làm theo lời kẻ tấn công hay không—đã khiến rủi ro của model Claude bị phóng đại lên từ 4 đến 6 lần. Khi áp dụng bộ lọc refusal-filtered scoring, tức chỉ tính là "thành công" khi agent không từ chối và thực thi đầy đủ hành động độc hại, con số thực của Claude Sonnet là 15,5%, còn Claude Haiku là 22,3%. Điều này có nghĩa là các benchmark bảo mật agent trước đây có thể đã vẽ sai bản đồ rủi ro, khiến các nhà phát triển và nhà đầu tư tin rằng model thông minh hơn thì an toàn hơn. Đừng hỏi model có an toàn không. Hãy hỏi framework của bạn đang mở những cánh cửa nào.

Cụ thể hơn, hãy tưởng tượng một agent được giao nhiệm vụ theo dõi thanh khoản của một pool trên Uniswap và tự động thực hiện rebalance. Tool Call Hijacking có thể biến lệnh "getReserves" thành lệnh "swapExactTokensForTokens" chỉ bằng cách chèn một tham số ẩn vào chuỗi công cụ. Output Poisoning có thể khiến agent xuất ra một báo cáo sai lệch, và báo cáo này sau đó được một agent khác tin tưởng sử dụng để đặt lệnh. Cross-Tool Injection lợi dụng việc một công cụ trả về dữ liệu có chứa chỉ thị; khi agent chuyển tiếp dữ liệu đó sang một công cụ khác, chỉ thị được kích hoạt. Memory Poisoning thì nguy hiểm hơn: kẻ tấn công tương tác với agent một lần, gieo vào bộ nhớ dài hạn một "sự thật" giả, và sau đó mọi quyết định của agent đều bị bóp méo. Trong một hệ thống blockchain, nơi mọi giao dịch đều có thể được nhìn thấy trên chuỗi, kẻ tấn công có thể dùng những dữ liệu công khai đó để xây dựng một câu chuyện sai về trạng thái thị trường. Agent không bao giờ biết mình đang bị lừa, vì nó tin vào nguồn dữ liệu mà framework đã cung cấp.

Hãy nhìn sang thế giới blockchain để thấy một mô hình lặp lại. Năm 2020, trong làn sóng DeFi Summer, hàng trăm dự án yield farming mọc lên. Nhà đầu tư đổ tiền vào các pool thanh khoản chỉ vì APY cao, trong khi các đội ngũ phát triển vội vã fork hợp đồng từ các dự án khác mà không hiểu rõ cấu trúc. Khi những lỗ hổng trong hợp đồng thông minh lộ ra, người ta mới hiểu rằng rủi ro không nằm ở một hàm riêng lẻ, mà nằm ở cách các hợp đồng kết nối với nhau—tính composability. Tôi nhớ chính tôi đã mất 30 ETH trong một chiến lược yield farming trên Aave vì không tính đến tác động của việc tài sản thế chấp giảm giá bất ngờ. Đó là một bài học về việc các lớp được xếp chồng lên nhau; bỏ qua lớp giữa, bạn sẽ trả giá bằng vốn thật.

Bây giờ, các agent AI trên blockchain đang đi lại đúng vết xe đó. Một agent không chỉ gọi một contract duy nhất; nó đọc dữ liệu từ nhiều nguồn, ghi nhớ bối cảnh của hàng loạt tương tác trước đó, rồi phối hợp với các agent khác trong một hệ thống phân tán. Mỗi framework thêm một lớp trừu tượng, và mỗi lớp trừu tượng là một bề mặt tấn công. Các CVE được ghi nhận trong sáu tháng qua—CVE-2026-62830 ảnh hưởng tới Azure SRE Agent, CVE-2026-9198 ảnh hưởng tới Langflow—cho thấy framework-level bug không chỉ là lý thuyết. Không phải model bị khai thác; khung xương quanh model bị khai thác. Không phải trí tuệ bị tấn công; kết nối bị tấn công.

Nhưng tôi không đến đây để hù dọa bạn. Tôi đến đây để nói về điều mà hầu hết mọi người bỏ qua. Cộng đồng blockchain tự hào về tính phi tập trung, nhưng khi tích hợp AI agent, họ lại giao toàn bộ quyền quyết định cho một framework tập trung do một nhóm kỹ sư viết ra. Bạn tin vào smart contract, nhưng bạn buộc agent của mình phải tin vào orchestration layer, memory layer, tool-use layer—những lớp mà bạn chưa từng audit. Nghiên cứu SADF liệt kê 8 loại thất bại: chiếm quyền gọi công cụ (Tool Call Hijacking), đầu độc kết quả đầu ra (Output Poisoning), tiêm nhiễm chéo giữa các công cụ (Cross-Tool Injection), đầu độc bộ nhớ (Memory Poisoning), đầu độc kho dữ liệu (RAG Poisoning), lạm dụng quyền được ủy quyền (Delegated Authority Abuse), lây lan giữa các agent (Multi-Agent Propagation), và vi phạm ranh giới ngữ cảnh (Context Boundary Violation). Tám cánh cửa. Đóng ba cánh, bạn vẫn còn năm cánh mở.

Đối với bất kỳ ai đang xây dựng agent trên blockchain, bài học rõ ràng là: tách quyền lực. Đừng trao cho agent toàn bộ private key. Hãy giới hạn phạm vi của framework bằng cách sử dụng các tài khoản có quyền hạn tối thiểu, yêu cầu xác nhận của con người đối với các giao dịch vượt ngưỡng, và thiết kế các "bộ ngắt mạch" (circuit breaker) để dừng agent ngay khi phát hiện hành vi bất thường. Điều này nghe có vẻ hiển nhiên, nhưng trong thực tế, tôi thấy hầu hết các dự án vẫn chạy agent với quyền quản trị tuyệt đối. Họ nghĩ rằng model thông minh sẽ tự biết đúng sai. SADF cho thấy ngay cả một model thông minh cũng có thể bị điều khiển bởi một framework yếu.

Tất nhiên, một nhà giao dịch kỳ cựu sẽ nhìn vào ba điểm mù của SADF trước khi đặt cược. Thứ nhất, 32 payload tấn công không phải là toàn bộ vũ khí mà kẻ tấn công thực tế có. Các vector hiếm gặp nhưng nguy hiểm—ví dụ tấn công chuỗi cung ứng mô hình, khai thác plugin, hoặc tấn công thông qua file định dạng đặc biệt—có thể không nằm trong bộ mẫu. Thứ hai, nghiên cứu chỉ cố định Claude Sonnet và Claude Haiku. Chưa ai biết khi thay bằng GPT-5.4, DeepSeek hay Llama, thứ hạng giữa các framework có còn nguyên không. Có thể SmolAgents tệ với Claude nhưng tốt hơn với một model khác; lúc đó, câu chuyện "framework quyết định rủi ro" sẽ cần được viết lại với sắc thái khác. Thứ ba—và đây là điểm thú vị nhất—phiên bản trước của nghiên cứu tuyên bố khảo sát tới 10 framework, nhưng phiên bản chính thức chỉ công bố số liệu đầy đủ cho 5 framework, và bản cũ bị xếp vào thư mục "SUPERSEDED". Ngay cả nhóm nghiên cứu cũng đang tự sửa lại dữ liệu của chính mình.

Điều đó có nghĩa là gì đối với các nhà đầu tư và builder? Nó có nghĩa là thị trường bảo mật AI agent vẫn còn quá sớm. Nếu bạn đang chọn một framework để xây dựng agent giao dịch, đừng chọn chỉ dựa trên bảng xếp hạng ACR của SADF. Hãy dùng bảng xếp hạng đó như một tín hiệu để đặt câu hỏi sâu hơn: framework của bạn xử lý bộ nhớ thế nào? Nó có tách biệt các tác vụ không? Khi agent đọc một trang web chứa dữ liệu độc hại, framework có chặn đứng hay để yên? Liệu agent có thể bị lây nhiễm từ một agent khác trong cùng hệ thống? Khi framework điều phối có thể bị đầu độc, model của bạn không phải là tài sản lớn nhất—mà là một phần của bề mặt tổn thương.

Tôi đã dành 25 năm quan sát những chu kỳ hưng - suy trong ngành tài chính và blockchain. Tôi tin vào dữ liệu, nhưng tôi cũng tin rằng dữ liệu mạnh nhất là dữ liệu khiến người ta phải tự vấn lại những giả định của mình. SADF là một trong số đó. Nó không bán cho bạn một giải pháp. Nó bán cho bạn một lăng kính. Trong một thị trường đang đi ngang, nơi các quỹ đầu tư đang chờ đợi, thứ giá trị nhất không phải là một token tăng giá, mà là khả năng nhìn thấy rủi ro trước khi số đông nhìn thấy. Bạn có thể tiếp tục chờ giá breakout, hoặc bạn có thể bắt đầu đặt câu hỏi: framework mà agent của bạn đang chạy có đang mở cửa cho kẻ tấn công ngay lúc này không? Tôi tin rằng trong vòng 24 tháng tới, các tiêu chuẩn bảo mật agent sẽ được viết lại dựa trên những dữ liệu kiểu SADF. Các công ty bảo mật như Palo Alto Unit 42 hay CrowdStrike đã bắt đầu tuyển chuyên gia AI agent; các quỹ đầu tư sẽ yêu cầu các startup cung cấp bản đồ bề mặt tấn công framework bên cạnh whitepaper. Lúc đó, những ai nói "model an toàn là đủ" sẽ bị bỏ lại phía sau, giống như những ai năm 2020 tin rằng "audit xong contract là đủ" đã bị bỏ lại khi tính composability bùng nổ. Còn bây giờ, câu hỏi duy nhất đáng hỏi nhất không phải là "bạn dùng framework nào", mà là: "bạn có biết framework đó đang kết nối tới những cánh cửa nào không?"

Giá thị trường

Tiền điện tử Giá 24h
BTC Bitcoin
$78,772.9 -0.53%
ETH Ethereum
$2,496.14 +1.14%
SOL Solana
$101.1 +3.81%
BNB BNB Chain
$703.2 +0.77%
XRP XRP Ledger
$1.41 -2.75%
DOGE Dogecoin
$0.0869 +0.03%
ADA Cardano
$0.2093 -1.41%
AVAX Avalanche
$7.36 -0.50%
DOT Polkadot
$0.8718 +1.64%
LINK Chainlink
$11.55 +1.17%

Sợ & Tham

71

Tham lam

Tâm lý thị trường

Tin nhanh 7x24h

Thêm >
{{快讯列表(10)}} {{loop}}
{{快讯时间}}

{{快讯内容}}

{{快讯标签}}
{{/loop}} {{/快讯列表}}

Lịch sự kiện blockchain

{{年份}}
08
04
upgrade Solana Firedancer

Trình xác thực độc lập ra mắt trên mainnet

28
03
unlock Mở khóa token Arbitrum

Giải phóng 92 triệu ARB

12
05
halving BCH Halving

Sự kiện giảm một nửa phần thưởng khối

30
04
upgrade Nâng cấp Celestia Mainnet

Cải thiện hiệu quả lấy mẫu tính khả dụng dữ liệu

22
03
unlock Mở khóa Optimism

Lượng cung lưu hành tăng khoảng 2%

15
04
halving Bitcoin Halving

Phần thưởng khối giảm xuống 3,125 BTC

18
03
unlock Mở khóa token Sui

Phần đội ngũ và nhà đầu tư sớm được giải phóng

10
05
upgrade Nâng cấp Ethereum Pectra

Tăng giới hạn validator và trừu tượng hóa tài khoản

🧮 Công cụ

Tất cả →

Chỉ số mùa altcoin

41

Mùa Bitcoin

Sự thống trị BTC Mùa altcoin

Theo dõi phí Gas

Ethereum 28 Gwei
BNB Chain 3 Gwei
Polygon 42 Gwei
Arbitrum 0.5 Gwei
Optimism 0.3 Gwei

Vốn hóa thị trường

Tất cả →
# Tiền điện tử Giá
1
Bitcoin BTC
$78,772.9
1
Ethereum ETH
$2,496.14
1
Solana SOL
$101.1
1
BNB Chain BNB
$703.2
1
XRP Ledger XRP
$1.41
1
Dogecoin DOGE
$0.0869
1
Cardano ADA
$0.2093
1
Avalanche AVAX
$7.36
1
Polkadot DOT
$0.8718
1
Chainlink LINK
$11.55

🐋 Theo dõi cá voi

🔴
0x798e...c994
12 phút trước
Chuyển ra
4,878,048 DOGE
🟢
0x6843...7d46
3 giờ trước
Chuyển vào
13,087 BNB
🔵
0xa9f1...6526
12 phút trước
Stake
2,215.51 BTC

💡 Smart Money

0x0465...2c83
Thợ đào DeFi hàng đầu
+$4.3M
65%
0xe1e4...fdad
Bot chênh lệch giá
+$0.9M
77%
0xa3e0...cd2a
Thợ đào DeFi hàng đầu
+$3.4M
77%