Tháng Hai, một agent OpenClaw chuyển mất khoảng 250,000 đến 450,000 đô giá trị token vì một giới hạn ký tự của tool call bị crash giữa session, agent mất trí nhớ về những gì nó đã làm, và hiểu sai lệnh “send 4 SOL” thành “send everything.” Mình đã viết về vụ này ở một bài khác. Điều đọng lại sau đó không phải con số đô la — mà là lỗi xảy ra hoàn toàn ở phần software, tầng application, không có gì bên dưới để chặn cú rơi đó lại.
Câu trả lời của NVIDIA cho dạng lỗi này, công bố tuần này, là ngừng coi agent safety chỉ là vấn đề software, và đẩy một phần xuống phần cứng. Stack có hai nửa: OpenShell, tầng thi hành policy chạy trên chip Vera CPU mới của họ, và Sentry, một watchdog sống trên DPU BlueField-4 — card mạng, không phải compute.
Tại sao đặt policy check trên CPU, không phải trong model
Lý do khá đơn giản khi ngồi nghĩ kỹ: nếu logic guardrail sống trong cùng process với agent, một bug hay một tool call bị compromise có thể kéo cả hai sập cùng lúc. OpenShell chạy ở một privilege ring riêng trên chip Vera, chặn hành động của agent — file write, network call, tool invocation — trước khi nó thực thi, đối chiếu với một policy đã khai báo. Về bản chất giống seccomp hay SELinux, chỉ khác là nhắm vào luồng hành động của agent thay vì syscall.
Đây không phải ý tưởng mới trong security nói chung. Nhưng là mới với agent framework, vì đa số vẫn check permission bằng một middleware function trong cùng process, tin tưởng hoàn toàn vào runtime của chính nó. Nếu runtime đó bị compromise — ví dụ bởi một prompt injection khiến agent load code độc hại — permission check cũng sập theo.
Sentry mới là nửa thú vị hơn, vì nó không sống trong cùng failure domain với thứ nó đang canh. Chạy trên DPU BlueField-4 nghĩa là nó quan sát traffic network và I/O độc lập với trạng thái của CPU host. NVIDIA tuyên bố quarantine trong vài milli giây khi phát hiện pattern vi phạm — không phải vì logic detection thông minh hơn, mà vì về mặt vật lý nó không thể bị “đói” hay bị pause bởi bất cứ thứ gì đang hỏng ở phía compute.
Chỗ mình thực sự sẽ dùng cái này
Mình test policy model của OpenShell với một scenario gần giống vụ OpenClaw: một agent có tool liên quan đến wallet và một mức chi tiêu tối đa cứng. Cú pháp policy khai báo, giống document IAM policy hơn là code:
policy: wallet-spend-cap
rules:
- action: token.transfer
max_amount: 50
unit: SOL
on_violation: deny
alert: sentry.escalate
Điều mình thích: cái cap được thi hành ngay tại điểm chặn ở CPU, không phải trong vòng lặp tool-calling của chính agent. Ngay cả khi reasoning của agent hoàn toàn sai — tin chắc là nên gửi hết — hành động đó cũng không bao giờ chạm tới chain. Đó chính xác là lỗ hổng gây ra vụ mất 250K-450K đô: không có một điểm dừng cứng giữa “model quyết định làm điều thảm họa” và “điều thảm họa thực sự xảy ra.”
Điều mình không thích: viết policy vẫn là việc của bạn. OpenShell không tự suy ra mức chi tiêu hợp lý cho business của bạn là bao nhiêu; bạn viết YAML, và nếu viết sai — quá lỏng, hoặc scope nhầm loại action — bạn dựng guardrail có lỗ hổng kèm một cảm giác an toàn giả. NVIDIA bán policy được thi hành bằng phần cứng, không bán policy tự nó.
Con số hơn 100 partner nói lên ít hơn bạn nghĩ
NVIDIA nêu con số hơn 100 partner đang integrate với platform này, trong đó có Anthropic. Mình sẽ coi con số đó là “slide logo”, không phải “số lượng deploy production”, cho tới khi thấy case study với dữ liệu incident thật. Integration partner cho một tầng safety dựa trên phần cứng thường có nghĩa là hỗ trợ SDK và vài pilot program trước, rollout toàn fleet thường đến sau một hai năm. Nếu bạn đang plan cho Q4 dựa trên cái này, bạn đang plan dựa trên SDK, không phải sản phẩm đã chín.
Nhận định của mình
Đây là hướng đi đúng và là câu trả lời chưa đủ hoàn chỉnh. Đưa việc enforcement ra khỏi process riêng của agent là một cải tiến security thật sự — nó đóng đúng loại lỗi đã biến một bug parse thành một khoản lỗ sáu con số. Nhưng nó chỉ giúp những team đã biết rõ hành động nguy hiểm của mình là gì, và đủ nghiêm túc để viết policy cho từng cái một. Đa số team mình làm việc chưa có danh sách đó. Họ vẫn đang tìm hiểu agent của mình có thể chạm vào cái gì, chứ chưa nói đến việc nên bị chặn khỏi cái gì.
Nếu bạn đang chạy agent có quyền truy cập tool liên quan đến tài chính hay có thể thay đổi infrastructure, hãy bắt đầu làm inventory policy ngay, bất kể có chọn dùng OpenShell hay không. Tầng phần cứng là cú cược của NVIDIA về nơi vấn đề này sẽ được giải. Danh sách hành động thật sự cần chặn thì vẫn là bài tập không ai làm giúp bạn được.