Tuần trước có bạn trong team nhắn mình: “hay mình chuyển agent runtime sang Agents API mới của OpenAI luôn, khỏi phải nuôi cả đội sandbox riêng?” Câu hỏi hợp lý. OpenAI mở beta công khai ngày 10/9, quảng cáo nghe rất gọn: gửi task lên, OpenAI chạy vòng lặp reasoning trên hạ tầng của họ, lệnh shell của agent chạy trong sandbox họ host sẵn, trừ khi mình tự mang sandbox riêng vào. Không còn phải lo image container, không còn patch, không còn capacity planning.
Mình dành hai buổi tối đọc docs giá và một bài mổ xẻ của tokencost.app trước khi trả lời bạn kia. Kết luận cuối cùng: “chưa vội, và đây là lý do.”
Thực ra mình đang mua cái gì
Bỏ hết phần marketing đi, Agents API bản chất là “Codex harness dưới dạng dịch vụ.” Gửi task, nó lập kế hoạch, gọi tool, chạy code, trả kết quả về — đúng cái mình đang chạy qua Claude Code và MCP server hiện giờ. Khác biệt duy nhất là vòng lặp đó chạy ở đâu: trên hạ tầng OpenAI thay vì hạ tầng của mình.
Giá sandbox chia 4 mức bộ nhớ, tính theo phiên 20 phút:
| Mức | Giá / 20 phút | Giá / giờ |
|---|---|---|
| 1 GB | $0.03 | $0.09 |
| 4 GB | $0.12 | $0.36 |
| 16 GB | $0.48 | $1.44 |
| 64 GB | $1.92 | $5.76 |
Ngoài ra tool call tính riêng — web search $10/1.000 lần gọi cộng token, file search $2.50/1.000 lần gọi cộng $0.10/GB/ngày lưu trữ sau GB đầu tiên. Tự thân các con số này không có gì vô lý.
Chỗ khiến mình gấp laptop lại, chưa ký gì hết
Đây là chỗ mọi thứ mờ mịt, và là chỗ mình khuyên ai đang làm capacity planning nên chậm lại.
Không được chọn mức bộ nhớ. API tạo session không có tham số memory. Docs không nói bạn sẽ rơi vào mức nào trong 4 mức — đồn đoán chung là mặc định mức 1 GB, nhưng đó là suy đoán chứ không phải tài liệu chính thức. Nếu agent cần giải nén một cây dependency lớn hoặc giữ dataset lớn trong bộ nhớ, bạn không có cần gạt nào để chỉnh, và không biết trước mình sẽ bị tính $0.03 hay $1.92 cho một phiên.
Khái niệm “session hợp lệ” không được định nghĩa. Trang giá ghi “các phiên container hợp lệ sẽ tính theo phút, tối thiểu 5 phút” — nhưng không giải thích thế nào là hợp lệ, đồng hồ tính tiền bắt đầu và dừng lúc nào.
Thời gian idle là hộp đen. Sandbox sống thêm tối đa một giờ sau khi task xong, và nhận keep-alive giữa các lượt của agent. Khoảng idle đó có tính tiền hay không, mình không tìm thấy chỗ nào nói rõ. Với một agent chạy dài, tạm dừng giữa các lượt để chờ người duyệt — mô tả đúng phần lớn workflow agent mình đã triển khai năm nay — thì sự mập mờ này không phải chuyện làm tròn số nhỏ.
Nếu mình không trả lời được câu “10.000 phiên agent tháng sau tốn bao nhiêu” bằng một bảng tính và tài liệu công khai, mình không thể đưa con số đó cho bộ phận tài chính.
Làm phép so sánh
Mình tra giá ba lựa chọn tự host cho cùng một phiên 20 phút:
- E2B, Daytona, Blaxel xoay quanh $0.055 cho một phiên 20 phút — xấp xỉ mức 4 GB của OpenAI, nếu bạn may mắn rơi đúng vào đó.
- Cloudflare và Vercel tính tiền theo thời gian CPU đang hoạt động chứ không theo thời gian phiên — nghĩa là một agent dành phần lớn 20 phút chờ phản hồi tool hoặc chờ người duyệt gần như không tốn tiền trên hai nền tảng này, trong khi trên OpenAI vẫn tính đủ giá.
Vậy sandbox của OpenAI đang chạy ở mức gấp đôi giá thị trường so với các nhà cung cấp tự host nhỏ hơn — và đó là chưa tính việc các nhà cung cấp kia cho phép chọn mức và chỉ tính tiền compute thực sự dùng. Đổi lại, bạn bớt một hệ thống phải vận hành: không build image, không patch, không lo capacity cho fleet container của riêng mình.
Khung mình thực sự dùng để quyết định
Mình không nghĩ “sandbox OpenAI đắt hơn” là đủ để chốt câu hỏi build-vs-buy. Câu hỏi thật sự là dòng chi phí nào chiếm phần lớn trong cấu trúc chi phí agent của bạn.
Nếu agent của bạn ngắn, dồn dập, không thường xuyên — kiểu bot hỗ trợ bật sandbox 90 giây vài lần mỗi giờ — thì mức phụ phí gấp đôi của sandbox chỉ là số lẻ so với thời gian kỹ sư bỏ ra để tự vận hành fleet. Mua.
Nếu agent chạy dài, nhiều thời gian idle giữa các lượt gọi tool — bất cứ thứ gì có bước người duyệt trong vòng lặp, hoặc làm research lặp lại với các khoảng chờ do rate limit — thì sự mập mờ về tính tiền idle có thể khiến chi phí thực tế gấp đôi, gấp ba so với nhà cung cấp tính theo CPU. Đó chính là hồ sơ của phần lớn agent tooling nội bộ mình xây năm nay, và đó là lý do mình bảo bạn kia khoan đã.
Nếu bạn đã có sẵn MCP server và fleet sandbox chạy Claude Code, chi phí biên để thêm OpenAI làm model backend thứ hai bên trong runtime hiện có gần như bằng không, và bạn vẫn giữ được độ dự đoán được về giá mà mình đã có. Thường đó là nước đi tốt hơn so với thay hẳn cả runtime.
Mình đang làm gì với chuyện này
Team mình không chuyển khỏi fleet sandbox riêng. Mình đang nối Agents API vào như một model backend thay thế, đứng sau cùng lớp MCP tool đang chạy, chỉ áp dụng cho workload dưới hai phút — chỗ mà sự mập mờ về mức bộ nhớ không gây hại nhiều. Nếu OpenAI công bố đủ các mảnh còn thiếu — chọn mức, định nghĩa “hợp lệ,” quy tắc tính idle — mình sẽ làm lại phép tính này. Còn bây giờ, mình không ký một hợp đồng mà mình không dự đoán được hóa đơn.
Một điều mình muốn nhắc ai đang cân nhắc cái này: hỏi thẳng người bán hàng của OpenAI, bằng văn bản, session mặc định rơi vào mức nào. Ba kỹ sư khác nhau mình hỏi tuần này nhận được ba câu trả lời khác nhau từ sales — tự nó đã nói lên bảng giá này mới đến mức nào.