Tôi tự host một nền tảng agent tên Hive: Python thuần thư viện chuẩn, SQLite, frontend Preact không cần build, chạy một tiến trình trên một container Proxmox. Nó đã có phòng cho nhiều agent nói chuyện với nhau, council phản biện, cron, webhook, ngân sách, eval. Nói thật là nó có nhiều thứ. Câu hỏi tôi chưa trả lời được là: nếu một nhóm năm người muốn mua nó, họ mua cái gì?
Ngày 18/09 tôi dành trọn một ngày đọc đối thủ để trả lời câu đó. Khoảng ba mươi sản phẩm, chia
sáu nhóm. Đọc bảng giá, đọc than phiền trên G2, Reddit, Hacker News, đọc luôn hai bài nghiên cứu
về multi-agent debate. Rồi đọc lại mã của chính mình — flows.py, rooms.py, llm.py,
triggers.py — để không tự dối về cái Hive đang có.
Kết quả gọn hơn tôi tưởng.
Kết luận trước
Thị trường 2026 không trả tiền cho orchestration. Lõi mã nguồn mở ở đâu cũng miễn phí: n8n, Dify, CrewAI, LangGraph, Paperclip. Không ai còn trả tiền để được “nối agent với nhau”. Người ta trả cho một việc lặp lại chạy đúng, có người duyệt, không vỡ hoá đơn.
Bốn lời than lớn nhất, lặp lại ở mọi nơi:
- Chi phí bất ngờ. Zapier 1.4 sao trên Trustpilot, phần lớn vì hoá đơn (than phiền về Zapier Agents). Credit của Lindy mờ. Make tính 50 credit mỗi lượt agent.
- Agent giòn. CrewAI có hẳn thread hỏi cách chặn vòng lặp vô hạn ngốn token. n8n rò bộ nhớ ở AI Agent node. LangGraph có chuỗi lỗ hổng self-host hồi tháng 6.
- Không ai kiểm tra đầu ra. Đây là lời than ít ồn nhất nhưng đau nhất. Human-in-the-loop, nếu có, là gate ở mức tool call (n8n 2.6 HITL tools), không phải một model thứ hai đọc bản giao và nói số liệu đúng hay sai.
- Tự host khó. Dify, LibreChat là một chồng container (review Dify sau 6 tháng). Open WebUI đổi giấy phép. OpenClaw lộ 21k instance ra internet.
Hai tín hiệu nữa cho tôi biết sàn và trần. OpenAI đóng AgentKit ngày 30/11/2026 (nguồn) — orchestrator đóng của nhà cung cấp lớn nhất không sống qua một năm. Còn Paperclip lên 30k sao GitHub trong ba tuần nhờ đúng một ý: tổ chức agent như org chart, mỗi agent có ngân sách, chạm 100 % thì tự dừng. Người ta không thiếu framework. Người ta muốn biết hoá đơn sẽ dừng ở đâu.
Bảng đối thủ (rút gọn)
| Nhóm | Ai | Học được gì | Không copy |
|---|---|---|---|
| Canvas no-code | n8n, Dify, Flowise, Langflow, Make, Zapier Agents | HITL ở mức tool; webhook/cron/Slack là chuẩn; Dify hiện chi phí từng run | Canvas. Họ đã thắng; Hive ghép việc bằng Rooms, không vẽ node |
| Framework dev | CrewAI, LangGraph, Agent Framework (AutoGen), Agno, Mastra | Lead ghi sổ và re-plan (Hive đã có board); suspend/resume | Orchestrator thứ tư |
| ”Nhân viên AI” SaaS | Lindy, Relevance, Gumloop | Giá theo bậc model; manager agent | Credit mờ, luôn bật |
| Control plane | Paperclip, Block Buzz, Odysseus | Ngân sách theo agent tự dừng; agent như org chart | Runtime-agnostic mọi thứ |
| Vendor đóng | Claude Cowork / routines / Managed Agents, OpenAI AgentKit, Gemini Enterprise | Routine = việc định kỳ có deliverable; 20–30 USD/ghế là trần chịu đựng | Phụ thuộc một nhà cung cấp |
| Chat local | Open WebUI, AnythingLLM, LibreChat, OpenClaw | Local-first đang hồi | Loang kênh, không kiểm duyệt |
Cột “không copy” hoá ra quan trọng ngang cột “học”. Nó là bức tường ngăn tôi khỏi việc tôi giỏi nhất: thêm hệ thống.
Bài nghiên cứu đổi ý tôi
Tôi từng nghĩ council — nhiều agent tranh luận nhiều vòng — là chế độ “xịn” của Hive. Hai bài nghiên cứu nói ngược lại. The Cost of Consensus (arXiv, 05/2026) và bài về problem drift cùng thấy: tranh luận tự do giữa các model đồng nhất kém hơn tự sửa cô lập, vì các agent cùng trôi khỏi bài toán. Mẫu thắng là verifier kích hoạt theo điều kiện: một người viết, một người kiểm, và chỉ mở phiên nặng khi người kiểm bác.
Hive có cả hai hình. Rooms chạy /goal (producer, rồi checker, hai vòng) và council đủ bốn pha,
2 + 2N lời gọi cho N ghế, tối đa sáu ghế. Nghiên cứu bảo: lấy cái đầu làm mặc định, và thôi coi
cái sau là lựa chọn người lớn.
Hive có gì, thiếu gì
Đọc lại mã một cách thật lòng:
- Checker có sẵn trong
/goal;/reviewcó hai reviewer song song rồi hoà giải. - Ngân sách hai lớp: agent 5 USD, workspace 20 USD/ngày, thêm phòng, project, API key, có ledger reserve/settle.
- Trigger: cron, webhook HMAC, email/ICS poller, lịch phòng tick 30 giây, OAuth GitHub, Linear, Notion, Sentry, Cloudflare.
- Bàn giao: docx/pptx/xlsx, signoff SHA-256, Telegram ra.
- BYO endpoint:
base_urltương thích OpenAI nào cũng chạy, nên Ollama, LM Studio, vLLM đã dùng được; embedding RAG đã local vớinomic-embed-text.
Và cái thiếu, may là toàn đường ống chứ không phải kiến trúc:
- Trigger đổ vào Chat hoặc Origin, không đổ vào
/goalcủa phòng — nên việc chạy theo lịch chưa bao giờ có checker. - Checker trả văn xuôi, không phải verdict có cấu trúc, nên phía sau không rẽ nhánh được.
- Council luôn chạy đủ ba vòng dù câu dễ. Council và delegate đều đặt
_no_cache, hai chỗ tốn nhất không bao giờ trúng cache. (Tôi tưởng còn thiếucache_controlAnthropic; hoá ra gateway cli-proxy-api đã tự chèn cho Claude — báo động nhầm.) - Không webhook ra khi run xong. Chưa có Telegram vào. Không preset local, không kiểm tra sức khoẻ endpoint.
- Không có “một việc” đóng gói để chỉ cho khách.
Tính năng tôi chọn: Routine
Một Routine là một việc định kỳ, trọn đường, dưới một ngân sách tự dừng:
kích hoạt → phòng
/goal→ producer trên model rẻ/local → checker trên model mạnh → leo thang có điều kiện → deliverable + signoff → giao về kênh của nhóm
Phiên bản khách hàng nói: “mỗi sáng 8h gom ticket Linear và PR GitHub, viết brief một trang, checker soát số liệu, gửi Telegram nhóm”. Hoặc: “webhook form đơn hàng → trích xuất → đối chiếu bảng giá → xuất xlsx → chờ kế toán duyệt”.
Từng bước:
- Kích hoạt. Cron, webhook HMAC, email/ICS, sau đó Telegram vào. Payload gắn vào run làm
input có SHA-256 (
attach_inputđã có). - Sản xuất trên bậc rẻ. Producer chạy bậc thấp nhất của ladder, ưu tiên local.
route_downđang là opt-in và chỉ áp cho lần thử đầu; với Routine nó bật mặc định. - Phản biện có điều kiện. Checker chạy model mạnh,
prompt_mode=task, trả verdict JSON:pass | revise | escalate, danh sách lỗi có trích dẫn, độ tin cậy.revisethì producer nhận chỉ verdict và đoạn bị bác, không nhận lại cả bài — bớt khoảng nửa token vòng hai. Tối đa hai vòng (đã làGOAL_ROUNDS).escalatehoặc bị bác hai lần thì hai trọng tài không phải producer hay checker phán đúng các tiêu chí đang tranh cãi: mù, song song, mỗi người một lời gọi. Lỗi chỉ được xoá khi cả hai cùng nói đạt và có bằng chứng; gộp kết quả tất định, không tốn thêm lời gọi Lead. Không cross-exam. - Bàn giao. Deliverable là file trong phòng, signoff theo manifest, docgen nếu là tài liệu. Gate người duyệt là tool approver 300 giây trên Today, sau này là nút Duyệt trên Telegram.
- Giao về kênh. Telegram ra (có), thêm webhook ra
POST url {run, status, files, cost}để n8n / Make / Zapier / Google Sheet của khách nhận, và API/v1chuẩn OpenAI để tool sẵn có của họ gọi Hive. - Ngân sách tự dừng. Mỗi Routine có
budget_usdtheo tháng. Chạm trần thì tạm dừng, báo Telegram, không gọi model. Dùng lại ledger đang có.
Phép tính chi phí
Đây là toàn bộ lý lẽ, bằng số. Council sáu ghế tốn 2 + 2N = 14 lời gọi model mạnh, lần nào
cũng vậy, dù câu dễ hay khó. Routine kỳ vọng 2–3 lời gọi: một producer trên model rẻ/local,
một checker trên model mạnh, thi thoảng một lần sửa. Xấu nhất — hai lần sửa rồi leo thang lên
mini-council — khoảng 7. Phần nặng chạy trên bậc rẻ; model mạnh đọc, không viết.
Nguyên tắc tôi sẽ ghi vào tài liệu: local cho sản xuất, trích xuất, phân loại; cloud cho phán xét và phản biện. Brain của Hive (smart, graph, Origin) vẫn cần Claude và giữ nguyên. Routine không đi qua Brain.
Không làm
Danh sách này tôi viết trước khi viết danh sách việc làm, và tôi nghĩ nó đáng tiền hơn.
- Canvas kéo thả — n8n, Dify, Flowise đã thắng.
- Orchestrator thứ tư bên cạnh CrewAI, LangGraph, Agent Framework (AutoGen đã vào maintenance mode).
- 70 connector.
- Bus tin nhắn agent, presence.
- Council làm mặc định.
- Brain local.
- Marketplace, billing theo ghế, multi-tenant.
- A2A (150 tổ chức) để sau, khi có khách hỏi. Bọc Hive thành MCP server để Claude Code, Cursor, n8n gọi Routine như một tool thì làm trước.
Bỏ luôn giá 12 USD/ghế tôi từng ghi. Bán một Routine chạy được: gói triển khai self-host trên máy khách, cấu hình ba Routine đầu, phí vận hành tháng. Bằng chứng bán hàng là trang Usage cho thấy mỗi Routine tốn bao nhiêu so với chạy cloud toàn phần.
Thứ tự làm
Ba đợt, mỗi đợt khoá bằng eval trước khi sang đợt sau.
- Preset Ollama / LM Studio / vLLM có kiểm tra sức khoẻ; ladder có bậc local; trigger đích
room:/goal; webhook ra. Nghiệm thu: cron thật gọi/goalbằng Ollama, checker cloud, có file xuất, webhook ra nhận payload. - Verdict có cấu trúc và vòng sửa chỉ liệt kê tiêu chí bị bác; trọng tài khi bất đồng; bỏ
_no_cachecho delegate; delegate song song. Nghiệm thu: so token trước/sau trên 5 case eval, hits cache > 0, council hai ghế ≤ 5 lời gọi. - Telegram vào với nút Duyệt; ngân sách Routine tự dừng và báo; trang Usage theo Routine; landing bán Routine. Nghiệm thu: chạm trần → dừng, không gọi model; restore drill.
Điều tôi mang về
Tôi bắt đầu ngày hôm đó nghĩ sẽ tìm được một tính năng đối thủ có mà Hive chưa có. Kết thúc ngày với điều ngược lại: Hive đã đứng đúng bốn khe thị trường đang than — checker có sẵn, ngân sách hai lớp, một tiến trình stdlib, eval — nhưng chưa ghép chúng thành một thứ mua được. Việc cần làm không phải thêm hệ thống mà là nối đường ống và bỏ bớt lựa chọn.
Đọc ba mươi đối thủ để biết cái gì không làm, hoá ra, quan trọng bằng để biết cái gì làm.