Tôi tự host một nền tảng agent tên Hive: Python thuần thư viện chuẩn, SQLite, frontend Preact không cần build, chạy một tiến trình trên một container Proxmox. Nó đã có phòng cho nhiều agent nói chuyện với nhau, council phản biện, cron, webhook, ngân sách, eval. Nói thật là nó có nhiều thứ. Câu hỏi tôi chưa trả lời được là: nếu một nhóm năm người muốn mua nó, họ mua cái gì?

Ngày 18/09 tôi dành trọn một ngày đọc đối thủ để trả lời câu đó. Khoảng ba mươi sản phẩm, chia sáu nhóm. Đọc bảng giá, đọc than phiền trên G2, Reddit, Hacker News, đọc luôn hai bài nghiên cứu về multi-agent debate. Rồi đọc lại mã của chính mình — flows.py, rooms.py, llm.py, triggers.py — để không tự dối về cái Hive đang có.

Kết quả gọn hơn tôi tưởng.

Kết luận trước

Thị trường 2026 không trả tiền cho orchestration. Lõi mã nguồn mở ở đâu cũng miễn phí: n8n, Dify, CrewAI, LangGraph, Paperclip. Không ai còn trả tiền để được “nối agent với nhau”. Người ta trả cho một việc lặp lại chạy đúng, có người duyệt, không vỡ hoá đơn.

Bốn lời than lớn nhất, lặp lại ở mọi nơi:

  1. Chi phí bất ngờ. Zapier 1.4 sao trên Trustpilot, phần lớn vì hoá đơn (than phiền về Zapier Agents). Credit của Lindy mờ. Make tính 50 credit mỗi lượt agent.
  2. Agent giòn. CrewAI có hẳn thread hỏi cách chặn vòng lặp vô hạn ngốn token. n8n rò bộ nhớ ở AI Agent node. LangGraph có chuỗi lỗ hổng self-host hồi tháng 6.
  3. Không ai kiểm tra đầu ra. Đây là lời than ít ồn nhất nhưng đau nhất. Human-in-the-loop, nếu có, là gate ở mức tool call (n8n 2.6 HITL tools), không phải một model thứ hai đọc bản giao và nói số liệu đúng hay sai.
  4. Tự host khó. Dify, LibreChat là một chồng container (review Dify sau 6 tháng). Open WebUI đổi giấy phép. OpenClaw lộ 21k instance ra internet.

Hai tín hiệu nữa cho tôi biết sàn và trần. OpenAI đóng AgentKit ngày 30/11/2026 (nguồn) — orchestrator đóng của nhà cung cấp lớn nhất không sống qua một năm. Còn Paperclip lên 30k sao GitHub trong ba tuần nhờ đúng một ý: tổ chức agent như org chart, mỗi agent có ngân sách, chạm 100 % thì tự dừng. Người ta không thiếu framework. Người ta muốn biết hoá đơn sẽ dừng ở đâu.

Bảng đối thủ (rút gọn)

NhómAiHọc được gìKhông copy
Canvas no-coden8n, Dify, Flowise, Langflow, Make, Zapier AgentsHITL ở mức tool; webhook/cron/Slack là chuẩn; Dify hiện chi phí từng runCanvas. Họ đã thắng; Hive ghép việc bằng Rooms, không vẽ node
Framework devCrewAI, LangGraph, Agent Framework (AutoGen), Agno, MastraLead ghi sổ và re-plan (Hive đã có board); suspend/resumeOrchestrator thứ tư
”Nhân viên AI” SaaSLindy, Relevance, GumloopGiá theo bậc model; manager agentCredit mờ, luôn bật
Control planePaperclip, Block Buzz, OdysseusNgân sách theo agent tự dừng; agent như org chartRuntime-agnostic mọi thứ
Vendor đóngClaude Cowork / routines / Managed Agents, OpenAI AgentKit, Gemini EnterpriseRoutine = việc định kỳ có deliverable; 20–30 USD/ghế là trần chịu đựngPhụ thuộc một nhà cung cấp
Chat localOpen WebUI, AnythingLLM, LibreChat, OpenClawLocal-first đang hồiLoang kênh, không kiểm duyệt

Cột “không copy” hoá ra quan trọng ngang cột “học”. Nó là bức tường ngăn tôi khỏi việc tôi giỏi nhất: thêm hệ thống.

Bài nghiên cứu đổi ý tôi

Tôi từng nghĩ council — nhiều agent tranh luận nhiều vòng — là chế độ “xịn” của Hive. Hai bài nghiên cứu nói ngược lại. The Cost of Consensus (arXiv, 05/2026) và bài về problem drift cùng thấy: tranh luận tự do giữa các model đồng nhất kém hơn tự sửa cô lập, vì các agent cùng trôi khỏi bài toán. Mẫu thắng là verifier kích hoạt theo điều kiện: một người viết, một người kiểm, và chỉ mở phiên nặng khi người kiểm bác.

Hive có cả hai hình. Rooms chạy /goal (producer, rồi checker, hai vòng) và council đủ bốn pha, 2 + 2N lời gọi cho N ghế, tối đa sáu ghế. Nghiên cứu bảo: lấy cái đầu làm mặc định, và thôi coi cái sau là lựa chọn người lớn.

Hive có gì, thiếu gì

Đọc lại mã một cách thật lòng:

  • Checker có sẵn trong /goal; /review có hai reviewer song song rồi hoà giải.
  • Ngân sách hai lớp: agent 5 USD, workspace 20 USD/ngày, thêm phòng, project, API key, có ledger reserve/settle.
  • Trigger: cron, webhook HMAC, email/ICS poller, lịch phòng tick 30 giây, OAuth GitHub, Linear, Notion, Sentry, Cloudflare.
  • Bàn giao: docx/pptx/xlsx, signoff SHA-256, Telegram ra.
  • BYO endpoint: base_url tương thích OpenAI nào cũng chạy, nên Ollama, LM Studio, vLLM đã dùng được; embedding RAG đã local với nomic-embed-text.

Và cái thiếu, may là toàn đường ống chứ không phải kiến trúc:

  • Trigger đổ vào Chat hoặc Origin, không đổ vào /goal của phòng — nên việc chạy theo lịch chưa bao giờ có checker.
  • Checker trả văn xuôi, không phải verdict có cấu trúc, nên phía sau không rẽ nhánh được.
  • Council luôn chạy đủ ba vòng dù câu dễ. Council và delegate đều đặt _no_cache, hai chỗ tốn nhất không bao giờ trúng cache. (Tôi tưởng còn thiếu cache_control Anthropic; hoá ra gateway cli-proxy-api đã tự chèn cho Claude — báo động nhầm.)
  • Không webhook ra khi run xong. Chưa có Telegram vào. Không preset local, không kiểm tra sức khoẻ endpoint.
  • Không có “một việc” đóng gói để chỉ cho khách.

Tính năng tôi chọn: Routine

Một Routine là một việc định kỳ, trọn đường, dưới một ngân sách tự dừng:

kích hoạt → phòng /goal → producer trên model rẻ/local → checker trên model mạnh → leo thang có điều kiện → deliverable + signoff → giao về kênh của nhóm

Phiên bản khách hàng nói: “mỗi sáng 8h gom ticket Linear và PR GitHub, viết brief một trang, checker soát số liệu, gửi Telegram nhóm”. Hoặc: “webhook form đơn hàng → trích xuất → đối chiếu bảng giá → xuất xlsx → chờ kế toán duyệt”.

Từng bước:

  1. Kích hoạt. Cron, webhook HMAC, email/ICS, sau đó Telegram vào. Payload gắn vào run làm input có SHA-256 (attach_input đã có).
  2. Sản xuất trên bậc rẻ. Producer chạy bậc thấp nhất của ladder, ưu tiên local. route_down đang là opt-in và chỉ áp cho lần thử đầu; với Routine nó bật mặc định.
  3. Phản biện có điều kiện. Checker chạy model mạnh, prompt_mode=task, trả verdict JSON: pass | revise | escalate, danh sách lỗi có trích dẫn, độ tin cậy. revise thì producer nhận chỉ verdict và đoạn bị bác, không nhận lại cả bài — bớt khoảng nửa token vòng hai. Tối đa hai vòng (đã là GOAL_ROUNDS). escalate hoặc bị bác hai lần thì hai trọng tài không phải producer hay checker phán đúng các tiêu chí đang tranh cãi: mù, song song, mỗi người một lời gọi. Lỗi chỉ được xoá khi cả hai cùng nói đạt và có bằng chứng; gộp kết quả tất định, không tốn thêm lời gọi Lead. Không cross-exam.
  4. Bàn giao. Deliverable là file trong phòng, signoff theo manifest, docgen nếu là tài liệu. Gate người duyệt là tool approver 300 giây trên Today, sau này là nút Duyệt trên Telegram.
  5. Giao về kênh. Telegram ra (có), thêm webhook ra POST url {run, status, files, cost} để n8n / Make / Zapier / Google Sheet của khách nhận, và API /v1 chuẩn OpenAI để tool sẵn có của họ gọi Hive.
  6. Ngân sách tự dừng. Mỗi Routine có budget_usd theo tháng. Chạm trần thì tạm dừng, báo Telegram, không gọi model. Dùng lại ledger đang có.

Phép tính chi phí

Đây là toàn bộ lý lẽ, bằng số. Council sáu ghế tốn 2 + 2N = 14 lời gọi model mạnh, lần nào cũng vậy, dù câu dễ hay khó. Routine kỳ vọng 2–3 lời gọi: một producer trên model rẻ/local, một checker trên model mạnh, thi thoảng một lần sửa. Xấu nhất — hai lần sửa rồi leo thang lên mini-council — khoảng 7. Phần nặng chạy trên bậc rẻ; model mạnh đọc, không viết.

Nguyên tắc tôi sẽ ghi vào tài liệu: local cho sản xuất, trích xuất, phân loại; cloud cho phán xét và phản biện. Brain của Hive (smart, graph, Origin) vẫn cần Claude và giữ nguyên. Routine không đi qua Brain.

Không làm

Danh sách này tôi viết trước khi viết danh sách việc làm, và tôi nghĩ nó đáng tiền hơn.

  • Canvas kéo thả — n8n, Dify, Flowise đã thắng.
  • Orchestrator thứ tư bên cạnh CrewAI, LangGraph, Agent Framework (AutoGen đã vào maintenance mode).
  • 70 connector.
  • Bus tin nhắn agent, presence.
  • Council làm mặc định.
  • Brain local.
  • Marketplace, billing theo ghế, multi-tenant.
  • A2A (150 tổ chức) để sau, khi có khách hỏi. Bọc Hive thành MCP server để Claude Code, Cursor, n8n gọi Routine như một tool thì làm trước.

Bỏ luôn giá 12 USD/ghế tôi từng ghi. Bán một Routine chạy được: gói triển khai self-host trên máy khách, cấu hình ba Routine đầu, phí vận hành tháng. Bằng chứng bán hàng là trang Usage cho thấy mỗi Routine tốn bao nhiêu so với chạy cloud toàn phần.

Thứ tự làm

Ba đợt, mỗi đợt khoá bằng eval trước khi sang đợt sau.

  1. Preset Ollama / LM Studio / vLLM có kiểm tra sức khoẻ; ladder có bậc local; trigger đích room:/goal; webhook ra. Nghiệm thu: cron thật gọi /goal bằng Ollama, checker cloud, có file xuất, webhook ra nhận payload.
  2. Verdict có cấu trúc và vòng sửa chỉ liệt kê tiêu chí bị bác; trọng tài khi bất đồng; bỏ _no_cache cho delegate; delegate song song. Nghiệm thu: so token trước/sau trên 5 case eval, hits cache > 0, council hai ghế ≤ 5 lời gọi.
  3. Telegram vào với nút Duyệt; ngân sách Routine tự dừng và báo; trang Usage theo Routine; landing bán Routine. Nghiệm thu: chạm trần → dừng, không gọi model; restore drill.

Điều tôi mang về

Tôi bắt đầu ngày hôm đó nghĩ sẽ tìm được một tính năng đối thủ có mà Hive chưa có. Kết thúc ngày với điều ngược lại: Hive đã đứng đúng bốn khe thị trường đang than — checker có sẵn, ngân sách hai lớp, một tiến trình stdlib, eval — nhưng chưa ghép chúng thành một thứ mua được. Việc cần làm không phải thêm hệ thống mà là nối đường ống và bỏ bớt lựa chọn.

Đọc ba mươi đối thủ để biết cái gì không làm, hoá ra, quan trọng bằng để biết cái gì làm.

Xuất nội dung

Bình luận