Sáng nay, thứ Năm 2/10, có người forward cho mình một cái carousel trên LinkedIn. Chữ in đậm to đùng: “Understanding AI Agent Architecture — The Backbone of Intelligent Systems.” Ba lớp, xếp như bánh cưới. Infrastructure ở dưới, “Agentic” ở giữa, Application trên cùng. Bốn cái tên viết tắt protocol xếp hàng — MCP, A2A, ACP, ANP — trình bày như bốn món cùng loại. Cuối bài còn có câu hỏi kiểu multi-agent sẽ thay đổi tự động hoá doanh nghiệp trong 3 năm tới ra sao.
Cái khung thì không sai. Compute ở dưới, orchestration ở giữa, sản phẩm ở trên — vẽ vậy là đúng hướng. Cái thiếu là gần như mọi chi tiết khiến nó thành thứ dùng được. “Cloud Platforms (Azure, AWS, GCP)” không phải kiến trúc, đó là một dòng logo. Bốn protocol xếp ngang hàng khiến người đọc nghĩ có bốn lựa chọn thật. Một trong bốn cái đó đã chết rồi.
Lớp infrastructure thật sự đang chạy gì
Ba sản phẩm, ba cái tên, ba ngày tháng cụ thể. AWS Bedrock AgentCore lên GA ngày 13/10/2025, sau bản preview từ tháng 7 — gồm Runtime, Gateway để expose tool, Identity, Memory, Observability, và một Code Interpreter chạy sandbox; Amazon thêm hỗ trợ A2A vào tháng 11. Azure AI Foundry Agent Service lên GA ngày 19/5/2025 tại sự kiện Build, rồi được gộp vào cái tên đổi lại là Microsoft Foundry từ tháng 1 năm nay. Bên Google chia làm hai: Vertex AI Agent Builder, preview tại Cloud Next ‘24, cho hướng managed/no-code; và Agent Development Kit, mở mã nguồn theo Apache 2.0 ngày 9/4/2025, cho ai muốn tự viết Python hay Java và tự kiểm soát luồng orchestration.
Không cái nào ở đây là logo. Đó là ba cách cược khác nhau về việc bạn chịu nhường bao nhiêu quyền kiểm soát để đổi lại việc không phải tự dựng queue, retry, sandbox chạy tool. Biết mình đang cược gì trước khi chọn, quan trọng hơn là biết tên.
Hai protocol thật, một ca tử, một con bài chưa rõ
MCP — Model Context Protocol — của Anthropic, công bố 25/11/2024. Đây là spec client-server kiểu JSON-RPC: client phía LLM nói chuyện với server expose ra tool, resource, prompt theo dạng model gọi được. Đây là cái thực sự lan rộng. VS Code lên GA tháng 7/2025, Cursor có từ bản 1.0 tháng 6, và đang chạy sống trong Responses API của chính OpenAI. Ngày 9/12/2025, Anthropic giao nó cho Agentic AI Foundation mới của Linux Foundation, đồng sáng lập cùng Block và — đáng chú ý — OpenAI, với Google, Microsoft, AWS, Cloudflare, Bloomberg làm thành viên. Một protocol mà cả OpenAI và Google cùng ngồi trong hội đồng quản trị thì không còn là món đồ chơi riêng của một hãng nữa.
A2A — Agent2Agent — của Google, từ 9/4/2025. Được quảng cáo là peer-to-peer, nhưng đọc kỹ spec thì nó gần với client-agent gọi tới remote-agent hơn: một bên public một Agent Card tại đường dẫn /.well-known/agent-card.json, bên kia đọc card đó rồi giao việc. Không đối xứng như cái tên gợi ý, nhưng vẫn thật sự hữu ích cho đúng việc nó làm — để một agent giao việc cho agent khác mà nó không kiểm soát. Cũng vào Linux Foundation, ngày 23/6/2025, với AWS, Cisco, Salesforce, SAP, Microsoft, ServiceNow là thành viên sáng lập.
Hai cái này giờ đang hội tụ lại — hầu hết sản phẩm infrastructure kể trên hỗ trợ cả hai.
Rồi tới ACP. IBM Research ra một bản đầu-giữa 2025, kiểu REST bổ sung cho MCP. Sống được vài tháng. Ngày 25/8/2025 nó sáp nhập vào A2A, và repo GitHub — lúc đó hơn một nghìn star — giờ đã archive. Nếu cần một câu để chứng minh việc hợp nhất chuẩn quan trọng hơn danh sách tính năng trong mảng này, thì đây: một protocol thật, từ một lab nghiêm túc, chết trong chưa đầy một năm, vì thị trường không cần ba cách làm agent handoff.
ANP — Agent Network Protocol — là code thật, khoảng 1.400 star trên GitHub, xây quanh identity phân tán (did:wba) để agent tìm nhau. Không có consortium đứng sau, một nhóm maintainer nhỏ, và các bài phân tích độc lập mô tả nó “ảnh hưởng quốc tế yếu” so với A2A. Có thể nó sẽ đi xa hơn. Nhưng chưa, tính tới lúc này. Xếp nó ngang MCP và A2A trên một slide là đang gợi ý một sự ngang hàng chưa tồn tại.
(FIPA Agent Communication Language, từ 2002, là một cái tên viết tắt ACP khác hay bị nhầm với bản của IBM. Đây là spec speech-act từ trước thời LLM, vẫn được một working group của IEEE duy trì. Lịch sử thú vị, nhưng không liên quan gì tới cái bạn sẽ xây năm nay.)
Lớp giữa mới là nơi đang có tranh luận thật
“Agent A xử lý task, Agent B tự động hoá, Agent C orchestration” là một cái sơ đồ, không phải một quyết định. Đây là thứ người ta đang thực sự chọn giữa, tính tới tháng này.
LangGraph lên bản 1.0 tháng 10/2025 và có case study thật đứng sau: Replit dùng nó trong production, ghi rõ trên trang customer của LangChain. CrewAI cũng lên GA tháng 10/2025 và có một case study với PwC đang lan truyền — nhưng do chính vendor công bố, không có báo độc lập xác nhận, nên đọc với một chút dè dặt. AutoGen của Microsoft chuyển sang chế độ maintenance từ tháng 10/2025, bị thay trên roadmap chính thức bởi Agent Framework mới; team gốc của AutoGen tách ra và tiếp tục mã nguồn mở dưới tên AG2. OpenAI ra Agents SDK tháng 3/2025 — mình tìm một case production được xác nhận độc lập và không thấy, không có nghĩa là không có ai dùng, chỉ là chưa ai viết ra. Claude Agent SDK của Anthropic, đổi tên từ Claude Code SDK ngày 29/9/2025, có case study mạnh nhất trong năm cái: Spotify xây một công cụ nội bộ tên Honk trên nền này, và cả blog kỹ thuật của Spotify lẫn trang customer của Anthropic đều độc lập nêu cùng một số — hơn 650 pull request do agent tạo ra mỗi tháng.
Nếu phải chọn học cái nào trước, dựa trên việc ai đã thật sự ship cái gì và cho mình đọc số liệu, mình chọn LangGraph hoặc Claude Agent SDK. Không phải vì ba cái còn lại tệ — mà vì ba cái đó hiện đang chỉ có một con số do vendor tự công bố, một thông báo chuyển sang maintenance, hoặc sự im lặng.
Trông ra sao khi xây thật, kèm số liệu thật
Anthropic công bố bản mô tả từ-gốc-tới-ngọn rõ nhất mình từng đọc về cái hộp ở giữa thực ra chứa gì, một khi không còn vẽ nó bằng một hình tròn nữa: “How we built our multi-agent research system”. Một agent Opus 4 đóng vai lead đọc câu hỏi, chia thành subtask, rồi khởi tạo các subagent Sonnet 4 chạy song song — mỗi subagent có context window riêng, một mục tiêu rõ ràng, một format output bắt buộc, và hướng dẫn tool cụ thể để không đi lạc. Tool được expose qua MCP. Subagent ghi kết quả trung gian ra bộ nhớ ngoài trước khi chạm ngưỡng khoảng 200K token của context riêng, và một CitationAgent riêng xử lý trích nguồn ở cuối, để logic trích dẫn không phải tranh context với logic nghiên cứu.
Số họ công bố: +90.2% so với baseline một-agent trên eval nội bộ, khoảng 15 lần chi phí token của một cuộc chat đơn, và giảm tới 90% thời gian thực tế cho các task nghiên cứu mà phần việc thực sự chia song song được. Cái đánh đổi cuối cùng đó gói trong một câu: bạn chi 15 lần token để mua lại 90% thời gian, và cái đổi đó chỉ hợp lý khi có người đang ngồi chờ câu trả lời.
Phần không infographic nào nhắc tới: không phải lúc nào cũng chạy
Trợ lý support chạy OpenAI của Klarna là case study lớp application ai cũng trích dẫn — 2,3 triệu cuộc hội thoại mỗi tháng, theo bài viết tháng 2/2024 của chính OpenAI, làm việc tương đương khoảng 700 nhân viên full-time. Cái bị cắt khỏi slide: CEO Klarna nói với Bloomberg và Reuters vào tháng 5/2025 rằng chất lượng support đã tụt, và công ty quay lại tuyển người. Cùng một hệ thống, cùng một công ty, cách nhau mười bốn tháng, hai câu chuyện hoàn toàn khác nhau — mà bản infographic chỉ bao giờ trích câu đầu.
Đây không phải lý do để không xây cái này. Đây là lý do để đừng tin bất kỳ số liệu deploy nào — kể cả những số trong bài này — cho tới khi thấy nó còn đứng được sau một năm.
Series này đi tiếp đâu
Bài này là bản đồ. Bài tiếp theo là mình thật sự nối một agent nhỏ qua MCP với một orchestrator thật — chắc là LangGraph, vì đó là cái có case study production mình trỏ được vào — và công bố cái gì hỏng, kèm code. Không phải một sơ đồ vẽ lại. Một repo.