Cần nói rõ ràng ngay từ đầu về việc này, vì tiêu đề báo chí khiến nó nghe như một tính năng của Anthropic — nhưng không phải. Ollama v0.33.0 (ra mắt khoảng 21-22/8/2026) thêm một nút bật, chuyển hướng các cuộc gọi model của Claude Desktop sang các model mở chạy local (hoặc trên Ollama-cloud) — Qwen, DeepSeek, Kimi và vài model khác. Đây không phải MCP server, và Anthropic không phải bên xây dựng nó. Ollama tự làm một proxy local riêng, giả lập một “gateway bên thứ ba” mà Claude Desktop vốn đã biết cách nói chuyện cùng — cụ thể là để lách qua việc Claude Desktop từ chối thẳng thừng mọi model ID không phải của Anthropic, chính bức tường đã khiến lần thử tích hợp đầu tiên của Ollama vài tháng trước thất bại. Hiểu rằng toàn bộ phần “ống dẫn” nằm ở phía Ollama là điều quan trọng, vì nó cho biết bạn nên nhìn vào đâu khi có sự cố (spoiler: đã có rồi).

Cách bật thực tế

Toàn bộ được điều khiển qua UI, đúng hướng cho việc phổ biến rộng, nhưng vẫn đáng đi qua một lượt: mở app Ollama trên desktop, vào mục Apps, bật công tắc Claude. Ollama sẽ tự cấu hình cài đặt gateway của Claude Desktop ở phía sau — không cần sửa JSON tay, không cần đụng file config. Sau đó trong chính phần settings của Claude Desktop, bạn chọn model local muốn dùng, khởi động lại, và thế là bạn đang nói chuyện với một model chạy hoàn toàn trên máy mình (hoặc tier cloud của Ollama, cho các model quá lớn để chạy local) ngay trong giao diện Claude Desktop. Trên Mac có một control ở thanh menu để chuyển qua lại giữa local và cloud Claude ngay trong một cuộc hội thoại. Muốn tắt thì gạt công tắc hoặc chạy ollama launch claude-desktop --restore. Hiện tại chỉ hỗ trợ desktop — Claude Code CLI chưa được nối vào — và hỗ trợ Windows đang “sắp ra mắt,” nên nếu bạn dùng Windows thì đây là mục cần chờ, chưa phải dùng ngay được.

Danh sách model thực tế

Danh sách được hỗ trợ tính đến bản này: Qwen (qwen3, qwen3.5, qwen3.8:27b khoảng 18GB ở lượng tử hóa Q4_K_M với context window 256K, qwen2.5-coder, qwen3-coder:30b), DeepSeek (deepseek-r1 chạy local được; deepseek-v4-flash chỉ chạy cloud, context 1M token, 284B tham số tổng nhưng chỉ 13B active mỗi lần nhờ định tuyến MoE), và Kimi (kimi-k2.6, chỉ cloud, context 256K, đa phương thức). GLM-5.2 có được nhắc tới trong release note chung của Ollama nhưng chưa xác nhận rõ ràng là đã nối vào tích hợp Claude Desktop cụ thể này — nên kiểm tra lại danh sách model Ollama local của bạn trước khi giả định nó xuất hiện trong bộ chọn.

Đánh đổi, kèm số liệu thực tế

Đây là phần quan trọng để quyết định có dùng nghiêm túc hay chỉ để thử cho vui. Suy luận local trên phần cứng phổ thông đạt khoảng 15-25 token/giây, so với 60-80+ token/giây của cloud Claude — chậm hơn rõ rệt nhưng không đến mức khó chịu cho một câu trả lời đơn lẻ. Độ trễ mới là khoảng cách lớn hơn: 10-60 giây cho sinh nội dung local so với 2-5 giây trên cloud, điều này thay đổi hẳn cảm giác khi dùng, đặc biệt là giữa chừng một cuộc hội thoại. Độ tin cậy khi gọi tool là con số mình thực sự để ý nếu định giao việc thật cho nó: các model mở đạt khoảng 85-90% độ tin cậy trên tác vụ coding thông thường so với cloud Claude, và khoảng cách này nới rộng đáng kể với tác vụ nhiều bước phức tạp, refactor lớn, và khả năng tự phục hồi khi gặp lỗi — đúng những kịch bản mà bạn muốn một agent không cần trông chừng. Một số tính năng cũng bị thiếu: Connectors và web search được báo là không dùng được ở một số cấu hình model local lúc mới ra mắt.

Điểm cộng: Ollama tuyên bố chính sách Zero Data Retention nghiêm ngặt, telemetry tắt mặc định — đây mới thực sự là lý do để chọn giải pháp này thay vì cloud Claude cho một phần công việc, không phải vì tốc độ mà vì quyền riêng tư và chi phí. Không tốn API cho bất cứ thứ gì chạy local, hoạt động offline/air-gapped, và đáp ứng được yêu cầu lưu trữ dữ liệu tại chỗ mà API cloud không thể.

Một lỗi đang tồn tại, nên biết trước khi demo cho team

Issue GitHub ollama/ollama#15992 ghi nhận tính năng Cowork của Claude Desktop phát hiện đúng 39 model từ endpoint /v1/models của gateway Ollama, nhưng sau đó lại báo “0 usable models” và âm thầm quay về model mặc định cứng “Legacy Model” (claude-sonnet-4-6) — không hiện lỗi nào cho người dùng thấy. Nếu bạn bật tính năng này và thấy Claude Desktop có vẻ phớt lờ lựa chọn model của mình, hãy kiểm tra xem liệu bạn có đang thực sự vẫn nói chuyện với cloud Claude trước khi kết luận setup local của mình bị hỏng. Đây là kiểu lỗi âm thầm dễ làm mất niềm tin của team nếu họ gặp phải mà không biết đây là lỗi đã được biết đến.

Chỗ đứng thực sự của tính năng này trong quy trình làm việc

Nhận định thật lòng của mình: đây là một lựa chọn mặc định tốt cho việc định tuyến theo loại tác vụ, chứ chưa phải thứ thay thế cloud Claude. Dùng model local như Qwen hay DeepSeek cho việc thường ngày, ít rủi ro — code lặp lại (boilerplate), tra cứu nhanh, bất cứ thứ gì mà gọi sai tool chỉ đơn giản là thử lại — và giữ cloud Claude cho các refactor nhiều bước và bất cứ thứ gì đụng đến dữ liệu khách hàng mà bạn vốn dĩ cũng không muốn rời khỏi máy. Nút chuyển đổi trong cùng một giao diện mới thực sự là phần hữu ích ở đây; bắt kỹ sư chuyển qua lại giữa hai app riêng biệt cho “việc rẻ” và “việc khó” là một loại ma sát không ai duy trì nổi lâu dài. Chỉ đừng triển khai cho cả team với kỳ vọng model local sánh ngang cloud Claude trong công việc agentic phức tạp — con số về độ tin cậy gọi tool cho thấy chưa đến mức đó, và lỗi âm thầm quay về model mặc định nghĩa là ticket “sao cái này không dùng model local của tôi” đầu tiên có lẽ đã có người report ở đâu đó rồi.

Nguồn: The New Stack — Ollama’s Claude Desktop integration, Ollama Blog, Ollama Docs

Xuất nội dung

Bình luận