Mario Rodriguez, Chief Product Officer của GitHub, nói thẳng trong release notes của Anthropic: Claude Opus 5.5 “giải được nhiều terminal task hơn Opus 5, với chưa tới một nửa số bước.” Đây là kiểu quote chỉ có được từ người đã thực sự chạy model trên workload thật trước khi công bố, không phải người đọc spec sheet. Vài phút sau khi Anthropic đăng quote đó hôm 22/9, OpenAI ra mắt hai model của riêng mình — GPT-6 Sol và GPT-6 Luna — và không bên nào cố thắng cùng một cuộc đua.
Hai bản release, cùng một buổi sáng, hai bài toán khác nhau
Nước đi giá của Anthropic với Opus 5.5 là một đợt cắt thẳng: input token giảm từ $5 xuống $4 mỗi triệu, output từ $25 xuống $20 mỗi triệu so với Opus 5, và cache reads giảm từ $0.50 xuống $0.20 — cắt 60% ở đúng chỗ quan trọng nhất với các agent loop cứ phải đọc lại cùng một context window. Anthropic gọi đây là mức giảm chi phí 40% trên workload điển hình, và bảng benchmark chứng minh vì sao: Terminal-Bench 4.0 tăng từ 52.3% lên 66.4%, OSWorld 2.0 từ 74.0% lên 81.8%, còn trên GDPval-AA (điểm Elo chất lượng agent của Anthropic) Opus 5.5 đạt 1846 so với 1708 của Opus 5 — vượt cả Fable 5.1 (1735) lẫn GPT-6 Astra (1542) trên cùng bảng.
Câu trả lời của OpenAI không phải một model, mà là hai, và khoảng cách giá giữa chúng cho biết chính xác mỗi model nhắm vào ai. Sol: $2 input / $10 output mỗi triệu token, nhắm vào “công việc coding và agent lặp lại thường xuyên” — 33.2% trên AutomationBench với 27 cent mỗi task hoàn thành, 68.8% trên các benchmark kỹ thuật phần mềm. Luna: mười cent input, năm mươi cent output — rẻ hơn Sol tới hai bậc độ lớn — dành cho “công việc khối lượng lớn, lặp đi lặp lại như tóm tắt và trích xuất.” Chính OpenAI khẳng định Luna, khi chạy ở mức effort cao hơn, đạt chất lượng ngang model tiền nhiệm “với chi phí chỉ bằng khoảng một phần trăm.” Cả hai model đều có giá bằng một nửa model tiền nhiệm.
Đọc hình dạng của bảng giá, đừng chỉ nhìn con số đầu tiên
Đặt bốn con số cạnh nhau, chiến lược của mỗi bên hiện rõ: Anthropic cắt giá flagship 20-40% và dồn phần biên lợi nhuận tiết kiệm được vào việc giảm số bước mỗi task. OpenAI chia dòng sản phẩm thành một model tầm trung cho agent và một model xử lý hàng loạt gần như miễn phí, đặt cược rằng phần lớn lưu lượng token trong production giống công việc của Luna — tóm tắt cái này, trích xuất cái kia — chứ không phải một phiên debug 38 prompt. Anthropic đang tối ưu 10% lưu lượng đắt đỏ nhất. OpenAI vừa biến 90% lưu lượng rẻ tiền thành gần như miễn phí.
Đối chiếu với traffic thật của bạn, đừng chỉ tin benchmark của hãng
Benchmark thực sự nên thay đổi cấu hình routing của bạn không phải là độ chính xác — mà là chi phí trên mỗi task hoàn thành, và con số đó chỉ hiện ra khi bạn replay chính traffic đã ghi lại của mình qua từng mức giá:
def cost_per_task(runs, price_in, price_out):
total_in = sum(r["input_tokens"] for r in runs)
total_out = sum(r["output_tokens"] for r in runs)
return ((total_in / 1_000_000 * price_in) +
(total_out / 1_000_000 * price_out)) / len(runs)
opus_5 = cost_per_task(runs, price_in=5, price_out=25)
opus_5_5 = cost_per_task(runs, price_in=4, price_out=20)
gpt6_sol = cost_per_task(runs, price_in=2, price_out=10)
gpt6_luna = cost_per_task(runs, price_in=0.10, price_out=0.50)
Hãy chạy traffic agent thật của bạn qua cả bốn mức giá trước khi chọn một model để chuẩn hóa. Workload nặng về các cuộc gọi trích xuất ngắn sẽ khiến Luna trông rẻ đến phi lý và Opus 5.5 trông lãng phí; workload chủ yếu là công việc agent nhiều bước dạng terminal hoặc coding sẽ cho kết quả ngược lại, vì lợi thế ít-bước-hơn-mỗi-task của Opus 5.5 cộng dồn đúng ở chỗ Luna cần gấp ba lần số lần thử lại mới ra câu trả lời tương đương.
Tôi sẽ route traffic thế nào
Nếu traffic production của bạn là một hỗn hợp — và hầu như ai cũng vậy — nước đi thành thật không phải là chọn một người thắng cuộc, mà là xây một bộ router. Đẩy các cuộc gọi ngắn, ít mơ hồ (phân loại, trích xuất, tóm tắt) sang thứ có giá kiểu Luna, và để dành ngân sách tầm Opus cho những cuộc gọi mà con số của GitHub thực sự đúng: ít bước hơn, ít làm lại hơn, ít rework hơn. Sean Heintz của Clio mô tả đúng mẫu hình này từ phía người dùng — “so với Opus 5, nó đạt các mốc nhanh hơn và cần rất ít phải làm lại” — còn Harley Barnes của Quantium đưa ra một con số cụ thể: một task phức tạp trước đây mất 38 prompt trong bốn ngày, giờ chỉ còn 11 prompt trong ba giờ. Đó không phải là một bảng benchmark, đó là một tuần làm việc thật của cả team được rút ngắn lại. Bộ router hai tầng quyết định loại cuộc gọi nào đi kèm mức giá nào đáng đầu tư công sức kỹ thuật quý này hơn là cuộc tranh cãi nên chuẩn hóa theo flagship của hãng nào.
Nguồn: Anthropic — Claude Opus 5.5, SiliconANGLE — Anthropic releases Claude Opus 5.5 and OpenAI counters with two cheaper GPT-6 models, The New Stack — OpenAI GPT-6 Sol Luna release