Trang giá Fable 5.1 của Anthropic có một con số nhìn rất đẹp trên slide: cache read giảm từ $1 xuống $0.25 mỗi triệu token, cắt 75%. Con số PR đi kèm là tiết kiệm tới 45% cho workload agentic nặng. Rồi Artificial Analysis tự chạy số của họ và báo cáo ngược lại cho các task chạy ở max effort: đắt hơn 20% mỗi task so với Fable 5, vì Fable 5.1 sinh ra nhiều hơn khoảng 1.7 lần output token để đạt kết quả đó.

Cả hai con số đều đúng. Chúng chỉ đang mô tả hai kiểu workload khác nhau. Mình dành một buổi chiều chạy log token của agent loop bên mình qua cả hai kịch bản để xem câu chuyện nào áp dụng cho mình, và đáng để đi qua từng bước vì phép tính này áp dụng được cho bất kỳ agent nào bạn đang chạy.

Vì sao cùng một đợt giảm giá có thể tiết kiệm hoặc làm bạn tốn thêm tiền

Giá input và output token của Fable 5.1 vẫn là $10/M và $50/M — y hệt Fable 5, không đổi. Toàn bộ câu chuyện giá nằm ở hai chỗ: cache read giảm 4 lần, và model có xu hướng “suy nghĩ” lâu hơn, nghĩa là nhiều output token hơn cho mỗi task.

Với một agent loop, hai hiệu ứng này kéo theo hai hướng ngược nhau:

  • Cache read tỉ lệ theo số lượt. Mỗi lượt trong một vòng chạy agentic dài đều gửi lại system prompt, tool definition, lịch sử hội thoại. Nếu phần lớn cái đó được cache, cắt 75% giá cache read nhân trực tiếp vào dòng chi phí lớn nhất của bạn.
  • Output token tỉ lệ theo độ sâu suy luận. Một model “nghĩ nhiều hơn” mỗi lượt đốt qua mức giá $50/M output nhanh hơn, và ở mức 1.7 lần khối lượng output, đó không phải là số lẻ — nó có thể vượt hẳn phần tiết kiệm từ cache.

Hiệu ứng nào thắng phụ thuộc hoàn toàn vào hình dạng vòng lặp của bạn: bao nhiêu lượt, bao nhiêu phần trong mỗi prompt cache được, và model nói dài đến mức nào ở effort level bạn đang chạy.

Chạy số trên chính vòng lặp của mình

Mình lấy log từ một agent nội bộ — bot review code, chạy khoảng 15 lượt gọi tool mỗi PR, với system prompt cộng tool schema khoảng 8.000 token giống hệt nhau ở mọi lượt (ứng viên cache kinh điển).

Trước (Fable 5, effort chuẩn), mỗi lần review PR:

  • Cache read: 14 lượt × 8.000 token × $1/M = $0.112
  • Output: ~15 lượt × trung bình 600 token × $50/M = $0.45
  • Tổng cache + output: ~$0.56

Sau (Fable 5.1, effort chuẩn), mỗi lần review PR:

  • Cache read: 14 lượt × 8.000 token × $0.25/M = $0.028
  • Output: 15 lượt × trung bình 600 token (effort chuẩn không kích hoạt mức tăng 1.7 lần mà Artificial Analysis đo được ở max effort) × $50/M = $0.45
  • Tổng cache + output: ~$0.48

Với mình đó là giảm 14% — có thật, nhưng còn xa con số “tới 45%” trên headline, vì khối lượng output mỗi lượt của mình không đổi ở effort chuẩn. Cả con số 45% lẫn con số đắt hơn 20% đều là trường hợp biên: một cái giả định chi phí cache read chiếm phần lớn hóa đơn của bạn (đúng với vòng lặp dài, output nhỏ rẻ), cái kia giả định bạn chạy ở max effort, nơi chuỗi suy luận dài hơn của model ăn hết phần tiết kiệm (đúng với các task suy luận khó, prompt ngắn).

Bot review code của mình nằm ở giữa: tái sử dụng cache vừa phải, output vừa phải. Bài học không phải là “bạn cũng sẽ tiết kiệm 14%” — mà là bạn phải tự chạy log của mình qua phép tính này, vì benchmark của vendor và workload của bạn rất có thể có hình dạng khác nhau hoàn toàn.

Điều thực sự quan trọng khi đánh giá lại một lần đổi model

Vài điều mình muốn nói với bất kỳ tech lead nào sắp đổi version model trên production:

Tách các lượt theo effort level trước khi tính trung bình bất cứ thứ gì. Nếu bạn route một số call ở effort chuẩn và nâng lên max effort cho case khó — kiểu tiered-routing mà đa số chúng ta đang chạy — thì một con số trung bình gộp qua các effort level sẽ giấu mất hẳn phần chi phí tăng vọt ở max effort. Lấy log theo từng effort tier, đừng lấy theo model.

Tỉ lệ cache hit quan trọng hơn giá cache. Giảm 75% giá cache read chẳng có ý nghĩa gì nếu system prompt của bạn đổi ở mọi lượt, làm cache bị invalidate. Kiểm tra tỉ lệ cache hit thực tế trước khi giả định mức giảm giá áp dụng cho mình. Bên mình tỉ lệ trên 90% vì tool schema và system prompt cố định; một bot có system prompt sinh động theo từng request sẽ gần như không hưởng lợi gì từ đợt giảm giá này.

Mức tăng output token cộng dồn theo các vòng tự sửa lỗi. Nếu agent của bạn có retry hoặc tự sửa — bên mình có, trung bình hai lần mỗi PR khi static analysis phát hiện vấn đề — thì hệ số nhân 1.7 lần output ở max effort áp dụng cho mọi lần retry, không chỉ lượt đầu. Đây chính là chỗ “đắt hơn 20%” có thể biến thành 35% hay 40% với workload nặng retry.

Kết quả cuối cùng bên mình

Mình giữ Fable 5.1 ở effort chuẩn cho bot review code — phần tiết kiệm 14% là có thật và gợi ý của model tốt lên rõ rệt, điều đó quan trọng với mình hơn vài xu mỗi PR. Mình tạm chưa nâng bất kỳ agent research nào đang chạy max effort lên Fable 5.1, cho đến khi chạy được cùng phép phân tích log này trên các vòng lặp đó — vì đó đúng là loại workload mà con số đắt hơn 20% của Artificial Analysis nhiều khả năng cũng là con số của mình.

Điểm lớn hơn: các công bố giá của vendor mô tả một mức trung bình qua các workload mà chẳng ai thực sự chạy. Hóa đơn của bạn là trung bình của workload bạn, không phải của họ. Kéo log của bạn ra trước khi tin bất kỳ headline nào.

Xuất nội dung

Bình luận