Simon Willison chia sẻ một biểu đồ tuần này từ chính bên trong đội research của OpenAI, và đây là một trong những data point trung thực nhất mình từng thấy về việc các công cụ agentic coding thực sự được adopt như thế nào — vì đây là telemetry nội bộ, không phải case study từ vendor. Nó theo dõi chi tiêu AI hàng ngày trên mỗi researcher, và hình dạng của đường cong nói nhiều hơn bất kỳ khảo sát tỷ lệ adoption nào.
Đến hết tháng 2/2026, chi tiêu hàng ngày mỗi researcher gần như bằng 0. Qua mùa xuân nó nhích dần lên — khoảng $50/ngày vào tháng 4, $150/ngày vào tháng 6 — rồi đi ngang quanh mức $150-165 suốt phần lớn tháng 7. Sau đó, cuối tháng 7, nó bứt phá mạnh, đạt khoảng $600 mỗi researcher mỗi ngày vào cuối tháng 8. Nhận định của Willison, khớp với thời điểm, là điểm uốn này tương quan với việc truy cập nội bộ vào thứ sau này trở thành GPT-6 Astra. Không phải mandate. Không phải chính sách mới. Một model vượt qua ngưỡng usability mà các model trước đó chưa làm được.
Nếu bạn là một Tech Lead đã dành cả năm qua cố gắng khiến team mình thực sự dùng agentic tooling thay vì chỉ gật đầu trong all-hands, đường cong này đáng nghiên cứu kỹ hơn cả chính bản thân thông báo ra mắt model.
Đoạn đi ngang mới là phần đáng chú ý, không phải đoạn tăng vọt
Bản năng của ai cũng là nói về đoạn tăng vọt. Đoạn đi ngang hữu ích hơn. Bốn tháng — từ tháng 2 đến tháng 6 — chi tiêu phẳng và thấp dù presumably đã có quyền truy cập các model đủ mạnh suốt thời gian đó (các model tầm GPT-5 đã production tốt trước giai đoạn này) cho bạn biết adoption không chủ yếu là vấn đề năng lực model một khi đã qua ngưỡng cơ bản. Đó là vấn đề trust và mức độ phù hợp với workflow. Các researcher không chi tiêu nhiều hơn không phải vì các model trước không đủ mạnh về mặt kỹ thuật, mà vì chúng chưa vượt qua ngưỡng nào đó khiến người ta mặc định dùng agent thay vì chỉ thử cho vui.
Điều này khớp với những gì mình từng thấy khi rollout các công cụ agentic coding cho các team thật: bạn có một đợt tăng do tò mò ban đầu, nó đi ngang ở mức “những người vốn đã thích công nghệ này,” rồi nằm yên đó — đôi khi hàng tháng — cho đến khi công cụ vượt qua một ngưỡng năng lực hoặc có gì đó buộc thay đổi workflow. Hãy chuẩn bị tinh thần cho giai đoạn đi ngang đó. Nếu biểu đồ adoption của bạn phẳng ba tháng sau rollout, đó không nhất thiết là một rollout thất bại; có thể đó là một phản ánh chính xác vị trí thực sự của công cụ so với workflow.
Một cú nhảy 4x trong sáu tuần thực sự ngụ ý gì về mặt vận hành
Đi từ ~$150/ngày lên ~$600/ngày mỗi researcher không phải là scale tuyến tính của cùng một pattern sử dụng — đó là thay đổi về việc công cụ đang được dùng để làm gì. Vài hệ quả vận hành, tất cả là những thứ mình sẽ kiểm tra nếu thấy đường cong này trên dashboard của chính team mình thay vì của OpenAI:
Cost governance phải theo sự kiện, không theo quý. Nếu chu kỳ review chi phí finance/eng của bạn là hàng quý còn đường cong chi tiêu thực tế trông như thế này, bạn sẽ biết về cú nhảy 4x đó ba tháng sau khi nó xảy ra, khi hóa đơn về tay. Một dashboard đơn giản chi tiêu-mỗi-ngày-mỗi-seat với ngưỡng cảnh báo sẽ bắt được điểm uốn khi nó còn giải thích được (“model mới ra mắt hôm thứ Ba”) thay vì khi nó đã thành một dòng chi phí ai đó phải giải trình sau đó.
# tripwire tối giản cho chi tiêu-mỗi-ngày-mỗi-seat, không cần ML
def check_spend_inflection(daily_spend: list[float], window: int = 14, threshold: float = 2.0):
"""Cảnh báo khi chi tiêu trung bình gần đây vượt `threshold`x trung bình cửa sổ trước đó."""
if len(daily_spend) < window * 2:
return None
recent = sum(daily_spend[-window:]) / window
prior = sum(daily_spend[-2*window:-window]) / window
if prior > 0 and recent / prior >= threshold:
return {"multiplier": round(recent / prior, 2), "recent_avg": recent, "prior_avg": prior}
return None
Một đường cong adoption tăng đột ngột là sự kiện capacity-planning, không chỉ là sự kiện chi phí. Nếu shape của việc sử dụng thay đổi nhanh như vậy, rate limit, API quota, và bất kỳ hạ tầng dùng chung nào (lớp proxy, credential broker, pipeline logging) được sizing cho giai đoạn đi ngang sẽ bị stress đúng lúc bạn ít muốn gặp sự cố bất ngờ nhất. Kiểm tra lại headroom ngay khi thấy những dấu hiệu đầu tiên của một điểm uốn, không phải sau khi nó đã đến hoàn toàn.
Con số chi tiêu một mình nó không nói gì về ROI — nhưng hình dạng đường cong nói về trust. $600/researcher/ngày vô nghĩa nếu không biết điều gì đã KHÔNG xảy ra nhờ nó: bug được fix, cycle time, tốc độ iterate research. Nhưng hình dạng của đường cong — phẳng, rồi một bước nhảy gắn với một model release cụ thể — tự nó là một tín hiệu độc lập với ROI: nó nghĩa là tooling trước đó không phải là điểm nghẽn, ngưỡng năng lực mới là. Đó là điều đáng biết trước khi bạn dành cả một quý cho change-management training trong khi khoảng cách thực sự là năng lực model, hoặc ngược lại.
Khoảng cách giữa “có sẵn” và “được dùng”
Phần mình cứ quay lại nghĩ: chính các researcher của OpenAI — có lẽ là nhóm người am hiểu agent nhất, ít e ngại công cụ nhất mà bạn có thể tìm thấy ở bất cứ đâu — mất khoảng năm tháng để dịch chuyển usage một cách đáng kể, và thứ đã dịch chuyển nó không phải là training, mandate, hay incentive. Đó là công cụ vượt qua một ngưỡng.
Đó là một sự điều chỉnh hữu ích nếu bạn là một engineering leader đang thất vọng vì việc team mình adopt Claude Code, Cursor, hay bất kỳ agent chuẩn nào của bạn trông vẫn phẳng dù đã đầu tư vào onboarding và champion nội bộ. Bài học không phải “bỏ cuộc với change management” — champion và onboarding vẫn quan trọng để nắm bắt adoption một khi công cụ đã đủ tốt, và chúng rút ngắn độ trễ giữa lúc năng lực vượt ngưỡng và lúc usage bắt kịp. Nhưng đừng nhầm một đường cong phẳng là vấn đề con người trước khi bạn đã loại trừ vấn đề năng lực công cụ. Team agent-native nhất hành tinh cũng đã nằm ở giai đoạn đi ngang bốn tháng chờ model, không phải chờ training.
Nếu bạn đang theo dõi adoption agent của chính team mình, phiên bản hành động của điều này rất đơn giản: vẽ biểu đồ chi tiêu hoặc usage hàng ngày mỗi kỹ sư theo thời gian, và thay vì hỏi “tại sao adoption không cao hơn,” hãy hỏi “đây có phải là một giai đoạn đi ngang đang chờ năng lực, hay một giai đoạn đi ngang bất chấp đã có năng lực.” Hai trường hợp đó cần cách fix hoàn toàn khác nhau, và đường cong của OpenAI là một lời nhắc rằng trường hợp đầu tiên phổ biến hơn hầu hết các postmortem rollout vẫn giả định.
Nguồn: