Tuần này OpenAI và Broadcom công bố Jalapeño — ASIC inference riêng đầu tiên của OpenAI, sản xuất trên tiến trình TSMC N3P, tape-out chỉ trong khoảng 16 tháng. SemiAnalysis đã bay đến lab của OpenAI để chạy benchmark độc lập, và con số đáng chú ý không phải là lời quảng cáo: Jalapeño vượt Nvidia Blackwell về hiệu năng trên mỗi watt ở gần như mọi workload họ test. Đây không phải câu chuyện về con chip của một công ty. Đây là bản xem trước hóa đơn hạ tầng AI của bạn sẽ trông như thế nào khi vendor model ngừng thuê compute và bắt đầu sở hữu toàn bộ stack xuống tận silicon.

Con số, nói thẳng

Bản silicon A0 hiện tại đạt 13.4 PFLOPs MXFP4 ở mức 700W, kết hợp HBM4 với băng thông bộ nhớ 15.4TB/s. Về throughput: hơn 700 token/giây/user trên DeepSeek R1, khoảng 1,400 token/giây/user trên GPT-OSS. Benchmark riêng của OpenAI công bố hiệu suất công việc hữu ích trên mỗi watt cao hơn Nvidia từ 1.5-1.9 lần trên GPT-OSS, DeepSeek R1, và Kimi K2.5 1T — và số liệu độc lập từ SemiAnalysis xác nhận điều này thay vì bác bỏ, đây mới là phần đáng chú ý. Bước silicon B0 đã ở trong fab, nhắm cải thiện thêm khoảng 25% hiệu năng/watt.

Ở quy mô rack: 128 ASIC Jalapeño mỗi rack, tối đa 2,048 XPU trên một domain scale-up gồm 16 rack, một cặp rack host-plus-ASIC hoàn chỉnh tiêu thụ khoảng 160kW. Đây là con số thật, có thể triển khai, không phải trò chơi trong lab — thứ này được xây cho inference production ở quy mô của OpenAI, không phải bản demo nghiên cứu.

Vì sao điều này quan trọng hơn một lần ra mắt model khác

Mỗi lần ra mắt model thay đổi thứ bạn có thể xây dựng. Một con chip inference riêng từ vendor model thay đổi thứ bạn phải trả để chạy nó — và hai bài toán kinh tế này phân kỳ theo một cách đáng chú ý.

Hiệu năng/watt mới là đòn bẩy định giá API thực sự. Chi phí inference ở quy mô hyperscaler không bị chi phối bởi giá mua chip — mà bị chi phối bởi điện năng và làm mát trong suốt vòng đời vận hành của chip. Một vendor hiệu quả hơn 1.5-1.9 lần trên mỗi watt so với lựa chọn silicon phổ thông có lợi thế chi phí mang tính cấu trúc, thể hiện ra bằng biên lợi nhuận tốt hơn hoặc giá API thấp hơn — và OpenAI được quyền chọn cái nào. Trong quá khứ, khi một lab frontier có lợi thế chi phí kiểu này, một phần thường đến tay khách hàng dưới dạng giá mỗi token thấp hơn — vì đây cũng là vũ khí cạnh tranh với Anthropic và Google, cả hai đều đang theo đuổi con đường silicon riêng (TPU của Google đã sang thế hệ thứ sáu trở lên; Anthropic dựa vào cả Trainium lẫn TPU của Google).

Đây là tín hiệu về độ tin cậy nguồn cung, không chỉ về chi phí. Năm 2025 và đầu 2026 được định hình bởi việc phân bổ GPU chính là nút thắt cổ chai thật sự với nhiều team — không phải năng lực model, mà đơn giản là có đủ phần cứng Nvidia được cấp phát hay không. Một vendor model có pipeline ASIC riêng, trên phần phân bổ fab riêng với TSMC, đang tự mua cho mình sự độc lập khỏi hàng đợi phân bổ của Nvidia. Nếu bạn xây hạ tầng trọng yếu trên API của một vendor, khả năng chống chịu chuỗi cung ứng của họ giờ âm thầm trở thành một phần rủi ro uptime của chính bạn.

Thiết kế-đến-tape-out trong 9 tháng là chi tiết đáng lo cho các hãng chip lâu đời hơn là cho bạn trực tiếp — nhưng nó thay đổi khung thời gian lập kế hoạch của bạn. OpenAI dùng chính các model generative của mình để tăng tốc quá trình thiết kế phần cứng. Nếu thiết kế chip tăng tốc bằng AI trở thành mô hình lặp lại được trên nhiều lab, chu kỳ 3-4 năm truyền thống cho một thế hệ phần cứng đáng kể sẽ bị nén lại. Điều đó nghĩa là các giả định chi phí hạ tầng bạn lập từ 18 tháng trước nhiều khả năng đã lỗi thời, và lỗi thời nhanh hơn trước.

Thực chiến: điều này thay đổi gì trong cách bạn lên kế hoạch năng lực

Đây không phải phần cứng bạn sẽ tự cấp phát trực tiếp — đó là hạ tầng nội bộ của OpenAI. Nhưng nó thay đổi ba thứ bạn thực sự kiểm soát được:

# Trước: mô hình chi phí giả định giá $/token cố định, thỉnh thoảng đổi bậc
monthly_inference_cost = tokens_per_month * current_price_per_token

# Sau: xây dựng giả định đường cong chi phí, không phải mức giá cố định,
# khi trong danh mục vendor của bạn có hãng làm silicon riêng
def projected_cost(tokens_per_month, current_price, months_out, annual_decline_pct=0.15):
    # Các vendor tích hợp dọc silicon trong quá khứ thường chuyển
    # lợi ích hiệu quả nhanh hơn các bên chỉ resell API
    projected_price = current_price * ((1 - annual_decline_pct) ** (months_out / 12))
    return tokens_per_month * projected_price
  1. Tính lại bài toán build-vs-buy với giả định giá giảm nhanh hơn cho các vendor tích hợp dọc. Nếu chi phí mỗi token của OpenAI giảm nhanh hơn về mặt cấu trúc so với một bên resell giá Nvidia, điều đó thay đổi bài toán nhiều năm về việc tự host model open-weight thuần vì lý do chi phí — lựa chọn API có thể tiếp tục rẻ đi nhanh hơn hạ tầng tự xây của bạn.
  2. Theo dõi workload nào được route qua Jalapeño trước. Các vendor thường route traffic khối lượng lớn, chịu được độ trễ trước tiên sang silicon riêng, vì đó là nơi ROI của khoản đầu tư thiết kế thể hiện nhanh nhất. Nếu profile workload của bạn khớp (dạng batch, không quá nhạy cảm độ trễ), bạn có thể thấy cải thiện về giá hoặc khả năng đáp ứng trước các workload nhạy cảm độ trễ.
  3. Coi sự độc lập chuỗi cung ứng của vendor là tiêu chí chọn vendor, không chỉ là chuyện thú vị. Khi chọn giữa các nhà cung cấp API cho critical path, “họ có tự kiểm soát pipeline phần cứng inference của mình không” giờ là một mục hợp lý cạnh chất lượng model và giá cả — đó là chỉ báo cho việc họ cách ly tốt đến đâu khỏi đợt khan hiếm GPU tiếp theo.

Tiêu đề thật sự ở đây không phải “OpenAI làm ra một con chip nhanh”. Mà là chất lượng model và chi phí hạ tầng đang bắt đầu tách rời khỏi lộ trình của Nvidia, ít nhất với một lab lớn — và nếu mô hình này lặp lại ở Anthropic, Google, và Meta, thì đường cong chi phí nhiều năm bạn đang lập kế hoạch hôm nay nhiều khả năng đã sai.

Xuất nội dung

Bình luận