Team Qwen của Alibaba phát hành Qwen3.8-Flash-Next ngày 26/8, và con số nổi bật khiến người ta phải kiểm tra lại nguồn: 62.5 điểm trên SWE-bench Pro, vượt qua Claude Opus 4.6 Max ở mức 53.4, Qwen3.8-27B ở mức 61.7, và DeepSeek-V4-Flash ở mức 56.0 — trong khi chỉ kích hoạt 6 tỷ trên tổng 180 tỷ tham số mỗi token. Alibaba nói rõ đây không chỉ là một bản phát hành ở tier tiết kiệm chi phí khác; nó được mô tả là bản preview sớm cho kiến trúc đứng sau dòng Qwen4 sắp tới. Tôi dành một buổi tối đọc technical report và chạy lại mô hình chi phí self-hosting với workload agent của chính mình, vì một bảng benchmark đơn thuần không nói lên được liệu model có thực sự phù hợp hay không.

Kiến trúc: vì sao 6B kích hoạt có thể vượt model có kích thước kích hoạt gấp 10 lần

Qwen3.8-Flash-Next là model Mixture-of-Experts — 125B tham số main-model, 51B trong N-gram embeddings, tổng 180B, nhưng một router chỉ chọn 6B tham số kích hoạt mỗi lượt forward pass. Điểm mới so với thế hệ trước nằm ở lớp attention: kết hợp Gated DeltaNet (một biến thể linear-attention) với Qwen Sparse Attention, cộng thêm gated residual branches và cấu hình Muon optimizer cập nhật để ổn định huấn luyện ở mức độ sparsity này.

Forward pass của Qwen3.8-Flash-Next, mỗi token:
  Tổng tham số:        180B  (125B main + 51B embedding)
  Router chọn:          6B tham số kích hoạt
  Attention:            Gated DeltaNet (linear, cục bộ) + Sparse Attention (toàn cục)
  Kết quả:               chất lượng gần ngang frontier với chi phí tính toán chỉ bằng một phần nhỏ

Lý do thực tế điều này quan trọng: chi phí inference và độ trễ tỷ lệ theo tham số kích hoạt, không phải tổng tham số. Một model 6B kích hoạt có thể chạy trên phần cứng mà một model dense 180B sẽ “nghẹt thở,” trong khi router vẫn cho nó quyền truy cập vào một kho kiến thức hiệu quả lớn hơn nhiều so với một model dense 6B thực sự. Đây là cùng một canh bạc MoE mà nhiều lab đã đặt cược trong năm nay, nhưng khoảng cách benchmark ở đây — vượt qua một model tầm Claude Opus trên SWE-bench Pro và CoWorkBench — đủ lớn để đáng xem xét nghiêm túc thay vì gạt bỏ như một tuyên bố “vượt GPT-4 trên eval chọn lọc” khác.

Đọc khoảng cách benchmark một cách trung thực

Trước khi phấn khích: SWE-bench Pro và CoWorkBench là benchmark cho coding agent và task nhiều bước, và chính team Qwen chạy và báo cáo các con số này. Điểm so sánh — Claude Opus 4.6 Max — cũng không phải model frontier hiện tại của Anthropic vào thời điểm bạn đọc bài này, nên “vượt Opus 4.6” là một kết quả thật nhưng là mục tiêu di động, không phải một tuyên bố vĩnh viễn. Khoảng cách JobBench là con số gây ngạc nhiên nhất (55.7 so với 36.6), và đó chính xác là kiểu khoảng cách tôi muốn verify với phân bố task của chính mình trước khi tin — những cú nhảy lớn trên benchmark tôi chưa tự stress-test là điều đầu tiên tôi chiết khấu khi đánh giá một model mới, không phải điều đầu tiên tôi lặp lại.

Điều tôi tin mà không cần verify thêm: tuyên bố về hiệu quả kiến trúc. 6B tham số kích hoạt tạo ra tier chất lượng này là một kết quả hiệu quả tính toán không phụ thuộc vào việc tin phương pháp benchmark của Qwen — đó là hệ quả trực tiếp của thiết kế MoE kết hợp hybrid attention, và bất kỳ ai self-host weights đều có thể verify độc lập.

Tính toán bài toán self-hosting

Giá trên API hosted là $0.16 input / $0.47 output mỗi triệu token — cạnh tranh, nhưng con số thú vị hơn với một Tech Lead đang đánh giá build-vs-buy là hồ sơ self-hosting. Weights FP8 nặng 172.78 GiB, nên cần một node multi-GPU chứ không phải một card đơn, nhưng đó là mục tiêu thực tế với một team đã vận hành hạ tầng inference. Weights có trên Hugging Face và chạy được ngay với Transformers, vLLM, SGLang, và Docker Model Runner.

# tính toán sơ bộ self-host vs API cho workload coding agent
# giả định: team 8 kỹ sư, mức dùng agent vừa phải
monthly_tokens_in = 600_000_000   # 600M token input/tháng (context lớn, output tool)
monthly_tokens_out = 60_000_000   # 60M token output/tháng

api_cost = (monthly_tokens_in / 1e6 * 0.16) + (monthly_tokens_out / 1e6 * 0.47)
# = $96 + $28.2 = ~$124/tháng ở mức này -- API thắng dễ dàng

# self-hosting chỉ bắt đầu hợp lý khi:
# 1. khối lượng cao hơn 15-20 lần (dùng ở quy mô nhiều team, không phải một squad), HOẶC
# 2. quy định về data residency/compliance loại bỏ hosted API bất kể chi phí, HOẶC
# 3. bạn đã vận hành hạ tầng GPU cho inference khác và chi phí biên thấp

Đó là điểm giao thoa trung thực: ở mức sử dụng cấp team, hosted API rẻ hơn và đơn giản hơn so với dựng inference multi-GPU cho bộ weight 172GB. Self-hosting trở thành lựa chọn đúng ở quy mô nền tảng hoặc khi compliance bắt buộc, không phải như một tối ưu mặc định.

Tôi sẽ thực sự route công việc gì cho model này

Với các con số SWE-bench Pro và CoWorkBench, tôi sẽ thí điểm Qwen3.8-Flash-Next cho các task coding agent có cấu trúc, dùng tool — sinh PR, viết test, refactor có phạm vi rõ — nơi tôi có thể đo thành công theo eval set của chính mình thay vì tin vào con số công bố. Tôi sẽ không thay thế mù quáng cho các task lập luận kiến trúc mở hoặc nặng phán đoán, nơi các model tầm Opus hoặc Sonnet có track record dài hơn trên workload cụ thể của tôi. Câu chuyện hiệu quả là thật và verify được độc lập; khung “vượt model frontier” cần bộ eval của chính bạn trước khi nó thay đổi nơi bạn route traffic production.

Kết luận

Con số 6B tham số kích hoạt là phần tôi thực sự sẽ xây quyết định xung quanh — đó là một sự thật kiến trúc verify được, không phải một tuyên bố benchmark, và nó thay đổi đáng kể bài toán self-hosting so với một model dense chất lượng tương đương. Tiêu đề SWE-bench Pro đáng để test trên task của chính bạn trước khi tin, nhưng lợi ích hiệu quả từ MoE kết hợp hybrid attention bên dưới mới là tín hiệu thật ở đây, và đó là bản preview cho hướng đi của Qwen4 — và có lẽ cả thế hệ dòng MoE tiếp theo của mọi lab lớn.

Nguồn: The New Stack: Qwen3.8-Flash Previews Qwen4, MarkTechPost: Alibaba’s Qwen Team Releases Qwen3.8-Flash-Next, officechai: Alibaba Releases Qwen 3.8 Flash-Next, Beats Opus 4.6 On Most Benchmarks

Xuất nội dung

Bình luận