BÀI VIẾT

GPT-6 Astra Đạt 55% Trên Công Việc Hợp Đồng Thật — Con Số Này Thực Ra Nói Lên Điều Gì

OpenAI và Ironclad công bố benchmark computer-use trên các tác vụ hợp đồng thật. Con số nổi bật là tăng 14 điểm so với model trước. Nhưng phần ghi chú nhỏ bên dưới mới là phần đáng đọc kỹ.

Đọc cùng AI

Chọn nội dung để sao chép và dán vào trợ lý AI. Không tự gửi dữ liệu. Nội dung CMS được chuyển sang Markdown; dùng Markdown gốc nếu có.

Ngày 6/10/2026, OpenAI và Ironclad — công ty chuyên về quản lý vòng đời hợp đồng (contract lifecycle management) — công bố kết quả cho GPT-6 Astra ở chế độ computer-use, chạy trên 11 tác vụ hợp đồng thật: soạn một NDA, dựng một chuỗi phê duyệt mua sắm, cập nhật một mẫu điều khoản pháp lý dùng lại cho đúng với luật của một khu vực mới — đúng loại việc một team pháp chế/hợp đồng làm hàng ngày. Astra đạt điểm trung bình 55,0% trên các tác vụ này. Model trước, GPT-5.6 Sol, đạt 41,6%. Tăng 14,4 điểm, và đây là con số đo được thật — cùng 11 tác vụ, cùng cách chấm, hai model.

Phần này của báo cáo đáng tin. Phần đáng đọc lại hai lần nằm ở các ghi chú nhỏ.

55% không có nghĩa như bạn nghĩ

Mỗi tác vụ trong 11 tác vụ được chấm theo 8 đến 50 tiêu chí nhỏ, tùy độ phức tạp. 55% là điểm trung bình tính theo phần trăm đạt được trên toàn bộ các tiêu chí đó, không phải tỷ lệ hoàn thành trọn vẹn từng tác vụ. Nó không có nghĩa là “Astra soạn đúng khoảng một nửa số hợp đồng”. Nó gần với “trên mọi tiêu chí nhỏ được kiểm tra — đúng điều khoản, đúng tên bên liên quan, đúng bước phê duyệt — Astra đạt được hơn một nửa, tính trung bình”. Đây là hai cách hiểu rất khác nhau, và sự khác biệt này quan trọng nếu bạn là người quyết định có để công cụ này chạm vào hàng đợi hợp đồng thật hay không.

Con số tiết kiệm thời gian là mô phỏng, và báo cáo tự ghi rõ điều đó

Con số lan truyền xa nhất từ báo cáo này — thời gian trung bình cho mỗi tác vụ giảm từ 37,0 phút xuống 19,2 phút — có một ghi chú ngay trong bản công bố gốc, ghi rằng đây là “ước tính mô phỏng dựa trên giả định về tốc độ xử lý và sinh kết quả của model, không phải thời gian tiết kiệm được đo thật từ khách hàng”. Không ai bấm giờ một chuyên viên hợp đồng làm 11 tác vụ này bằng tay. Cũng không ai bấm giờ Astra chạy chúng trên một tài khoản Ironclad thật. Con số này là mô hình dự đoán chênh lệch thời gian, dựng từ giả định về tốc độ xử lý, không phải phép đo từ cả hai phía làm việc thật. Công bố một dự đoán như vậy không có gì sai. Nhưng đó không phải là bằng chứng, và báo cáo không hề khẳng định nó là bằng chứng — sự cẩn trọng nằm ở ghi chú nhỏ, không nằm ở dòng tiêu đề.

Clip demo và bảng dữ liệu kể hai câu chuyện khác nhau, và cả hai đều đúng

Các clip demo lan truyền quanh đợt ra mắt cho thấy điểm số 94% và 85% trên từng tác vụ riêng lẻ — những con số không giống gì với mức trung bình 55,0% trên cả 11 tác vụ. Cả hai con số đều chính xác. Clip demo chọn những tác vụ cụ thể, nơi Astra làm đặc biệt tốt; con số trung bình tính trên cả 11 tác vụ, bao gồm cả những tác vụ nó làm kém hơn. Đây là một chiêu marketing benchmark rất phổ biến, và cũng là một cái bẫy quen thuộc với ai chỉ lướt qua trang ra mắt mà không mở bảng dữ liệu: một clip trường hợp tốt nhất và một điểm trung bình đều là số thật, mô tả hai thứ khác nhau, và chỉ một trong hai cho bạn biết nên chờ đợi gì ở hợp đồng tiếp theo rơi vào hàng đợi.

Model tốt nhất của OpenAI chưa được tung ra

Nằm sâu trong cùng báo cáo: một model nội bộ chưa phát hành đạt 63,7% trên đúng 11 tác vụ này — cao hơn gần chín điểm so với bản Astra thực tế đang bán cho khách hàng. OpenAI không giải thích khoảng cách này trong tài liệu công bố. Dù lý do là gì — chi phí, độ trễ, quy trình kiểm duyệt an toàn, hay thứ khác — con số đang có trên thị trường hôm nay không phải con số tốt nhất OpenAI từng tạo ra trong nội bộ với đúng bài test này. Đáng nhớ điều này lần sau khi một nhà cung cấp công bố kết quả benchmark: hỏi xem đó là điểm của sản phẩm đã phát hành, hay là kết quả trong phòng lab mà sản phẩm phát hành vẫn chưa theo kịp.

Câu nói trung thực nằm trong báo cáo, không nằm trong bài pitch

Chính báo cáo của OpenAI nói rõ ràng: giới hạn thực sự của việc một công ty phần mềm có thể tự tin giao cho agent hôm nay là model “làm mất dấu một quy tắc nghiệp vụ giữa chừng tác vụ”. Đó là vấn đề kỹ thuật thật, và nó hữu ích hơn bất kỳ con số phần trăm nào trên trang. Một chuỗi phê duyệt mua sắm có quy tắc nghiệp vụ ở từng nhánh — ai phê duyệt mức tiền nào, khu vực pháp lý nào cần thêm một chữ ký, loại điều khoản nào áp dụng cho loại hợp đồng nào. Một agent đúng trung bình 55% và sai theo kiểu âm thầm bỏ mất một quy tắc giữa chừng chưa phải là một thành viên team hợp đồng. Nó là một trợ lý soạn thảo mà mọi output cần được kiểm tra lại dựa trên đúng những quy tắc nó có thể đã bỏ quên.

Checklist cho benchmark agent tiếp theo mà một nhà cung cấp đưa cho bạn

  • Con số phần trăm nổi bật là trung bình trên các tiêu chí chấm điểm, hay tỷ lệ hoàn thành trọn vẹn tác vụ? Hai cái nhìn giống nhau trên tiêu đề nhưng ý nghĩa rất khác trong thực tế.
  • Con số tiết kiệm thời gian hay chi phí được đo từ sử dụng thật, hay là ước tính/mô phỏng? Đọc ghi chú nhỏ, không đọc slide.
  • Clip demo cho thấy trường hợp trung bình hay trường hợp tốt nhất trong nhiều lần chạy?
  • Model được benchmark là model bạn thực sự mua được, hay có một bản nội bộ tốt hơn mà nhà cung cấp chưa phát hành?

Tăng 14 điểm phần trăm tiêu chí chấm điểm trên 11 tác vụ hợp đồng thật là một kết quả thật, xứng đáng được ghi nhận. Công bố chi tiết đến từng tác vụ và một ghi chú trung thực về thời gian tiết kiệm được là mô phỏng, thay vì chỉ một con số marketing duy nhất, cũng xứng đáng được khen — rất nhiều trang ra mắt không làm vậy. Nhưng “kết quả thật” và “sẵn sàng để chạy chuỗi phê duyệt pháp lý của team bạn mà không cần giám sát” là hai khẳng định khác nhau, và khoảng cách giữa chúng nằm chính trong các ghi chú nhỏ của báo cáo này. Đọc chúng trước khi đọc con số tiết kiệm thời gian.

Nguồn: Báo cáo benchmark chung của OpenAI và Ironclad, công bố ngày 6/10/2026.

Thảo luận

Bình luận được duyệt trước khi công khai. Email của bạn được giữ riêng tư.

← Về danh sáchRead in English